source avatarNeilXbt

Bagikan

Sebagian besar orang menganggap model terbesar membutuhkan VRAM paling banyak! Sebenarnya, dengan AirLLM, Kimi K3, model dengan 2,8 triliun parameter, membutuhkan VRAM lebih sedikit daripada model padat 70B. Alasannya adalah K3 adalah model sparse mixture-of-experts, sehingga AirLLM hanya mengalirkan pakar spesifik yang benar-benar dituju oleh suatu token, bukan memuat seluruh lapisan padat. Dikombinasikan dengan memuat hanya satu lapisan ke GPU sekaligus. Inilah cara DeepSeek-V3 (671B) muat dalam 12GB dan model 2,8 triliun parameter muat dalam kurang dari 4GB, tanpa kuantisasi, tanpa distilasi, dan tanpa pruning sama sekali. Simpan agar tidak hilang! Repo: https://t.co/dO2TABPfqr Ikuti @neil_xbt untuk lebih banyak lagi!

Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini. Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.