Çoğu kişi, en büyük modellerin en çok VRAM gerektirdiğini varsayar! Aslında AirLLM ile, 2,8 trilyon parametreli Kimi K3, 70B yoğun modelden daha az VRAM gerektirir. Nedeni, K3'ün seyrek bir uzmanlar karışımı model olmasıdır; bu nedenle AirLLM, bir belirteçin tamamını yüklemek yerine yalnızca o belirtecin gerçek olarak yönlendirildiği uzmanları akışa alır. Buna ek olarak, GPU'ya aynı anda yalnızca bir katman yüklenir. İşte bu sayede DeepSeek-V3 (671B) 12 GB’da ve 2,8 trilyon parametreli bir model 4 GB’ın altında yer alır; hiçbir nicelleştirme, distilasyon veya budama yapılmadan. Kaybetmemek için yer işaretleyin! Repo: https://t.co/dO2TABPfqr Daha fazlası için @neil_xbt’i takip edin!
NeilXbtPaylaş
Kaynak:Orijinalini göster
Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir.
Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.