source avatarNeilXbt

साझा करें

अधिकांश लोग मानते हैं कि सबसे बड़े मॉडल को सबसे अधिक VRAM की आवश्यकता होती है! वास्तव में, AirLLM के साथ, 2.8 ट्रिलियन पैरामीटर वाला Kimi K3, एक 70B घन मॉडल से कम VRAM की आवश्यकता रखता है। कारण यह है कि K3 एक स्पार्स मिक्सचर-ऑफ-एक्सपर्ट्स मॉडल है, इसलिए AirLLM केवल उन विशिष्ट एक्सपर्ट्स को स्ट्रीम करता है जिनकी एक टोकन वास्तव में रूटिंग करता है, और पूरी घन परत को लोड नहीं करता। इसके साथ मिलाकर, GPU पर एक समय में केवल एक ही परत लोड करना। इसी तरह DeepSeek-V3 (671B) 12GB में फिट हो जाता है और 2.8 ट्रिलियन पैरामीटर वाला मॉडल 4GB से कम में फिट हो जाता है, बिना किसी क्वांटाइजेशन, डिस्टिलेशन या प्रूनिंग के। इसे बुकमार्क कर लें ताकि आप इसे खोए नहीं! Repo: https://t.co/dO2TABPfqr अधिक के लिए @neil_xbt का अनुसरण करें!

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।