हाल ही में, निविडा ने एक आधिकारिक बड़े मॉडल निष्कर्षण मार्गदर्शिका जारी की, लेकिन इसे पढ़ते-पढ़ते यह एक चीनी टीम के शोध पत्रों का संग्रह लगने लगा।
ऐसा है।
2 सितंबर को, निवेडिया टेक ब्लॉग पर एक लंबा लेख "स्पेकुलेशन के साथ एआई मॉडल कोलैबोरेटिव डिजाइन को डिकोड करना" प्रकाशित हुआ।
लेख का मुख्य बिंदु एक चयन सारणी है, जो वर्तमान में सबसे लोकप्रिय 6 निष्कर्षण त्वरण विकल्पों को एक पंक्ति में व्यवस्थित करती है और प्रशिक्षण लागत और उपयुक्त परिदृश्यों को भी स्पष्ट रूप से प्रस्तुत करती है।

इसका महत्व यह है कि यह चिप के शीर्ष निर्माता द्वारा अत्यंत दुर्लभ रूप से आधिकारिक रूप से यह नियम बनाया गया है कि मॉडल को हार्डवेयर की भौतिक सीमाओं के साथ कैसे डिज़ाइन किया जाए।
जब वे चारों ओर देखते हैं और सिलिकॉन चिप की सीमाओं पर नाचने वाले आदर्श समाधान की तलाश करते हैं, तो मार्गदर्शिका में शामिल मुख्य समाधान लगभग सभी चीनी टीमों द्वारा प्रमुखता से विकसित किए गए हैं।
यह सामान्य एल्गोरिथम समीक्षा के परास से कहीं अधिक है। यह तालिका वास्तव में क्या रहस्य उजागर कर रही है? आइए इसे पंक्ति दर पंक्ति विघटित करते हैं।
लगभग शुद्ध लाभ का व्यापार: स्पेकुलेशन डिकोड क्या कर रहा है
इस तालिका को समझने के लिए, आपको पहले "स्पेकुलेटिव डिकोडिंग" क्या है, यह समझना होगा।
बड़े मॉडल शब्दों को एक-एक करके बाहर निकालते हैं। प्रत्येक शब्द के लिए, कई सौ जीबी पैरामीटर को ग्राफिक्स मेमोरी में पूरी तरह से चलाना पड़ता है। वास्तव में, अधिकांश समय, कैलकुलेशन पावर मेमोरी द्वारा डेटा स्थानांतरित होने का इंतजार कर रहा होता है।
स्पेकुलेशन डिकोड का समाधान बहुत सीधा और सरल है—
पहले एक हल्के मॉडल का उपयोग करके पूर्वानुमान लगाएं, एक साथ 7 अक्षरों का अनुमान लगाएं; फिर बड़ा मॉडल इन 7 अक्षरों की एक साथ पुष्टि करता है।
7 अक्षरों की पुष्टि करने में लगने वाला समय और अपने द्वारा 1 अक्षर लिखने में लगने वाला समय लगभग समान है, क्योंकि भार को अंततः एक बार ही ले जाना पड़ता है।
अगर आपने सही अनुमान लगाया, तो सीधे ले लें, अगर गलत अनुमान लगाया, तो ब्रेकपॉइंट से फिर से शुरू करें। क्योंकि बड़े मॉडल केवल उन्हीं अक्षरों को स्वीकार करते हैं जो वे स्वयं लिखने में सक्षम हैं, इसलिए अंतिम आउटपुट में कोई विराम चिह्न भी नहीं बदलना है। यही कहलाता है «बिना क्षति के त्वरण»।

इस गेम में, सभी कैलकुलेशन एक केंद्रीय गणितीय अपेक्षा सूत्र के चारों ओर केंद्रित हैं:
स्पीडअप = 𝔼[L] × TtargetTdraft + Tverify
The numerator is the expected reward 𝔼[L], representing the expected accepted length (the average number of characters a large model can select per round).
अंश आपके द्वारा भुगतान किया गया अतिरिक्त लागत है, जो छोटे मॉडल द्वारा भविष्यवाणी करने का समय (Tdraft) और बड़े मॉडल द्वारा अंतिम पुष्टि का समय (Tverify) है।
स्पीडअप को तेज़ करने के लिए दो ही रास्ते हैं: या तो अंश को बढ़ाएं (अधिक सटीक अनुमान लगाएं), या फिर हर को अत्यधिक संपीड़ित करें (तेज़ी से अनुमान लगाएं)।
प्रतिद्वंद्वियों के कंधों पर चढ़कर, चौथी पीढ़ी के विकास को आगे बढ़ाएं
निविडा के इस टेबल को ऊपर से नीचे तक देखें, आप एक स्पष्ट प्रतिस्पर्धा की रेखा देखेंगे।
पहली पंक्ति सबसे पुराना "एक्सटर्नल ड्राफ्ट मॉडल" है, जिसके लिए एक अलग छोटा मॉडल ट्रेन करने की आवश्यकता है।
NVIDIA ने सीधे भारी बिल दिखाया: शुरुआत से ट्रेन करने के लिए 1T से 10T टोकन की खपत होती है, जिसकी कीमत बहुत अधिक है।
लेकिन इसे तालिका पर इसलिए छोड़ा गया है क्योंकि न्वीडिया ने इसके लिए एक विशिष्ट भाग्य निर्धारित किया है—उन्होंने 200 अरब डॉलर खर्च करके Groq चिप (LPU) को अधिग्रहित किया है।
अंतिम पंक्ति बिना प्रशिक्षण के n-gram टेबल लुकअप विधि है, जो पिछले पाठ से दोहराए गए अंशों को सीधे ढूंढकर प्रतिलिपि बनाती है, और केवल बड़े पैमाने पर कॉपी-पेस्ट के लिए उपयुक्त है।
वास्तविक तकनीकी विकास को बीच की चार पंक्तियाँ दर्शाती हैं।

दूसरी पंक्ति: EAGLE-3।
उत्तर प्रदेश विश्वविद्यालय के युहुई ली, वॉटरलू विश्वविद्यालय के होंगयांग जांग आदि की टीम द्वारा।
ICML और EMNLP से लेकर NeurIPS तक, तीन साल में तीन पीढ़ियाँ लॉन्च करके, उन्होंने "एक-एक करके अगला शब्द अनुमान लगाने" वाली पारंपरिक समानांतर राह को भौतिक सीमा तक पहुँचा दिया।
यह पहले इस क्षेत्र का निरपेक्ष शासक था, लेकिन न्विडिया की नई सूची में, इसे केवल एक छोटे से 'रेफरेंस' स्थान पर धकेल दिया गया, और कारण बहुत छोटा है: स्वीकार्य लंबाई को अगली लहर ने पार कर लिया है।
तीसरी पंक्ति: MTP (मल्टी-टोकन प्रेडिक्शन)।
विचार मूल रूप से 2024 में मेटा द्वारा शुरू किया गया था, लेकिन जिसने इसे बड़े मॉडल निष्कर्षण के लिए मानक बना दिया, वह है DeepSeek -V3।
NVIDIA को इसकी बहुत उच्च सराहना मिली है — GPU पर बड़े मॉडल के लिए सर्वश्रेष्ठ विकल्प। मुख्य बात यह है कि इस योजना को प्री-ट्रेनिंग चरण में ही मुख्य मॉडल के साथ साथ ट्रेन किया जाना चाहिए।
चौथी पंक्ति: DFlash। 6x नुकसानरहित त्वरण का खतरनाक खिलाड़ी।
तीन लेखक जियान चेन, येशेंग लियांग, ज़हिजियान लिउ। यह EAGLE और MTP के एक-एक करके अक्षर अनुमान लगाने वाले क्रमिक दृष्टिकोण को पूरी तरह से छोड़ देता है और बजाय इसके, प्रसार मॉडल को संदर्भित करता है, एकल फॉरवर्ड कैलकुलेशन के साथ, सीधे 7 टोकन की भविष्यवाणी की गई अनुक्रम को एक साथ उत्पन्न करता है, जिससे हरण (समय) को अधिकतम संपीड़ित किया गया है।
By the way, the advisor Zhijian Liu is an assistant professor at UCSD, but he is also a research scientist at NVIDIA Research.
पंक्ति 5: DSpark। DeepSeek और पeking विश्वविद्यालय के मिश्रित 24 सदस्यीय टीम द्वारा विकसित।
DFlash का समानांतर आर्किटेक्चर तेज है, लेकिन इसका एक घातक दोष है: जितना आगे अनुमान लगाया जाता है, उतना ही अनुमान गलत होता जाता है। अंश (स्वीकार्य लंबाई) को जानबूझकर बढ़ाने के लिए, DSpark ने समानांतर आधार पर एक अत्यंत हल्का क्रमिक मॉड्यूल जोड़ा है।
वास्तविक परीक्षण डेटा बहुत स्पष्ट है: स्वीकृत लंबाई EAGLE-3 की तुलना में लगभग 30% अधिक है और DFlash की तुलना में 18% अधिक है। इसमें DeepSeek ऑनलाइन उत्पादन वातावरण V4 में, गति MTP से 60% से 85% तक तेज है।
Hardware constants, reverse lock-in model architecture
इन चार पीढ़ियों की तकनीक ने केवल एल्गोरिदमिक बुद्धिमत्ता के बजाय कैलकुलेशन क्षमता को इतना निचोड़ लिया है।
बहुत से लोग सोचते हैं कि जितना अधिक ड्राफ्ट में अनुमान लगाएंगे, उतना ही अधिक लाभ होगा, लेकिन यह पूरी तरह से सिलिकॉन चिप के भौतिक नियमों को नजरअंदाज करता है।
जब ध्यान यंत्र डिकोडिंग समय का बड़ा हिस्सा लेता है, तो बड़े मॉडल के वैलिडेशन चरण में संसाधित किए जाने वाले टोकन की कुल संख्या 1+D (1 वास्तविक इनपुट + D खाका भविष्यवाणियाँ) होती है।
इस डेटा को GPU को प्रदान करने के लिए, हार्डवेयर नीचे स्तर पर Query हेड और KV हेड को समूहों में विभाजित करता है, और प्रत्येक समूह के ध्यान कोर के ब्लॉक आकार को GPU के भौतिक मैट्रिक्स की सीमा (Tile Size, वर्तमान आर्किटेक्चर में आमतौर पर 128) के अनुसार सख्ती से नियंत्रित किया जाना चाहिए।
इस प्रकार नीचे की संरेखण सूत्र प्राप्त होता है: G × (1 + D) ≤ 128
थोड़ा निष्कर्ष निकालने से, निवेडिया गाइड में अंतिम स्थिरांक नियम प्राप्त होता है:
D = 128G − 1
इसमें, G ध्यान समूह संख्या है (Query हेड और KV हेड का अनुपात)।
इसका मतलब है कि आपके मॉडल के डिज़ाइन के शुरुआती बिंदु पर ध्यान कैसे समूहीकृत किया गया, उसने सीधे तौर पर यह निर्धारित किया कि रूपरेखा को GPU के ब्लॉक को पूरी तरह से भरने के लिए कितने अक्षरों का अनुमान लगाना चाहिए।
अगर G=8 है, तो आप ठीक 15 अनुमान लगा सकते हैं; अगर G=32 है, तो केवल 3 अनुमान लगा सकते हैं। हार्डवेयर सीमा पार नहीं कर सकता, भले ही आपने अंतिम Tile का केवल आधा हिस्सा ही उपयोग किया हो, कैलकुलेशन की लागत पूरे Tile के आधार पर ही ली जाएगी।
पहले, अनुमानित डिकोडिंग एक मॉडल के प्रशिक्षण के बाद इंजीनियरिंग टीम द्वारा बाहरी त्वरण पैकेज के रूप में जोड़ा जाता था। लेकिन अब, निम्नस्तरीय भौतिक नियम आपको बताते हैं: एक हार्डवेयर मैट्रिक्स का स्थिरांक सीधे मॉडल आर्किटेक्चर के डिजाइन पैरामीटर में प्रतिबिंबित होता है।
हमारे अनुभव के अनुसार, कम से कम चिप निर्माता ऐसा नहीं करते कि वे एक निचले स्तर के हार्डवेयर के प्रतिबंध समीकरण को बड़े मॉडल के डिजाइन ड्राइंग में शामिल करें।
अंत
मॉडल रनिंग इफ़िशिएंसी की प्रतियोगिता का केंद्र पूरी तरह से बदल गया है।
बड़े पैरामीटर्स को बस जमा करने का युग समाप्त हो रहा है; अब वास्तविक निर्णायक कारक यह है कि कौन अपने नीचे के सिलिकॉन चिप की भौतिक सीमाओं को बेहतर समझता है।
इस नए मैदान में, जहां चिप विशालकाय ने नियमों को उलट दिया है, चीनी टीम अचानक से ही समाधान का डिफ़ॉल्ट उत्तर बन गई है।
जैसे कि NVIDIA जैसा कैलकुलेशन का शासक, वह स्टॉक पर कौन सा एल्गोरिथम रखा है, इस पर कोई आपत्ति नहीं करेगा।
लेकिन इस सिलिकॉन वेफर की सीमा को निकालने वाला यह आदर्श हल किसके द्वारा बनाया गया, वह स्पष्ट रूप से कागज पर छपा हुआ है।
यह लेख वेचेन ग्रुप "न्यूज़िज़ियुआन" से है, लेखक: ASI अपोकैलिप्स
