GPT-6 Astra ने खुलासा किया कि इसे ट्रेन करने के लिए 100,000 से अधिक Grace Blackwell GPU का उपयोग किया गया है, जिसका अर्थ है कि अग्रणी मॉडल प्रतिस्पर्धा अब अत्यधिक पैमाने के क्लस्टर युग में प्रवेश कर चुकी है।लेखक, स्रोत: ME News

TL;DR:
- GPT-6 Astra ने खुलासा किया कि इसे ट्रेन करने के लिए 100,000 से अधिक Grace Blackwell GPU का उपयोग किया गया है, जिसका अर्थ है कि अग्रणी मॉडल प्रतिस्पर्धा अब अत्यधिक पैमाने के क्लस्टर युग में प्रवेश कर चुकी है।
- चीन की शीर्ष मॉडल कंपनियों के पास विशालकाय कैलकुलेशन क्षमता नहीं है, लेकिन जारी जानकारी के अनुसार, उन्नत GPU पीढ़ियों और एकल स्थापना के पैमाने में अभी भी स्पष्ट अंतर है।
- ByteDance, Kimi, DeepSeek जैसी कंपनियों की कैलकुलेशन बुनियादी ढांचे की नियोजन बढ़ रहा है, लेकिन वर्तमान में अधिकांशतः Hopper आर्किटेक्चर या घरेलू विकल्पों पर केंद्रित है, जो Blackwell स्तर के क्लस्टर से अभी भी पीछे है।
- AI प्रतिस्पर्धा की कुंजी अब “क्या GPU है” से बदलकर “क्या आप नवीनतम पीढ़ी के GPU प्राप्त कर सकते हैं और लाखों चिप्स को कुशलतापूर्वक संगठित कर सकते हैं” हो गई है।
- भले ही ब्लैकवेल निविडा का सबसे नवीनतम आर्किटेक्चर न हो, रुबिन द्वारा ट्रेनिंग लागत को और कम करने की प्रवृत्ति का अर्थ है कि अग्रणी अंतर संभवतः बुनियादी ढांचे की क्षमता में केंद्रित होता रहेगा।
10 लाख Blackwell के पीछे, बड़े मॉडल प्रतिस्पर्धा गणना बुनियादी ढांचे के युग में प्रवेश कर रही है
जे एच नियन ने GPT-6 Astra के प्रशिक्षण आकार का खुलासा किया, तो बाहरी दुनिया केवल "10 लाख GPU" के अंक पर ही ध्यान नहीं दे रही थी, बल्कि इस अंक के पीछे एक नया AI प्रतिस्पर्धा मॉडल देख रही थी।
पिछले कुछ वर्षों में, बड़े मॉडल प्रतिस्पर्धा को अक्सर एल्गोरिदम, डेटा और इंजीनियरिंग क्षमता की प्रतिस्पर्धा के रूप में समझा गया है। मॉडल आर्किटेक्चर में नवाचार, प्रशिक्षण विधियों में अनुकूलन और निष्कर्षण दक्षता में सुधार, वास्तव में AI उत्पाद की अंतिम क्षमता को निर्धारित करते हैं। लेकिन 2026 के बाद, एक और अधिक स्पष्ट प्रवृत्ति बन रही है: जब मॉडल का आकार लगातार बढ़ता है, तो बुनियादी ढांचे की क्षमता स्वयं प्रौद्योगिकी की सीमा को निर्धारित करने का महत्वपूर्ण कारक बन रही है।
हर्नान युआन के खुलासे के अनुसार, GPT-6 Astra प्रशिक्षण के लिए 10 लाख से अधिक Grace Blackwell GPU का उपयोग किया गया है और इन्हें NVLink72 के माध्यम से उच्च गति के इंटरकनेक्ट क्लस्टर में जोड़ा गया है। उन्होंने यह भी कहा कि अगले समूह में 40 लाख GPU लाइव होंगे, लेकिन उन्होंने विशिष्ट मॉडल और स्वामित्व का खुलासा नहीं किया है।
भले ही भविष्य के डिप्लॉयमेंट विवरण क्या हों, यह संकेत बहुत स्पष्ट है: सबसे उन्नत मॉडल के प्रशिक्षण की प्रतिस्पर्धा, पिछले कई दसियों ट्रिलियन पैरामीटर और हजारों GPU की प्रतिस्पर्धा से बदलकर लाखों या दस लाखों उन्नत GPU क्लस्टर के बीच की प्रतिस्पर्धा हो गई है।
यहाँ मुख्य बात केवल संख्या नहीं है।
अगर केवल GPU की संख्या की तुलना की जाए, तो चीनी कंपनियों के पास पूरी तरह से बड़े पैमाने पर कैलकुलेशन संसाधन नहीं हैं। वास्तविक अंतर यह है कि क्या वे नवीनतम पीढ़ी के उच्च-प्रदर्शन GPU प्राप्त कर सकते हैं और क्या वे इन GPU को एक ही प्रशिक्षण कार्य में उच्च कुशलता से सहयोग करने के लिए सक्षम हैं।
बड़े मॉडल के लिए, एकल GPU की शीर्ष क्षमता केवल आधार है। एक बड़े मॉडल को प्रशिक्षित करने के लिए, कई GPU के बीच निरंतर रूप से पैरामीटर और डेटा का आदान-प्रदान होना आवश्यक है। यदि संबंधित दक्षता पर्याप्त नहीं है, तो भले ही आपके पास कई चिप हों, तब भी प्रभावी कैलकुलेशन क्षमता नहीं बन पाएगी।
इसलिए, AI बुनियादी ढांचे की प्रतिस्पर्धा, मूलतः "कितने कार्ड खरीदें" से बढ़कर "किस प्रकार का कंप्यूटिंग सिस्टम बनाएं" में बदल गई है।
चीन के शीर्ष मॉडल कंपनियों की कैलकुलेशन बुनियादी ढांचे की व्यवस्था, ब्लैकवेल युग के साथ पीढ़ीगत अंतर रखती है
वर्तमान में उपलब्ध जानकारी के अनुसार, चीन की शीर्ष मॉडल कंपनियों की कैलकुलेशन क्षमता तेजी से बढ़ रही है, लेकिन GPT-6 Astra द्वारा प्रतिनिधित्व किए जाने वाले Blackwell स्तर के ट्रेनिंग क्लस्टर की तुलना में अभी भी स्पष्ट अंतर है।
बाइटडांस देशी सार्वजनिक कैलकुलेशन बुनियादी ढांचे में अंतरराष्ट्रीय शीर्ष स्तर के सबसे निकटतम कंपनियों में से एक है। इस वर्ष, बाइटडांस ने मलेशिया के माध्यम से लगभग 36,000 B200 GPU जोड़े। ये चिप्स निविडा के ब्लैकवेल आर्किटेक्चर से संबंधित हैं और एस्ट्रा द्वारा उपयोग किए जाने वाले GB200 के समान पीढ़ी के हैं।
हालांकि, ध्यान दें कि यह B200 सेट विदेशों में तैनात किया गया है। बाइटडांस जब चीन के भीतर AI बुनियादी ढांचे का उल्लेख करता है, तो मुख्य रूप से Hopper आर्किटेक्चर के चीन-विशिष्ट H20 और पहले प्राप्त H800 जैसे चिप्स का उपयोग करता है।
इसमें दिखाई देने वाला केवल संख्यात्मक अंतर नहीं है, बल्कि आपूर्ति श्रृंखला और डिप्लॉयमेंट वातावरण का अंतर है।
Blackwell, Hopper की तुलना में गणना क्षमता, वीडियो मेमोरी और इंटरकनेक्ट क्षमता आदि में अपग्रेड किया गया है। विशेष रूप से GB200, यह केवल एक GPU नहीं है, बल्कि Grace CPU और Blackwell GPU को NVL72 सिस्टम के माध्यम से एक ही उच्च-गति इंटरकनेक्ट डोमेन में 72 GPU से जोड़ता है।
बड़े मॉडल्स के प्रशिक्षण के लिए, इस सिस्टम-लेवल डिज़ाइन का महत्व बढ़ता जा रहा है। क्योंकि जितना बड़ा मॉडल होगा, GPU के बीच संचार का अनुपात उतना ही अधिक होगा, और चिप्स के बीच कुशल सहयोग की क्षमता प्रशिक्षण की दक्षता पर सीधा प्रभाव डालेगी।
किमी के पीछे का मून ऑफ द डार्क साइड को अलीबाबा के माध्यम से लगभग 20,000 Hopper GPU प्राप्त हुए हैं। ब्लूमबर्ग के संदर्भ में यह बताया गया कि मॉडल H200 है, लेकिन अलीबाबा ने H200 मॉडल के बारे में इस दावे को नकार दिया है।
यदि H200 के आधार पर देखा जाए, तो यह अभी भी पिछली पीढ़ी के Hopper आर्किटेक्चर से संबंधित है, जबकि B200 अब Blackwell युग में प्रवेश कर चुका है। दोनों के बीच सिर्फ नया और पुराना बदलाव का संबंध नहीं है, बल्कि यह AI इंफ्रास्ट्रक्चर क्षमता के विभिन्न चरणों को दर्शाता है।
DeepSeek की स्थिति और भी विशेष है।
डीपसीक ने 2025 की शुरुआत में उच्च कुशलता वाले मॉडल के साथ वैश्विक ध्यान आकर्षित किया, और उसकी तकनीकी रणनीति ने साबित किया कि एल्गोरिदम अनुकूलन और इंजीनियरिंग कुशलता से कैलकुलेशन की आवश्यकता को आंशिक रूप से कम किया जा सकता है। हालाँकि, उपलब्ध जानकारी के अनुसार, कंपनी ने V4 की पूर्ण प्रशिक्षण हार्डवेयर कॉन्फ़िगरेशन का खुलासा नहीं किया है।
लियांग वेनफेंग के निवेशक बातचीत के ट्रांसक्रिप्ट में बताया गया कि कंपनी के पास मई में लगभग 20,000 H-समतुल्य कैलकुलेशन क्षमता थी, जिसमें से अधिकांश हाल ही में पहुंचे हैं, और भविष्य में खरीदारी “मूल रूप से NVIDIA” होगी। हुआवेई ने DeepSeek को लगभग 16,000 इकाइयों की क्षमता प्रदान की है। लियांग वेनफेंग ने कहा कि यह घरेलू कार्ड लगभग 4,000 NVIDIA B-सीरीज कार्ड के समतुल्य हैं, जो केवल वर्तमान पीढ़ी के मॉडल के प्रशिक्षण के लिए पर्याप्त हैं।
ये जानकारियाँ एक वास्तविकता को दर्शाती हैं: भले ही चीनी कंपनियों के पास काफी मात्रा में AI कैलकुलेशन क्षमता हो, लेकिन एक ही पीढ़ी के 100,000 उन्नत GPU का एक साथ प्रशिक्षण कार्य में उपयोग करने के लिए अभी भी पैमाने का अंतर है।
चीन की AI कैलकुलेशन क्षमता की वास्तविक कमी, चिप्स के अभाव में नहीं, बल्कि उन्नत क्लस्टर क्षमता के अभाव में है
चीनी AI कैलकुलेशन पावर पर चर्चा करते समय, आमतौर पर दो चरमों में फंस जाना आसान होता है।
एक दृष्टिकोण के अनुसार, चीन में उन्नत AI चिप्स की पूर्ण अनुपलब्धता है, इसलिए वह प्रतिस्पर्धा में भाग नहीं ले सकता; दूसरा दृष्टिकोण यह है कि जब तक घरेलू चिप्स की संख्या बढ़ेगी, तब तक निविडा को जल्दी से पीछे छोड़ा जा सकता है।
वास्तव में, स्थिति अधिक जटिल है।
AI ट्रेनिंग क्षमता कई घटकों द्वारा निर्धारित होती है, जिनमें चिप प्रदर्शन, उन्नत प्रक्रिया, वीडियो मेमोरी क्षमता, उच्च गति संबंध, सर्वर डिज़ाइन, डेटा केंद्र बिजली आपूर्ति, सॉफ्टवेयर पारिस्थिति और बड़े पैमाने पर स्केड्यूलिंग क्षमता शामिल हैं।
GPU केवल सबसे महत्वपूर्ण एक भाग है, लेकिन सब कुछ नहीं।
NVIDIA का लंबे समय तक बनाया गया लाभ केवल GPU हार्डवेयर से ही नहीं, बल्कि CUDA इकोसिस्टम, नेटवर्क इंटरकनेक्ट तकनीक, सर्वर समाधान और क्लाउड कंपनियों के साथ बनाई गई पूर्ण प्रणाली से भी आता है।
ब्लैकवेल के युग में, इस प्रणाली का लाभ और बढ़ गया।
जब एक मॉडल ट्रेनिंग के लिए 100,000 GPU की आवश्यकता होती है, तो समस्या केवल कुछ लाख चिप्स खरीदने की नहीं, बल्कि एक स्थिर रूप से कार्यरत बड़ी कंप्यूटिंग फैक्ट्री बनाने की होती है।
यही कारण है कि जनता के सामने उपलब्ध जानकारी में, चीनी कंपनियों ने अभी तक 100,000 एक ही पीढ़ी के उन्नत GPU का उपयोग करके एक मॉडल ट्रेनिंग पूरी करने का कोई मामला प्रकाशित नहीं किया है।
चीनी कंपनियाँ विभिन्न तरीकों से क्षमताओं को बढ़ा रही हैं, जिसमें विदेशी कैलकुलेशन क्षमता तैनाती बढ़ाना, घरेलू चिप्स के अनुकूलन के पैमाने को बढ़ाना, मॉडल आर्किटेक्चर को अनुकूलित करना और प्रशिक्षण की दक्षता बढ़ाना शामिल है। इन सभी पथों का मूल्य है, लेकिन छोटे समय के भीतर ये सबसे उन्नत GPU क्लस्टर द्वारा प्रदान की जाने वाली मूलभूत क्षमता के लाभ को पूरी तरह से प्रतिस्थापित करने में सक्षम नहीं होंगे।
पिछले कुछ वर्षों में, चीन का AI उद्योग एक तथ्य साबित किया है: एल्गोरिदम नवाचार कुछ अंतरों को काफी कम कर सकता है।
DeepSeek जैसी कंपनियों के आगमन से स्पष्ट होता है कि उत्कृष्ट इंजीनियरिंग टीमें मॉडल स्ट्रक्चर में सुधार, प्रशिक्षण रणनीति में समायोजन और संसाधन उपयोग की दक्षता में वृद्धि के माध्यम से सीमित कैलकुलेशन क्षमता के साथ भी क्रांतिकारी प्रगति हासिल कर सकती हैं।
लेकिन एक और तथ्य भी मौजूद है: जब वैश्विक प्रतिस्पर्धा अगली पीढ़ी के बेस मॉडल चरण में प्रवेश करती है, तो कैलकुलेशन क्षमता के पैमाने का महत्व अभी भी बढ़ता रहेगा।
दक्षता में सुधार से लागत कम की जा सकती है, लेकिन उन्नत हार्डवेयर और अति-विस्तारित क्लस्टर द्वारा लागू की गई क्षमता की सीमा को पूरी तरह से बदलना मुश्किल है।
Blackwell के बाद, Rubin का युग संभवतः बुनियादी ढांचे के अंतर को और बढ़ा सकता है
अधिक महत्वपूर्ण बात यह है कि ब्लैकवेल निवेडिया के वर्तमान तकनीकी मार्ग का अंत नहीं है।
निविडा की अगली पीढ़ी की वेरा रुबिन आर्किटेक्चर अब बड़े पैमाने पर उत्पादन में है। निविडा के खुले अनुमान के अनुसार, बड़े MoE मॉडल के प्रशिक्षण के लिए रुबिन द्वारा आवश्यक GPU की संख्या ब्लैकवेल की लगभग चौथाई होगी।
इसका अर्थ है कि भविष्य में AI प्रतिस्पर्धा में एक नया चक्र दिखाई दे सकता है।
लीडिंग कंपनियाँ नवीनतम आर्किटेक्चर के साथ आती हैं, इसलिए वे कम चिप्स के साथ बड़े पैमाने पर प्रशिक्षण कर सकती हैं; कम प्रशिक्षण लागत से कंपनियाँ अधिक प्रयोग करती हैं, जिससे मॉडल क्षमता में और वृद्धि होती है।
जबकि पिछड़े हुए उद्यम यदि केवल पिछली पीढ़ी के हार्डवेयर का ही उपयोग कर सकते हैं, तो उन्हें दो समस्याओं का सामना करना पड़ सकता है: एक ओर प्रशिक्षण की दक्षता कम होती है, और दूसरी ओर सबसे बड़े मॉडल में प्रतिस्पर्धा करना कठिन हो जाता है।
इसका अर्थ यह नहीं है कि चीनी AI कंपनियों के लिए कोई अवसर नहीं है।
AI के इतिहास ने बार-बार साबित किया है कि तकनीकी प्रतिस्पर्धा केवल एकल हार्डवेयर द्वारा निर्धारित नहीं होती। मॉडल नवाचार, अनुप्रयोग के मामले, व्यावसायिक क्षमता और इंजीनियरिंग दक्षता, सभी नए क्रांतिकारी विकास को जन्म दे सकते हैं।
लेकिन यदि बुनियादी ढांचे के दृष्टिकोण से देखा जाए, तो GPT-6 Astra द्वारा 100,000 Blackwell GPU का उपयोग करना एक ऐसा परिवर्तन दर्शाता है जो चल रहा है: वैश्विक AI प्रतिस्पर्धा का केंद्रीय मैदान, मॉडल स्तर से आगे गणना बुनियादी ढांचे के स्तर पर खिसक रहा है।
अगले कुछ वर्षों में, एक एआई कंपनी की प्रतिस्पर्धात्मकता का निर्धारण केवल एक उत्कृष्ट मॉडल को प्रशिक्षित करने की क्षमता से नहीं, बल्कि अगली पीढ़ी के मॉडल को निरंतर रूप से प्रशिक्षित करने की क्षमता से होगा।
चीनी AI उद्योग के लिए, वास्तव में जिसका पीछा किया जाना चाहिए, वह किसी एक मॉडल या किसी एक प्रकाशन नहीं, बल्कि चिप प्राप्ति, डेटा केंद्र निर्माण, क्लस्टर स्केड्यूलिंग से लेकर सॉफ्टवेयर पारिस्थिति तक की पूरी प्रणाली क्षमता है।
10 लाख Blackwell का महत्व इस बात में नहीं है कि यह एक अद्भुत संख्या बनाता है, बल्कि यह बाजार को याद दिलाता है कि कृत्रिम बुद्धिमत्ता औद्योगिक स्तर पर प्रवेश कर रही है, और औद्योगिक प्रतिस्पर्धा अंततः बुनियादी ढांचे पर निर्भर करती है।
संदर्भ स्रोत:
- NVIDIA's official public materials on Blackwell, GB200 NVL72, Vera Rubin architecture, and AI infrastructure.
- हुआंग रेनक्सुन के सार्वजनिक भाषण और मीडिया साक्षात्कार की जानकारी।
- ब्लूमबर्ग के बारे में किमी कैलकुलेशन की खरीद और H200 से संबंधित रिपोर्ट।
- ByteDance द्वारा खुलेआम जारी की गई AI बुनियादी ढांचे और विदेशी कैलकुलेशन शक्ति तैनाती की जानकारी।
- डीपसीक की जनसामान्य जानकारी और लियांग वेनफेंग निवेशकों के साथ बातचीत के संबंधित ट्रांसक्रिप्शन डेटा।
- अलीबाबा क्लाउड के बारे में AI बुनियादी ढांचे और बड़े मॉडल कैलकुलेशन क्षमता के सहयोग पर खुली जानकारी।
