बहुत शानदार।
अभी-अभी, निविडा ने अपने अगली पीढ़ी के फ्लैगशिप कैबिनेट, वेरा रुबिन NVL72, के पहले ऑन-चिप परीक्षण डेटा को प्रकाशित किया।
और, इस प्रयोग ने सीधे लाया DeepSeek -V4-Pro, सबसे वास्तविक «एजेंट कोडिंग» कार्य चलाएं!
परिणाम आश्चर्यजनक हैं: वर्तमान शीर्ष एआई सुपरकंप्यूटर GB300 NVL72 की तुलना में, वेरा रुबिन की प्रति मेगावाट थ्रूपुट में 30 गुना की वृद्धि और प्रति टोकन लागत में 35 गुना की कमी दर्ज की गई!

किसी ने चिल्लाकर कहा: "मैंने निवेशकों को धोखा देने के लिए भी इतना नहीं लिखा होता!"
एक और यूजर ने मजाकिया टिप्पणी की: "पहले मुझे लगता था कि H200 की कीमत 30,000 डॉलर बहुत ज्यादा है, लेकिन अब पीछे मुड़कर देखूं तो पता चलता है कि H200 तो बस बेसिक वर्जन भी नहीं है।"

आइए इसे ध्यान से जांचें।
H200 से GB300 तक, वास्तविक Agent वर्कलोड की थ्रूपुट में अधिकतम 30 गुना की वृद्धि हुई है, और लागत लगभग दोगुनी हो गई है।
GB300 से वेरा रुबिन तक, थ्रूपुट फिर से 30 गुना तक बढ़ गया है, और पूरे रैक की कीमत लगभग दोगुनी हो गई है।
अगर लाओ हुआंग के मोर्स के नियम के अनुसार, तो पिछले दो वर्षों में निविडिया की सबसे बड़ी तकनीकी क्रांति GPU खुद नहीं, बल्कि इसकी कीमत 4 गुना बढ़ाकर 900 गुना तेज़ी पाना है!

इस बार, न्वीडिया ने सभी को एक विपरीत तथ्य की घोषणा की: LLM युग समाप्त हो गया है, एजेंट युग आ गया है, पिछले AI परफॉर्मेंस बेंचमार्क सब अमान्य हो गए!

इसी बीच, एजेंट्स के लिए विशेष रूप से डिज़ाइन किया गया Vera CPU, मस्क के SpaceXAI द्वारा रातभर इंस्टॉल कर दिया गया है, और इसे सीधे अंतरिक्ष में भेजने की तैयारी भी की जा रही है।
आज ही, निवेडिया ग्रोक 3 एलपीएक्स भी पूर्ण उत्पादन में आ गया है।
Gemma 4 31B ऊपर चल रहा है, इसकी गति बेहद शानदार है, सीधे 3400 टोकन प्रति सेकंड तक पहुँच गया। ट्रिलियन पैरामीटर मॉडल की थ्रूपुट, 35 गुना तेज।


ये नए रिकॉर्ड, आज रात से ही Agent इकोसिस्टम के व्यापारिक ढांचे को फिर से लिख देंगे!
Why must NVIDIA launch Vera Rubin?
OpenRouter के नवीनतम डेटा से उत्तर मिलता है: वास्तविक दुनिया में, एक Agent AI कार्य द्वारा खप्त Token की संख्या, सामान्य चैट बातचीत की तुलना में 15 गुना है!
उदाहरण के लिए, यदि किसी एजेंट को एक कंपनी की अध्ययन करके निवेश निर्णय लेने के लिए भेजा जाए, तो इस प्रक्रिया में एजेंट और सब-एजेंट लगातार तर्क करते रहेंगे, और संचित टोकन अगले चरण के इनपुट के रूप में उपयोग होंगे, जिससे लंबे संदर्भ का संसाधन ही एजेंट AI के लिए सबसे महत्वपूर्ण सीमा बन जाती है।

जितनी अधिक बार स्मार्ट एजेंट अंतर्क्रिया करते हैं, उतना ही अधिक थ्रूपुट होता है—स्मार्ट एजेंट की संख्या 10 गुना बढ़ गई, टूल कॉल 2 गुना बढ़ गए, और कैलकुलेशन क्षमता और एल्गोरिदम के बीच के संघर्ष ने नए आवश्यकताओं को जन्म दिया।

Don't treat chat as an agent; all old benchmarks are obsolete!
इस समय, पारंपरिक AI बेंचमार्क (जैसे निश्चित लंबाई के 8K/1K अनुक्रम परीक्षण) पूरी तरह अक्षम हो जाते हैं।
NVIDIA ने स्पष्ट कर दिया: प्रदर्शन मापन को विकसित किया जाना चाहिए! एकल अनुरोध के आधार पर मापन नहीं, बल्कि पूर्ण Agent वर्कफ्लो को पकड़ना आवश्यक है।
इसके लिए, उन्होंने SemiAnalysis के अधीनस्थ AgentX बेंचमार्क का उपयोग किया।
यह परीक्षण अब कठोर प्रश्नोत्तरी नहीं है, बल्कि वास्तविक, संदर्भ-आधारित वृद्धि, उपकरण आह्वान और उप-बुद्धिमान उत्पादन के साथ «कोडिंग सत्र» का पुनर्निर्माण है।

इसीलिए H200 नए Agent के मैदान में असमर्थ है, वेरा रुबिन को राजा बनना है।
वेरा रुबिन NVL72 × DeepSeek-V4-Pro:
हैशरेट मोन्स्टर आ गया है
वेरा रुबिन NVL72 की क्षमता साबित करने के लिए, न्विडिया ने ओपन सोर्स के राजा— DeepSeek -V4-Pro (1.6T) का ऑन-चिप परीक्षण किया जा रहा है।
डेटा आने के बाद, परिणाम आश्चर्यजनक है—
AgentX वर्कलोड के तहत, Vera Rubin NVL72 की प्रति मेगावाट थ्रूपुट, GB300 NVL72 की तुलना में अधिकतम 30 गुना तक बढ़ गई!

ध्यान दें, यहाँ पुराने H200 की तुलना नहीं, बल्कि बहुत लोकप्रिय मुख्य GB300 की तुलना की जा रही है।
GB300 एक ही DeepSeek -V4-Pro टेस्ट में, प्रति मेगावॉट थ्रूपुट पहले से 15 गुना बेहतर हो गया है।
हालांकि वेरा रुबिन ने GB300 के कंधे पर फिर से 30 गुना ऊँचाई तक पहुँच ली और पूरे पैरेटो वक्र को और ऊपर उठा दिया!
What does this mean?
इससे बिजली की आपूर्ति के प्रतिबंधों के तहत काम करने वाले "AI कारखानों" के लिए भौतिक नियमों की सीमाएँ सीधे विस्तारित होती हैं।
एक ही बिजली बजट के तहत, वेरा रुबिन 30 गुना अधिक एजेंट कार्य कर सकती है।
मेगावॉट और गीगावॉट स्तर के डेटासेंटर्स के लिए, यह 30 गुना की कैलकुलेशन एसेट्स को अचानक बना देता है।
इसके अलावा, NVIDIA DSX MaxLPS तकनीक GPU, रैक और वर्कलोड स्तर पर बिजली प्रबंधन कर सकती है, जिससे समान मेगावाट बजट में GPU की संख्या में अधिकतम 40% वृद्धि हो सकती है, जिससे AI कारखाने की प्रति मेगावाट थ्रूपुट और बढ़ जाती है!

टोकन लागत 35 गुना गिर गई! एजेंट उद्योग का «लेजर» पूरी तरह से फिर से लिखा गया
प्रति मेगावॉट थ्रूपुट, जो प्रत्येक जेनरेट किए गए टोकन की लागत को सीधे प्रभावित करता है। प्रदर्शन में वृद्धि, व्यावसायिक मॉडल के नाभिकीय विस्फोट का सबसे सीधा परिणाम है।
निविडा ने घोषणा की कि वेरा रुबिन NVL72 प्रति मिलियन टोकन की लागत, GB300 NVL72 की तुलना में अधिकतम 35 गुना कम है!

जब निष्कर्ष लेने की लागत 35 गुना अचानक गिर जाए, तो 24 घंटे अविरत डिजिटल कर्मचारी सामने आ जाएंगे, और ToC सुपर ऐप्स में भारी विस्फोट होगा।
लाओ हुआंग के इस कदम ने एजेंट एप्लिकेशन के युग के दरवाजे को सीधे खोल दिया।

Extreme Coordinated Design: How did Huang do it?
आप पूछ सकते हैं: 30 गुना तेज़ कैसे? क्या यह एकल चिप के प्रक्रम पर निर्भर करता है?
Obviously not.
Vera Rubin NVL72 का अद्भुत प्रदर्शन सुधार, 「अत्यधिक सहयोगात्मक डिज़ाइन」 के कारण है।

जैसे अलग सेवाएँ, वितरित KV कैश, KV-अनुभवी रूटिंग, मेगाMoE आदि।

इसके अलावा, NVFP4 क्वांटाइजेशन मॉडल वेट्स को सीधे 4-बिट परिशुद्धता तक संपीड़ित करता है, जिससे आउटपुट की गुणवत्ता को प्रभावित किए बिना मेमोरी उपयोग में भारी कमी आती है और थ्रूपुट तुरंत बढ़ जाता है।
और छठी पीढ़ी के NVLink और बड़े मॉडल MoE द्वारा, एक ऐसा नेटवर्क प्रदान किया जाता है जो तैयार इथरनेट से 10 गुना तेज और 3 गुना कम लेटेंसी प्रदान करता है, जिससे जैसे DeepSeek इस MoE आर्किटेक्चर पर आधारित बड़े मॉडल को 72 GPU के बीच विभिन्न 'विशेषज्ञ' सबनेटवर्क्स को बिना किसी रुकावट के कॉल करने की सुविधा है।
यह अब केवल GPU बेचने की बात नहीं है, रेड ने एक पूरा “AI पावर प्लांट” बेचा है।

NVIDIA Groq 3 LPX का पूर्ण उत्पादन शुरू:
3400 टोकन/सेकंड, कोड एजेंट बदल गया!
इस Hot Chips 2026 सम्मेलन में, NVIDIA ने एक आश्चर्यजनक घोषणा भी की: Groq 3 LPX का पूर्ण उत्पादन शुरू हो गया है!

Groq 3 LPX, Vera Rubin NVL72 डेटासेंटर प्लेटफॉर्म के लिए एक विशिष्ट विस्तार है।
यह इस सिस्टम के लिए विशेष रूप से डिज़ाइन किया गया है, जिसका मुख्य फोकस निम्न लेटेंसी निष्पादन त्वरण है।
यह काला तकनीकी उपकरण पिछले दिसंबर में निवेशक ने शुरुआती कंपनी Groq से 200 बिलियन डॉलर का भुगतान करके खरीदा था।

AI एजेंट्स को डिकोडिंग लेटेंसी की समस्या का सामना करना पड़ता है, इस पीड़ा को समाप्त करने के लिए, Groq 3 LPX बड़े कॉन्टेक्स्ट प्रोसेसिंग और टोकन जनरेशन को पूरी तरह से अलग करता है।
NVIDIA का समाधान है कि Rubin GPU बड़े संदर्भ को संभाले और अत्यधिक तेज़ी से Token उत्पन्न करने का कार्य Groq 3 LPX को सौंप दें।
एक पढ़ने के लिए, एक लिखने के लिए, हर कोई अपनी सबसे अच्छी बात करता है।

एक पूर्ण रैक-लेवल डिप्लॉयमेंट में, अत्यधिक बैंडविड्थ इंटरकनेक्ट के माध्यम से अधिकतम 256 LP30 एक्सेलरेटर्स GPU के साथ सहयोग कर सकते हैं और एंटरप्राइज-लेवल की इन्फरेंस इंजन का निर्माण कर सकते हैं।

इससे, Groq 3 LPX ने रिकॉर्ड ब्रेकिंग आउटपुट स्पीड हासिल कर ली।
Artificial Analysis के बेंचमार्क में, Groq 3 LPX ने 100,000 Token के लंबे कॉन्टेक्स्ट विंडो के साथ Gemma 4 31B चलाया, और आउटपुट स्पीड 3,400 Token/सेकंड तक पहुंच गई!
This makes it four times faster in response than competitors for latency-critical workloads.

जो कार्य पिछले कुछ घंटों में पूरा किए जा सकते थे, अब कुछ मिनटों में पूरे किए जा सकते हैं!

Groq 3 LPX ने 5000 टोकन जेनरेट करने में समय 50 सेकंड से घटाकर 1.5 सेकंड कर दिया, 34 गुना का अंतर।

और कोडिंग टास्क में, Groq 3 LPX की अधिकतम आउटपुट गति 6981 टोकन/सेकंड है।

हुआंग रेन्शुन ने सीधे कहा कि LPX के माध्यम से अत्यधिक तेज़ टोकन उत्पादन को आगे बढ़ाकर AI थ्रूपुट और प्रतिक्रिया क्षमता में "एक और विशाल कूद" हुई है।

Nebius ने Nebius Token Factory में यह चिप डिप्लॉय किया है, ताकि एजेंट साइकिल के प्रत्येक चरण में तत्काल प्रतिक्रिया का अद्भुत अनुभव मिल सके।

इसके बाद, ग्रोक स्वयं भी आता है।

पहला Agent-विशिष्ट CPU लॉन्च किया गया,
मस्क ने रातभर "अंतरिक्ष में प्रवेश किया"!
इस आधिकारिक घोषणा में, सबसे अधिक दांव लगाने वाला कदम Vera CPU है।
एजेंट के लिए, न्यूडिया ने एक विशेष CPU बनाया।
Vera यह CPU, जो एजेंट को पूरी तरह से भरने के लिए विशेष रूप से बनाया गया है,
इसमें 88 स्व-विकसित Olympus कोर, उच्च बैंडविड्थ LPDDR5X मेमोरी और 1.2 TB/s तक सीधा बैंडविड्थ शामिल है।

बड़े मॉडल युग में नया CPU क्यों आवश्यक है?
Hot Chips पर, NVIDIA के Vera CPU के अधिकारी ने सीधे कहा, "Agentic AI सबसे जटिल कंप्यूटेशनल टास्क है।"

एक कार्य के लिए, एजेंट के पीछे सैकड़ों कदम चलने पड़ते हैं: उपकरणों को कॉल करना, Python कोड निष्पादित करना, संदर्भ को बदलना, विशाल मात्रा में डेटा को संसाधित करना...
इन डिलीवरी स्केड्यूलिंग कार्यों को सभी CPU पर जोर देकर संभालना पड़ता है। इसलिए, NVIDIA को Agent के लिए अलग CPU बनाना होगा।
इस बात को ध्यान में रखते हुए, मस्क की SpaceXAI ने रातभर में घोषणा कर दी कि वह निवेडिया Vera CPU का आमूलचूल बड़े पैमाने पर तैनाती कर रही है!
इस साल मई में ही, निविडा ने पहले Vera सैंपल्स को चुपचाप A कंपनी, OpenAI और SpaceXAI को भेजकर पहले 'परीक्षण' किया।
केवल तीन महीने बाद, SpaceXAI इसे पूर्ण तैनाती में स्थानांतरित करने के लिए बेसब्री से इंतजार कर रहा है।
अधिक अद्भुत बात यह है कि SpaceXAI, Grok को संचालित करने के लिए Vera Rubin प्लेटफॉर्म पर गीगावॉट कैपेसिटी फैक्ट्री बना रहा है।
不仅如此,这套算力还要被直接送上太空。
मस्क ने कहा, "दो मजबूत टीमों ने मिलकर 2028 में बड़े पैमाने पर तैनात किए जाने वाले वेरा रुबिन NVL72 का अनुकूलित संस्करण डिज़ाइन किया है।"

SpaceXAI की पहली पीढ़ी के 'Starmind' AI उपग्रह को Vera Rubin NVL72 रैक-लेवल सिस्टम के साथ लॉन्च किया जाने की योजना है।

एक GPU से लेकर पूरी Agent फैक्ट्री तक
उसी दिन, दो प्रमुख चिप्स, Vera CPU और Groq 3 LPX, का पूर्ण उत्पादन शुरू हो गया।
This is significant for NVIDIA.

बड़े मॉडल के युग में, न्वाडिया ने GPU के माध्यम से ट्रेनिंग और इन्फरेंस पर कब्जा किया।
एजेंट युग में, इसका क्षेत्र CPU, इन्फरेंस एक्सेलरेटर, NVLink आदि तक विस्तारित हो चुका है।
लाओ हुआंग बेच रहे हैं, जो अब केवल एक GPU नहीं है।
वह एक ऐसा AI कारखाना बेच रहा है, जो लगातार Token उत्पन्न कर सकता है।
इस बार, लाओ हुआंग पूरे «एजेंट युग» के लिए फिर से नींव रखने जा रहे हैं।
संदर्भ:
https://x.com/MinLiBuilds/status/2091915873661686204
https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/
https://developer.nvidia.com/blog/inside-nvidia-groq-3-lpx-the-low-latency-inference-accelerator-for-the-nvidia-vera-rubin-platform/
https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/
यह लेख वेचेन ग्रुप "न्यूज़िज़यन" से आया है, लेखक: ASI उपदेश
