بہت زبردست۔
ابھی ابھی، نوویدیا نے اپنے اگلے جنریشن کے فلگشپ کیبنٹ Vera Rubin NVL72 کے پہلے چپ پر ٹیسٹ ڈیٹا کا اعلان کیا ہے۔
اور اس بار کے عملی ٹیسٹ نے براہ راست لایا DeepSeek -V4-Pro، سب سے اصلی «ایجینٹ کوڈنگ» ٹاسک کے لیے!
نتیجہ حیرت انگیز ہے: موجودہ لیڈر گیم چیف GB300 NVL72 کے مقابلے میں ویرا روبن کی فی میگاواٹ ذخیرہ صلاحیت میں 30 گنا اضافہ اور ٹوکن لاگت میں 35 گنا کمی ہوئی!

کسی نے چیخ کر کہا: "میں نے تو انvestors کو جھوٹ بولنے کے لیے بھی ایسا PPT نہیں بنایا!"
ایک صارف نے مزاحیہ تبصرہ کیا: "پہلے میں H200 کو 30,000 امریکی ڈالر کی قیمت پر مہنگا سمجھتا تھا، لیکن اب پیچھے مڑ کر دیکھوں تو، H200 تو اب گدی ورژن بھی نہیں لگتا۔"

آئیے اسے تفصیل سے جانچیں۔
H200 سے GB300 تک، اصل Agent ورک لوڈ کی ٹھیکہ 30 گنا تک بڑھ گئی، جبکہ لاگت تقریباً دگنی ہو گئی۔
GB300 سے لے کر ویرا روبن تک، ذخیرہ کشی دوبارہ 30 گنا تک بڑھ گئی، اور مکمل ریک کی قیمت تقریباً دوگنا ہو گئی۔
لیڈی ہوئنگ کے مور کے قانون کے مطابق، پچھلے دو سالوں میں نوڈیا کا سب سے بڑا ٹیکنالوجیکل برجھا GPU خود نہیں بلکہ اس کی قیمت چار گنا بڑھا کر 900 گنا تیزی حاصل کرنا تھا!

اس بار، نوڈیا نے سب کو ایک غیر متوقع حقیقت کا اعلان کیا: LLM کا دور ختم ہو چکا ہے، ایجنٹ کا دور شروع ہو گیا ہے، اور پرانے AI اسکورنگ بینچ مارکس بالکل بے کار ہو چکے ہیں!

اسی دوران، ایجینٹس کے لیے خصوصی طور پر تیار کیا گیا Vera CPU، ماسک کی SpaceXAI نے رات بھر کام کرکے اسے انسٹال کر دیا ہے، اور اسے فوراً خلاء میں بھیجنے کی تیاری بھی کر رہی ہے۔
آج ہی، نویدیا گروک 3 LPX بھی مکمل طور پر تیار کیا جانے لگا۔
گیما 4 31B اوپر چل رہا ہے، اس کی رفتار بے مثال ہے، جو فوراً 3400 ٹوکن فی سیکنڈ تک پہنچ گیا۔ تریلین پیرامیٹر ماڈل کی ٹھیکہ رفتار، 35 گنا تیز۔


یہ نئے ریکارڈ، آج رات سے ہی ایجینٹ ایکوسسٹم کے کاروباری منظر کو دوبارہ لکھ دیں گے!
کیوں نیوڈیا کو ویرا روبن لانچ کرنا چاہیے؟
OpenRouter کے تازہ ترین ڈیٹا کے مطابق، اصل دنیا میں ایک Agent AI کا کام عام چیٹ ڈائیلاگ کے 15 گنا زیادہ ٹوکنز استعمال کرتا ہے!
مثلاً، اگر کسی ایجنٹ کو ایک کمپنی کی تحقیق کے لیے سرمایہ کاری کے فیصلے کے لیے متعین کیا جائے، تو اس عمل کے دوران ایجنٹ اور ذیلی ایجنٹس لگاتار استدلال کرتے رہیں گے، اور جمع ہونے والے ٹوکن اگلے مرحلے کے لیے ان پٹ بن جائیں گے، جس سے لمبے حوالہ متن کا معالجہ ایجنٹ AI کی سب سے اہم پابندی بن جاتا ہے۔

جتنی زیادہ بار ذہنی ایجنٹس آپس میں تعامل کرتے ہیں، اتنی زیادہ ٹھوکر ہوتی ہے — ذہنی ایجنٹس کی تعداد دس گنا بڑھنے سے ٹولز کے استعمال میں دو گنا اضافہ ہوا، جس سے کمپوٹیشنل طاقت اور الگورتھمز کے درمیان تنازع نئی ضرورتیں پیدا کر دیں۔

چیٹ کو ایجینٹ نہ سمجھیں، پرانا بینچ مارک مکمل طور پر ختم!
اس وقت، روایتی AI بینچ مارکس (جیسے مخصوص لمبائی کے 8K/1K سیکوئنس ٹیسٹ) مکمل طور پر بے کار ہو جاتے ہیں۔
نیوڈیا نے واضح کر دیا: پرفارمنس کی پیمائش کو ترقی دینا ہوگا! صرف ایک منفرد انفرینس کے درخواست کو نہیں، بلکہ مکمل ایجنٹ ورک فلو کو پکڑنا ہوگا۔
اس کے لیے، انہوں نے SemiAnalysis کے زیر انتظام AgentX بینچ مارک کا استعمال کیا۔
یہ ٹیسٹ اب سخت سوال وجواب نہیں ہے، بلکہ حقیقی، متن کے ساتھ بڑھتے ہوئے، ٹولز کے استعمال اور ذیلی انسٹیگنٹس کی تخلیق کے ساتھ «کوڈنگ سیشن» کی ریکارڈڈ ریپلے ہے۔

اسی لیے H200 نئے Agent میدان میں کمزور ثابت ہوا، ویرا روبن کو بادشاہ بننا ہے۔
ورا روبن NVL72 × DeepSeek-V4-Pro:
ہیش پاور مونسٹر آ گیا ہے
ویرا روبن NVL72 کی طاقت کو ثابت کرنے کے لیے، نوڈیا نے خود کو کھلے ذرائع کا بادشاہ — DeepSeek -V4-Pro (1.6T) کو آن چپ پر ٹیسٹ کیا جا رہا ہے۔
ڈیٹا جاری ہوتے ہی نتائج حیرت انگیز ہو گئے—
AgentX ورک لوڈ کے تحت، Vera Rubin NVL72 کی فی میگاواٹ تھروپٹ GB300 NVL72 کے مقابلے میں تین گنا تک بڑھ گئی!

براہ کرم توجہ دیں، یہاں پر پرانے H200 کا مقابلہ نہیں بلکہ بہت مقبول مین لائن GB300 کا مقابلہ کیا جا رہا ہے۔
GB300 اسی پر DeepSeek -V4-Pro کے ٹیسٹ میں، فی میگاواٹ ذخیرہ کاری H200 کے مقابلے میں 15 گنا بڑھ چکی ہے۔
لیکن ویرا روبن نے GB300 کے کندھوں پر 30 گنا بڑھا دیا اور پیاریٹو منحنی پر مزید بڑھا دیا!
اس کا کیا مطلب ہے؟
برق کی فراہمی پر منحصر "AI فیکٹریوں" کے لیے، یہ فزیکل قوانین کے سرحد کو ب без توسیع کرتا ہے۔
ایک ہی بجلی کے بجٹ کے تحت، ویرا روبن تین گنا ذہین ایجنٹس کا کام کر سکتی ہے۔
میگاواٹ یا گیگاواٹ سطح کے ڈیٹا سینٹرز کے لیے، یہ 30 گنا کمپوٹنگ اثاثوں کو فضا سے پیدا کرنے کے برابر ہے۔
اس کے علاوہ، NVIDIA DSX MaxLPS ٹیکنالوجی GPU، ریک، اور ورک لوڈ کے سطح پر بجلی کا انتظام کرتی ہے، جس سے ایک ہی میگاواٹ بجٹ میں 40 فیصد تک زیادہ GPU قابلِ اضافہ ہوتے ہیں، جس سے AI فیکٹری کی میگاواٹ فی ٹھوسنگ میں مزید بہتری ہوتی ہے!

ٹوکن لاگت 35 گنا کم ہو گئی! ایجنٹ صنعت کا «دفتر» مکمل طور پر دوبارہ لکھا گیا
ہر میگاواٹ کے ذخیرہ کے ساتھ، ہر ٹوکن کی پیداوار کی لاگت براہ راست متاثر ہوتی ہے۔ صلاحیت میں اضافہ کا سب سے براہ راست نتیجہ تجارتی ماڈل کا نیوکلیئر دھماکہ ہے۔
نیوڈیا نے اعلان کیا ہے کہ ویرا روبن NVL72 کی فی ملین ٹوکن تولید لاگت، GB300 NVL72 سے تکریباً 35 گنا کم ہے!

جب استدلال کی لاگت 35 گنا کم ہو جائے، تو 24 گھنٹے کام کرنے والے ڈیجیٹل ملازمین حقیقت بن جائیں گے، اور ToC سپر ایپس میں بڑا اضافہ ہوگا۔
لاؤ ہوئنگ نے ایک کٹ لگا کر ایجنٹ ایپلیکیشنز کے دور کا دروازہ کھول دیا۔

بہترین ہم آہنگی ڈیزائن: لاؤ ہو نے اسے کیسے حاصل کیا؟
آپ پوچھ سکتے ہیں: 30 گنا تیز کیسے؟ کیا یہ ایک ہی چپ کے پروسیس کی وجہ سے ہے؟
بالکل نہیں۔
ورا روبن NVL72 کی حیرت انگیز کارکردگی میں اضافہ، "بہت زیادہ ہم آہنگ ڈیزائن" کی وجہ سے ہے۔

جیسے الگ الگ سروسز، ڈسٹریبیوٹڈ KV کیش، KV ایوئیر راؤٹنگ، میگا مو ای وغیرہ۔

اس کے علاوہ، NVFP4 کوانتائزیشن براہ راست ماڈل وزن کو 4 بٹ کی درستگی تک دباتی ہے، جس سے آؤٹ پٹ کی معیار میں کمی کے بغیر میموری کا استعمال کافی حد تک کم ہو جاتا ہے اور ٹھراؤ بڑھ جاتا ہے۔
اور جنریشن 6 NVLink اور بڑے ماڈل MoE کے ساتھ، ایک ایسا انٹرکنیکٹیو نیٹ ورک فراہم کیا جاتا ہے جو موجودہ ایتھرنیٹ سے 10 گنا تیز اور تین گنا کم لیٹنسی کے ساتھ ہے، جس سے DeepSeek یہ MoE آرکیٹیکچر پر مبنی بڑا ماڈل 72 جی پی یو کے درمیان مختلف "ماہر" سب نیٹ ورکس کو آرام سے استعمال کر سکتا ہے۔
یہ صرف گرافکس کارڈ فروخت نہیں ہے، لاؤ ہو پورا ایک “AI بجلی گھر” بیچ رہا ہے۔

NVIDIA Groq 3 LPX کا مکمل بڑے پیمانے پر پیداوار:
سیکنڈ کے لیے 3400 ٹوکن، کوڈ ایجینٹ کا تبدیل ہونا!
اس Hot Chips 2026 کانفرنس میں، نوڈیا نے ایک حیرت انگیز اعلان بھی کیا: گروک 3 LPX کا مکمل تیاری شروع ہو چکا ہے!

Groq 3 LPX، جو Vera Rubin NVL72 ڈیٹا سینٹر پلیٹ فارم کے لیے مخصوص اضافہ ہے۔
یہ اس سسٹم کے لیے خصوصی طور پر ڈیزائن کیا گیا ہے، جس کا مرکزی خصوصیت کم تاخیر والی استدلال تیزی ہے۔
یہ سیاہ ٹیکنالوجی، گزشتہ دسمبر میں نوڈیا نے اسٹارٹ اپ گروک سے 200 ارب امریکی ڈالر خرچ کر کے خریدی تھی۔

AI ایجینٹس کو ڈیکوڈنگ میں تاخیر کا سامنا ہوتا ہے، اس پریشانی کو ختم کرنے کے لیے، Groq 3 LPX نے بڑے کنٹیکس کے معالجہ اور ٹوکن جنریشن کو مکمل طور پر الگ کر دیا ہے۔
نوڈیا کا حل یہ ہے کہ Ruben GPU کو بڑے پیمانے پر سیاق و سباق کے لیے استعمال کیا جائے اور ٹوکن کی تیزی سے پیداوار کا کام Groq 3 LPX کو دیا جائے۔
ایک پڑھنے کا، ایک لکھنے کا، ہر ایک اپنی سب سے اچھی چیز کرتا ہے۔

ایک مکمل ریک سطحی ڈیپلویمنٹ میں، 256 تک LP30 ایکسیلریٹرز کو超高 بینڈ ویتھ انٹرکنیکشن کے ذریعے جوڑا جا سکتا ہے تاکہ جی پی یو کے ساتھ مل کر کاروباری سایز کا انفرنس انجن بنایا جا سکے۔

اس طرح، Groq 3 LPX نے براہ راست ریکارڈ توڑنے والی آؤٹ پٹ سپیڈ حاصل کر لی۔
Artificial Analysis کے بینچ مارک میں، Groq 3 LPX نے 100,000 ٹوکن کے لمبے کنٹیکس ونڈو کے ساتھ Gemma 4 31B چلایا، جس سے حیرت انگیز 3,400 ٹوکن/سیکنڈ کی رفتار سے آؤٹ پٹ ملا!
یہ اسے انتہائی حساس تاخیر والے ورک لوڈز میں مقابلہ کرنے والوں کے مقابلے میں 4 گنا تیز ردعمل فراہم کرتا ہے۔

اب کچھ ہی منٹوں میں وہ متعدد مرحلہ ایجنٹ کام مکمل ہو جاتے ہیں جو پچھلے کچھ گھنٹوں لگتے تھے!

Groq 3 LPX، 5000 ٹوکنز کو جنریٹ کرنے میں وقت 50 سیکنڈ سے گھٹا کر 1.5 سیکنڈ کر دیا گیا، 34 گنا کا فرق۔

اور کوڈنگ کے کام میں، Groq 3 LPX کی زیادہ سے زیادہ آؤٹ پٹ رفتار 6981 ٹوکن/سیکنڈ ہے۔

ہو رنیون نے صاف کہا کہ LPX کے ذریعے ا超高速 ٹوکن جنریشن کو فروغ دے کر AI کی ٹھیکنگ اور ریسپانس کی صلاحیت میں "ایک اور بڑی کھچھڑی" حاصل ہوئی ہے۔

نیبیس نے اپنے نیبیس ٹوکن فیکٹری میں یہ چپ ڈپلوی کر دیا ہے، جس سے ایجنٹ سائکل کے ہر مرحلے پر فوری ردعمل کا بہترین تجربہ ممکن ہو جاتا ہے۔

اس کے بعد، گروک خود بھی آئے گا۔

پہلا Agent کے لیے مخصوص CPU جاری کیا گیا،
ماسک نے رات بھر کھڑکی سے باہر نکل کر "انٹرنیٹ پر چڑھ دیا"!
اس اعلان میں سب سے خیالی قدم، ویرا سی پی یو ہے۔
ایجینٹ کے لیے نوڈیا نے ایک خاص CPU تیار کیا۔
ویرا یہ سی پی یو، صرف اسٹائل کو بھرنا ہے،
اس میں 88 خود ساختہ Olympus کورز، اعلی بینڈ ویتھ LPDDR5X میموری شامل ہے، جس کی بینڈ ویتھ ب без 1.2TB/s تک ہے۔

بڑے ماڈلز کے دور میں نئے CPU کیوں درکار ہیں؟
ہاٹ چپس کے مقام پر، نوڈیا ویرا سی پی یو کے ایگزیکٹو نے کہا، "ایجنٹک آئی اے سب سے زیادہ پیچیدہ کمپیوٹنگ ٹاسک ہے۔"

ایک ٹاسک کے لیے، ایجنٹ کو سینکڑوں اقدامات کرنے پڑتے ہیں: ٹولز کا استعمال کرنا، پائیتھن کوڈ انجام دینا، کنٹیکسٹ کو چیک کرنا، بہت زیادہ ڈیٹا کو پروسیس کرنا...
یہ سب ڈیلیوری اسکیڈولنگ کے کامز CPU پر ہی بوجھ کے طور پر ڈال دیے جاتے ہیں۔ اس لیے، نوڈیا کو ایجینٹ کے لیے الگ CPU تیار کرنا ہوگا۔
اس بات کو مد نظر رکھتے ہوئے، مسک کی SpaceXAI نے رات بھر کام کرکے نیوڈیا کے Vera CPU کو تجارتی سطح پر لاگو کرنے کا اعلان کر دیا!
اس سال مئی میں ہی نیوڈیا نے اپنے پہلے ویرا نمونوں کو اے کمپنی، اوپن اے آئی، اسپیس ایکس اے آئی کو چھپا کر بھیج دیا تاکہ وہ پہلے ٹیسٹ کر سکیں۔
صرف تین ماہ بعد، SpaceXAI اسے مکمل طور پر لاگو کرنے کے لیے بے صبر ہو گیا۔
مزید پاگلپن یہ ہے کہ SpaceXAI، Grok کو چلانے کے لیے Vera Rubin پلیٹ فارم پر گیگاواٹ کی کمپوٹنگ فیکٹری تعمیر کر رہا ہے۔
اس کے علاوہ، یہ حسابی طاقت براہ راست خلاء میں بھیجی جائے گی۔
ماسک نے کہا، "دو مضبوط کمپنیوں نے مل کر 2028 میں بڑے پیمانے پر تنصیب کے لیے ایک بہترین ویرا روبن NVL72 ڈیزائن کیا ہے۔"

سپیس ایکس اے آئی کی پہلی نسل کے "سٹار مائنڈ" AI سیٹلائٹ کو ویرا روبن NVL72 ریک لیول سسٹم کے ساتھ ڈیزائن کیا گیا ہے۔

ایک GPU سے لے کر پوری Agent فیکٹری تک
اسی دن، دو بڑے چپس ویرا سی پی یو اور گروک 3 ایل پی ایکس کا مکمل تیاری کا عمل شروع ہو گیا۔
This is significant for NVIDIA.

بڑے ماڈل کے دور میں، نوڈیا نے گیم پر ٹریننگ اور انفرنس حاصل کی۔
ایجینٹ کے دور میں، اس کا دائرہ کار CPU، انفرس ایکسلریٹرز، NVLink وغیرہ تک پھیل چکا ہے۔
لاؤ ہوئن نے جو کچھ بیچا، وہ صرف ایک GPU نہیں تھا۔
وہ جو بیچنا چاہتا ہے، وہ ایک ایسا AI فیکٹری ہے جو لگاتار ٹوکن پیدا کر سکتی ہے۔
اس بار، لاؤ ہوئان پورے «ایجنٹ دور» کے لیے بنیاد دوبارہ ڈال رہے ہیں۔
حوالہ جات:
https://x.com/MinLiBuilds/status/2091915873661686204
https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/
https://developer.nvidia.com/blog/inside-nvidia-groq-3-lpx-the-low-latency-inference-accelerator-for-the-nvidia-vera-rubin-platform/
https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/
یہ مضمون ویچن گروپ "نیوزی یوآن" سے ہے، مصنف: ASI وحی
