نیوڈیا نے AI انفرنس پری-فِل کی تیزی سے تیار کرنے والے GPU پروجیکٹ "Rubin CPX" کو دوبارہ شروع کر دیا ہے، جس کی پیداوار 2027 کے پہلے تہائی میں شروع ہونے کی منصوبہ بندی ہے۔ یہ مصنوعہ لمبے سیاق و سباق کے پری-فِل سیناریوز کے لیے ڈیزائن کیا گیا ہے، جس میں 168GB HBM4 میموری شامل ہے اور اس کی کمپوٹنگ پاور معیاری Rubin GPU کے قریب ہے، جبکہ ایک گرافکس کارڈ کی طاقت 2300 واٹ تک پہنچ جاتی ہے۔ اس مصنوعے کو الگ MGX ETL ریک ڈیزائن کے ساتھ فراہم کیا جائے گا، جو 64 سے 256 GPU تک لچکدار ڈپلوئمنٹ کنفگریشن کو سپورٹ کرتا ہے۔ انٹرکنکٹ اسٹرکچر ہائیرارکل ڈیزائن پر مبنی ہے، جس میں ایک ٹرے کے اندر NVLink استعمال ہوتا ہے اور ٹرےز کے درمیان ایتھرنٹ، جو صلاحیت اور لاگت کے درمیان توازن برقرار رکھتا ہے۔ Rubin CPX، معیاری Rubin GPU کے ساتھ مل کر پری-فِل ایکسلریٹر کے طور پر استعمال ہوگا، جس میں 1:1 کے تناسب سے تقسیم کام کیا جائے گا—CPX پری-فِل اور KV Cache تخلیق کرے گا، جبکہ Rubin GPU ڈیکوڈنگ کا کام کرے گا، جو لمبے سیاق و سباق کے انفرنس سیناریوز کے لیے خصوصی طور پر بہتر بنایا گیا ہے۔مضمون کے مصنف، ذریعہ: وول سٹریٹ ویزن
نیوڈیا نے ایک ایسے چپ پروجیکٹ کو دوبارہ شروع کر دیا ہے جسے مارکیٹ نے پہلے چھوڑ دیا تھا، اور یہ پروجیکٹ AI انفرنس کے لیے اعلیٰ لاگت والے پری فل (Prefill) ایکٹ کو ہدف بناتا ہے۔
نیوڈیا نے AI انفرنس پری فل کی تیزی سے گاڑیوں کا منصوبہ "Rubin CPX" دوبارہ شروع کیا ہے اور مصنوعات کے ڈیزائن میں بڑے تبدیلیاں کی ہیں۔ موجودہ منصوبہ کے مطابق، نئی نسخہ Rubin CPX کا پیداوار 2027 کے پہلے تिमاہی میں شروع ہونے کا تصور ہے۔
اس منصوبے کی دوبارہ شروعات ایک واضح سگنل ہے کہ NVIDIA AI انفرنس کے مرحلے میں پری فل کی صلاحیت اور لاگت کی پابندیوں کو حل کرنے پر زور دے رہا ہے۔ جب بڑے ماڈلز کی کنٹیکس لمبائی مسلسل بڑھ رہی ہے، تو پری فل مرحلہ بہت زیادہ ان پٹ معلومات کو معالجہ کرنے اور KV Cache تخلیق کرنے کی ضرورت رکھتا ہے، جس کی کارکردگی AI انفرنس کی کل لاگت اور ڈپلوئمنٹ کی مالیات پر فوری اثر ڈالتی ہے۔
گو مینگچی کا کہنا ہے کہ موجودہ وقت میں 50% سے زیادہ AI استنتاج کے ورک لوڈز ان پٹ کنٹیکس کے معالجہ اور KV کیش کی تعمیر سے آ رہے ہیں۔
چپ کی مخصوصات میں بڑی تبدیلی کی گئی ہے، جس سے کمپوٹیشنل پاور روبن کے معیاری سطح کے قریب پہنچ گئی ہے
طاقت اور بجلی کے استعمال کے لحاظ سے، نئی نسخہ CPX کی کارکردگی معیاری Rubin GPU کے قریب پہنچ گئی ہے، اور ایک کارڈ کی 최高 بجلی کا استعمال بھی 2300 واٹ تک پہنچ گیا ہے۔ میموری کے لحاظ سے، نئی CPX نے 128GB GDDR7 کے پچھلے حل کے مقابلے میں 168GB HBM4 ویڈیو میموری استعمال کی ہے، لیکن اب بھی معیاری Rubin GPU کے 288GB HBM4 سے کم ہے۔
گو مینگچی کے مطابق، 8-کارڈ CPX کمپیوٹنگ ٹرے کی مجموعی HBM4 کی صلاحیت تقریباً 1.34 ٹی بی ہے، جو زیادہ تر لمبے سیاق و سباق پر پری فل کرنے کے کاموں اور متعلقہ KV کیش کی ضروریات کو پورا کرتی ہے۔ اس کا مطلب ہے کہ Rubin CPX صرف زیادہ عام کمپوٹیشنل پاور کے لیے نہیں بنایا گیا، بلکہ لمبے سیاق و سباق کے مناظر کے لیے گرافکس میموری کی صلاحیت اور پری فل کرنے کی کارکردگی کو دوبارہ ڈیزائن کیا گیا ہے۔
اشیئڈ ریک سے انڈیپینڈنٹ ڈیپلویمنٹ پر منتقل ہوں، جس سے کنفیگریشن زیادہ لچکدار ہو جاتی ہے
ریک ارکیٹیکچر بھی اس تبدیلی کا مرکزی نقطہ ہے۔
پہلے منصوبے میں، CPX نے Rubin GPU کے ساتھ ریک شیئر کرنے کا منصوبہ بنایا تھا؛ نئے ورژن میں، اسے الگ MGX ETL ریک کا استعمال کرتے ہوئے تبدیل کر دیا گیا ہے، جس سے صارفین CPX کی کمپوٹنگ طاقت کو اپنی ضروریات کے مطابق الگ سے بڑھا سکتے ہیں۔
بذریعہ تفصیل، صارفین 64، 128، 192 یا 256 CPX GPU کے ڈیپلومنٹ سائز کا انتخاب کر سکتے ہیں۔ ہر 64 CPX GPU ایک ریک ماڈیول تشکیل دیتے ہیں، جس میں 8 کمپیوٹنگ ٹرے شامل ہیں، جن میں سے ہر ایک پر 8 CPX GPU لگے ہوتے ہیں، اور ایک سوئچ ٹرے بھی شامل ہوتا ہے۔
ماڈیولر ڈیزائن کا مطلب ہے کہ صارفین کو مخصوص، بڑے سائز کے Rubin ریکس خریدنے کی ضرورت نہیں ہے؛ وہ CPX کی کمپوٹنگ طاقت کو اپنی حقیقی ضروریات کے مطابق، پہلے سے بھرے ہوئے لوڈ کے ساتھ لچک سے بڑھا سکتے ہیں۔
لیوریڈ انٹرکنیکشن ڈیزائن، پری-فِل کی ڈیپلومنٹ لاگت کو کم کرتا ہے
انٹرکنیکٹڈ آرکیٹیکچر پر، روبن CPX ایک لیئرڈ ڈیزائن استعمال کرتا ہے جو صلاحیت اور لاگت کے درمیان توازن برقرار رکھتا ہے۔
ایک یکجا کمپیوٹنگ ٹرے کے اندر، 8 CPX GPU کو NVLink کے ذریعے سکیل-اپ کیا جاتا ہے۔ ہر CPX GPU کا NVLink بینڈ ویتھ 1 سے 1.5 TB/s ہے، جو معیاری Rubin GPU کے 3.6 TB/s سے کم ہے۔
اسکیل آؤٹ لیول پر، CPX کریسٹل کے درمیان اور ریک ماڈیول کے اندر Spectrum-6 ایتھر نیٹ وائٹ کی مکمل تانبے کی L1 لینکس استعمال کرتا ہے؛ جبکہ ریک ماڈیولز کے درمیان کنکشن کے لیے، ہر ماڈیول کے Spectrum-6 سوئچز کے ذریعے OSFP فائبر لینکس کے ذریعے انٹرکنکٹ کیا جاتا ہے۔
بالکل اونچی بینڈ ویتھ GPU انٹر کنکشن پر انحصار کرنے والے حل کے مقابلے میں، یہ لیئرڈ آرکیٹیکچر پری فل پاسکیس کے لیے لاگت کو بہتر بنانے پر زیادہ زور دیتا ہے۔
Rubin GPU کے ساتھ مل کر لمبے سیاق و سباق کی استدلال کی طرف متوجہ ہوں
Rubin CPX ایک مستقل کام کرنے والی جنرل پرپوز GPU نہیں ہے، بلکہ اسے Vera Rubin NVL72 کے ساتھ پری فل کرنے والے ایکسیلریٹر کے طور پر استعمال کیا جاتا ہے۔
گو مینگچی کے مطابق، نوڈیا CPX اور Rubin GPU کو 1:1 کے تناسب میں ڈپلو کرنے کی تجویز کرتا ہے: CPX پری فل کے مرحلے کی حسابگری کرتا ہے اور KV Cache تخلیق کرتا ہے، پھر KV Cache کو ایتھرنیٹ RDMA کے ذریعہ Rubin GPU تک بھیجا جاتا ہے، جو بعد کے ڈیکوڈنگ کا کام کرتا ہے۔
پروڈکٹ کی پوزیشننگ کے لحاظ سے، Rubin CPX کا مرکزی مقصد معیاری Rubin GPU کو تبدیل کرنا نہیں بلکہ AI انفرنس پروسیس کو مزید تقسیم کرنا ہے تاکہ مختلف GPU پری فل اور ڈیکوڈنگ کے کاموں کو الگ الگ سنبھال سکیں۔
گو مینگچی نے اسے "لمبے سیاق و سباق پر پریفِلِنگ کا بہترین قیمت اور مالیت کا حل" قرار دیا ہے۔ جیسے جیسے AI ماڈل کے سیاق و سباق کا ونڈو بڑھ رہا ہے، پریفِلِنگ مرحلے کی کمپوٹیشنل لوڈ اور KV کیش کا سائز مسلسل بڑھ رہا ہے، اور نیوڈیا کا اس بار CPX منصوبہ دوبارہ شروع کرنا شاید لمبے سیاق و سباق کی استدلال لاگت کو مزید کم کرنے کے لیے مخصوص ہارڈویئر اور ہائبرڈ ڈیپلوئمنٹ کے ذریعے کوشش ہے۔
