مصنف: SemiAnalysis
ترجمہ: شن چاؤ ٹیک فلو
شین چاؤ کا خلاصہ: OpenAI کی پہلی خود ساختہ انفرینس چپ Jalapeño کے ٹیسٹ ڈیٹا سامنے آ گئے ہیں، جو نیوڈیا کی موجودہ فلگشپ Blackwell کی کارکردگی سے بہتر ہے اور اگلی نسل Rubin کے قریب پہنچ گئی ہے۔ ڈیٹا سینٹر کی بجلی کی پابندیوں سے جُڑے AI کمپنیوں کے لیے، یہ چپ اسکیل کے مارکیٹ کے منظر نامے کو تبدیل کر سکتی ہے۔ لیکن پہلی نسل کی چپ کیا واقعی نیوڈیا کے CUDA ایکوسسٹم کو متاثر کر پائے گی، اس بات پر ابھی سوال علامہ لگا ہوا ہے۔
اپنے خود کی ہوئے ASIC کا استعمال کرتے ہوئے Rubin، Jalapeño کی کل مالیت، فی میگاواٹ ذخیرہ صلاحیت، اور مزید تفصیلات کا موازنہ کریں
گزشتہ دو سالوں میں، OpenAI نے "Jalapeño" نامی ایک انفرینس چپ پر خاموشی سے کام کیا ہے، جس کا اعلان حال ہی میں Hot Chips پر ہوا ہے۔ چپ کے سکیس فل ریلیز کے افواہیں پہلے سے گردش کر رہی تھیں۔ لیکن اب ہمیں تفصیلات مل گئی ہیں۔ OpenAI نے ہمیں چپ دیکھنے، لیب میں جا کر اس کی اصلیت کی تصدیق کرنے، اور اپنے InferenceX ٹول کٹ کا استعمال کرکے بنچ مارک کرنے کے لیے دعوت دی ہے۔
2024ء کے جون میں، OpenAI نے بروکوم کے ساتھ مل کر ایک چپ کا منصوبہ جاری کیا، جو LLM انفرنس کے لیے صفر سے تیار کیا گیا۔ ڈیزائن کا کام 2024ء کے وسط میں شروع ہوا، اور ابتدائی ٹیم کے انتخاب سے لے کر تیاری تک صرف تقریباً 16 ماہ لگے، جو ایک بہت تیز ASIC ترقی کا دورہ ہے۔
عام طور پر، پہلی نسل کے چپس مقابلہ نہیں کر پاتے، لیکن OpenAI نے اس کے برعکس کیا اور متعدد ٹاپ اوپن سورس ماڈلز پر، ہم نے جتنے بھی NVIDIA، AMD اور Google کے چپس ٹیسٹ کیے، ان سب پر فتح حاصل کی اور صنعت کی قیادت کی۔ OpenAI کی کامیابی کا راز انتہائی نرم اور سخت اضافی ڈیزائن ہے۔ حیرت کی بات یہ ہے کہ OpenAI نے ماڈل انفرنس کے کسی خاص پہلو پر زیادہ توجہ نہیں دی، بلکہ ایک ایسا عام چپ بنانے پر توجہ دی جو تمام سیناریوز میں بلند پرفارمنس فراہم کرے۔
یہ مضمون Jalapeño کے InferenceX پر آرکیٹیکچرل تفصیلات، سافٹ ویئر تفصیلات اور پرفارمنس کے نتائج پر گہرائی سے روشنی ڈالے گا۔

ایک جامع استدلال چپ
سب کہتے ہیں کہ OpenAI کا چپ OpenAI ماڈل کے لیے خصوصی طور پر ڈیزائن کیا گیا ہے، لیکن یہ غلط ہے، OpenAI نے AI انفرنس کے لیے ایک جامع چپ بنائی ہے۔
ٹائم لائن بہت پاگل ہے۔ یہ ثابت کرتا ہے کہ "AI کے ذریعے چپ ڈیزائن کو تیز کرنا" کا دعویٰ سچ ہے۔ حالانکہ ٹائم لائن تیز ہے، لیکن OpenAI نے بہت زیادہ پیسہ خرچ کیا، عملی ڈیزائن کے فیصلے کیے، اور ٹیم بہت مضبوط تھی، اس لیے یہ حیران کن نہیں ہے۔
صرف اسپیکس دیکھ کر، یہ فوراً ایک طاقتور مقابلہ کرنے والا بن جاتا ہے:

اور HBM4 کا استعمال کرکے اسے نوڈیا اور AMD کے فلگشپ GPU کے ساتھ موازنہ کرنے کے قابل بنائیں:

کئی میڈیا نے اس چپ کے بارے میں رپورٹ کرتے ہوئے OpenAI کے کچھ بے ترتیب بیانات پر یقین کر لیا کہ یہ چپ اپنے ماڈلز کو دیگر چپس کے ذریعے نہیں کیے جانے والے طریقے سے آپٹمائز کرے گی۔ یہ غلط ہے۔ Jalapeño ایک جنرل پرپوز ریزنگ چپ ہے جو مختلف ماڈلز اور مختلف ورک لوڈز، بشمول ہمارے InferenceX بینچ مارک کو چلا سکتی ہے—ہم نے اس بینچ مارک کو اپنے لیب میں OpenAI انجینئرز کے ساتھ مل کر چلایا تھا۔ مزاح کے طور پر، OpenAI نے ہمیں یہ بھی دکھایا کہ وہ اس پر "Doom" کھیل چلا رہے ہیں، جسے صرف Codex پرامپٹس کے ذریعے ان کی چپ پر منتقل کر دیا گیا تھا۔
ہم نے مجموعی طور پر فی میگاواٹ بجلی کے استعمال کے تحت ٹوکن ٹھروپٹ کو دیکھا ہے۔ جالاپینو دیگر تمام چپس کے مقابلے میں بالکل بہتر ہے۔ یہ سب کچھ ملٹی ٹوکن پریڈکشن (MTP) کے بغیر حاصل کیا گیا ہے، جبکہ گراف میں دیگر چپس اپنی اپنی SKU کے بہترین ترتیبات کے ساتھ MTP کے ساتھ چل رہی ہیں۔

جلاپینیو تقریباً تمام سیناریوز میں بلاکول کے مقابلے میں صرفہ/واٹ کے لحاظ سے بہتر پرفارم کرتا ہے، اور کسی خاص نقطہ کے لیے آپٹیمائز نہیں کیا گیا۔ یہ نہ صرف کم لیٹنسی والے سیناریوز میں بہترین ہے، بلکہ ہائی تھروٹل سیناریوز میں بھی عمدہ پرفارم کرتا ہے۔ ایک اور انصاف پر مبنی تقابل ایک ٹوکن کے پیشگوئی نتائج کا ہے، جس میں جلاپینیو ہر مقابلہ کرنے والے کو کئی فاصلوں سے پیچھے چھوڑ دیتا ہے۔ کم کانکرنسی سیناریوز میں، جلاپینیو نے گہری تفصیل R1 ماڈل پر ایک صرف صارف کے لیے فی سیکنڈ 700 سے زائد ٹوکنز کا اندازہ لگایا۔
حیران کن بات یہ ہے کہ یہ سب ایک ٹوکن پریڈکشن (STP) کے ذریعے حاصل کیا گیا، بغیر کسی تخمینہ ڈیکوڈنگ یا پری-فِل اور ڈیکوڈنگ کے الگ کرنے کے۔ DeepSeek R1 کے علاوہ، ہم نے دیگر کچھ ماڈلز جیسے Kimi-K2.5 اور GPT-OSS بھی دیکھے جو تقریباً ہر صارف کے لیے فی سیکنڈ 1,400 ٹوکن تک پہنچ گئے۔ تمام ماڈلز کے لیے، ہم نے تصدیق کی ہے کہ Jalapeño کا GSM8k ایوانٹ نیکوڈیا چپس کے برابر ہے۔
کچھ نوٹس ہیں۔ پہلا، تمام ڈیٹا OpenAI سے فراہم کیا گیا ہے۔ ہم نے اپنے لیب میں InferenceX کا عمل تصدیق کیا ہے، لیکن مکمل InferenceX بینچ مارک سوٹ نہیں چلایا اور AgentX کے نتائج نہیں دیکھے۔ AgentX ہمارا چپ کی پرفارمنس کے لیے پسندیدہ بینچ مارک سوٹ ہے، کیونکہ اس کے ڈیٹا سیٹ کی طویل سیاق و سباق اور متعدد راؤنڈ کی خصوصیات حقیقی پروڈکشن ورک لوڈ کے تحت کیش کے رویے کو ظاہر کرتی ہیں۔ 8k1k پر اچھا پرفارم کرنے والا فریم ورک AgentX پر زیادہ خراب پرفارم کر سکتا ہے، کیونکہ حقیقی پروڈکشن ورک لوڈ روتر، پریفکس کیش مکانزم، کیش مینجمنٹ، اور آفلاڈ انفراسٹرکچر جیسے اجزاء کو ٹیسٹ کرتا ہے۔ ایک راؤنڈ 8k1k ٹیسٹ ان عناصر تک نہیں پہنچتا۔ مزید تفصیلات کے لیے ہمارے AgentX آرٹیکل کو پڑھیں۔
AgentX - InferenceXv3: کیا CUDA کا دفاعی دیوار ایجنٹ انفرنس میں اب بھی برقرار ہے؟
دوم، ہم سمجھتے ہیں کہ بلاک ویل کے ساتھ تقابل کچھ ناقص اور منصفانہ نہیں ہے۔ جلاپینیو کا اصل مقابلہ ایسے چپس ہیں جو HBM4 کا استعمال کرتے ہیں، جیسے روبن۔ ویرا روبن سسٹم ابھی صارفین کو شپنگ شروع کر چکا ہے، جبکہ OpenAI کا جلاپینیو ابھی صرف انجینئرنگ نمونہ ہے، اور اس کے لیے تیاری کے لیے اب بھی کچھ عرصہ درکار ہے۔
اس لیے، پرفارمنس کا حقیقی موازنہ روبن کے ساتھ ہونا چاہیے، بلوکول کے ساتھ نہیں۔ کچھ معنوں میں، ہم پہلے ہی انتظار کر رہے تھے کہ جالاپینو جیسے کسٹم چپس بلوکول سے آگے نکل جائیں گے۔ ویرا روبن NVL72 کی پرفارمنس فی واٹ، GB200 NVL72 کی 5.4 گنا ہے، جس کا ذکر ہم نے پچھلے ماہ نیوڈیا اور کوروویو کے پرفارمنس دعوؤں کے تجزیہ میں کیا تھا۔ ہم جلد ہی جالاپینو اور ویرا روبن کے جولائی کے پرفارمنس ڈیٹا کا موازنہ کریں گے۔
ورا روبن NVL72 کا GB200 NVL72 کے ساتھ موازنہ؟ ریزنگ TCO اور آرکیٹیکچر تجزیہ
تیسری بات، ٹیسٹ کیے گئے ماڈلز کھلے ذرائع کے سب سے آگے نہیں ہیں۔ نوڈیا اور ایم ڈی اے نے پہلے ہی AgentX کے ذریعے بڑے ماڈلز جیسے DeepSeek V4 Pro اور Kimi K3 کے نتائج شائع کر دیے ہیں۔ جتنا بڑا اور جتنا نیا ماڈل ہوگا، اسے نئے چپ پر چلانا اتنا ہی پیچیدہ ہوگا۔ تاہم، OpenAI نے Jalapeño پر بھی کافی بڑا ماڈل چلا لیا ہے۔
Performance Analysis
OpenAI کا ڈیزائن ہدف پرفارمنس فی واٹ ہے۔ وجہ آسان ہے: OpenAI کی موجودہ حد بجٹ یا سرور روم کی جگہ نہیں، بلکہ ڈیٹا سینٹر کی بجلی پر منحصر ہے، اس لیے فی میگاواٹ ٹوکن کی تعداد اہم ہے۔ Computex 2026 پر، ہوائِنگ نے کہا کہ پرفارمنس فی واٹ، قابلیت اور لمبی عمر مستقبل کے GPU کی بنیادی خصوصیات ہیں۔ اس نے اپنے الفاظ میں کہا: "اگر آپ کے پاس ایک گیگاواٹ بجلی ہے، تو فی واٹ ٹھوکر معاوضہ ہے۔" اس نے مزید کہا کہ صرف اس لیے کہ چپ سستی ہے، غلط آرکٹیکچر منتخب کرنا بے معنی ہے۔

نیوڈیا نے Hot Chips 2026 کے ویرا سیشن میں بھی یہ بات زور دے کر کہی اور اسی آمدنی کا گراف پیش کیا: "آج کے دن ڈیٹا سنٹر بجلی کی حد تک محدود ہیں۔" بجلی انتہائی اہم ہے اور آمدنی کو چلاتی ہے۔
آپریٹرز کو آسانی سے مزید میگاواٹ حاصل نہیں کر سکتے۔ جی پی یو کو بڑھانے اور بجلی کے شبکے کی صلاحیت بڑھانے کے درمیان وقت کا فرق بہت زیادہ ہے۔ ڈیٹا سینٹر کی بجلی کی حد بہت سی پابندیوں سے متاثر ہے۔ مثال کے طور پر، یونٹیلٹی کنکشن، بنیادی ڈھانچہ، ٹھنڈا کرنے کی صلاحیت اور یو پی ایس/بیک اپ جنریٹر ڈیزائن۔ بجلی کے شبکے کی تاخیر بار بار ہارڈویئر اور تعمیر کی رفتار سے آگے نکل جاتی ہے، جس سے بک ٹاؤن بجلی کی صلاحیت کی ضرورت پیدا ہوتی ہے۔ یعنی ڈیٹا سینٹر کے مقام پر گیس ٹربائن اور فیلڈ جنریٹرز تعمیر کرنا۔ یہ صلاحیتیں یونٹیلٹی میٹر کے بعد واقع ہوتی ہیں اور عوامی بجلی کے شبکے پر انحصار نہیں کرتیں۔ اس سے آپریٹرز کو بجلی کے شبکے کنکشن اور یونٹیلٹی اپگریڈ کا انتظار کرنے کی ضرورت نہیں پڑتی تاکہ وہ اپنے فیسٹلٹیز کو بجلی فراہم کر سکیں۔ یہی وجہ ہے کہ xAI کا Colossus 2 بک ٹاؤن بجلی پر شدید طور پر انحصار کرتا ہے، جبکہ اس کا عملی بجلی کنکشن کافی عرصہ تاخیر میں ہے۔ مزید معلومات کے لئے ہمارے توانائی ماڈل دेखیں۔
جیسا کہ ہم نے اپنے X پوسٹ میں لکھا تھا، tok/s/MW کو ہر جول کے لیے ٹوکن کی تعداد کے طور پر سادہ کیا جا سکتا ہے۔ کیونکہ واٹ ہر سیکنڈ جول ہے۔ اس لیے tok/s/MW نظام کی کارکردگی اور توانائی کو ٹوکن میں تبدیل کرنے کی صلاحیت کو ظاہر کرتا ہے۔

اس حوالے سے، جلپیںو نے روبن کے مقابلے میں بھی فتح حاصل کر لی ہے۔ OpenAI کا Jalapeño ہر میگاواٹ STP پر ٹوکن ٹھوسٹ کی شرح میں Vera Rubin کے MTP نتائج سے آگے نکل گیا ہے۔ یہ نتیجہ نوڈیا اور کورویو نے جولائی میں جاری کیا تھا۔ یہ نتیجہ GB200 کے 2025 کے MTP نتائج سے بھی کافی زیادہ ہے۔ جیسا کہ ہم نے Vera Rubin کے مضمون میں بتایا تھا، VR اور 2025 کے GB200 نتائج کا موازنہ کیا گیا ہے۔ اس کا سبب یہ ہے کہ دونوں اسی قسم کے ابتدائی شروعاتی مراحل میں ہیں۔ اس کے علاوہ، 2025 کے GB200 کے ساتھ موازنہ کرنے سے سافٹ ویئر کی بالغت مستقل رہتی ہے۔ اس منطق کے مطابق، ہم تین قسم کے نتائج کا موازنہ کرتے ہیں: Vera Rubin کا جدید ترین جولائی 2026 کا نتیجہ، GB200 کا 2025 کا نتیجہ، اور موجودہ Jalapeño کا نتیجہ۔ یہ موازنہ بہت منطقی ہے کیونکہ یہ بہترین علنا شدہ Rubin ڈیٹا ہیں۔ اس کے علاوہ، OpenAI نے Rubin کے بعد اپنا چپ جاری کیا ہے۔ OpenAI اور Rubin دونوں ابھی تک بالغ نہیں ہوئے، اس لیے ان کی پرفارمنس مزید بڑھتی رہے گی۔

性能 اور کل مالیاتی اخراجات (TCO) کے لحاظ سے، ویرا روبن اور جلپیونو کا اداء مساوی ہے۔ ہر امریکی ڈالر کے لحاظ سے تقریباً ایک جیسی آؤٹ پٹ ٹوکن کی تعداد پیدا ہوتی ہے۔ تاہم، جیسا کہ پہلے بیان کیا گیا، جلپیونو کے نتائج میں توقعات کے ساتھ ڈیکوڈنگ استعمال نہیں کی گئی ہے، جبکہ ویرا روبن کے نتائج میں توقعات کے ساتھ ڈیکوڈنگ استعمال کی گئی ہے۔ توقعات کے ساتھ ڈیکوڈنگ سے ہر ٹوکن کی لاگت تقریباً 3 سے 5 گنا کم ہو جاتی ہے۔ جب جلپیونو توقعات کے ساتھ ڈیکوڈنگ کو لاگو کر لے گا، تو اس کا ٹوکن فراہم کرنا زیادہ لاگت کے لحاظ سے موثر ہو جائے گا۔ بالکل، TCO کا کچھ فائدہ نوڈیا کی اعلیٰ منافع شرح سے بچ کر بروکوم کی کم (لیکن ابھی بھی اعلیٰ) منافع شرح پر منتقل ہونے سے حاصل ہوتا ہے۔ لیکن یہ واحد وجہ نہیں ہے۔ مثال کے طور پر، میٹا اور مائیکروسافٹ کے AI ASIC منصوبوں میں زیادہ وقت لگا لیکن انہیں کامیاب نہیں بنایا جا سکا۔ اس سے ظاہر ہوتا ہے کہ لاگت صرف مساوات کا ایک حصہ ہے۔ جلپیونو کا مکمل TCO تفصیل، SemiAnalysis AI Cloud TCO ماڈل میں دستیاب ہے۔

آرکیٹیکچر کے لحاظ سے، OpenAI نے پری فل (prefill) اور ڈیکوڈ (decode) کو الگ الگ چپ پولز میں تقسیم نہیں کیا۔ ڈرافٹ ماڈل اور مین ماڈل ایک ہی چپ اور انٹرکنیکشن سٹرکچر کا استعمال کرتے ہیں۔ اس ڈیزائن فلسفے نے نظریاتی کارکردگی کا کچھ حصہ قربان کر دیا ہے تاکہ عملی آپریشنز میں آسانی حاصل ہو۔ اس کا مقصد یہ ہے کہ ورک لوڈ کا ترکیب وقت کے ساتھ تبدیل ہوتا رہتا ہے۔ مثال کے طور پر، ان پٹ، کیش ورائٹ، کیش ریڈ اور آؤٹ پٹ ٹوکن کا تناسب مسلسل تبدیل ہو چکا ہے۔ یہ تبدیلی ہم نے تین ماڈل دوروں کے بعد تجربہ کی ہے: جو کہ علم، استدلال اور ایجنٹس ہیں، جیسا کہ ہمارے حالیہ مضمون میں بحث کی گئی ہے۔ اس لیے، اگر ہم غیر ہموجنس پری فل اور ڈیکوڈ سلیکون کے لیے پہلے سے مقرر ثابت تعداد تعین کرتے، تو وقت کے ساتھ ساتھ اس سے کارکردگی میں کمی آتی۔ OpenAI نے اس آرکیٹیکچر میں ہموجنس پول کا انتخاب کیا ہے اور چپس کو تمام کاموں پر بہترین طریقے سے کام کرنے کے لیے ترجیح دی گئی ہے۔
اور اس نے ایسا کیا۔ کیمی K2.5 (جو کرسر کمپوزر 2.5 کی بنیاد ہے) پر، جلاپینو کی رفتار 700 ٹوک/صارف تک پہنچ گئی۔ یہ رفتار دوسرے بہترین چپ کی 100 ٹوک/صارف کی نسبت 9 گنا سے زیادہ ہے۔

GPT-OSS پر، دوبارہ ایک دوسرے کو دبانے کا مظاہرہ۔ Jalapeño کی فی میگاواٹ انٹرایکٹو ٹھروپٹ گیب 200 کے اعلی ترین ٹھروپٹ کا تقریباً دوگنا ہے۔ اور GB200 کے 1 کانکرنس کا 50 گنا سے زیادہ ہے۔ زیادہ کانکرنس والے Jalapeño پوائنٹس EP8 استعمال کرتے ہیں۔

یہ نتائج حیرت انگیز ہیں! لیکن ہمیں تفصیل سے دیکھنا ہوگا: یہ صرف 8k1k ہیں، جن کا فائن ٹیوننگ کرنا بہت آسان ہے، اور ان پر اب تک AgentX کا کوئی رن ڈیٹا نہیں ہے۔ جیسا کہ ہم نے AgentX آرٹیکل میں بتایا، متعدد راؤنڈ اور لمبے کانٹیکسٹ ورک لوڈ ریزنگ اسٹیک کے زیادہ پہلوؤں پر دباؤ ڈالتے ہیں۔ مثال کے طور پر روتر اور پریفکس کیش۔ ایجنٹ ورک لوڈ میں بہترین پرفارمنس کے لیے مزید آپٹیمائزیشن کی ضرورت ہے۔ مزید تفصیلات کے لیے AgentX آرٹیکل پڑھیں۔
AgentX - InferenceXv3: کیا CUDA کا دفاعی خندق ایجینٹ انفرنس میں برقرار رہ سکتا ہے؟
گہرائی والی خصوصیات اور ساخت
یہ تمام نتائج Jalapeño کے A0 اسٹیپ سے حاصل کیے گئے ہیں، جبکہ پروجیکٹ صرف 9 ماہ پرانا ہے۔ لیکن B0 اسٹیپ اب ویفر فیکٹری میں موجود ہے! B0 کے بہترین بنائے جانے سے A0 سلیکون کے مقابلے میں فی واط پرفارمنس میں تقریباً 25% کا اضافہ ہوا۔ خاص طور پر، B0 اسٹیپ ایک ہی ماسک سائز کے چپ پر MXFP4 کی 13.4 PFLOPs کا عمل کرتا ہے۔ یہ چپ TSMC N3P پر تیار کیا گیا ہے۔ مقابلے کے لیے، ایک واحد Rubin کمپوٹنگ چپ، مشابہ سائز اور اسی نوڈ پر، م密 Rubin NVFP4 کی 17.5 PFLOPs کا عمل کرتا ہے۔
جلاپینیو کا TDP صرف 700W ہے، جبکہ روبن کی ہر کمپیوٹنگ چپ 900-1150W کی ہے، اس لیے یہ کارکردگی مزید قابلِ تعریف ہے۔ چونکہ جلاپینیو کو تربیت کے بجائے استنتاج کے لیے ڈیزائن کیا گیا ہے، اس لیے OpenAI کو FLOPs کو زیادہ سے زیادہ کرنے کے لیے TDP بڑھانے کی ضرورت نہیں تھی۔ یہ سمجھ میں آتا ہے۔ لیکن باوجود اس کے، اوپر کے نتائج سے ظاہر ہوتا ہے کہ جلاپینیو قابلِ ذکر پیک تھیوریٹیکل FLOPs فراہم کرتا ہے۔
دیگر اسکیلرز کے ساتھ تقابلی طور پر، جلاپینیو کے پاس فی واٹ سب سے زیادہ HBM بینڈ ویتھ اور فی واٹ سب سے زیادہ FLOPs ہیں، جو 1800W کے روبن میکس-کیو کانفیگریشن کے برابر ہے۔

جلاپینیو HBM4 کے ساتھ لانچ ہوگا، جو Nvidia اور AMD کے بعد اس ٹیکنالوجی کو جلد از جلد اپنانے والے چپس میں شامل ہوگا، اور موجودہ TPU اور Trainium منصوبوں سے بھی آگے نکل جائے گا۔ جلاپینیو کا ایک اہم آرکیٹیکچرل اصول HBM کی بینڈ ویتھ کو پوری طرح استعمال کرنا ہے، اس لیے غیر بالا-level HBM کا استعمال اس مقصد کے خلاف ہوگا۔ اس سے ہر پیکیج کی میموری بینڈ ویتھ 15.4TB/s تک پہنچ جاتی ہے، جو HBM3E استعمال کرنے والے تمام دیگر اکسلریٹرز سے زیادہ ہے۔ 15.4TB/s کی بینڈ ویتھ سے ظاہر ہوتا ہے کہ اس کا HBM4 10Gbps پن ریٹ تک پہنچ سکتا ہے، جو Nvidia کے Rubin میں HBM4 کے 9.6Gbps سے تھوڑا زیادہ ہے۔ HBM احتمالاً Samsung سے فراہم کیا جائے گا۔

اوپن اے آئی نے 2025ء کے نومبر میں Jalapeño کا چِپ ڈیزائن مکمل کیا، جو صرف ٹاپ لیول چِپ نہیں بلکہ CoWoS ڈیزائن چِپ ہے۔ 2025ء کے نومبر میں چِپ ڈیزائن کے بعد صرف 9 ماہ اور صرف تین ماہ کے حقیقی سلیکون پر ٹیسٹنگ کے بعد، اوپن اے آئی نے Jalapeño کے ساتھ بہت اچھے نتائج حاصل کر لیے ہیں۔ اس کے علاوہ، یہ اور بھی حیران کن ہے کہ ٹیم نے سافٹ ویئر اسٹیک پر صفر سے شروع کیا تھا۔
اسی دوران، روبن کا CoWoS 2025ء کے اکتوبر میں فینل ہو گیا، جو ایک ماہ پہلے تھا، لیکن ہم جو اب تک واحد ابتدائی نتائج دیکھ رہے ہیں وہ CoreWeave کے انجینئرنگ پروٹو ٹائپس سے آ رہے ہیں۔ Nvidia نے OpenAI کی طرح ہمیں اپنے چپس کا ٹیسٹ کرنے اور بنچ مارکس شیئر کرنے کی اجازت نہیں دی، جس سے ظاہر ہوتا ہے کہ ان کے چپس کا سافٹ ویئر اب بھی ناقص ہے۔ اس بات کو مد نظر رکھتے ہوئے کہ OpenAI اپنے اپنے چپس پر نئے ماڈلز کو اتنی جلدی چلا سکتا ہے، CUDA کا دفاعی خندق شاید ختم ہو چکا ہے۔
یہ اب بھی بہت زیادہ بہتر نہیں ہوئے، اور ہم دیکھ سکتے ہیں کہ کلی طور پر Jalapeño بہتر ڈیٹا فراہم کرتا ہے۔ ہم نہیں سمجھتے کہ Nvidia کا ہارڈویئر کمتر ہے، بلکہ Jalapeño کا سافٹ ویئر ڈیبگنگ Nvidia کے مقابلے میں زیادہ تیزی سے آگے بڑھ رہا ہے۔ یہ ہارڈویئر/سافٹ ویئر کوآ-ڈیزائن کی طاقت کو ظاہر کرتا ہے، جو اعلیٰ سرحدی لیبارٹریز کے ASIC ٹیم کو زیادہ پختہ کمرشل چپ فروشندگان سے آگے نکلنے کا بنیادی شعبہ ہے۔ غیر متوقع طور پر، صفر سے شروع کرنا OpenAI کو بھی فائدہ پہنچا سکتا ہے، کیونکہ یہ اسے پیچھے کی مطابقت یا پرانے سافٹ ویئر ورژنز کے بندوبست کے بغیر نئے آرکٹیکچرل فیصلوں کو اپنانے کی اجازت دے سکتا ہے۔
ہاں، ہر ایک کا اپنا ایک چھوٹا سا ہاتھ ہوتا ہے، جس کا مطلب ہے کہ وہ اپنے کام کو اپنے طریقے سے کرتے ہیں۔
کہا جا سکتا ہے کہ OpenAI Jalapeno ایک حقیقی بڑے پیمانے پر ASIC ہے۔
rubin کے ٹائم لائن کے مقابلے میں jalapeño کی رفتار حیرت انگیز ہے۔ جیسا کہ پہلے ظاہر کیا گیا، rubin کے باوجود ابتدائی شروعات کے باوجود، jalapeño کے نتائج rubin سے بہتر ہیں۔

جالاپینو اسکیما
گہری ساخت کے لحاظ سے، یہ چپ ایم ایکس ایف پی نمبر فارمیٹ اور وزن رکھنے والے پلیٹ فارم کا استعمال کرتی ہے، جو TPU کے مشابہ ہے۔ لیکن TPU کے براہ راست مقابلے میں، یہ چھوٹے شکل/ڈائیمنشنز کو سپورٹ کرتی ہے، جس کا مطلب ہے کہ یہ بڑے پلیٹ فارم پر شکل کے مطابق نہ ہونے والے میٹرکس ضرب کی طرح عجیب پرفارمنس کلائف نہیں دکھائے گی۔
اس کے پاس 64 بٹ سکیلر کور اور FP32/INT32 ویکٹر کور بھی ہیں۔ اوپن اے آئی نے ٹرے لیول پر بھی زائدی کا ڈیزائن کیا ہے اور کور اور چینل لیول پر یولٹی ریکوری کو شامل کیا ہے۔ وہ دعویٰ کرتے ہیں کہ AI کی مدد سے ڈیزائن کرنے سے SIMD کا رقبہ 8 فیصد اور میٹرکس انجن کا رقبہ 10 فیصد کم ہوا۔ حالانکہ انہوں نے مخصوص پروسیس/ولٹیج/ٹیمپرچر (PVT) کنڈیشنز کا ذکر نہیں کیا، لیکن انہوں نے بتایا کہ AI مدد شدہ ماڈیول نے ابتدائی ماڈیول کے مقابلے میں ٹائمنگ اور طاقت کے استعمال میں بہتری لائی ہے۔
جالاپینیو آرکیٹیکچر، KVCache اور وزن کے میموری موشن، اور فکسڈ لیٹنسی اور اوورہیڈ کو ختم کرنے پر مرکوز ہے، تاکہ دیگر ایکسلریٹرز کے مقابلے میں چھوٹے بیچ یا چھوٹی شکلوں میں بھی اصل پیک کمپوٹیشن/بینڈ وڈتھ کے قریب تر پہنچا جا سکے۔
مرکزی اور HBM کو متعدد ٹکڑوں میں تقسیم کیا گیا ہے، جہاں ہر مرکزی ٹکڑا اپنے مخصوص HBM ٹکڑے تک کم تاخیر والی مقامی رسائی رکھتا ہے۔ ٹکڑوں کے درمیان مطابقت اعلی پٹ ویڈتھ والے مخصوص کالیکٹو نیٹ ورک کے ذریعے حاصل کی جاتی ہے۔ اس بہت سادہ میموری ہیرارکی نے Jalapeño کو GPU کے مقابلے میں بڑا ممکنہ فائدہ فراہم کیا ہے، کیونکہ GPU کی میموری رسائی کو پیچیدہ میموری سسٹم سے گزرنا پڑتا ہے، جس سے بڑی تاخیر پیدا ہوتی ہے جسے بڑے شکل پر تقسیم یا چھپانا پڑتا ہے۔
یہ منتخب کرنا ممکن ہے کیونکہ وزن اور KV کو مناسب طریقے سے رکھنے سے مرکزیوں کے درمیان مطابقت کو محدود اور معلوم بینڈ ویتھ کمیونیکیشن پر محدود رکھا جا سکتا ہے، جیسے کہ کمپیوٹیشن کے ساتھ اوورلیپ ہونے والی ٹینسر پیرلل کمیونیکیشن۔

اس کے علاوہ، عام مواصلات اور وسعت یافتہ نیٹ ورک تک رسائی کے لیے ایک اضافی عام NoC بھی ہے۔ کل مل کر، OpenAI نے سادہ NOC اور میموری سبسسٹم کے ذریعے Nvidia اور Google کے مقابلے میں بہت زیادہ طاقت بچائی اور نمایاں کارکردگی میں اضافہ کیا۔

بنیادی سطح پر، OpenAI نے L1 کیش کے ساتھ ایک آؤٹ آف آرڈر (OoO) کور کا تصور پیش کیا ہے۔ یہ اس بات سے بہت مختلف ہے جو ہم دیگر ایکسلریٹرز میں دیکھتے ہیں، جہاں عام طور پر سافٹ ویئر مینیجڈ اسٹیٹک ریجسٹرز، اکثر ای سینکرونس DMA سپورٹ کے ساتھ استعمال ہوتے ہیں۔ یہاں کا دعویٰ یہ ہے کہ اس سے Jalapeño میں باریئر لیٹنس جیسے فکسڈ اوورہیڈ سے بچا جا سکتا ہے، جبکہ دیگر ایکسلریٹرز (جیسے GPU) پر ان اوورہیڈز کو چھپانے یا تقسیم کرنے کے لیے ہر کور پر کام کی مقدار بڑھانی پڑتی ہے، جس سے اصل پیک بینڈ ویتھ/کمپوٹنگ پاور تک پہنچنا مشکل ہو جاتا ہے۔
اس کی قیمت یہ ہے کہ Jalapeño کو میموری درخواستوں کو وقت پر پہنچانے کے لیے اچھی پری-فچ کی ضرورت ہوتی ہے، جو زیادہ مشکل سے پیش بینی اور استدلال کی جا سکتی ہے۔ تاہم، Codex کی مدد سے اچھے فریم ورک میں تفصیلی ٹریس حاصل کرکے، دی گئی شکل کے لیے بہترین پری-فچ کے ساتھ بہترین کرنل تلاش کرنا تقریباً مکمل طور پر انسانی مداخلت کے بغیر ممکن ہو سکتا ہے۔ ہم سمجھتے ہیں کہ یہی وجہ ہے کہ OpenAI نے DeepSeek R1، Kimi K2.5 اور GPT-OSS کو اتنی جلدی چلایا۔
مرکزی اکائی "چھوٹے" میٹرکس ابعاد کو بھی سپورٹ کرتی ہے، جو (چھوٹا ہونے کے مطابق) مختلف ماڈل اور بیچ ابعاد پر زیادہ عام بناتی ہے، اور میٹرکس ابعاد کی تطابق، پیڈنگ کا اخراج، اور بلاکنگ کی ناکارگی کے لیے کم حساس ہوتی ہے۔ مثال کے طور پر، TPU، Trainium اور Etched چپس کے پاس بہت بڑے سائز کے پالسی آررے ہوتے ہیں، جنہیں بلاکنگ کی ناکارگی سے بچنے کے لیے بڑے بیچ یا بالکل تقسیم ہونے والے ماڈل ابعاد کی ضرورت ہوتی ہے۔
جلاپینو کے ذریعے، OpenAI سسٹم میں مقررہ تاخیر کو ختم کرنے پر توجہ مرکوز کرتا ہے تاکہ پیریٹو منحنی کے تمام علاقوں میں روف لائن کی کارکردگی کے قریب تر پہنچا جا سکے۔ نظریہ طور پر، یہ کئی کام کے نقاط پر GPU کے مقابلے میں فائدہ لاسکتا ہے:
کم تاخیر / چھوٹے بیچ کی استدلال کی اعلیٰ صلاحیت GPU سے کہیں بہتر ہے۔ GPU کو شروع کرنے کی تاخیر، بیریئر تاخیر، میموری سسٹم تاخیر جیسے ثابت اخراجات کی وجہ سے پابند ہے۔
بڑے پیمانے پر یا لمبے کنٹیکس کے باوجود، یہ ہارڈویئر روف لائن کے قریب تر ہونے کی صلاحیت رکھتا ہے۔
یہ ایک انتباہ کے ساتھ ہے: جبکہ نظریہ طور پر ایک حد کی کارکردگی موجود ہے، عملی کرنل اس کارکردگی تک پہنچنا زیادہ مشکل ہو سکتا ہے۔ اس لیے، اس کا طریقہ یہ لگتا ہے:
تمام ورک لود شیپس کے لیے اعلی ترین حد کی کارکردگی کا ڈیزائن کریں
کوڈیکس کو بھاری کام کرنے دیں اور اس حد تک پہنچنے کے لیے کرن تلاش کریں
اوپن اے آئی ٹیم نے جلاپینو پر انفرینس ایکس ورک لوڈ شروع کیا ہے، جس کا ٹرنئیر ویل بہت تیز ہے۔
ہم اس طریقے کے بارے میں مثبت ہیں۔
اگر جلاپینیو کامیاب ہو جائے تو، یہ طاقتور سگنل جاری کرے گا۔
پروگرامنگ ماڈل اور مکمل جامع کمپائلر کے لیے صنعت کا جنون، سرحدی AI ماڈلز کے ذریعے توڑ دیا جائے گا۔
اوپن اے آئی جلپیانو کرنل کو اسمبلی کی طرح لکھتی ہے۔
ہر کور کے لیے ہاتھ سے ٹیون کیا گیا کوڈ ہے، جس کا کچھ حصہ تقریباً 3000 لائنز پر مشتمل ہے۔
ساتھ ہی درستگی کی جانچ اور کسٹم سینیٹائزر کی سہولت بھی موجود ہے۔
اولیہ کور کام انسانی مداخلت کے ساتھ، مکمل طور پر خودکار نہیں تھا۔
بعد میں مزید بڑے پیمانے پر اندر کا Codex استعمال کیا گیا۔
اوپن اے آئی اس ورژن کو کاروباری صارفین کو فروخت کرنے کی منصوبہ بندی کر رہا ہے۔
اندر کا سروس انجن "Teacup" کہلاتا ہے۔
د цیل، اوپن اے آئی نے پہلے کبھی اندر کا MLA کرنل ایمپلیمنٹیشن نہیں کیا تھا۔
jab tak unہوں نے InferenceX کے ساتھ DeepSeek کا بینچ مارک نہیں کیا۔
کوڈیکس ایک کارآمد کرنل تحریر کرنے میں اتنی تیزی سے کام کر سکتا ہے اور کرنل انجینئرنگ ٹیم کی مداخلت کی ضرورت نہیں ہوتی۔
یہ سافٹ ویئر پائپ لائن کی ترقی کی صلاحیت کو ظاہر کرتا ہے۔
اوپن اے آئی نے جلپیانو کے لیے گلوون کا استعمال کیا۔
Gluon OpenAI کی کرنل پروگرامنگ زبان ہے۔
گلوون تریٹن کے اوپر بنایا گیا ہے، جو تریٹن کا SPMD (Single Program Multiple Data) پروگرامنگ ماڈل برقرار رکھتا ہے۔
لیکن یہ بنیادی پروگرامنگ ایبسترکشن کو ظاہر کرتا ہے۔
مثلاً، NVIDIA GPU کے لیے، یہ PTX احکامات کے ساتھ م핑 کیا گیا API فراہم کرتا ہے۔
MMA ہدایات، TMA ہدایات، mbarrier مکانیزم وغیرہ شامل ہیں۔
گلوون کی فراہم کردہ سب سے منفرد ایبسترکشن لے آؤٹ ہے۔
عام طور پر، لیاﺅٹ ہارڈویئر وسائل اور ٹینسر عناصر کے درمیان میپنگ کو تعریف کرتا ہے۔
مثلاً، وارپ 9 کا پانچواں رجسٹر، ٹینسر کے 6ویں سطر اور 7ویں کالم کے عنصر کے مطابق ہے۔
گلوون کا لے آؤٹ ایبسترکشن لینئر لے آؤٹس پر مبنی ہے۔
یہ OpenAI کے ذریعہ دریافت کیا گیا ایک لے آؤ الجبرا ہے۔
لینیئر لے آؤٹس لے آؤٹ کیا ہے اس کا ریاضیاتی طور پر فارمولہ بند کرتے ہیں۔
اور آپریشن لے آؤٹ کے لیے ٹولز فراہم کریں۔
یہ کئی فنکشنز کو سپورٹ کرتا ہے، جیسے کہ ثابت کیے جانے والے لیآؤٹ تبدیلیاں۔
بہترین میموری سویزلنگ بھی ہے۔
جلاپینیو کے پروگرامنگ ماڈل میں، ہر Gluon پروگرام ایک مستقل تھریڈ سے ملتا ہے۔
ہم سمجھتے ہیں کہ یہ جلپیونو کو مستقل کرنر پروگرامنگ ماڈل کے لیے مناسب ہونے کی نشاندہی کرتا ہے۔
ہر پروگرام کو کئی ٹائلز پر ایک پروگرامر کی طرف سے کام تقسیم کیا جاتا ہے، نہ کہ ہارڈویئر اسکیڈیولر کی طرف سے۔
اوپن اے آئی نے ٹینسر انفو کا ذکر کیا۔
یہ ایک واضح کوڈڈ لے آؤٹ کا اbstract ہے۔
یہ جالاپینیو کے لیے ڈیزائن کی گئی ایک سیٹ لے آؤٹ ہو سکتی ہے۔
یہ لینیئر لے آؤٹس سے چلائی جائے گی۔
آخر میں، ہر کور کے لیے ڈیٹا پریفچ اور ڈیکوپلڈ آرڈرڈر یونٹ فراہم کیا جاتا ہے۔
مثال کے طور پر، صارف پیش گھٹائی گئی ڈیٹا کا انتظار کرنے کے لیے پروگرام کر سکتا ہے۔
یہ ڈیٹا سیمنفور کے ذریعے لاک ہے۔
مزاحیہ بات یہ ہے کہ GPT 5.6 Sol جیسے OpenAI ماڈل اب NVIDIA GPU پر چل رہے ہیں۔
ان کا استعمال چپس ڈیزائن کرنے کے لیے کیا جاتا ہے، جو CUDA کے دفاعی دیوار کو اصل خطرہ پیدا کرتا ہے۔
NVIDIA کے اپنے GPU درحقیقت ممکنہ جانشین کو ریل ٹائم میں سپورٹ کر رہے ہیں۔
ٹائم اسپین کے ساتھ تقابل کرتے ہوئے، ہم جلاپینیو کی ترقی کی رفتار بھی دیکھ سکتے ہیں۔
دو ہفتے سے کم کے اندر، کچھ انٹرایکشن سیناریوز کی ذخیرہ صلاحیت دو گنا سے زیادہ بڑھ گئی۔
ہمیں Jalapeño ٹیم سے ملنے والے ہر tarball میں عجیب دنیا شامل ہے۔

نہ صرف کور پرفارمنس میں اضافہ ہوا، بلکہ 8 دن میں Jalapeño ٹیم نے TP32 فعال کر دیا۔
پہلے TP8 کانفیگریشن کے مطابق، ایک منفرد سسٹم کے باہر توسیع کرکے بڑے ماڈل کے لیے مکمل ریک کانفیگریشن حاصل کریں۔
یہ ترقی کی رفتار حقیقت میں حیرت انگیز ہے۔

اپنے اصل ہارڈویئر پر چلانے سے پہلے اپنی کارکردگی کی تصدیق کے لیے، OpenAI کے پاس ایک محاکمہ "chilisim" بھی ہے۔
اس کی درستگی حقیقی ہارڈویئر کے 5% کے اندر ہے، فکسڈ وائیڈتھ ٹریس بس کا استعمال کرتے ہوئے۔
A0 پر ٹریکنگ کی صلاحیت محدود ہے، لیکن B0 پر محسوس طور پر بہتر ہوئی ہے۔
یہ A0 سلیکون وافٗق کے عملی ڈیٹا کی وجہ سے ممکن ہے۔
انجینئر نے کوڈیکس CLI کو اندر کے ماڈل کے ساتھ چلایا۔
اس کا نام "Raiku" یا "5.3 Codex Spark" ہے، TPOT 1.2ms ہے۔
ٹیم نے کوڈیکس کے ذریعہ لکھے گئے ڈیمو کو چپ پر براہ راست چلایا۔
36 FPS کے ساتھ ڈوم، FP32 فلود ڈائنامکس سیمولیشن شامل ہیں۔
"لیکوڈ لائٹ" ماؤس ڈریگ ویژولائزیشن بھی ہے۔

ماڈل کے حوالے سے، OpenAI کے اندر میگاکرنل سکیم کا نام "gigakernel" ہے۔
یہ ایک منفرد میگاکرنل کے اردگرد تعمیر کیا گیا ہے، جو ڈیوائس پر چکر لگاتا ہے تاکہ سی پی یو کا بوجھ اور شروع ہونے کا وقت کم ہو۔
ٹیم اب بھی ٹیسٹنگ کے دوران اسٹریٹجی کی حساب کتاب جاری رکھ رہی ہے۔
100 لاکھ رول آؤٹس کے استعمال کو کیسے موزوں کیا جائے، اس پر داخلی خصوصی توجہ دی جا رہی ہے۔
کیا میں ڈس ایگ کروں، یہ ایک سوال ہے
ہم نے پہلے بتایا تھا کہ OpenAI نے ان چپس پر prefill-decode الگ کرنے کا استعمال نہیں کیا۔
یہ ہمیں حیران کرتا ہے کیونکہ NVIDIA اور AMD GPU کی کارکردگی PDD سے نمایاں طور پر فائدہ اٹھا رہی ہے۔
یہاں تک کہ ایک جیسے ہارڈویئر پر بھی۔
ہم جالاپینیو ٹیم کے اس طرح کرنے کی وجوہات کو گہرا کرکے دیکھتے ہیں۔
جب لوڈ ثابت ہو، تو prefill-decode الگ کرنا دلچسپ لگتا ہے۔
Prefill اور decode کے لیے ہارڈویئر پر مختلف دباؤ ہوتا ہے۔
ہر مرحلہ کو الگ الگ ٹیون کیے گئے پول میں مختص کریں تاکہ منتخب ان پٹ آؤٹ پٹ نسبت کے تحت کارکردگی میں اضافہ ہو۔
لیکن پیداواری ٹریفک اس تناسب کو برقرار نہیں رکھے گا۔
انپٹ آؤٹپٹ سیکوئنس لمبائی، کانکرنسی، کیش ہٹ ریٹ، اسپیکولیٹو ایکسیپٹنس ریٹ اور لیٹنسی ہدف پورے دن تبدیل ہوتے رہتے ہیں۔
جب ڈیوائس کو prefill اور decode پول میں تقسیم کر دیا جائے، تو prefill کی زیادہ تقاضا decode چپ کو بے کار رکھ دیتی ہے اور درخواستیں قطار میں لگ جاتی ہیں۔
لیکن زیادہ سے زیادہ ڈیکوڈ کی درخواست کا اُلٹا اثر ہوتا ہے۔
آپریٹر کو مسلسل صحیح تقسیم کا پیش گوئی کرنا چاہیے اور دونوں طرف کے لیے بیک اپ کیپسیٹی محفوظ رکھنی چاہیے۔
ایک ایدیل نسبت جو مستقل تبدیل ہو رہی ہے، اسے دوبارہ توازن میں لائیں۔
ایک یکساں نظام میں، کچھ وسائل خاص مراحل میں ناکافی طور پر استعمال ہو سکتے ہیں۔
لیکن ہر ڈیوائس اگلے درخواست کے لیے استعمال کی جا سکتی ہے۔
ایک الگ نظام میں، پورا چپ صرف غلط پول میں شامل ہونے کی وجہ سے بے کار پڑ سکتا ہے۔
مقامی استعمال بہتر لگ رہا ہے، لیکن عالمی استعمال خراب ہو سکتا ہے۔

الگ کرنا مقامیت کو بھی خراب کر دے گا۔
prefill worker بڑے KV کیش کو decode worker کے فوری ضرورت کے لیے پیدا کرتا ہے۔
اسٹیٹس کو نیٹ ورک کے ذریعے منتقل کیا جانا چاہیے تاکہ جنریشن جاری رہ سکے۔
یہ بینڈ ویتھ کے استعمال، سنکرنائزیشن، قطار میں انتظار اور ایک اور خرابی کے شعبے میں اضافہ کرتا ہے۔
لاگت بھی ان پٹ سیکوئنس کی لمبائی کے ساتھ بڑھتی ہے کیونکہ KV کیش بڑھ رہی ہے۔
تاہم، KV کو منتقل کرنے سے بچنا بنیادی طور پر بجلی کی خرچ اور تاخیر کے بہترین عمل کے لیے ہے۔
کچھ KV کو منتقل کرنا ہارڈویئر کی استعمال کو بہتر بن سکتا ہے، لیکن اس کی قیمت پاور کھپت اور ایک درخواست کی تاخیر ہوگی۔

قابل تبدیل کلسٹرز تاخیر حساس درخواستوں اور ٹھیکہ کی طرف مائل بیچس کے درمیان صلاحیت منتقل کر سکتے ہیں۔
فکسڈ سپلٹ ٹریفک کمبینیشن میں تبدیلی کے وقت ہارڈویئر کو بے کار رکھتا ہے۔
اس کے علاوہ، کنٹیکس لمبائی میں تبدیلی ایٹنشن اور FFN کے درمیان توازن کو متاثر کرتی ہے۔
کوئی بھی ثابت ہارڈویئر نسبت صرف ڈیزائن پوائنٹ کے قریب کارآمد ہوتی ہے۔

اسی پابندی کو تجسسی ڈیکوڈنگ پر بھی لاگو کیا جاتا ہے۔ مسودہ ماڈل کو ویریفائر کو بہت کم لیٹنسی پر کینڈیڈٹ ٹوکن فراہم کرنے ہوں گے۔ دونوں کو الگ الگ مخصوص پولز میں رکھنا، تنگ طور پر جڑے ہوئے ڈیکوڈنگ لوپ کو ڈسٹریبیوٹڈ پروٹوکول میں تبدیل کر دے گا۔ اضافی مواصلات اور تعاون ممکنہ طور پر مسودہ کے ذریعے بچائے گئے لیٹنسی کو ختم کر دے گا۔ دونوں ماڈلز کو ایک ہی ڈیوائس اور کم لیٹنسی سٹرکچر پر رکھنا ہی اس بات کو یقینی بناتا ہے کہ تجسسی ڈیکوڈنگ کا فائدہ برقرار رہے۔

تاہم، جہاں مانگ کافی بڑی، مستقل اور قابل پیشگوئی ہو، ڈیکوپلنگ ابھی بھی فتح پا سکتا ہے۔ خاص طور پر جب روایتی GPU کو اچھی ٹھرک کے لیے بڑے اور مرحلہ وار بیچز کی ضرورت ہوتی ہے۔ لیکن یہ مفت کا نہایت نہیں ہے۔
جاپانی سے ہندوستانی (میٹھا سے بہت تیز): کاتسو، ونڈالو اور چنا — یہ کریم کیسے ریک سسٹم بناتے ہیں؟
جلاپینیو سسٹم ریک یونٹ لیول پر CPU ہوسٹ ریک اور ASIC ریک پر مشتمل ہے۔ ہوسٹ ریک میں "کاتسو" نامی 16 ہوسٹ CPU ٹرے شامل ہیں۔ ہر کاتسو دائیں طرف "ونڈالو" نامی 16 ASIC ٹرے میں سے ایک کے مطابق ہوتا ہے۔ ہر ہوسٹ پر دو تورین کلاس AMD EPYC CPU، 1.5TB DRAM، 2x E1.S اور 2x M.2 SSD لگے ہوئے ہیں۔ ہر ٹرے پر 400G (2x200G) فرنت اینڈ نیٹ ورک بھی لگا ہوا ہے۔ ہر کاتسو ٹرے کو 8 بیرونی PCIe DAC کیبلوں کے ذریعے ہر وندالو ٹرے سے جوڑا جاتا ہے۔ یہ کیبلز ریک کے سامنے افقی طور پر لگائی جاتی ہیں۔ سسٹم لیول ڈیزائن سیلیسٹیکا کے ساتھ مل کر تیار کیا گیا۔
ASIC ریک 16 ونڈالو ٹرے اور 8 ایکسپینشن سوئچ ٹرے (6 مقامی + 2 عالمی) پر مشتمل ہے، جسے "چنا" کہا جاتا ہے۔ ہر ونڈالو ٹرے میں 8 جلپینو ASIC ہوتے ہیں، جس سے مجموعی طور پر ریک میں 128 جلپینو ASIC ہوتے ہیں۔ ASIC کو ہر چنا سوئچ ٹرے سے تانبے کے کیبل بیک پلیٹ کے ذریعے جوڑا جاتا ہے، جو Nvidia کے Oberon کے مشابہ ہے۔ ایکسپینشن ٹاپولوجی مقامی اور عالمی دونوں ڈومین میں تقسیم ہے۔ مقامی ڈومین ریک کے اندر 128 ASIC کو کور کرتا ہے۔ عالمی ڈومین زیادہ سے زیادہ 16 ریک یا 2,048 ASIC کو جوڑتا ہے۔ ہم نیچے بینڈ ویدتھ اور ٹاپولوجی کو مزید تفصیل سے سمجھائیں گے۔
سائیڈ ماؤنٹڈ ہوسٹ ریک کی بجلی کی فراہمی تقریباً 50kW (پیداوار میں 31kW) ہے، جبکہ ASIC ریک 130kW کھا جاتا ہے۔ پورا ڈبل ریک سسٹم تقریباً 160kW ہے۔ بجلی کے استعمال کے لحاظ سے، یہ تقریباً ایک ڈبل وائیڈ GB300 ریک کے برابر ہے۔

OpenAI ایک واحد اسکیل ایبل نیٹ ورک میں زیادہ سے زیادہ 2,048 Jalapeño XPU کو جوڑ سکتا ہے۔ اسکیل ایبل نیٹ ورک دو ڈومینز پر مشتمل ہے۔ لوکل ڈومین بیک پلیٹ کے ذریعے ریک کے اندر تمام 128 XPU کو جوڑتا ہے۔ جلوبل ڈومین کا استعمال کاپر کیبلز اور آپٹیکل انٹرکنیکشن کے مخلوط استعمال سے 16 ریکس کے 2,048 XPU کو جوڑتا ہے۔ ہر ریک میں 8 Chana سوئچ ٹرے شامل ہوتے ہیں۔ مقامی ڈومین کے لیے درمیانی 6 Chana سوئچز استعمال ہوتے ہیں۔ ہر ایک میں 102.4T Tomahawk 6 سوئچ ASIC ہوتا ہے۔ جلوبل ڈومین کے لیے اوپر اور نیچے کے 2 Chana سوئچز استعمال ہوتے ہیں۔ ہم سمجھتے ہیں کہ شاید 2x 102.4T Tomahawk 6 سوئچز ہوں، جس سے ہر سوئچ ٹرے پر زیادہ سے زیادہ 204.8T ہو سکتا ہے۔
مقامی طور پر، 128 جلپینیو چپس ہر XPU کے لیے 4.8Tb/s ایک طرفہ بینڈ ویتھ فراہم کرتی ہیں۔ وہ 6 ٹومہاوک 6 ASICs کے ساتھ مکمل فور فور طریقے سے جڑے ہوئے ہیں، جس کا مطلب ہے کہ ہر XPU کے لیے 48 جوڑے ڈفرینشل جوڑ (DP) مردہ اور خاتون کنکٹرز ہیں۔ مقامی وسعت کے لیے کل میں 6,144 DP پاسیو کاپر کیبلز فراہم کیے گئے ہیں۔
گلوبل ڈومین میں، 16 ریکس میں 2,048 XPU کو کاپر بیک پلیٹ، الیکٹریکل 204.8T TH6 سوئچ، 1.6T آپٹیکل مڈیول اور آپٹیکل سوئچنگ ڈیوائسز کے مجموعے سے جوڑا گیا ہے۔ ہر XPU کے لیے گلوبل لینک کا ایک طرفہ بینڈ ویتھ 1.6Tb/s ہے۔ یعنی ہر XPU کے پاس XPU اور گلوبل سوئچ کے درمیان بیک پلیٹ کے لیے 16 جوڑے ڈفرنشل پیر (DP) میل اور فیمل کنکٹرز ہیں۔ ہر گلوبل سوئچ ٹرے میں 2 ASIC ہوتے ہیں، جن کا آؤٹ پٹ بینڈ ویتھ بیک پلیٹ اور فراؤنٹ پینل آپٹیکلز کے درمیان تقسیم کیا جاتا ہے۔
ہر XPU کے لیے 64 جوڑے DP کے ساتھ، ہر ریک پر کل 8,192 جوڑے DP کے پاسیو کاپر کیبلز۔
گلوبل ڈومین میں صرف ریل ارکیٹیکچر استعمال کیا جاتا ہے، جس میں 8 ریلیں شامل ہیں۔ ہم سمجھتے ہیں کہ OpenAI گلوبل ڈومین میں روشنی کے لینکس کو ریل کے ہر ایک پر نصب OCS (آپٹیکل سوئچنگ) کے ذریعے رُٹ کرتا ہے۔ ہر XPU کا 1.6Tb/s گلوبل بینڈ ویتھ کاپر بیک پلیٹ کے ذریعے گلوبل سوئچ ٹرے تک پہنچتا ہے۔ پھر یہ سوئچ سے آگے کی فرنٹ پینل پر موجود 1.6T آپٹیکل ماڈیولز کے ذریعے باہر نکلتا ہے۔ یہ پہلے پاسیو آپٹیکل سوئچ میں داخل ہوتا ہے، پھر ریل سے باہر نکلتا ہے۔ اس سے 2,048 XPU تک کا اسکیل ایکسپینشن ممکن ہوتا ہے، جو 16 ریلز پر مشتمل ہے، جس میں ہر ریل میں 128 XPU ہوتے ہیں۔

چونکہ ایکسٹینشن نیٹ ورک کا کل سسٹم لاگت میں صرف تقریباً 10 فیصد حصہ ہے، اس لیے یہ لچک مستقبل کے 10 ٹریلین سے 20 ٹریلین پیرامیٹرز والے ماڈلز یا 2 ملین سے 4 ملین ٹوکن کے کنٹیکس ونڈو کے لیے قیمتی اختیارات فراہم کرتی ہے۔ ڈپلوymینٹ کے حوالے سے، OpenAI neocloud کے ساتھ تعاون کر رہا ہے۔ اس نے ایک ماہ پہلے ڈیٹا سنٹر شراکت داروں کے ساتھ قابلیت کے ڈیٹا جمع کیے، جبکہ ڈاک سے ریک تک ڈپلوymینٹ کے وقت کو بہتر بنانے پر توجہ دی۔
اگلا قدم
اگلے، ہم جلاپینیو کے مستقبل پر بات کریں گے، جس کا پہلا پروڈکشن ٹوکن قریب ہے۔ اگلے ہدف کا 100 میگاواٹ ہے، جس کی رکاوٹیں بنیادی طور پر ہارڈویئر میں ہیں: وہ کتنی مقدار میں پروڈکشن کر سکتے ہیں، ڈیٹا سینٹر کو کتنے اچھے طریقے سے ڈپلوی اور آپریٹ کر سکتے ہیں، اور مانیٹرنگ اور ریزیلینس جیسے معاملات کو کیسے ہینڈل کر سکتے ہیں۔ سافٹ ویئر کا تصدیق شدہ ہے، اور ان کے پاس اندر کا ماڈل بھی ہے، جس کا مطلب ہے کہ کوئی بھی سافٹ ویئر کا فرسٹ موف ایڈوانٹیج آسانی سے حاصل کر لیا جا سکتا ہے۔ ادائیگی کے دیوار کے بعد، ہم NVIDIA، AMD، Cerebras جیسی چپ کمپنیوں پر اثرات پر بات کریں گے، جن کے پاس OpenAI کے ساتھ آنے والے کچھ سالوں کے لیے معاہدے ہیں۔
ہم ایکسلریٹر ماڈل میں نسل کے چپس کی پیداوار، تعداد اور شیڈول بھی شامل کرتے ہیں۔
اس کے بعد کا حصہ ادائیگی کی شرط پر ہے، جس کی وجہ سے اجازت کی وجہ سے مزید ترجمہ نہیں کیا گیا، لیکن پہلے حصے میں OpenAI کے نیوڈیا چپس کے لیے چیلنج کے بارے میں کافی معلومات دی گئی ہیں۔ چپس سیکٹر اور نیوڈیا کے اسٹاک پر نظر رکھنے والے کھلاڑیوں کے لیے یہ معلومات نئی اور مضبوط حوالہ فراہم کریں گی۔
