اوپن اے آئی، نوڈیا اور گوگل ایل ایل ایم انفرنس کے لیے اے آئی چپ ڈیزائن میں الگ ہو گئے

iconMetaEra
بانٹیں
AI summary iconخلاصہ
ای آئی اور کرپٹو خبروں کے شو میں بڑے کھلاڑیوں کے ایل ایل ایم انفرنس چپ ڈیزائن میں فرق نمایاں ہوا۔ اوپن اے آئی کا جالاپینو انفرنس کے لیے ہے، نوڈیا جی پی یو کو گروک کے ایل پی یو کے ساتھ ملا رہا ہے، اور گوگل ٹی پی یو 8 ٹی اور 8 آئی کو تربیت اور انفرنس کے لیے الگ کر رہا ہے۔ انفرنس کے لیے اب زیادہ ایچ بی ایم بینڈ ویتھ، بڑا ایس آر ایم، اور سخت نیٹ ورک پاتھس کی ضرورت ہے۔ جب چپس زیادہ کام کے مخصوص ہوتے جا رہے ہیں، تو ٹوکن لاگت FLOPS کے ساتھ ساتھ اہمیت حاصل کر رہی ہے۔ ڈیزائن کی حکمت عملی میں ایک نیٹ ورک اپ گریڈ AI ہارڈ ویئر مقابلے کو دوبارہ شکل دے رہا ہے۔
AI چپ کے مقابلے کا ڈھانچہ گہرے طور پر تبدیل ہو رہا ہے۔ OpenAI نے Jalapeño چپ جاری کی ہے جو LLM انفرنس کے لیے مخصوص ہے، NVIDIA نے GPU کو Groq LPU کے ساتھ جوڑ کر ہائبرڈ کمپوٹنگ حاصل کی ہے، جبکہ Google نے ٹریننگ اور انفرنس کو الگ الگ TPU 8t اور TPU 8i چپس میں تقسیم کیا ہے۔ یہ تین راستے ٹریننگ اور انفرنس کی مختلف ہارڈویئر کی ضروریات کو ظاہر کرتے ہیں: ٹریننگ میں میٹرکس کمپوٹیشن اور بڑے پیمانے پر کنکشن پر زور دیا جاتا ہے، جبکہ انفرنس کے لیے زیادہ HBM بینڈ ویتھ، بڑا SRAM اور مختصر نیٹ ورک پاتھ درکار ہوتے ہیں۔ جب دونوں قسم کے ورک لود کے لیے چپ کے ڈیزائن میں فرق بڑھتا جا رہا ہے، تو FLOPS اب واحد معیار نہیں رہا، بلکہ Token لاگت AI ہارڈویئر کے مقابلے کا نیا اندازہ بن گئی ہے۔

مضمون کا مصنف، ذریعہ: Leifengwang

ٹوکن لاگت بڑے ماڈل ہارڈویئر کی مقابلہ کی نئی پیمائش بن گئی ہے

ایمبڈڈ انٹیلیجنس، دھواں بھرے رستے میں داخل ہو رہا ہے

ملین ٹریفک کے تحت روبوٹ کی ملازمت

سابق نائب صدر Covariant AI، Zhoupu Shuzhong نے LPU کے کردار کو ویرا روبن کے کم تاخیر والے ڈیکوڈ کے علاقے میں خلا کو پُر کرنے کے طور پر خلاصہ کیا۔

جالاپینو رن بار بار، جی پی یو انفرنس راستہ شروع ہو گیا؟

گروک کا چپ ڈیزائن بھی اسی بات کے اردگرد مرکوز ہے۔ ایک LPX ریک میں 256 LPU ہوتے ہیں، جن کا مجموعی SRAM صرف 128 GB ہوتا ہے، جو GPU ریک میں موجود HBM کے ساتھ تقابلی طور پر نہیں لایا جا سکتا، لیکن مجموعی SRAM بینڈ ویتھ 40 PB/s تک پہنچ سکتی ہے۔

اس ڈیزائن کا اہم نقطہ "قريب" ہے۔ HBM بہت سارے ماڈل کی حالتیں محفوظ کر سکتا ہے لیکن کمپوٹیشن یونٹ سے دور ہوتا ہے؛ SRAM مہنگا ہے اور اس کی صلاحیت بڑھانا مشکل ہے، لیکن ڈیٹا چپ کے اندر ہوتا ہے جو بہت زیادہ بینڈ ویتھ اور بہت کم ایکسیس لیٹنسی فراہم کرتا ہے۔

جالاپینو رن بار بار، جی پی یو انفرنس راستہ شروع ہو گیا؟

ہر قدم پر کی جانے والی حساب کتاب محدود ہوتی ہے، اور ڈیٹا کو بار بار حاصل کیا جاتا ہے، اس لیے ڈیٹا کو ALU کے قریب رکھنا اگلے ٹوکن کے انتظار کے وقت پر براہ راست اثر ڈالتا ہے۔

گروک نے مزید ڈائنانمک ہارڈویئر کنٹرول کو کم کر دیا۔ ایل پی یو ایک ڈیٹرمنسٹک ایکزیکشن آرکیٹیکچر ہے، جہاں انسٹرکشن سکیڈولنگ زیادہ تر سافٹ ویئر کے ذریعہ پہلے سے مکمل کر دی جاتی ہے۔ ہر چپ ایک پروسیسر اور روتر دونوں کے طور پر کام کرتی ہے، جس میں کمپائلر کمپوٹیشن اور نیٹ ورک وسائل کو ایک ساتھ سکیڈول کرتا ہے، اور روایتی ہارڈویئر فلو کنٹرول اور ورچوئل چینل جیسے میکانزمز کو ختم کر دیتا ہے۔

جالاپینو رن بار بار، جی پی یو انفرنس راستہ شروع ہو گیا؟

لاگت بھی واضح ہے: یہ ایک ایسی ساخت ہے جو GPU کی طرح عام نہیں ہے، اور اس کا اپنا SRAM مکمل بڑے ماڈل کی حالت کو محفوظ نہیں کر سکتا۔ اس لیے NVIDIA نے Groq 3 کو مکمل ماڈل کو الگ سے چلانے نہیں دیا، بلکہ ایک زیادہ پیچیدہ ہائبرڈ سسٹم تیار کیا۔

جالاپینو رن بار بار، جی پی یو انفرنس راستہ شروع ہو گیا؟

GPU پر پریفِل کیا جاتا ہے، اور زیادہ تر ڈیکوڈ LPU پر ہوتا ہے؛ ڈیکوڈ میں اٹینشن دوبارہ GPU پر واپس آ سکتا ہے۔ GPU اور LPU اپنے اپنے KV کیش کو الگ الگ برقرار رکھتے ہیں، اور دونوں کے درمیان بنیادی طور پر ڈرافٹ ٹوکنز کا تبادلہ ہوتا ہے، جبکہ مائیکرو-بیچ کے ذریعے کمپوٹیشن اور مواصلات کو اوورلیپ کیا جاتا ہے۔ چونکہ LPU سینکرونائزڈ ڈومین ہے، جبکہ GPU اور بیرونی KV کیش غیر سینکرونائزڈ سسٹم ہیں، NVIDIA نے دونوں کے درمیان غیر سینکرونائزڈ برج کے طور پر FPGA بھی شامل کیا ہے۔

یہ ساخت یہ ظاہر کرتی ہے کہ AI چپس کی تقسیم کام کے لیے کتنی آگے بڑھ چکی ہے۔ یہ صرف "ٹریننگ چپس" اور "انفرنس چپس" تک محدود نہیں، بلکہ ایک Decode کے مختلف حصوں کو بھی مختلف آرکیٹیکچر پر انجام دیا جا سکتا ہے۔

تاہم، NVIDIA نے جو ڈیٹا پیش کیا، اس سے اس راستے کی حدود بھی واضح ہوتی ہیں: جب کاروبار صرف کل ٹھیکنگ پر توجہ دے اور زیادہ تاخیر کو قبول کر لے، تو Rubin GPU ابھی بھی کارآمد ہے؛ جب ایک صارف کے ٹوکن کی رفتار کی ضرورت بڑھتی ہے، تو LPX کا فائدہ آہستہ آہستہ ظاہر ہوتا ہے، اور زیادہ LPU استعمال کرنے کے بعد کل ٹھیکنگ کارآمدی کم ہو جاتی ہے۔

جالاپینو رن بار بار، جی پی یو انفرنس راستہ شروع ہو گیا؟

تو Groq 3 کے ظہور کا مطلب یہ نہیں کہ GPU کو انفرینس کے لیے ختم کر دیا گیا ہے۔ اس سے ایک اور بات سامنے آتی ہے: ایک ہی GPU کو ایک ساتھ اعلیٰ ٹھراؤ اور بہت کم تاخیر دونوں پر قبضہ کرنا مشکل ہے، جبکہ دونوں ہارڈویئرز کو اپنے زیادہ مہارت والے علاقوں میں چلنا چاہیے، جس سے سسٹم کی پرفارمنس کریو کو زیادہ آسانی سے الگ کیا جا سکتا ہے۔

گوگل نے اس کاٹ کو زیادہ اوپر رکھا۔

جالاپینو رن بار بار، جی پی یو انفرنس راستہ شروع ہو گیا؟

ٹریننگ اور انفرنس کے لیے دو الگ چپ ریسیپیز استعمال کریں

گوگل نے TPU 8 کی اس نسل میں TPU 8t اور TPU 8i دونوں بنائے،t تربیت کے لیے،i استدلال کے لیے۔ اس تقسیم کے پیچھے کا منطق براہ راست چپ کی میموری کانفگریشن پر لکھا گیا ہے۔

ہاٹ چپس کے لائیو شو میں، TPU 8t کا استعمال ہو رہا ہے 6 گروپس HBM، جبکہ TPU 8i نے استعمال کیا 8 گروپس۔ گوگل کی طرف سے دی گئی وضاحت یہ ہے کہ انفریڈنگ کے لیے فی یونٹ کمپوٹیشن زیادہ HBM درکار ہوتا ہے، ساتھ ہی SRAM کا زیادہ تناسب بھی درکار ہوتا ہے، اس لیے 8i نے زیادہ وسائل SRAM، میموری کی صلاحیت اور بینڈ ویتھ کے لیے مختص کیے ہیں۔

جالاپینو رن بار بار، جی پی یو انفرنس راستہ شروع ہو گیا؟

یہ فرق بہت سوچنے کی بات ہے۔ اگر AI چپ صرف میٹرکس کی حساب کتاب کی طاقت کا مقابلہ کر رہی ہے، تو اس صورت میں انفرینس ورژن کے لیے میموری پر اتنے زیادہ چپ کا رقبہ اور پیکیج وسائل خرچ کرنے کا کوئی منطق نہیں ہے۔ TPU 8i کا یہ ڈیزائن یہ ظاہر کرتا ہے کہ Google کو ڈیٹا کی فراہمی میں رکاوٹ دکھائی دے رہی ہے۔

ٹریننگ کے دوران، بڑے بیچ وزن کی ریڈنگ لاگت کو بہت سے ٹوکنز پر تقسیم کر دیتے ہیں؛ ڈیکوڈ میں ہر بار صرف کم ٹوکنز پیدا ہوتے ہیں، لیکن وزن اور KV کیش کو اب بھی بار بار ایکسیس کیا جاتا ہے۔ اس لیے، ہر اکائی FLOPS کے لیے کتنی HBM بینڈ ویتھ درکار ہے، دونوں طرح کے کاموں کے لیے جوابات مختلف ہوتے ہیں۔

گوگل نے اس فرق کو نیٹ ورک ٹوپولوجی تک لے گیا۔ سابقہ TPU کا استعمال کیا جانے والا 3D Torus ٹریننگ کے لیے زیادہ مناسب ہے، جس میں بڑے کلسٹر میں کل ٹھروپٹ پر زور دیا جاتا ہے۔ TPU 8i BoardFly کو سپورٹ کرتا ہے، جس کا نیٹ ورک پاتھ مختصر ہے: BoardFly کا پاتھ حد 7 hops تک ہے، جبکہ 3D Torus کی حد 16 hops تک ہے۔

جالاپینو رن بار بار، جی پی یو انفرنس راستہ شروع ہو گیا؟

ٹریننگ کے لیے، کچھ اضافی نیٹ ورک ہاپس کے بعد عام طور پر بڑا میٹرکس کمپیوٹیشن ہوتا ہے، جس سے کمیونیکیشن کا وقت تقسیم ہو جاتا ہے۔ Decode کے ہر ایک مرحلے کا کمپیوٹیشن ونڈو مختصر ہوتا ہے، جس کی وجہ سے کچھ ہاپس کی نیٹ ورک لیٹنسی آسانی سے ٹوکن کے درمیان کے فاصلے میں آ جاتی ہے۔

MoE اس مسئلے کو مزید واضح کر دیتا ہے۔ MoE ایک ٹوکن کو صرف کچھ ایکسپرٹس کو فعال کرنے دیتا ہے، جس سے حسابی طور پر بہت فائدہ ہوتا ہے، لیکن راؤٹر ٹوکن کو مختلف ایکسپرٹس پر بھیج دیتا ہے۔ جب یہ ایکسپرٹس مختلف چپس پر منتشر ہو جائیں، تو حسابی کام کم ہوتا ہے، لیکن All-to-All مواصلات بڑھ جاتی ہیں۔

جالاپینو رن بار بار، جی پی یو انفرنس راستہ شروع ہو گیا؟

اس لیے TPU 8i میں Collective Acceleration Engine بھی شامل کیا گیا ہے، جو کچھ collective آپریشنز کو نیٹ ورک انٹرفیس کے قریب I/O Die پر پروسیس کرتا ہے۔ ڈیٹا کو پہلے Compute Die میں منتقل کرنے اور HBM کے ذریعے آپریشن مکمل کرنے کی ضرورت نہیں، بلکہ چپ کے اندر ڈیٹا منتقل کرنے کا ایک حصہ براہ راست محفوظ ہو جاتا ہے۔

ٹریننگ ورژن TPU 8t کے وسائل کی تقسیم واضح طور پر دوسری طرف جھکی ہوئی ہے۔ ٹریننگ کے لیے بہت زیادہ FLOPS کی ضرورت ہوتی ہے، اور پیرامیٹرز اور گریڈینٹس کو سینکرونائز کرنے کے لیے بہت بڑا Scale-Up ڈومین بھی ضروری ہوتا ہے۔ TPU 8t کا Superpod 9600 چپس تک وسعت حاصل کر سکتا ہے، جس میں تقریباً 2 PB شیئرڈ HBM اور 121 EFLOPS FP4 کل مجموعی کمپوٹیشنل کابیلیٹی ہے، اور Google نے اس کے لیے Virgo نیٹ ورک متعارف کرایا ہے جو بڑے پیمانے پر ٹریننگ کو ایک الگ نظام میں جوڑتا ہے۔

جالاپینو رن بار بار، جی پی یو انفرنس راستہ شروع ہو گیا؟

گوگل نے مقامی طور پر ایک بہت عملی چپ ڈیزائن کا مسئلہ بھی اٹھایا: ڈارک سلیکون۔

چپ کا رقبہ اور طاقت کا بجٹ محدود ہے۔ اگر ایک ہی چپ میں تربیت کے لیے درکار بہت سارے میٹرکس کمپوٹیشن ریسورسز اور انفریس کے لیے زیادہ SRAM، HBM اور کم تاخیر والے نیٹ ورکس دونوں ڈال دیے جائیں، تو کسی بھی ایک workload کے عمل کے دوران ہمیشہ کچھ سرکٹس لمبے عرصے تک بے کار رہیں گے۔

جالاپینو رن بار بار، جی پی یو انفرنس راستہ شروع ہو گیا؟

چونکہ دونوں کاموں کے لیے مختلف وسائل کا تناسب درکار ہے، اس لیے دونوں چپس الگ الگ بنانا زیادہ صاف ہوگا۔

FLOPS سے ٹوکن اقتصادیات تک

تینوں راستوں کو ایک ساتھ رکھنے پر، فرق واضح ہو جاتا ہے۔

اوپن اے آئی جالاپینو بناتا ہے، جس میں چپ کو LLM انفرنس تک مخصوص کر دیا جاتا ہے، لیکن پری فل اور ڈیکوڈ کو ایک ہی ہارڈویئر پر لچکدار طریقے سے شیڈول کیا جاتا ہے؛ نیکوڈیا گھٹنے تک ٹوٹتا ہے، جس سے جی پی یو اور گروک ایل پی یو ایک انفرنس کے مختلف مراحل کو تقسیم کرتے ہیں؛ گوگل اوپر تک کاٹتا ہے، جس سے تربیت اور انفرنس کو براہ راست دو TPU بنایا جاتا ہے۔

ان راستوں کے پیچھے کوئی نئی رازانہ حسابی اصول نہیں ہے، بلکہ وسائل کا تناسب تبدیل ہوتا ہے۔ تربیت کے لیے زیادہ ٹرانزسٹرز میٹرکس کی حسابگری اور بڑے پیمانے پر جڑنے میں لگائے جاتے ہیں، کیونکہ بڑا Batch ڈیٹا منتقل کرنے کی لاگت کو تقسیم کر دیتا ہے؛ کم تاخیر والی استعمال کے لیے زیادہ HBM بینڈ ویتھ، بڑا SRAM، بہتر KV Cache کی مقامی صلاحیت اور مختصر نیٹ ورک راستے درکار ہوتے ہیں، کیونکہ بہت سا وقت ڈیٹا کا انتظار کرنے میں ضائع ہوتا ہے۔

جب دو قسم کے لوڈ کو "چپ ریسیپ" کی ضرورت میں فرق بڑھتا جائے، تو ایک یونیورسل چپ کے ذریعہ ان دونوں کو ایک ساتھ سنبھالنا ناکارہ ہو جائے گا۔

یہی وجہ ہے کہ اس ہارڈویئر مقابلے کا مرکزی عدد تبدیل ہو رہا ہے۔ FLOPS اب بھی اہم ہے، لیکن اس کے ساتھ Tokens/s/user، TBT، TTFT، Tokens/kW، HBM بینڈ ویتھ اور نیٹ ورک لیٹنس ظاہر ہو رہی ہیں۔

یہ دراصل ایک ہی بات کی وضاحت کرتے ہیں: کمپیوٹنگ پاور پہلے سے موجود ہے، اب نظام کیا جاری رکھ سکتا ہے کہ ڈیٹا کو لگاتار فراہم کرے اور تخلیق کیے گئے ٹوکن کو جلد سے جلد بھیجے؟

اوپن اے آئی، نوڈیا اور گوگل ابھی مختلف حدود کا انتخاب کر رہے ہیں، اور مستقبل میں جو تبدیلی جاری رہے گی، وہ اس حد کو کہاں رکھنا چاہیے اس کے بارے میں ہوگی۔

ٹریننگ اور انفرنس کو الگ کیا جا سکتا ہے، پریفِل اور ڈیکوڈ کو الگ کیا جا سکتا ہے، اور ڈیکوڈ کے اندر ایٹینشن دیگر کمپوٹیشن سے بھی الگ کیا جا سکتا ہے۔ جتنا زیادہ تقسیم کیا جائے، اتنی ہی آسانی سے ہر ایک کی کارکردگی بڑھائی جا سکتی ہے، لیکن وسائل کی منصوبہ بندی، KV کیش کا منتقل کرنا اور ہارڈویئر کے درمیان مواصلات زیادہ پیچیدہ ہو جائیں گی۔

اس لیے اگلے مرحلے میں AI چپ کی مقابلہ کا مسئلہ شاید صرف ایک زیادہ طاقتور چپ بنانے تک محدود نہیں رہا۔

مزید مشکل بات یہ ہے کہ فیصلہ کرنا کہ کون سے کاموں کے لیے الگ چپ بنائی جائے اور کون سے کاموں کو ایک ہی ہارڈویئر پر رکھا جائے تاکہ پورے سسٹم کی ٹوکن لاگت کم ہو۔

اعلان دستبرداری: اس صفحہ پر معلومات تیسرے فریق سے حاصل کی گئی ہوں گی اور یہ ضروری نہیں کہ KuCoin کے خیالات یا خیالات کی عکاسی کرے۔ یہ مواد کسی بھی قسم کی نمائندگی یا وارنٹی کے بغیر صرف عام معلوماتی مقاصد کے لیے فراہم کیا گیا ہے، اور نہ ہی اسے مالی یا سرمایہ کاری کے مشورے کے طور پر سمجھا جائے گا۔ KuCoin کسی غلطی یا کوتاہی کے لیے، یا اس معلومات کے استعمال کے نتیجے میں کسی بھی نتائج کے لیے ذمہ دار نہیں ہوگا۔ ڈیجیٹل اثاثوں میں سرمایہ کاری خطرناک ہو سکتی ہے۔ براہ کرم اپنے مالی حالات کی بنیاد پر کسی پروڈکٹ کے خطرات اور اپنے خطرے کی برداشت کا بغور جائزہ لیں۔ مزید معلومات کے لیے، براہ کرم ہماری استعمال کی شرائط اور خطرے کا انکشاف دیکھیں۔