حالیہ وقت میں، نوڈیا نے اپنی سرکاری گائیڈ جاری کی، لیکن اسے پڑھتے پڑھتے یہ لگنے لگا جیسے یہ چینی ٹیم کی تحقیقی مقالوں کا ایک مجموعہ ہو۔
یہ طرح ہے۔
2 ستمبر کو، نوڈیا کے ٹیکنالوجی بلاگ پر ایک لمبا مضمون "سپیکولیشن کو ڈیکوڈ کرکے AI ماڈل کو مشترکہ ڈیزائن کرنا" شائع ہوا۔
مرکزی مضمون ایک منتخب جدول ہے جو موجودہ دور کے 6 سب سے مقبول انفریئر ایکسلریشن حل کو ایک لائن میں ترتیب دیتا ہے، اور تربیت کی لاگت اور مناسب صورتحال دونوں کو واضح طور پر بیان کرتا ہے۔

اس کا اہمیت یہ ہے کہ یہ چپ کے بادشاہ کی طرف سے بہت نایاب طور پر، ایک سرکاری طور پر یہ متعین کیا گیا ہے کہ "ماڈل کو ہارڈویئر کی فزیکل حد تک کیسے ڈیزائن کیا جائے"۔
جب وہ اپنے آس پاس دیکھ رہے ہوتے ہیں کہ سلیکون چپ کی حدود پر ناچنے والے بہترین حل کہاں ہیں، تو گائیڈ میں شامل مرکزی حل تقریباً سب چینی ٹیموں کی قیادت میں ہیں۔
یہ عام الگورتھم جائزے سے کہیں زیادہ ہے۔ اس جدول میں کیا راز چھپا ہوا ہے؟ آئیے اسے ایک ایک لائن کر کے تجزیہ کرتے ہیں۔
لگبھگ صرف منافع کمانے کا معاملہ: سپیکولیشن ڈیکوڈ کیا کر رہا ہے
اس جدول کو سمجھنے کے لیے، آپ کو "سپیکولیٹو ڈیکوڈنگ" کیا ہے، یہ سمجھنا ہوگا۔
بڑے ماڈل الفاظ ایک ایک کر کے نکالتے ہیں۔ ہر الفاظ کے نکلنے پر، کئی سو جیگا باٹس کے پیرامیٹرز کو گرافکس میموری میں مکمل طور پر چلانا پڑتا ہے۔ دراصل، زیادہ تر وقت کیلکولیشن پاور میموری کے ذریعہ ڈیٹا منتقل ہونے کا انتظار کرتا ہے۔
"اسپیکولیٹو ڈیکوڈ" کا حل بہت آسان اور سیدھا سادہ ہے—
سب سے پہلے ایک ہلکا پھلکا مॉडل استعمال کریں تاکہ پہلے 7 حروف کا پیش گوئی کیا جا سکے؛ پھر بڑا مॉडل ان 7 حروف کی ایک ساتھ تصدیق کرے۔
7 حروف کی تصدیق اور اپنے آپ سے ایک حرف لکھنے میں تقریباً اتنی ہی وقت لگتا ہے، کیونکہ وزن کو پھر بھی ایک بار منتقل کرنا پڑتا ہے۔
جس نے صحیح اندازہ لگایا، وہ براہ راست وصول کر لے، جس نے غلط اندازہ لگایا، وہ بیک اپ سے دوبارہ شروع کرے۔ کیونکہ بڑے ماڈل صرف اپنے اپنے لکھنے والے حروف ہی قبول کرتے ہیں، اس لیے آخری نتیجہ میں کوئی علامت تبدیل نہیں ہوتی۔ یہی «بے نقص تیزی» کہلاتی ہے۔

اس گیم میں، تمام کمپیوٹیشنل طاقت کا استعمال ایک مرکزی ریاضیاتی امید کے فارمولے کے گرد گھومتا ہے:
اسپیڈ اپ = 𝔼[L] × TtargetTdraft + Tverify
分子 کا فائدہ 𝔼[L] ہے، جو توقع شدہ قبول شدہ لمبائی کی نمائندگی کرتا ہے (بڑے ماڈل کی اوسطاً ہر راؤنڈ میں کتنے حروف کو چنا جاتا ہے)۔
ہر قیمت کا مخرج آپ کی طرف سے ادا کی جانے والی اضافی قیمت ہے، جو چھوٹے ماڈل کے پیشگوئی کے لیے وقت (Tdraft) اور بڑے ماڈل کی آخری تصدیق کے وقت (Tverify) کا مجموعہ ہے۔
سپیڈ اپ کو تیز کرنے کے لیے صرف دو راستے ہیں: یا تو عددیہ کو بڑھائیں (زیادہ درست اندازہ لگائیں)، یا پھر عمل کو بہت زیادہ کم کر دیں (زیادہ تیز اندازہ لگائیں)۔
ہم ساتھیوں کے کندھوں پر چڑھ کر چوتھی نسل کی ترقی کرتے ہیں
نیوڈیا کے اس جدول کو اوپر سے نیچے تک پڑھتے ہوئے، آپ ایک واضح مقابلے کا خاکہ دیکھیں گے۔
پہلی لائن سب سے پرانا "بیرونی ڈرافٹ ماڈل" ہے، جس کے لیے ایک الگ چھوٹا ماڈل ٹرین کرنا ہوگا۔
نیوڈیا نے براہ راست ایک بہت ہی مہنگا بل پیش کیا: شروع سے ٹرین کرنے کے لیے 1T سے 10T ٹوکنز کی ضرورت ہوتی ہے، جس کا اخراج بہت زیادہ ہے۔
تاہم اس کی وجہ سے یہ فہرست پر موجود ہے کیونکہ نوڈیا نے اس کے لیے ایک خاص مقام مقرر کیا ہے — وہ 200 ارب ڈالر خرچ کرکے Groq چپ (LPU) کو ضم کر چکے ہیں۔
آخری لائن میں نے تربیت کے بغیر n-gram ٹیبل کا استعمال کیا ہے، جو صرف اگلے متن سے دہرائے گئے حصوں کو تلاش کرکے براہ راست کاپی کرتی ہے، اور یہ صرف بڑے پیمانے پر کاپی اور پیسٹ کرنے کے لیے مناسب ہے۔
ٹیکنالوجی کی ترقی کی حقیقی نمائندگی درمیانی چار لائنوں سے ہوتی ہے۔

دوسرا لائن: EAGLE-3۔
北大 کے یوہوی لی، واترلو یونیورسٹی کے ہونگیانگ زہانگ اور دیگر کی ٹیم سے۔
ICML اور EMNLP سے لے کر NeurIPS تک، تین سال میں تین نسلیں جاری کر کے، "لفظ وار نیچے کی طرف اندازہ لگانا" والی سلیسل پرانی راہ کو فزیکل حد تک پہنچا دیا گیا۔
یہ اس شعبے کا مکمل طور پر سب سے بڑا کنٹرولر تھا، لیکن نوڈیا کی نئی فہرست میں، اسے صرف "حوالہ جات" کی حیثیت دے دی گئی، اور وجہ بہت مختصر تھی: قبول کی گئی لمبائی پیچھے والوں سے پار کر چکی ہے۔
تیسری لائن: MTP (متعدد ٹوکن پیشگوئی)۔
فکر تو 2024 میں میٹا نے شروع کی تھی، لیکن اسے حقیقی طور پر بڑے ماڈل کے استدلال کا معیاری طریقہ بنانے والا، DeepSeek -V3۔
نیوڈیا کو اس کی بہت اچھی تعریف ملی ہے — GPU پر بڑے ماڈل کا بہترین انتخاب۔ بنیادی بات یہ ہے کہ اس منصوبے کو پری ٹریننگ کے دوران اصل ماڈل کے ساتھ ساتھ تربیت دینی چاہیے۔
چوتھی لائن: DFlash۔ 6 گنا بے نقص تیزی حاصل کرنے والا طاقتور کردار۔
تین مصنفین جیان چین، یشینگ لیانگ، اور زہجیان لیو۔ یہ EAGLE اور MTP کے "ایک حرف کے بعد ایک حرف اندازہ لگانے" والے ترتیبی طریقہ کار کو مکمل طور پر چھوڑ دیتا ہے اور پھیلاؤ ماڈلز کو الٹا کرتے ہوئے، ایک منفرد فارورڈ کمپیوٹیشن کے ذریعہ 7 ٹوکن کی پیشگوئی کی ترتیب کو فوراً تیار کر دیتا ہے، جس سے ڈینومینیٹر (وقت) کو حد تک کم کر دیا جاتا ہے۔
ایک بات یاد رکھیں، ہدایت کار Zhijian Liu UCSD کے ایسوسی ایٹ پروفیسر ہیں، لیکن وہ英偉達 ریسرچ لیب کے ریسرچ سائنسدان بھی ہیں۔
پانچویں لائن: DSpark۔ DeepSeek اور پکنگ یونیورسٹی کے مل کر بنائے گئے 24 افراد کی ٹیم نے اسے تیار کیا۔
DFlash کا موازی آرکیٹیکچر تیز ہے، لیکن اس کا ایک مہلک خامی ہے: جیسے جیسے آگے بڑھتے ہیں، اندازہ لگانا کم درست ہوتا جاتا ہے۔ مولیکیول (قبول کی لمبائی) کو جبری طور پر بڑھانے کے لیے، DSpark نے موازی بنیاد پر ایک بہت ہلکا ترتیبی ماڈیول جوڑا ہے۔
عملی ڈیٹا بہت واضح ہے: قبول کی گئی لمبائی EAGLE-3 سے تقریباً 30% زیادہ اور DFlash سے 18% زیادہ ہے۔ DeepSeek آن لائن پروڈکشن ماحول V4 میں، MTP کے مقابلے میں رفتار 60% سے 85% تک زیادہ ہے۔
Hardware constants, reverse lock-in model architecture
یہ چاروں نسلوں کی ٹیکنالوجیاں صرف الگورتھم کے ذہنی ایجادوں پر ہی نہیں، بلکہ کمپیوٹیشنل پاور کو اس قدر دباؤ میں لانے پر بھی منحصر ہیں۔
بہت سے لوگ سمجھتے ہیں کہ جتنا زیادہ ڈرافٹ میں اندازہ لگائیں، اتنا ہی زیادہ کمائیں گے، لیکن یہ بالکل سلیکون چپ کے فزیکل قوانین کو نظرانداز کرتا ہے۔
جب توجہ کا机制 ڈیکوڈنگ کے وقت کا بڑا حصہ لے لے، تو بڑے ماڈل کے تصدیق مرحلے میں کل ٹوکنز کی تعداد 1+D (1 حقیقی ان پٹ + D منصوبہ بند پیشگوئیاں) ہوتی ہے۔
اس ڈیٹا کو GPU کو فراہم کرنے کے لیے، ہارڈویئر نیچے کی سطح پر کوئری ہیڈ اور KV ہیڈ کو گروپس میں تقسیم کرتا ہے، اور ہر گروپ کے توجہ کور کا بلوک سائز، GPU کے فزیکل میٹرکس کی حد (Tile Size، جو موجودہ آرکیٹیکچر میں عام طور پر 128 ہوتا ہے) کے تحت سختی سے محدود ہوتا ہے۔
اس طرح بنیادی ترتیب فارمولا حاصل ہو گیا: G × (1 + D) ≤ 128
थوڑی سی استدلال کر کے، نیوڈیا گائیڈ میں انتہائی مستقل اصول نکل آیا:
D = 128G − 1
جہاں G توجہ گروپس کی تعداد ہے (کوئری ہیڈ اور KV ہیڈ کا تناسب)۔
اس کا مطلب یہ ہے کہ آپ کے ماڈل کے ڈیزائن کے آغاز میں توجہ کو کیسے گروپ کیا گیا، اس سے دونوں ڈرافٹ کے لیے درست حروف کی تعداد طے ہو جاتی ہے تاکہ GPU کے بلاکس مکمل طور پر بھر جائیں۔
اگر G=8، تو آپ درستی سے 15 اعداد کا اندازہ لگا سکتے ہیں؛ اگر G=32، تو صرف 3 اعداد کا اندازہ لگا سکتے ہیں۔ ہارڈویئر حد سے نہیں گزر سکتا، چاہے آپ نے آخری ٹائل کا صرف نصف حصہ استعمال کیا ہو، کمپوٹیشنل طاقت پورے ٹائل کے لحاظ سے چarges کی جائے گی۔
پہلے، ہجومی ڈیکوڈنگ کو ماڈل کے تربیت کے بعد انجینئرنگ ٹیم کو باہر سے تیز کرنے والے پیکجز کے طور پر شامل کیا جاتا تھا۔ لیکن اب، بنیادی فزیکل قوانین آپ کو بتاتے ہیں: ایک ہارڈویئر میٹرکس کا مستقل، ماڈل آرکیٹیکچر کے ڈیزائن پیرامیٹرز پر ب без تبدیلی سے واپس اثر انداز ہوتا ہے۔
ہمیں عام طور پر ایسا نہیں لگتا کہ کوئی چپ فیکٹری ایسے ہی، ایک بنیادی ہارڈویئر کی پابندیوں کو بڑے ماڈل کے ڈیزائن ڈرافٹ میں شامل کرے۔
اختتام
ماس کی کارکردگی کے مقابلے کا مرکز بالکل بدل گیا۔
بڑے پیمانے پر پیرامیٹرز کے جمع کرنے کا دور ختم ہو رہا ہے، اب حقیقی فتح کا معیار یہ ہے کہ کون اپنے نیچے والے سلیکون چپ کی فزیکل حد کو بہتر سمجھتا ہے۔
اس نئے میدان میں، جہاں چپ کے بڑے ٹیکنالوجی کمپنیاں قواعد کو الٹ رہی ہیں، چینی ٹیم نے ایک خاموش طور پر حل کے لیے ڈیفالٹ جواب بن دیا ہے۔
جیسے کہ نوویدیا جیسا کمپوٹیشنل پاور گیم چیمپئن، اس کے لیے شیلف پر کون سا الگورتھم رکھا ہے، اس پر کوئی توجہ نہیں دے گا۔
لیکن یہ بہترین حل، جو سلیکون وافل کی حد تک ان کا استعمال کرتا ہے، کس کے ہاتھ سے نکلا، وہ سفید کاغذ پر سیاہ حروف میں واضح طور پر درج ہے۔
یہ مضمون ویچن گروپ "نیوزی ایوان" سے ہے، مصنف: ASI کا وحی
