NVIDIA نے AI انفرنس گائیڈ جاری کیا، چینی ٹیموں کی قیادت میں 6 گنا بے نقص تیزی

icon MarsBit
بانٹیں
AI summary iconخلاصہ
نیوڈیا نے 2 ستمبر کو ایک AI انفرنس گائیڈ جاری کی، جس میں ستہ تیزی کے طریقے شامل ہیں۔ چینی ٹیمیں تخمینہ کے مطابق ڈیکوڈنگ اور DFlash جیسے اہم نوآوریوں کی قیادت کر رہی ہیں، جو 6 گنا بے ضائع تیزی فراہم کرتا ہے۔ آلٹ کوائنز جن کا تجارتی توجہ بڑھ رہی ہے، ان کے ساتھ فیئر اینڈ گریڈ انڈیکس اب بھی بلند ہے۔ GPU ٹائل سائز جیسے ہارڈویئر حدود ماڈل ڈیزائن کو شکل دیتے ہیں۔ DeepSeek-V3 کا MTP طریقہ اور دیگر تکنیکیں کارکردگی کے لیے زور دیا گیا ہے۔ گائیڈ میں ہر طریقہ کے لیے لاگت اور استعمال کے معاملات تفصیل سے بیان کیے گئے ہیں۔

حالیہ وقت میں، نوڈیا نے اپنی سرکاری گائیڈ جاری کی، لیکن اسے پڑھتے پڑھتے یہ لگنے لگا جیسے یہ چینی ٹیم کی تحقیقی مقالوں کا ایک مجموعہ ہو۔

یہ طرح ہے۔

2 ستمبر کو، نوڈیا کے ٹیکنالوجی بلاگ پر ایک لمبا مضمون "سپیکولیشن کو ڈیکوڈ کرکے AI ماڈل کو مشترکہ ڈیزائن کرنا" شائع ہوا۔

مرکزی مضمون ایک منتخب جدول ہے جو موجودہ دور کے 6 سب سے مقبول انفریئر ایکسلریشن حل کو ایک لائن میں ترتیب دیتا ہے، اور تربیت کی لاگت اور مناسب صورتحال دونوں کو واضح طور پر بیان کرتا ہے۔

DeepSeek

اس کا اہمیت یہ ہے کہ یہ چپ کے بادشاہ کی طرف سے بہت نایاب طور پر، ایک سرکاری طور پر یہ متعین کیا گیا ہے کہ "ماڈل کو ہارڈویئر کی فزیکل حد تک کیسے ڈیزائن کیا جائے"۔

جب وہ اپنے آس پاس دیکھ رہے ہوتے ہیں کہ سلیکون چپ کی حدود پر ناچنے والے بہترین حل کہاں ہیں، تو گائیڈ میں شامل مرکزی حل تقریباً سب چینی ٹیموں کی قیادت میں ہیں۔

یہ عام الگورتھم جائزے سے کہیں زیادہ ہے۔ اس جدول میں کیا راز چھپا ہوا ہے؟ آئیے اسے ایک ایک لائن کر کے تجزیہ کرتے ہیں۔

لگبھگ صرف منافع کمانے کا معاملہ: سپیکولیشن ڈیکوڈ کیا کر رہا ہے

اس جدول کو سمجھنے کے لیے، آپ کو "سپیکولیٹو ڈیکوڈنگ" کیا ہے، یہ سمجھنا ہوگا۔

بڑے ماڈل الفاظ ایک ایک کر کے نکالتے ہیں۔ ہر الفاظ کے نکلنے پر، کئی سو جیگا باٹس کے پیرامیٹرز کو گرافکس میموری میں مکمل طور پر چلانا پڑتا ہے۔ دراصل، زیادہ تر وقت کیلکولیشن پاور میموری کے ذریعہ ڈیٹا منتقل ہونے کا انتظار کرتا ہے۔

"اسپیکولیٹو ڈیکوڈ" کا حل بہت آسان اور سیدھا سادہ ہے—

سب سے پہلے ایک ہلکا پھلکا مॉडل استعمال کریں تاکہ پہلے 7 حروف کا پیش گوئی کیا جا سکے؛ پھر بڑا مॉडل ان 7 حروف کی ایک ساتھ تصدیق کرے۔

7 حروف کی تصدیق اور اپنے آپ سے ایک حرف لکھنے میں تقریباً اتنی ہی وقت لگتا ہے، کیونکہ وزن کو پھر بھی ایک بار منتقل کرنا پڑتا ہے۔

جس نے صحیح اندازہ لگایا، وہ براہ راست وصول کر لے، جس نے غلط اندازہ لگایا، وہ بیک اپ سے دوبارہ شروع کرے۔ کیونکہ بڑے ماڈل صرف اپنے اپنے لکھنے والے حروف ہی قبول کرتے ہیں، اس لیے آخری نتیجہ میں کوئی علامت تبدیل نہیں ہوتی۔ یہی «بے نقص تیزی» کہلاتی ہے۔

DeepSeek

اس گیم میں، تمام کمپیوٹیشنل طاقت کا استعمال ایک مرکزی ریاضیاتی امید کے فارمولے کے گرد گھومتا ہے:

اسپیڈ اپ = 𝔼[L] × TtargetTdraft + Tverify

分子 کا فائدہ 𝔼[L] ہے، جو توقع شدہ قبول شدہ لمبائی کی نمائندگی کرتا ہے (بڑے ماڈل کی اوسطاً ہر راؤنڈ میں کتنے حروف کو چنا جاتا ہے)۔

ہر قیمت کا مخرج آپ کی طرف سے ادا کی جانے والی اضافی قیمت ہے، جو چھوٹے ماڈل کے پیشگوئی کے لیے وقت (Tdraft) اور بڑے ماڈل کی آخری تصدیق کے وقت (Tverify) کا مجموعہ ہے۔

سپیڈ اپ کو تیز کرنے کے لیے صرف دو راستے ہیں: یا تو عددیہ کو بڑھائیں (زیادہ درست اندازہ لگائیں)، یا پھر عمل کو بہت زیادہ کم کر دیں (زیادہ تیز اندازہ لگائیں)۔

ہم ساتھیوں کے کندھوں پر چڑھ کر چوتھی نسل کی ترقی کرتے ہیں

نیوڈیا کے اس جدول کو اوپر سے نیچے تک پڑھتے ہوئے، آپ ایک واضح مقابلے کا خاکہ دیکھیں گے۔

پہلی لائن سب سے پرانا "بیرونی ڈرافٹ ماڈل" ہے، جس کے لیے ایک الگ چھوٹا ماڈل ٹرین کرنا ہوگا۔

نیوڈیا نے براہ راست ایک بہت ہی مہنگا بل پیش کیا: شروع سے ٹرین کرنے کے لیے 1T سے 10T ٹوکنز کی ضرورت ہوتی ہے، جس کا اخراج بہت زیادہ ہے۔

تاہم اس کی وجہ سے یہ فہرست پر موجود ہے کیونکہ نوڈیا نے اس کے لیے ایک خاص مقام مقرر کیا ہے — وہ 200 ارب ڈالر خرچ کرکے Groq چپ (LPU) کو ضم کر چکے ہیں۔

آخری لائن میں نے تربیت کے بغیر n-gram ٹیبل کا استعمال کیا ہے، جو صرف اگلے متن سے دہرائے گئے حصوں کو تلاش کرکے براہ راست کاپی کرتی ہے، اور یہ صرف بڑے پیمانے پر کاپی اور پیسٹ کرنے کے لیے مناسب ہے۔

ٹیکنالوجی کی ترقی کی حقیقی نمائندگی درمیانی چار لائنوں سے ہوتی ہے۔

DeepSeek

دوسرا لائن: EAGLE-3۔

北大 کے یوہوی لی، واترلو یونیورسٹی کے ہونگیانگ زہانگ اور دیگر کی ٹیم سے۔

ICML اور EMNLP سے لے کر NeurIPS تک، تین سال میں تین نسلیں جاری کر کے، "لفظ وار نیچے کی طرف اندازہ لگانا" والی سلیسل پرانی راہ کو فزیکل حد تک پہنچا دیا گیا۔

یہ اس شعبے کا مکمل طور پر سب سے بڑا کنٹرولر تھا، لیکن نوڈیا کی نئی فہرست میں، اسے صرف "حوالہ جات" کی حیثیت دے دی گئی، اور وجہ بہت مختصر تھی: قبول کی گئی لمبائی پیچھے والوں سے پار کر چکی ہے۔

تیسری لائن: MTP (متعدد ٹوکن پیشگوئی)۔

فکر تو 2024 میں میٹا نے شروع کی تھی، لیکن اسے حقیقی طور پر بڑے ماڈل کے استدلال کا معیاری طریقہ بنانے والا، DeepSeek -V3۔

نیوڈیا کو اس کی بہت اچھی تعریف ملی ہے — GPU پر بڑے ماڈل کا بہترین انتخاب۔ بنیادی بات یہ ہے کہ اس منصوبے کو پری ٹریننگ کے دوران اصل ماڈل کے ساتھ ساتھ تربیت دینی چاہیے۔

چوتھی لائن: DFlash۔ 6 گنا بے نقص تیزی حاصل کرنے والا طاقتور کردار۔

تین مصنفین جیان چین، یشینگ لیانگ، اور زہجیان لیو۔ یہ EAGLE اور MTP کے "ایک حرف کے بعد ایک حرف اندازہ لگانے" والے ترتیبی طریقہ کار کو مکمل طور پر چھوڑ دیتا ہے اور پھیلاؤ ماڈلز کو الٹا کرتے ہوئے، ایک منفرد فارورڈ کمپیوٹیشن کے ذریعہ 7 ٹوکن کی پیشگوئی کی ترتیب کو فوراً تیار کر دیتا ہے، جس سے ڈینومینیٹر (وقت) کو حد تک کم کر دیا جاتا ہے۔

ایک بات یاد رکھیں، ہدایت کار Zhijian Liu UCSD کے ایسوسی ایٹ پروفیسر ہیں، لیکن وہ英偉達 ریسرچ لیب کے ریسرچ سائنسدان بھی ہیں۔

پانچویں لائن: DSpark۔ DeepSeek اور پکنگ یونیورسٹی کے مل کر بنائے گئے 24 افراد کی ٹیم نے اسے تیار کیا۔

DFlash کا موازی آرکیٹیکچر تیز ہے، لیکن اس کا ایک مہلک خامی ہے: جیسے جیسے آگے بڑھتے ہیں، اندازہ لگانا کم درست ہوتا جاتا ہے۔ مولیکیول (قبول کی لمبائی) کو جبری طور پر بڑھانے کے لیے، DSpark نے موازی بنیاد پر ایک بہت ہلکا ترتیبی ماڈیول جوڑا ہے۔

عملی ڈیٹا بہت واضح ہے: قبول کی گئی لمبائی EAGLE-3 سے تقریباً 30% زیادہ اور DFlash سے 18% زیادہ ہے۔ DeepSeek آن لائن پروڈکشن ماحول V4 میں، MTP کے مقابلے میں رفتار 60% سے 85% تک زیادہ ہے۔

Hardware constants, reverse lock-in model architecture

یہ چاروں نسلوں کی ٹیکنالوجیاں صرف الگورتھم کے ذہنی ایجادوں پر ہی نہیں، بلکہ کمپیوٹیشنل پاور کو اس قدر دباؤ میں لانے پر بھی منحصر ہیں۔

بہت سے لوگ سمجھتے ہیں کہ جتنا زیادہ ڈرافٹ میں اندازہ لگائیں، اتنا ہی زیادہ کمائیں گے، لیکن یہ بالکل سلیکون چپ کے فزیکل قوانین کو نظرانداز کرتا ہے۔

جب توجہ کا机制 ڈیکوڈنگ کے وقت کا بڑا حصہ لے لے، تو بڑے ماڈل کے تصدیق مرحلے میں کل ٹوکنز کی تعداد 1+D (1 حقیقی ان پٹ + D منصوبہ بند پیشگوئیاں) ہوتی ہے۔

اس ڈیٹا کو GPU کو فراہم کرنے کے لیے، ہارڈویئر نیچے کی سطح پر کوئری ہیڈ اور KV ہیڈ کو گروپس میں تقسیم کرتا ہے، اور ہر گروپ کے توجہ کور کا بلوک سائز، GPU کے فزیکل میٹرکس کی حد (Tile Size، جو موجودہ آرکیٹیکچر میں عام طور پر 128 ہوتا ہے) کے تحت سختی سے محدود ہوتا ہے۔

اس طرح بنیادی ترتیب فارمولا حاصل ہو گیا: G × (1 + D) ≤ 128

थوڑی سی استدلال کر کے، نیوڈیا گائیڈ میں انتہائی مستقل اصول نکل آیا:

D = 128G − 1

جہاں G توجہ گروپس کی تعداد ہے (کوئری ہیڈ اور KV ہیڈ کا تناسب)۔

اس کا مطلب یہ ہے کہ آپ کے ماڈل کے ڈیزائن کے آغاز میں توجہ کو کیسے گروپ کیا گیا، اس سے دونوں ڈرافٹ کے لیے درست حروف کی تعداد طے ہو جاتی ہے تاکہ GPU کے بلاکس مکمل طور پر بھر جائیں۔

اگر G=8، تو آپ درستی سے 15 اعداد کا اندازہ لگا سکتے ہیں؛ اگر G=32، تو صرف 3 اعداد کا اندازہ لگا سکتے ہیں۔ ہارڈویئر حد سے نہیں گزر سکتا، چاہے آپ نے آخری ٹائل کا صرف نصف حصہ استعمال کیا ہو، کمپوٹیشنل طاقت پورے ٹائل کے لحاظ سے چarges کی جائے گی۔

پہلے، ہجومی ڈیکوڈنگ کو ماڈل کے تربیت کے بعد انجینئرنگ ٹیم کو باہر سے تیز کرنے والے پیکجز کے طور پر شامل کیا جاتا تھا۔ لیکن اب، بنیادی فزیکل قوانین آپ کو بتاتے ہیں: ایک ہارڈویئر میٹرکس کا مستقل، ماڈل آرکیٹیکچر کے ڈیزائن پیرامیٹرز پر ب без تبدیلی سے واپس اثر انداز ہوتا ہے۔

ہمیں عام طور پر ایسا نہیں لگتا کہ کوئی چپ فیکٹری ایسے ہی، ایک بنیادی ہارڈویئر کی پابندیوں کو بڑے ماڈل کے ڈیزائن ڈرافٹ میں شامل کرے۔

اختتام

ماس کی کارکردگی کے مقابلے کا مرکز بالکل بدل گیا۔

بڑے پیمانے پر پیرامیٹرز کے جمع کرنے کا دور ختم ہو رہا ہے، اب حقیقی فتح کا معیار یہ ہے کہ کون اپنے نیچے والے سلیکون چپ کی فزیکل حد کو بہتر سمجھتا ہے۔

اس نئے میدان میں، جہاں چپ کے بڑے ٹیکنالوجی کمپنیاں قواعد کو الٹ رہی ہیں، چینی ٹیم نے ایک خاموش طور پر حل کے لیے ڈیفالٹ جواب بن دیا ہے۔

جیسے کہ نوویدیا جیسا کمپوٹیشنل پاور گیم چیمپئن، اس کے لیے شیلف پر کون سا الگورتھم رکھا ہے، اس پر کوئی توجہ نہیں دے گا۔

لیکن یہ بہترین حل، جو سلیکون وافل کی حد تک ان کا استعمال کرتا ہے، کس کے ہاتھ سے نکلا، وہ سفید کاغذ پر سیاہ حروف میں واضح طور پر درج ہے۔

یہ مضمون ویچن گروپ "نیوزی ایوان" سے ہے، مصنف: ASI کا وحی

اعلان دستبرداری: اس صفحہ پر معلومات تیسرے فریق سے حاصل کی گئی ہوں گی اور یہ ضروری نہیں کہ KuCoin کے خیالات یا خیالات کی عکاسی کرے۔ یہ مواد کسی بھی قسم کی نمائندگی یا وارنٹی کے بغیر صرف عام معلوماتی مقاصد کے لیے فراہم کیا گیا ہے، اور نہ ہی اسے مالی یا سرمایہ کاری کے مشورے کے طور پر سمجھا جائے گا۔ KuCoin کسی غلطی یا کوتاہی کے لیے، یا اس معلومات کے استعمال کے نتیجے میں کسی بھی نتائج کے لیے ذمہ دار نہیں ہوگا۔ ڈیجیٹل اثاثوں میں سرمایہ کاری خطرناک ہو سکتی ہے۔ براہ کرم اپنے مالی حالات کی بنیاد پر کسی پروڈکٹ کے خطرات اور اپنے خطرے کی برداشت کا بغور جائزہ لیں۔ مزید معلومات کے لیے، براہ کرم ہماری استعمال کی شرائط اور خطرے کا انکشاف دیکھیں۔