نیا کاغذ جنریٹو ماڈلز کے لیے ایکسپلوریٹو ماڈلنگ کے ذریعے اینڈ تو اینڈ ٹریننگ پیش کرتا ہے

icon MarsBit
بانٹیں
AI summary iconخلاصہ
UIUC اور ہارورڈ کی طرف سے ایک نئی کتاب میں ایکسپلوریٹو ماڈلنگ (XM) کا تعارف کیا گیا ہے، جو جنریٹو ماڈلز کے لیے ایک انڈ-ٹو-انڈ تربیتی طریقہ ہے۔ یہ طریقہ ایک فور-لوپ کا استعمال کرتا ہے تاکہ کاندیدیٹس کو جنریٹ اور منتخب کیا جا سکے، جس سے موڈ بلرینگ کم ہوتا ہے۔ اس کا اثر تصویر، ویڈیو اور زبان کے کاموں میں دیکھا گیا ہے، جہاں FLOP، نمونہ اور پیرامیٹر کی کارآمدی میں بہتری آئی ہے۔ جبکہ نگرانی کے لیے آلٹ کوائنز کی توجہ بڑھ رہی ہے، ایسے ایجادات ٹریڈرز کے درمیان فیئر اینڈ گریڈ انڈیکس پر اثر ڈال سکتی ہیں۔

2012 میں، الیکسنٹ نے ایک دور کو دباؤ کے ساتھ ختم کر دیا۔ اس سے پہلے، تصویر شناخت کے لیے انسانوں کو ایک ایک کر کے خصوصیات نکالنے کے لیے ہندسی طریقہ کار تیار کرنا پڑتا تھا؛ الیکسنٹ نے ایک ایسی بات ثابت کر دی جو بعد میں بار بار تصدیق ہوئی: پورا کام ایک ساتھ ماڈل کو سیکھنے کے لیے دے دیا جائے، تو یہ تقریباً ہمیشہ انسانوں کے طویل، مرحلہ وار عمل سے بہتر ہوتا ہے۔

تصویر کی طبقہ بندی سے لے کر اشیاء کی تشخیص اور تصویر کے تقسیم تک، گہری سیکھنے کی ہر قدم پیچھے ایک ہی بات ہے: اسے خود کو ایک ساتھ سیکھنے دیں۔

صرف ایک شعبہ ہمیشہ استثناء ہے: جنریٹو ماڈلز۔

آج کا سب سے طاقتور اور سب سے زیادہ وسعت پذیر جنریٹو ماڈل (چاہے وہ آٹو ریگریسیو ہو یا ڈیفیوژن ماڈل) اندرونی طور پر نہیں ہے۔

انہیں تربیت کے دوران صرف ایک چھوٹے قدم کا پیش گوئی سیکھا گیا تھا، لیکن استدلال کے دوران انہیں ایک چکر نیٹ ورک کی طرح اس ایک قدم کو سینوں یا ہزاروں بار دہرانا پڑتا ہے۔

ٹریننگ اور انفرنس کے لیے الگ الگ نمونہ لینے کے طریقے استعمال ہوتے ہیں۔ یہ فرق ایک پرانا مسئلہ پیدا کرتا ہے: ہر قدم کی غلطی اگلے قدم میں داخل ہو جاتی ہے، جس سے ان پٹ تدریجاً ٹریننگ کے دوران دیکھے گئے توزیع سے دور ہوتا جاتا ہے اور غلطیاں اکٹھی ہوتی جاتی ہیں۔ اسے اکادمیک طور پر "ایکسپوژر بائس" کہا جاتا ہے۔

دیگر الفاظ میں، گہری سیکھنے کا سب سے بنیادی تجربہ، "اینڈ تو اینڈ بہتر ہے"، پچاس سالوں سے حقیقت میں جنریٹو ماڈلز پر لاگو نہیں ہوا ہے۔

اور حال ہی میں، UIUC اور ہارورڈ یونیورسٹی کے ایک مقالے نے اس آخری ٹکڑے کو مکمل کرنے کی کوشش کی۔

جنریٹ مدل

مصنف نے اس نئے طریقہ کار کا نام "Explorative Modeling" (تجرباتی ماڈلنگ) رکھا، جس کا مختصر نام XM ہے۔ اس کا خیال اتنا سادہ ہے جیسے بہت زیادہ سادہ، لیکن یہ ایک جرأت بھرے نتیجہ کی طرف اشارہ کرتا ہے: جنریٹو ماڈلز کے پاس پیرامیٹرز اور ڈیٹا کے علاوہ تیسری ایک ایسی محور بھی ہے جسے بڑھایا جا سکتا ہے۔

جنریٹ مدل

پروجیکٹ کی ویب سائٹ: https://explorative-modeling.github.io

کاغذ کا لنک: https://arxiv.org/abs/2607.27372

کوڈ ریپوزٹری: https://github.com/alexiglad/XM

مسئلے کا بنیادی سبب: ماڈل صرف "اعتدال لے گا"

اس مضمون کو کیا حل کرنا ہے، اسے سمجھنے کے لیے، یہ سمجھنا ضروری ہے کہ پیدا کرنا کیوں مشکل ہے۔

عام سپروائزڈ لرننگ (جیسے طبقہ بندی) میں، ہر ان پٹ کا بنیادی طور پر ایک ہی صحیح جواب ہوتا ہے، اور ماڈل صرف ایک متعین کردہ میپنگ سیکھتا ہے۔

لیکن پیدا کردہ چیزیں مختلف ہوتی ہیں۔ آپ مدل کو "ایک کتا پیدا کرو" کہتے ہیں، تو صحیح جواب کا ممکنہ طور پر لامتناہی عدد ہو سکتا ہے۔ یہ قانونی آؤٹ پٹس، ڈیٹا کے توزیع میں الگ الگ موڈز (یعنی توزیع کے الگ الگ علیحدہ چوٹیاں) ہیں۔ پیدا کرنا مشکل ہے، کیونکہ ان سب موڈز کو ایک ساتھ پکڑنا ہوتا ہے۔

مسئلہ یہ ہے کہ مین لائن جنریٹو ماڈلز کو تربیت دی جاتی ہے جبکہ ان کا ریکنسٹرکشن لاس (مثلاً مربع خطاء) استعمال ہوتا ہے۔ جب ایک ان پٹ کو کئی مختلف قانونی ٹارگٹس کے ساتھ رینڈم طور پر جوڑا جاتا ہے، تو ریکنسٹرکشن لاس کا بہترین حل ان ٹارگٹس کا اوسط ہوتا ہے۔ اور زیادہ تر ڈیٹا کے لیے، اوسط ڈیٹا کے مینی فولڈ پر نہیں ہوتا، بلکہ کئی موڈز کے درمیان میں پڑتا ہے، جو کسی بھی ایک کی مانند نہیں ہوتا۔

کاغذ میں وہ گراف بہت واضح ہے: مدل کو کسی بھی ٹرک کے بغیر براہ راست اینڈ تو اینڈ ریگریشن کرنے دیں، تین گروہ سکیٹر پوائنٹس اس کے ذریعہ درمیان میں ایک نقطہ بن جائیں گے، ایک کتا کی تصویر ایک گڑبڑ میں بدل جائے گی، اور ایک جملہ "the" کو دہرانے تک کم ہو جائے گا۔ یہی "موڈ بلررنگ" (mode blurring) ہے، جس میں بہترین حل وہی ہوتا ہے جو حقیقی ڈیٹا سے سب سے کم ملتا جلتا ہے۔

جنریٹ مدل

موجودہ ماڈل کیسے گزرتا ہے؟ جواب یہ ہے کہ "پیدا کرنا" کو چھوٹے چھوٹے حصوں میں تقسیم کر دیا جاتا ہے۔ خود بہ خود ایک بار میں صرف ایک عنصر کا پیشن گوئی کرتا ہے، اسکیٹر ایک بار میں صرف تھوڑا سا شور ہٹاتا ہے، اور ہر چھوٹے مرحلے کا مقصد تقریباً صرف ایک منفرد موڈ تک محدود ہو جاتا ہے، اس لیے دوبارہ تعمیر کا نقصان اوسط لینے کی بجائے نہیں ہوتا۔

یہ "تقسیم اور پیداوار کا عمل" ہی وہ چیز ہے جس کی وجہ سے ڈیفیوژن اور آٹو ریگریسیو دونوں اعلیٰ معیار کے نمونے پیدا کر سکتے ہیں، لیکن یہی وجہ ہے کہ مدل کو ایک ساتھ ختم نہیں کیا جا سکتا۔

اس لیے مصنف ایک اہم سوال اٹھاتا ہے: ایک جنریٹو ماڈل میں صرف دو چیزیں ہیں جنہیں الگ کیا جا سکتا ہے: ایک تو یہ کہ کیسے جنریٹ کیا جائے، دوسرا یہ کہ کیسے ٹرین کیا جائے۔

اگر ڈیکمپائل کرنا اس راستے کو شیڈ کر دے گا، تو پھر ٹریننگ کو کیوں نہیں ڈیکمپائل کیا جاتا؟

جنریٹ مدل

ایک for لوپ: ایکسپلورٹری مڈلنگ کا مکمل مرکز

Explorative Modeling وہی ہے جو تربیتی حلقوں کو ہٹا دیتا ہے۔

اس کا مکانیزم ایک جملے میں کیا جا سکتا ہے: ہر تربیتی قدم پر، ماڈل صرف ایک نمونہ نہیں بناتا جو مقصد کے لیے مجبور کیا جائے، بلکہ K امیدوار بناتا ہے، اور پھر حقیقی ڈیٹا کے سب سے قریب والے کو چن کر تربیت دی جاتی ہے اور گریڈینٹ واپس بھیجے جاتے ہیں۔ پیپر میں اسے 3 سے 5 لائنوں کے ایک for لوپ کے طور پر لاگو کیا گیا ہے، جو اتنا آسان ہے کہ شک ہوتا ہے (الگورتھم 1)۔

جنریٹ مدل

یہ کیوں حل کرتا ہے mode کی عدم وضاحت؟

زندگی کے ایک اور منظر کو سوچیں: دھنک کے گرنے کی جگہ کا اندازہ لگائیں۔ اگر صرف ایک بار اندازہ لگانے کی اجازت ہو، تو آپ کا بہترین راستہ تمام دھنکوں کے اوسط نقطہ پر اندازہ لگانا ہوگا، لیکن یہ عام طور پر اس ٹارگٹ پر ایسی جگہ ہوتی ہے جہاں کوئی دھنک نہیں گرا۔ لیکن اگر آپ کو K بار اندازہ لگانے کی اجازت ہو اور صرف سب سے قریبی اندازہ پر نمبر دیا جائے، تو بہترین راستہ فوراً بدل جاتا ہے: آپ اپنے اندازوں کو مختلف جگہوں پر بکھیر دیں گے تاکہ ہر اندازہ مختلف گرنے والے نقطوں کو کور کرے۔

جنریٹ مدل

ماسٹر کے لیے بھی یہی بات ہے۔ جب اسے K امکانات کو تلاش کرنے کی اجازت دی جاتی ہے، تو مختلف ان پٹ نوائس ہر ایک الگ mode کو "اپنا" لیتے ہیں، نہ کہ سب اوسط کی طرف جمع ہو جائیں۔ جتنا زیادہ تلاش کیا جائے، ماسٹر اتنے ہی زیادہ mode کو پکڑ لیتا ہے۔

جنریٹ مدل

مصنف نے اس طویل عرصے سے نظرانداز کی جانے والی صلاحیت کا نام "جینریٹو ایکسپریسیوٹی" رکھا اور واضح کیا کہ یہ تربیت کے مقصد سے طے ہوتی ہے، چاہے آپ پیرامیٹرز اور ڈیٹا کو کتنے بھی بڑھا دیں، یہ خود بخود نہیں بڑھے گی۔

جنریٹ مدل

یہ ایک ایسے عجیب ظاہر کو بھی سمجھاتا ہے جسے صنعت پہلے ہی نوٹ کر چکی تھی: کیوں آج کے بہترین ماڈلز «ہدایت» (guidance) ٹیکنالوجی پر اتنے زیادہ انحصار کرتے ہیں۔

بے طریقہ ہدایت کا مطلب یہ ہے کہ پیشگوئی کو اس模糊 اوسط سے دور کیا جائے۔ لیکن اگر ماڈل خود ہی اچھا ہے، تو اسے دور کرنے کی ضرورت کیوں؟ ہدایت کا فائدہ صرف اس لیے ہے کہ موڈ کی模糊یت کی وجہ سے مسئلہ پیدا ہوتا ہے۔

کاغذ میں فارورڈ اور ریورس دو ایکسپلوریشن ڈائریکشنز دی گئی ہیں: پہلا ایک حقیقی ہدف کو ثابت رکھتا ہے اور اپنی تخلیق میں سب سے قریبی کو تلاش کرتا ہے، جو "پورا کور" (تمام موڈز کو کور کرنا) کی طرف رجحان رکھتا ہے؛ دوسرا ایک تخلیق کو ثابت رکھتا ہے اور حقیقی ڈیٹا میں سب سے قریبی کو تلاش کرتا ہے، جو "درستگی" کی طرف رجحان رکھتا ہے، اور تقریباً کوئی کمپوٹیشنل آؤٹ پٹ نہیں بڑھاتا، لیکن قیمت یہ ہے کہ یہ صرف کچھ موڈز پر گر سکتا ہے۔ دونوں ایک دوسرے کے مکمل ہیں اور انہیں ملا کر استعمال کیا جا سکتا ہے۔

جنریٹ مدل

جنریٹ مدل

تیسری محور: جتنا زیادہ زوم کریں، اتنی زیادہ منافع ہوگا

اس تحقیقی مقالے کا سب سے اہم نتیجہ یہ ہے کہ "کھوج" کو ایک حقیقی اسکیلنگ محور کے طور پر ثابت کیا گیا ہے۔

لکھاری نے ایکسپلوریشن کو ڈیفیوژن/ڈیفیوژن مڈل، جمپی مڈل اور ماسکڈ ڈیفیوژن لینگویج مڈل تک وسیع کیا، جس سے تصویر، ویڈیو اور زبان کے تین ماڈلز پر ایک جیسی طرح پرفارمنس مسلسل بہتر ہوئی۔ اور زیادہ اہم بات یہ ہے کہ سائز کے ساتھ فائدہ کا رجحان: جتنا بڑا کریں، اتنا ہی زیادہ طاقتور۔

کاغذ میں دیے گئے اعداد و شمار یہ ہیں: جب ڈیٹا کا سائز بڑھتا ہے، تو ایکسپلوریشن سے حاصل ہونے والی فائدہ 7% سے بڑھ کر 36% ہو جاتا ہے؛ جب ماڈل بڑھتا ہے، تو یہ فائدہ 13% سے بڑھ کر 23% ہو جاتا ہے؛ جب کمپیوٹیشنل طاقت تین گنا ہو جاتی ہے، تو کارکردگی میں فائدہ دوگنا سے زیادہ ہو جاتا ہے۔

کارکردگی کے لحاظ سے، اس نے FLOP کارکردگی کو 4.1 گنا، نمونہ کارکردگی کو 6.2 گنا، اور پیرامیٹر کارکردگی کو 47% بڑھایا۔ تصویر تخلیق میں، اس نے موجودہ سب سے طاقتور RAE ریسیپی کو ImageNet پر بے ہدایت 1.43 FID تک پہنچا دیا، جو صنعت کے بہترین مستوی کے قریب ہے۔

جنریٹ مدل

ایک ایسا بڑا ماڈل جو 5 موڈز کا جائزہ لیتا ہے، جو 47% زیادہ پیرامیٹرز والے XLarge ماڈل کو شکست دے سکتا ہے جو کوئی جائزہ نہیں لیتا۔

جنریٹ مدل

اس رجحان کا مطلب کافی بڑا ہے۔ مصنف کی وضاحت یہ ہے:چھوٹے پیمانے پر، ماڈل بنیادی طور پر پیرامیٹرز اور ڈیٹا کی وجہ سے محدود ہوتا ہے، اور پیداواری اظہار کبھی بھی رکاوٹ نہیں بنتا؛ لیکن جب پیرامیٹرز اور ڈیٹا اس حد تک بڑھ جائیں کہ وہ محدودیت نہ رہیں، تو پیداواری اظہار آہستہ آہستہ اصل رکاوٹ بن جائے گا۔ اور یہی وہ چیز ہے جس کا تجربہ براہ راست بڑھانے کے لیے کیا جا رہا ہے۔

جس طرح کی موجودہ حقیقی بنیادی ماڈل ٹریننگ کے لیے کمپوٹیشنل طاقت استعمال ہو رہی ہے، وہ اس پیپر کے سب سے بڑے تجربے سے تقریباً چار درجے زیادہ ہے، اس لیے مصنفین کا خیال ہے کہ پیپر میں درج کیے گئے یہ اعداد و شمار بڑے پیمانے پر منافع کی حد سے کم ہو سکتے ہیں۔

حقیقی end-to-end جنریشن

اگر تلاش کو حد تک لے جایا جائے، تو کیا ہوگا؟ جواب اس شروع کی پراسرار بات پر واپس آ جاتا ہے: جنریٹو ماڈل اب بالآخر اینڈ تو اینڈ ہو گئے ہیں۔

لکھاری نے XM کو ایک الگ اندروز اینڈ اینڈ ماڈل کے طور پر استعمال کیا اور اسے روبوٹ کنٹرول کے کاموں کے لیے استعمال کیا۔ اس کے رویہ نقل (Behaviour Cloning) پر، ان کا Explorative Policy صرف ایک بار نیٹ ورک فارورڈ کے ساتھ 100 بار فارورڈ کی ضرورت والے Diffusion Policy کو برابر یا زیادہ کر دیا؛ اور مقصد مدار ماحول کی تشکیل پر، Explorative World Model نے Diffuser سے 16 سے 256 گنا کم انفرینس کی طاقت استعمال کرتے ہوئے بہتر اوسط کارکردگی حاصل کی۔

جنریٹ مدل

جنریٹ مدل

اس فرق کا ذریعہ واضح ہے: ڈیفیوژن ماڈلز تھوڑے ہی مراحل میں تخلیق کے لیے استدلال کے دوران سینکڑوں اسٹیپس استعمال کرتے ہیں، جبکہ اینڈ-ٹو-اینڈ XM اس لاگت کو تربیت کے دوران تجربے پر منتقل کر دیتا ہے، جس کی وجہ سے استدلال صرف ایک فاروارڈ پاس کی ضرورت ہوتی ہے۔ "متعدد موڈز کو سنبھالنا" اسی ایک بات کو، یا تو استدلال کے دوران آہستہ آہستہ تقسیم کیا جاتا ہے، یا تربیت کے دوران ایک بار مکمل طور پر تجربہ کیا جاتا ہے؛ اس تحقیقی مقالے نے دوسرے کو اپنایا ہے۔

مصنف کا تعارف

اس تحقیقی مقالے کے پہلے مصنف ایلیکسی گلیڈسٹون پہلے سے جانے جاتے ہیں۔ جولائی 2025 میں، ان کی قیادت میں تیار کیا گیا Energy-Based Transformers (EBT) سوشل میڈیا پر کافی بحث کا موضوع بن چکا تھا۔

جنریٹ مدل

اس کام کا دعویٰ ہے کہ اس نے پہلی بار کئی ابعاد میں معیاری فیڈ فاروڈ ٹرانسفارمر کی اسکیلنگ کریو کو "ہرا" دیا ہے اور "سسٹم 2 سوچ" کو کسی بھی موڈ میں لاگو کرنے کی کوشش کی ہے۔ ماشین زِن کی رپورٹ "نیا پیراڈائم آ گیا! نیا انرجی ماڈل ٹرانسفارمر++ کی اسکیلنگ لِمٹ توڑ دی، ٹریننگ اسکیلنگ ریٹ 35% تیز" کو دیکھیں۔

جنریٹ مدل

ایکسپلوریٹو ماڈلنگ اس کے معمول کے خیالات کا ایک امتداد ہے: دونوں یہ سوال اٹھاتے ہیں کہ "کیا ماڈل کسی تلاش یا تجربے کے طریقے سے ایک منفرد فارورڈ پاس میں نہیں کر سکتا؟" اور یہ تحقیق اس کے ساتھیوں (یلون دو اور ہینگ جی) کے دوسرے نظریہ "موڈ فورسنگ" پر مبنی ہے۔ تحقیق میں صاف طور پر کہا گیا ہے کہ اس نظریہ کے وجود کی وجہ سے، XM کے زیادہ تر نتائج پہلے نظریاتی طور پر پیش گوئی کئے گئے اور پھر تجرباتی طور پر تصدیق کئے گئے، جو گہری سیکھنے کے شعبے میں جہاں "تجربات کرنے کے بعد وضاحت کرنا" عام ہے، وہاں نایاب بات ہے۔

جنریٹ مدل

مصنف نے اپنی حدود کو بھی صاف صاف تسلیم کیا: بیسٹ آف K کا خیال خود نئے نہیں ہے، پہلے بھی کئی بار کیا جا چکا ہے؛ ان کا اصل کردار یہ تھا کہ انہوں نے اس آسان حلقوں کو سمجھ لیا کہ یہ بالکل کیا کر رہا ہے: یہ تولید کے عمل کو تقسیم کیے بغیر، تولیدی اظہار کو براہ راست بڑھا رہا ہے۔

علاوہ ازیں، خودبازی زبانی ماڈل اب بھی سب سے مشکل چیلنج ہیں، اور صرف اینڈ-ٹو-اینڈ فارورڈ XM بہت زیادہ موڈ والے توزیع (جیسے تصویر پیدا کرنا) پر اب بھی بہت مہنگا ہے، جن کو بعد کے کاموں کے لیے چھوڑ دیا گیا ہے۔

کئی دہائیوں تک، ہم نے جنریٹو ماڈلز کو تنظیم دینے کے لیے دو گھنٹیوں کا استعمال کیا: انہیں زیادہ بڑا بنانا اور انہیں زیادہ ڈیٹا دینا۔

اس تحقیق میں پیش کیا گیا تیسرا گھڑیا بہت سادہ ہے: ماڈل کو کئی بار اندازہ لگانے دیں اور صرف بہترین اندازہ ہی رکھیں۔ لیکن اگر یہ رجحان درست ثابت ہوا، تو جب تک پیمانہ مزید بڑھتا رہے گا، پہلے دو گھڑیے جلد ہی اپنے حد تک گھوم جائیں گے، جبکہ تیسرا ابھی شروع ہوا ہے۔

حوالہ جات کا لنک

https://x.com/AlexiGlad/status/2083230922196107288

یہ مضمون ویچن گروپ "مشین سائنس" (ID: almosthuman2014) سے ہے، مصنف: پانڈا

اعلان دستبرداری: اس صفحہ پر معلومات تیسرے فریق سے حاصل کی گئی ہوں گی اور یہ ضروری نہیں کہ KuCoin کے خیالات یا خیالات کی عکاسی کرے۔ یہ مواد کسی بھی قسم کی نمائندگی یا وارنٹی کے بغیر صرف عام معلوماتی مقاصد کے لیے فراہم کیا گیا ہے، اور نہ ہی اسے مالی یا سرمایہ کاری کے مشورے کے طور پر سمجھا جائے گا۔ KuCoin کسی غلطی یا کوتاہی کے لیے، یا اس معلومات کے استعمال کے نتیجے میں کسی بھی نتائج کے لیے ذمہ دار نہیں ہوگا۔ ڈیجیٹل اثاثوں میں سرمایہ کاری خطرناک ہو سکتی ہے۔ براہ کرم اپنے مالی حالات کی بنیاد پر کسی پروڈکٹ کے خطرات اور اپنے خطرے کی برداشت کا بغور جائزہ لیں۔ مزید معلومات کے لیے، براہ کرم ہماری استعمال کی شرائط اور خطرے کا انکشاف دیکھیں۔