ایک AI کو کام کرنے والی کوڈ لکھنا سکھانا ایک بات ہے۔ اسے کام کرنے والی کوڈ لکھنا سکھانا جو تیز ہو، ظاہر ہے، بالکل الگ مسئلہ ہے۔
29 جولائی کو شائع ہونے والی میٹا AI کے FAIR ٹیم کی نئی پیپر میں یہ ظاہر ہوا ہے کہ کوڈ کی درستگی سے لے کر کوڈ کی رفتار کے بہترین بنانے تک تقویت سیکھنے کو وسعت دینا ایسے مسائل سے بھرا ہوا ہے جن کو معیاری طریقے آسانی سے نہیں سنبھال سکتے۔ ذمہ دار: انتہائی ادھوری ٹائمنگ کی پیمائش، کم ایوارڈ، اور وہ الگورتھم جو آپ جب ان سے صرف درستگی کے بجائے کارکردگی کے بارے میں فکر کرنے کو کہتے ہیں تو وہ تباہ ہو جاتے ہیں۔
سپیڈ کا مسئلہ
جب آپ یہ پیمائش کرتے ہیں کہ کوڈ درست جواب پیدا کرتا ہے یا نہیں، تو آپ کو ایک صاف دو_ary سگنل ملتا ہے۔ لیکن کوڈ کے کتنے تیز چلنے کی پیمائش کرنا ایک اڑتال چیز ہے۔ ایک ہی مشین پر ایک ہی کوڈ کو دو بار چلائیں اور آپ کو تھوڑے سے مختلف اجراء کے وقت ملیں گے۔ پس منظر کے عمل، سی پی یو شیڈولنگ، میموری الائوسمنٹ، سب ٹائمنگ پیمائشوں میں نوائس پیدا کرتے ہیں۔
میٹا ٹیم نے پایا کہ جنرلائزڈ رینفورسمنٹ پالیسی آپٹیمائزیشن، یا GRPO، جو تربیتی سیکھنے کے اوزار میں ایک معیاری الگورتھم ہے، جب آپ اس میں ان قسم کے نویزی سپیڈ میٹرکس فراہم کرتے ہیں تو اس کا عمل عدم استحکام کا شکار ہو جاتا ہے۔
انعام کی کمی مسئلہ کو مزید جٹھاتی ہے۔ زیادہ تر کوڈ کے بہترین بنانے سے صرف کم ترقی حاصل ہوتی ہے، جس کا مطلب ہے کہ ماڈل کو کبھی کبھی ہی ایک مضبوط مثبت سگنل ملتا ہے جو اسے بتائے کہ “ہاں، وہ تبدیلی نے چیزوں کو تیز کر دیا۔”
DMC-Optim: ایک نیا مسئلے کے لیے ایک نیا معیار
ان چیلنجز کو حل کرنے کے لیے، تحقیق کاروں نے DMC-Optim بنایا، جو ایک کیلبریٹڈ سینڈ باکس ماحول اور ایک مخصوص تربیتی پائپ لائن پر مشتمل ہے۔ یہ سسٹم آف لائن سیمولیٹر میں درستگی اور اجرائیہ رفتار دونوں کے لیے انعامات کو جوڑتا ہے، جس سے ایک کنٹرولڈ ماحول تخلیق ہوتا ہے جہاں ٹائمنگ نوائس کو نظرانداز نہیں بلکہ منظم کیا جا سکتا ہے۔
نتائج کے ساتھ بحث کرنا مشکل ہے۔ Qwen 2.5 7B کی پاس ریٹ 18.0% سے بڑھ کر 31.3% ہو گئی، جو تقریباً 74% نسبی بہتری ہے۔ CWM 32B کی پاس ریٹ 30.7% سے بڑھ کر 50.4% ہو گئی، جو 64% نسبی فائدہ ہے۔ LCB بینچ مارک پر، اس طریقہ سے تربیت یافتہ CWM 32B نے قابل تصدیق انعامات سے سیکھنے والے ماڈلز کے مقابلے میں 83% وقت میں میڈین سپیڈ کو شکست دیا۔
خراب ٹائمنگ کی صورت میں، جہاں پیمائش کے شور کو عمدہ طور پر بڑھایا گیا ہے، DMC-Optim بینچ مارک نے معیاری طریقوں کے مقابلے میں 100% سے 200% تک کی بہتری دکھائی۔
یہ مقالہ پییر شمبون، کونہاؤ زینگ، جولیٹ دیکوگس، بینوئٹ ساگو، اور گابریل سینائیوو نے لکھا ہے، جو سب میٹا AI سے ہیں۔
