میٹا AI کوڈ کی رفتار کے لیے تقویتی سیکھنے میں چیلنجز کی شناخت کرتی ہے

iconCryptoBriefing
بانٹیں
AI summary iconخلاصہ
میٹا AI کے FAIR ٹیم کی طرف سے AI اور کرپٹو خبروں کے مطابق، ری انفورسمنٹ لرننگ کو کوڈ سپیڈ آپٹیمائزیشن میں نویزی ٹائمنگ، اسپارس ریوارڈز اور عدم استحکام کی وجہ سے مشکلات کا سامنا ہے۔ ٹیم نے DMC-Optim نامی ایک بینچ مارک شروع کیا ہے جو درستگی اور رفتار کو ملا کر Qwen 2.5 7B اور CWM 32B جیسے ماڈلز کے پاس ریٹس میں اضافہ کرتا ہے۔ AI کی ترقیات کو ٹریڈرز کی نظر میں رکھتے ہوئے نئے ٹوکن لسٹنگز اب بھی اہم ترجیح ہیں۔

ایک AI کو کام کرنے والی کوڈ لکھنا سکھانا ایک بات ہے۔ اسے کام کرنے والی کوڈ لکھنا سکھانا جو تیز ہو، ظاہر ہے، بالکل الگ مسئلہ ہے۔

29 جولائی کو شائع ہونے والی میٹا AI کے FAIR ٹیم کی نئی پیپر میں یہ ظاہر ہوا ہے کہ کوڈ کی درستگی سے لے کر کوڈ کی رفتار کے بہترین بنانے تک تقویت سیکھنے کو وسعت دینا ایسے مسائل سے بھرا ہوا ہے جن کو معیاری طریقے آسانی سے نہیں سنبھال سکتے۔ ذمہ دار: انتہائی ادھوری ٹائمنگ کی پیمائش، کم ایوارڈ، اور وہ الگورتھم جو آپ جب ان سے صرف درستگی کے بجائے کارکردگی کے بارے میں فکر کرنے کو کہتے ہیں تو وہ تباہ ہو جاتے ہیں۔

سپیڈ کا مسئلہ

جب آپ یہ پیمائش کرتے ہیں کہ کوڈ درست جواب پیدا کرتا ہے یا نہیں، تو آپ کو ایک صاف دو_ary سگنل ملتا ہے۔ لیکن کوڈ کے کتنے تیز چلنے کی پیمائش کرنا ایک اڑتال چیز ہے۔ ایک ہی مشین پر ایک ہی کوڈ کو دو بار چلائیں اور آپ کو تھوڑے سے مختلف اجراء کے وقت ملیں گے۔ پس منظر کے عمل، سی پی یو شیڈولنگ، میموری الائوسمنٹ، سب ٹائمنگ پیمائشوں میں نوائس پیدا کرتے ہیں۔

اعلان

میٹا ٹیم نے پایا کہ جنرلائزڈ رینفورسمنٹ پالیسی آپٹیمائزیشن، یا GRPO، جو تربیتی سیکھنے کے اوزار میں ایک معیاری الگورتھم ہے، جب آپ اس میں ان قسم کے نویزی سپیڈ میٹرکس فراہم کرتے ہیں تو اس کا عمل عدم استحکام کا شکار ہو جاتا ہے۔

انعام کی کمی مسئلہ کو مزید جٹھاتی ہے۔ زیادہ تر کوڈ کے بہترین بنانے سے صرف کم ترقی حاصل ہوتی ہے، جس کا مطلب ہے کہ ماڈل کو کبھی کبھی ہی ایک مضبوط مثبت سگنل ملتا ہے جو اسے بتائے کہ “ہاں، وہ تبدیلی نے چیزوں کو تیز کر دیا۔”

DMC-Optim: ایک نیا مسئلے کے لیے ایک نیا معیار

ان چیلنجز کو حل کرنے کے لیے، تحقیق کاروں نے DMC-Optim بنایا، جو ایک کیلبریٹڈ سینڈ باکس ماحول اور ایک مخصوص تربیتی پائپ لائن پر مشتمل ہے۔ یہ سسٹم آف لائن سیمولیٹر میں درستگی اور اجرائیہ رفتار دونوں کے لیے انعامات کو جوڑتا ہے، جس سے ایک کنٹرولڈ ماحول تخلیق ہوتا ہے جہاں ٹائمنگ نوائس کو نظرانداز نہیں بلکہ منظم کیا جا سکتا ہے۔

نتائج کے ساتھ بحث کرنا مشکل ہے۔ Qwen 2.5 7B کی پاس ریٹ 18.0% سے بڑھ کر 31.3% ہو گئی، جو تقریباً 74% نسبی بہتری ہے۔ CWM 32B کی پاس ریٹ 30.7% سے بڑھ کر 50.4% ہو گئی، جو 64% نسبی فائدہ ہے۔ LCB بینچ مارک پر، اس طریقہ سے تربیت یافتہ CWM 32B نے قابل تصدیق انعامات سے سیکھنے والے ماڈلز کے مقابلے میں 83% وقت میں میڈین سپیڈ کو شکست دیا۔

خراب ٹائمنگ کی صورت میں، جہاں پیمائش کے شور کو عمدہ طور پر بڑھایا گیا ہے، DMC-Optim بینچ مارک نے معیاری طریقوں کے مقابلے میں 100% سے 200% تک کی بہتری دکھائی۔

یہ مقالہ پییر شمبون، کونہاؤ زینگ، جولیٹ دیکوگس، بینوئٹ ساگو، اور گابریل سینائیوو نے لکھا ہے، جو سب میٹا AI سے ہیں۔

اعلان دستبرداری: اس صفحہ پر معلومات تیسرے فریق سے حاصل کی گئی ہوں گی اور یہ ضروری نہیں کہ KuCoin کے خیالات یا خیالات کی عکاسی کرے۔ یہ مواد کسی بھی قسم کی نمائندگی یا وارنٹی کے بغیر صرف عام معلوماتی مقاصد کے لیے فراہم کیا گیا ہے، اور نہ ہی اسے مالی یا سرمایہ کاری کے مشورے کے طور پر سمجھا جائے گا۔ KuCoin کسی غلطی یا کوتاہی کے لیے، یا اس معلومات کے استعمال کے نتیجے میں کسی بھی نتائج کے لیے ذمہ دار نہیں ہوگا۔ ڈیجیٹل اثاثوں میں سرمایہ کاری خطرناک ہو سکتی ہے۔ براہ کرم اپنے مالی حالات کی بنیاد پر کسی پروڈکٹ کے خطرات اور اپنے خطرے کی برداشت کا بغور جائزہ لیں۔ مزید معلومات کے لیے، براہ کرم ہماری استعمال کی شرائط اور خطرے کا انکشاف دیکھیں۔