میٹا اور الیگزینڈری یونیورسٹی آف الینوائے نے ایووہارنیس-آر ایل تیار کیا، جس سے AI ایجینٹ کی کامیابی کی شرح 96.9% تک بڑھ گئی

iconCryptoBriefing
بانٹیں
AI summary iconخلاصہ
میٹا اور الیگزینڈریا یونیورسٹی کے تحقیقی ٹیم نے ایووہارنیس-آر ایل، ای آئی ایجینٹس کے لیے ایک خود ترقی کرتا ہوا رن ٹائم لیئر تیار کیا ہے۔ اس سسٹم نے معیاری بینچ مارک پر 47.9% سے بڑھا کر 96.9% کامیابی کی شرح حاصل کی۔ یہ فریم ورک پیچیدہ کاموں کو سنبھالنے کے لیے بِلیف، پروگریس اور ایکسپیرینس (BPE) کے ساختی باہری حالت کا استعمال کرتا ہے۔ اس میں ہارنیس اینیلنگ اور ترقی جیسے نمٹنے والے رویے ظاہر ہوتے ہیں۔ یہ ترقی CFT کے کاموں پر اثر ڈال سکتی ہے اور کرپٹو مارکیٹس میں مائع پن میں بہتری لاسکتی ہے۔

میٹا AI اور ایلینوائے یونیورسٹی اربانا-شامپین کے تحقیق کاروں نے ایک نیا مقالہ جاری کیا ہے جس میں ایووہارنیس-آر ایل کا تعارف کرایا گیا ہے، جو بڑے زبان ماڈل ایجنس کو اپنا خارجی حالت بنانے، تک پہنچنے اور اس کا انتظام کرنے کی اجازت دیتا ہے۔ نتیجہ: معیاری بینچ مارک پر 47.9% سے بڑھ کر 96.9% کامیابی کا شمار ہوا۔

EvoHarness-RL در اصل کیا کرتا ہے

LLM ایجنسز کے پاس محدود کنٹیکس ونڈوز ہوتے ہیں۔ جب کوئی کام کئی مراحل پر مشتمل ہو، جس میں ڈائنانک API کنکشنز، سرور لاگز، منتظر ذیلی مقاصد، اور خطا کی تلافی شامل ہو، تو ماڈل کی اندر کی یادداشت کافی نہیں ہوتی۔ اسے اس بات کو ٹریک رکھنے کے لیے ایک باہری سہارا درکار ہوتا ہے کہ وہ دنیا کے بارے میں کیا سمجھتا ہے، اس نے کتنا ترقی کی ہے، اور اس نے گزشتہ غلطیوں سے کیا سیکھا ہے۔

یہ فریم ورک تین اجزاء کے ارد گرد ایک منظم خارجی حالت پیش کرتا ہے: عقیدہ، ترقی، اور تجربہ، جنہیں مل کر BPE کہا جاتا ہے۔ عقیدہ ایجنٹ کی ماحول کے بارے میں موجودہ سمجھ کو ظاہر کرتا ہے۔ ترقی مکمل اور منتظر ذیلی مقاصد کو ٹریک کرتی ہے تاکہ ایجنٹ مراحل نہ چھوڑے یا کام دوبارہ نہ کرے۔ تجربہ ایسی غلطیوں سے سبق محفوظ کرتا ہے، جیسے کہ API ریٹ لِمٹس کی وجہ سے API کا ایک بیچ رد ہو جانا، تاکہ ایجنٹ اپنے طریقے کو اپناسکے۔

ٹریننگ دو مراحل میں ہوتی ہے۔ پہلا، ماہرین کے مظاہرے کا استعمال کرتے ہوئے سپروائزڈ فائن ٹننگ ماڈل کو ہارنس کے ساتھ تعامل کرنے کا طریقہ سکھاتی ہے۔ پھر ایک لاگت-آگاہ تحسین تکنیک، جسے گروپ ریلیٹو پالیسی آپٹیمائزیشن یا GRPO کہا جاتا ہے، ایجینٹ کے رویے کو ہارنس کالز کی کمپوٹیشنل لاگت کے خلاف انجام کی کارکردگی کو متوازن بنانے کے لیے بہتر بناتی ہے۔

اعلان

محققین نے اپنے طریقہ کار کا آزمائش Qwen3-8B ماڈل کے ساتھ ALFWorld پر کیا، جو ایک ایسا بینچ مارک ہے جس میں ایجنس کو متعدد مراحل میں گھریلو کاموں کو مکمل کرنا ہوتا ہے۔ معلوم ماحول میں 96.9 فیصد کامیابی کی شرح خود بخود متاثر کن ہے، لیکن شاید زیادہ اہم بات یہ ہے کہ نئے ماحول میں 86.6 فیصد کامیابی کی شرح حاصل ہوئی۔

دو رویے جنہیں محققین نے صریحاً پروگرام نہیں کیا

یہ کاغذ تربیت کے دوران ظاہر ہونے والے دو نئے ظواہر پر روشنی ڈالتا ہے، جن میں سے کوئی بھی براہ راست ڈیزائن نہیں کیا گیا تھا۔

پہلا "ہارنیس اینیلینگ" ہے۔ وقت کے ساتھ، ایجینٹ روزمرہ کے ہارنیس آپریشنز کو اندر گھلنا شروع کر دیتا ہے، جس سے اسے باہری حالت کی مدد لینے کی ضرورت کم ہو جاتی ہے۔ ہارنیس کالز کم ہوتی جا رہی ہیں، کیونکہ سسٹم خراب نہیں ہو رہا، بلکہ ماڈل نے نمونوں کو سمجھ لیا ہے۔

دوسرا "تکامل کو استعمال کرنا" ہے۔ جب ایجینٹ تربیت حاصل کرتا ہے، تو وہ اپنی بیرونی حالت کو مخصوص کاموں کے لیے مناسب ایک زیادہ مختصر فارمیٹ میں دبائے اور دوبارہ ساخت کرتا ہے۔ BPE رپریزینٹیشن اپنے ڈیزائن میں کسی انسانی مداخلت کے بغیر نازک اور مخصوص تر ہو جاتا ہے۔

پہلے کے کام پر مبنی

ایوہارنس-RL، میٹا-ہارنس پر مبنی ہے، جو مارچ 2026 کا ایک پچھلا منصوبہ تھا جس نے ایجنٹک تلاش کے طریقوں کے ذریعے ہارنس کوڈ کو بہتر بنانے پر توجہ دی تھی۔ جہاں میٹا-ہارنس نے ہارنس کو تلاش کے ذریعے بہتر بنانے کے لیے کوڈ کے طور پر دیکھا، وہیں ایوہارنس-RL پورے کوآرڈینیشن لیئر کو ایسی چیز کے طور پر دیکھتا ہے جسے ماڈل خود سیکھ سکتا ہے اور بہتر بناسکتا ہے۔

اس کاغذ میں موجودہ ایجینٹ فریم ورکس جیسے اسکل آس اور اسکل آر ایل کے مقابلے میں غیر معلوم کاموں پر بہتری کا بھی ذکر ہے۔ ایووہارنس-آر ایل کے لیے واقعات جن کا پہلے سے تجربہ ہے اور نئے ماحولوں کے درمیان کارکردگی کا فرق تقریباً 10 فیصد ہے، جبکہ مقابلہ کرنے والے طریقوں میں یہ کمی بہت زیادہ ہے۔

اینٹرپرائز AI ڈیپلویمنٹ کے لیے اس کا کیا مطلب ہے

controlled ماحول میں کامیابی کی شرح 48% سے بڑھ کر 97% ہونا کوئی چھوٹی بہتری نہیں۔ 86.6% جنرلائزیشن کی شرح بھی اہم ہے، کیونکہ حقیقی دنیا کے کاروباری کامز عام طور پر تربیتی ڈیٹا جیسے نہیں ہوتے۔

GRPO تربیت کے مرحلے میں ڈالی گئی لاگت کو سمجھنے والا بہترین طریقہ ایک عملی خدشہ بھی حل کرتا ہے۔ باہری ہارنیس کال مفت نہیں ہوتے۔ یہ کمپیوٹنگ کا استعمال کرتے ہیں اور تاخیر شامل کرتے ہیں۔ ہارنیس اینیلنگ کے ذریعے ایجنٹ کو غیر ضروری کالوں کو کم کرنے کے لیے تربیت دے کر، فریم ورک وقت کے ساتھ زیادہ موثر بن جاتا ہے بغیر درستگی کو متاثر کیے۔

اعلان دستبرداری: اس صفحہ پر معلومات تیسرے فریق سے حاصل کی گئی ہوں گی اور یہ ضروری نہیں کہ KuCoin کے خیالات یا خیالات کی عکاسی کرے۔ یہ مواد کسی بھی قسم کی نمائندگی یا وارنٹی کے بغیر صرف عام معلوماتی مقاصد کے لیے فراہم کیا گیا ہے، اور نہ ہی اسے مالی یا سرمایہ کاری کے مشورے کے طور پر سمجھا جائے گا۔ KuCoin کسی غلطی یا کوتاہی کے لیے، یا اس معلومات کے استعمال کے نتیجے میں کسی بھی نتائج کے لیے ذمہ دار نہیں ہوگا۔ ڈیجیٹل اثاثوں میں سرمایہ کاری خطرناک ہو سکتی ہے۔ براہ کرم اپنے مالی حالات کی بنیاد پر کسی پروڈکٹ کے خطرات اور اپنے خطرے کی برداشت کا بغور جائزہ لیں۔ مزید معلومات کے لیے، براہ کرم ہماری استعمال کی شرائط اور خطرے کا انکشاف دیکھیں۔