میٹا AI اور ایلینوائے یونیورسٹی اربانا-شامپین کے تحقیق کاروں نے ایک نیا مقالہ جاری کیا ہے جس میں ایووہارنیس-آر ایل کا تعارف کرایا گیا ہے، جو بڑے زبان ماڈل ایجنس کو اپنا خارجی حالت بنانے، تک پہنچنے اور اس کا انتظام کرنے کی اجازت دیتا ہے۔ نتیجہ: معیاری بینچ مارک پر 47.9% سے بڑھ کر 96.9% کامیابی کا شمار ہوا۔
EvoHarness-RL در اصل کیا کرتا ہے
LLM ایجنسز کے پاس محدود کنٹیکس ونڈوز ہوتے ہیں۔ جب کوئی کام کئی مراحل پر مشتمل ہو، جس میں ڈائنانک API کنکشنز، سرور لاگز، منتظر ذیلی مقاصد، اور خطا کی تلافی شامل ہو، تو ماڈل کی اندر کی یادداشت کافی نہیں ہوتی۔ اسے اس بات کو ٹریک رکھنے کے لیے ایک باہری سہارا درکار ہوتا ہے کہ وہ دنیا کے بارے میں کیا سمجھتا ہے، اس نے کتنا ترقی کی ہے، اور اس نے گزشتہ غلطیوں سے کیا سیکھا ہے۔
یہ فریم ورک تین اجزاء کے ارد گرد ایک منظم خارجی حالت پیش کرتا ہے: عقیدہ، ترقی، اور تجربہ، جنہیں مل کر BPE کہا جاتا ہے۔ عقیدہ ایجنٹ کی ماحول کے بارے میں موجودہ سمجھ کو ظاہر کرتا ہے۔ ترقی مکمل اور منتظر ذیلی مقاصد کو ٹریک کرتی ہے تاکہ ایجنٹ مراحل نہ چھوڑے یا کام دوبارہ نہ کرے۔ تجربہ ایسی غلطیوں سے سبق محفوظ کرتا ہے، جیسے کہ API ریٹ لِمٹس کی وجہ سے API کا ایک بیچ رد ہو جانا، تاکہ ایجنٹ اپنے طریقے کو اپناسکے۔
ٹریننگ دو مراحل میں ہوتی ہے۔ پہلا، ماہرین کے مظاہرے کا استعمال کرتے ہوئے سپروائزڈ فائن ٹننگ ماڈل کو ہارنس کے ساتھ تعامل کرنے کا طریقہ سکھاتی ہے۔ پھر ایک لاگت-آگاہ تحسین تکنیک، جسے گروپ ریلیٹو پالیسی آپٹیمائزیشن یا GRPO کہا جاتا ہے، ایجینٹ کے رویے کو ہارنس کالز کی کمپوٹیشنل لاگت کے خلاف انجام کی کارکردگی کو متوازن بنانے کے لیے بہتر بناتی ہے۔
محققین نے اپنے طریقہ کار کا آزمائش Qwen3-8B ماڈل کے ساتھ ALFWorld پر کیا، جو ایک ایسا بینچ مارک ہے جس میں ایجنس کو متعدد مراحل میں گھریلو کاموں کو مکمل کرنا ہوتا ہے۔ معلوم ماحول میں 96.9 فیصد کامیابی کی شرح خود بخود متاثر کن ہے، لیکن شاید زیادہ اہم بات یہ ہے کہ نئے ماحول میں 86.6 فیصد کامیابی کی شرح حاصل ہوئی۔
دو رویے جنہیں محققین نے صریحاً پروگرام نہیں کیا
یہ کاغذ تربیت کے دوران ظاہر ہونے والے دو نئے ظواہر پر روشنی ڈالتا ہے، جن میں سے کوئی بھی براہ راست ڈیزائن نہیں کیا گیا تھا۔
پہلا "ہارنیس اینیلینگ" ہے۔ وقت کے ساتھ، ایجینٹ روزمرہ کے ہارنیس آپریشنز کو اندر گھلنا شروع کر دیتا ہے، جس سے اسے باہری حالت کی مدد لینے کی ضرورت کم ہو جاتی ہے۔ ہارنیس کالز کم ہوتی جا رہی ہیں، کیونکہ سسٹم خراب نہیں ہو رہا، بلکہ ماڈل نے نمونوں کو سمجھ لیا ہے۔
دوسرا "تکامل کو استعمال کرنا" ہے۔ جب ایجینٹ تربیت حاصل کرتا ہے، تو وہ اپنی بیرونی حالت کو مخصوص کاموں کے لیے مناسب ایک زیادہ مختصر فارمیٹ میں دبائے اور دوبارہ ساخت کرتا ہے۔ BPE رپریزینٹیشن اپنے ڈیزائن میں کسی انسانی مداخلت کے بغیر نازک اور مخصوص تر ہو جاتا ہے۔
پہلے کے کام پر مبنی
ایوہارنس-RL، میٹا-ہارنس پر مبنی ہے، جو مارچ 2026 کا ایک پچھلا منصوبہ تھا جس نے ایجنٹک تلاش کے طریقوں کے ذریعے ہارنس کوڈ کو بہتر بنانے پر توجہ دی تھی۔ جہاں میٹا-ہارنس نے ہارنس کو تلاش کے ذریعے بہتر بنانے کے لیے کوڈ کے طور پر دیکھا، وہیں ایوہارنس-RL پورے کوآرڈینیشن لیئر کو ایسی چیز کے طور پر دیکھتا ہے جسے ماڈل خود سیکھ سکتا ہے اور بہتر بناسکتا ہے۔
اس کاغذ میں موجودہ ایجینٹ فریم ورکس جیسے اسکل آس اور اسکل آر ایل کے مقابلے میں غیر معلوم کاموں پر بہتری کا بھی ذکر ہے۔ ایووہارنس-آر ایل کے لیے واقعات جن کا پہلے سے تجربہ ہے اور نئے ماحولوں کے درمیان کارکردگی کا فرق تقریباً 10 فیصد ہے، جبکہ مقابلہ کرنے والے طریقوں میں یہ کمی بہت زیادہ ہے۔
اینٹرپرائز AI ڈیپلویمنٹ کے لیے اس کا کیا مطلب ہے
controlled ماحول میں کامیابی کی شرح 48% سے بڑھ کر 97% ہونا کوئی چھوٹی بہتری نہیں۔ 86.6% جنرلائزیشن کی شرح بھی اہم ہے، کیونکہ حقیقی دنیا کے کاروباری کامز عام طور پر تربیتی ڈیٹا جیسے نہیں ہوتے۔
GRPO تربیت کے مرحلے میں ڈالی گئی لاگت کو سمجھنے والا بہترین طریقہ ایک عملی خدشہ بھی حل کرتا ہے۔ باہری ہارنیس کال مفت نہیں ہوتے۔ یہ کمپیوٹنگ کا استعمال کرتے ہیں اور تاخیر شامل کرتے ہیں۔ ہارنیس اینیلنگ کے ذریعے ایجنٹ کو غیر ضروری کالوں کو کم کرنے کے لیے تربیت دے کر، فریم ورک وقت کے ساتھ زیادہ موثر بن جاتا ہے بغیر درستگی کو متاثر کیے۔
