نشر باحثون من Meta AI وجامعة إيلينوي أوربانا-شامبين ورقة بحثية جديدة تقدم EvoHarness-RL، وهي طبقة تنسيق قابلة للتدريب تسمح لوكالات النماذج اللغوية الكبيرة بإنشاء الوصول إلى وإدارة حالتها الخارجية الخاصة. النتيجة: معدل نجاح بلغ 96.9% على معيار قياسي، بزيادة من 47.9% للنموذج الأساسي الذي يعمل بدونه.
ما الذي يفعله EvoHarness-RL فعليًا
لدى وكلاء نماذج اللغة مساحات سياق محدودة. عندما تمتد المهمة عبر خطوات عديدة، وتشمل اتصالات API ديناميكية، وسجلات الخوادم، وأهداف فرعية معلقة، واستعادة الأخطاء، لا تكفي ذاكرة النموذج الداخلية. إنه بحاجة إلى هيكل خارجي لتتبع ما يعتقده عن العالم، وما التقدم الذي أحرزه، وما تعلمه من الأخطاء السابقة.
يُقدّم الإطار حالة خارجية منظمة مبنية على ثلاثة مكونات: المعتقد، التقدم، والخبرة، ويُطلق عليها مجتمعةً BPE. يُلتقط المعتقد الفهم الحالي للوكيل لبيئته. يتتبع التقدم الأهداف الفرعية المكتملة والقيد التنفيذ لضمان عدم تخطي الوكيل للخطوات أو تكرار العمل. تخزن الخبرة الدروس المستفادة من الأخطاء، مثل رفض قاعدة بيانات لدفعة بسبب حدود معدل واجهة برمجة التطبيقات، ليتمكن الوكيل من تكييف نهجه.
يحدث التدريب على مرحلتين. أولاً، يتم التهذيب الخاضع للإشراف باستخدام عروض توضيحية من الخبراء لتعليم النموذج كيفية التفاعل مع الأداة. ثم تُحسّن تقنية تحسين تراعي التكلفة تُسمى تحسين السياسة النسبية المجموعة، أو GRPO، سلوك الوكيل لتحقيق توازن بين أداء المهمة وتكلفة استدعاءات الأداة.
اختبر الباحثون منهجهم باستخدام نموذج Qwen3-8B على ALFWorld، وهو معيار للذكاء الاصطناعي المتجسد يتطلب من الوكلاء إكمال مهام منزلية عبر خطوات متعددة. إن نسبة النجاح البالغة 96.9% في البيئات المألوفة مذهلة بحد ذاتها، لكن ربما يكون أكثر دلالة هو معدل النجاح البالغ 86.6% في البيئات غير المألوفة.
سلوكان لم يبرمجهما الباحثون صراحة
تُبرز الورقة ظاهرتين ناشئتين ظهرتا أثناء التدريب، ولم يُصمم أي منهما مباشرة.
الأول هو "الخضوع للتخمير." مع مرور الوقت، يبدأ الوكيل في تبني عمليات التثبيت الروتينية، مما يقلل من التردد الذي يحتاجه للاستعانة بالحالة الخارجية. تنخفض مكالمات التثبيت ليس لأن النظام يتدهور، بل لأن النموذج قد استوعب الأنماط.
الثاني هو "استغلال التطور". مع تدريب الوكيل، يتعلم ضغط وإعادة هيكلة حالته الخارجية إلى تنسيق أكثر إحكامًا يناسب أنواع المهام المحددة. يصبح تمثيل BPE أكثر خفة وأكثر تخصصًا دون أي تدخل بشري في تصميمه.
البناء على العمل السابق
يُبنى EvoHarness-RL على Meta-Harness، وهو مشروع سابق من مارس 2026 ركز على تحسين كود الهارنيس من خلال تقنيات البحث الوكيلي. بينما عامل Meta-Harness الهارنيس ككود يُحسَّن عبر البحث، يعامل EvoHarness-RL طبقة التنسيق بأكملها كشيء يمكن للنموذج تعلّم بنائه وصقله بنفسه.
كما تُبلغ الورقة عن تحسينات مقارنة بإطارات الوكلاء الحالية مثل SkillOS وSkillRL، خاصة في المهام غير المعروفة. الفجوة بين الأداء في البيئات المألوفة مقابل البيئات الجديدة تبلغ حوالي 10 نقاط مئوية لـ EvoHarness-RL، مقارنة بانخفاضات أكبر بكثير للنهج المنافسة.
ما يعنيه ذلك لنشر الذكاء الاصطناعي في المؤسسات
لا يُعدّ ارتفاع معدل النجاح من حوالي 48% إلى 97% في بيئات خاضعة للتحكم تحسينًا طفيفًا. كما أن معدل التعميم البالغ 86.6% مهم أيضًا، لأن مهام المؤسسات في العالم الحقيقي نادرًا ما تبدو تمامًا مثل بيانات التدريب.
يُعالج التحسين المدروس من حيث التكلفة المدمج في مرحلة تدريب GRPO أيضًا مسألة عملية. مكالمات التجهيز الخارجي ليست مجانية. فهي تستهلك موارد حسابية وتضيف تأخيرًا. من خلال تدريب الوكيل على تقليل المكالمات غير الضرورية عبر التبريد التدريجي للتجهيز، يصبح الإطار أكثر كفاءة مع مرور الوقت دون التضحية بالدقة.
