Ang mga siyentipiko mula sa Meta AI at ang University of Illinois Urbana-Champaign ay nag-publish ng isang bagong papel na naglalayon sa EvoHarness-RL, isang trainable na coordination layer na nagpapahintulot sa mga agent na may malaking language model na lumikha, makakuha, at pamahalaan ang kanilang sariling panlabas na estado. Ang resulta: 96.9% na rate ng tagumpay sa isang standard na benchmark, tumataas mula sa 47.9% para sa baseline model na tumatakbo nang walang ito.
Ano ang ginagawa ng EvoHarness-RL
Ang LLM agents ay may limitadong context window. Kapag isang gawain ay nagtatagal sa maraming hakbang, kasama ang dinamikong API connections, server logs, pending subgoals, at error recovery, sapat na ang loob na memorya ng model. Kailangan nito ng panlabas na suporta upang subaybayan kung ano ang kaniyang paniniwala tungkol sa mundo, kung ano ang progreso na naitaguyod niya, at kung ano ang natutunan niya mula sa nakaraang pagkakamali.
Ang framework ay nagtatampok ng isang structured external state na nakabatay sa tatlong komponente: Belief, Progress, at Experience, na kabuuan ay tinatawag na BPE. Ang Belief ay nagsasalaysay ng kasalukuyang pag-unawa ng agent sa kanyang kapaligiran. Ang Progress ay sinusubaybayan ang mga natapos at nakaantay na subgoals upang hindi makalimutan ng agent ang mga hakbang o magkaroon ng duplicado na gawain. Ang Experience ay nag-iimbak ng mga aral mula sa mga pagkakamali, tulad ng pagtanggi ng database sa isang batch dahil sa API rate limits, upang makapag-adjust ang agent sa kanyang paraan.
Nangyayari ang pagsasanay sa dalawang yugto. Una, ang supervised fine-tuning gamit ang mga ekspertong demonstrasyon ay nagtuturo sa modelo kung paano makipag-ugnayan sa harness. Pagkatapos, ang isang cost-aware na teknik sa optimisasyon na tinatawag na Group Relative Policy Optimization, o GRPO, ay pinapabuti ang pag-uugali ng agent upang balansehin ang pagganap sa gawain laban sa computational cost ng mga tawag sa harness.
Sinubukan ng mga mananaliksik ang kanilang pamamaraan gamit ang Qwen3-8B model sa ALFWorld, isang benchmark para sa embodied AI na nangangailangan ng mga agent na kumpletuhin ang mga gawain sa bahay sa maraming hakbang. Ang 96.9% na rate ng tagumpay sa pamilyar na mga kapaligiran ay nakakaimpresyon na mismo, ngunit mas malinaw ang 86.6% na rate ng tagumpay sa hindi nakikita na mga kapaligiran.
Dalawang pag-uugali na hindi direktang pinrogram ng mga mananaliksik
Nilalayong ipakita ng papel ang dalawang nagkakalat na pangyayari na lumabas habang pinapagana, na walang direkta ng inhenyero.
Ang unang ay ang “harness annealing.” Sa paglipas ng panahon, ang agent ay nagsisimulang mag-internalize ang mga karaniwang operasyon ng harness, na nagbabawas sa kung gaano kadalas ito kailangang konsultahin ang external state. bumababa ang mga harness calls hindi dahil sa pagkabagsak ng sistema, kundi dahil ang modelo ay nakalap na ang mga pattern.
Ang pangalawa ay “pagsasamantala sa evolusyon.” Habang nagtatrabaho ang agent, natututo ito na i-compress at muli ayusin ang kanyang panlabas na estado sa isang mas kompak na anyo na angkop para sa mga partikular na uri ng gawain. Ang BPE representation ay naging mas maliit at mas espesyalisado nang walang tulong ng tao sa pagdisenyo nito.
Nagpapatuloy sa nakaraang gawa
Binubuo ng EvoHarness-RL ang Meta-Harness, isang mas naunang proyekto noong Marso 2026 na nakatuon sa pagpapabuti ng harness code sa pamamagitan ng mga teknik na agentic search. Kung saan ang Meta-Harness ay tinuturing ang harness bilang code na dapat mapabuti sa pamamagitan ng paghahanap, tinuturing ng EvoHarness-RL ang buong coordination layer bilang kahit ano na maaaring matutunan at mapapahusay ng modelo mismo.
Ang papel ay nagrereport din ng mga pagpapabuti sa mga umiiral na agent framework tulad ng SkillOS at SkillRL, lalo na sa mga hindi nakikita na gawain. Ang pagkakaiba sa pagitan ng performance sa pamilyar at bagong mga kapaligiran ay humigit-kumulang 10 puntos porsyento para sa EvoHarness-RL, kumpara sa mas malalaking pagbaba para sa mga kumpetitibong pagkakataon.
Ano ang ibig sabihin nito para sa pag-deploy ng enterprise AI
Hindi isang maliit na pagpapabuti ang pagtaas ng rate ng tagumpay mula sa halos 48% patungo sa 97% sa kontroladong mga kapaligiran. Mahalaga rin ang 86.6% na rate ng generalisasyon, dahil ang mga gawain sa enterprise sa totoong mundo ay rare na magkakatulad ng training data.
Ang cost-aware optimization na nakabuilt sa GRPO training stage ay tumutugon din sa isang praktikal na pag-aalala. Ang mga panlabas na harness calls ay hindi libre. Ito ay naglalabas ng compute at nagdaragdag ng latency. Sa pamamagitan ng pagtuturo sa agent na mabawasan ang hindi kailangang mga calls sa pamamagitan ng harness annealing, mas maging epektibo ang framework sa paglipas ng panahon nang hindi pinapawi ang akurasyon.
