來自 Meta AI 和伊利諾伊大學厄巴納-香檳分校的研究人員發表了一篇新論文,介紹了 EvoHarness-RL,這是一個可訓練的協調層,讓大型語言模型代理能夠建立、存取和管理自己的外部狀態。結果顯示,在標準基準測試中,成功率從未使用該層的基線模型的 47.9% 提升至 96.9%。
EvoHarness-RL 實際上做什麼
LLM 代理的上下文窗口有限。當任務涵蓋多個步驟,涉及動態 API 連接、伺服器日誌、待處理的子目標和錯誤恢復時,模型的內部記憶不足以應對。它需要一個外部支架來追蹤其對世界的認知、已取得的進展,以及從過往錯誤中學到的經驗。
該框架引入了一個以三個元件為基礎的結構化外部狀態:信念、進度和經驗,統稱為 BPE。信念捕捉代理對其環境的當前理解。進度追蹤已完成和待處理的子目標,以確保代理不會跳過步驟或重複工作。經驗儲存從錯誤中學到的教訓,例如 API 速率限制導致資料庫拒絕批次,以便代理能調整其方法。
訓練分為兩個階段。首先,透過專家示範進行監督式微調,教導模型如何與測試框架互動;接著,採用一種稱為群組相對策略優化(Group Relative Policy Optimization,簡稱 GRPO)的成本感知優化技術,優化代理的行為,以在任務表現與測試框架呼叫的計算成本之間取得平衡。
研究人員在 ALFWorld 上使用 Qwen3-8B 模型測試了他們的方法,ALFWorld 是一個要求代理在多個步驟中完成家庭任務的具身 AI 基準。在熟悉環境中 96.9% 的成功率本身已令人印象深刻,但更為關鍵的是在未見環境中 86.6% 的成功率。
研究人員並未明確編程的兩種行為
該論文重點介紹了在訓練過程中出現的兩種新興現象,這兩種現象均非直接設計而成。
第一種是「 harness 遞歸退火」。隨著時間推移,代理會逐漸內化常規的 harness 操作,減少其需要查閱外部狀態的頻率。harness 調用減少並非因為系統退化,而是因為模型已吸收了這些模式。
第二是「利用進化」。隨著代理訓練,它學會將外部狀態壓縮並重構為更緊湊的格式,以適應特定任務類型。BPE 表示法在無需人工干預其設計的情況下變得更精簡且更專門化。
基於早期的工作
EvoHarness-RL 基於 Meta-Harness,這是一個於 2026 年 3 月推出的早期項目,專注於透過代理搜尋技術優化 harness 程式碼。與 Meta-Harness 將 harness 視為透過搜尋來改進的程式碼不同,EvoHarness-RL 將整個協調層視為模型本身可以學習構建和優化的對象。
該論文還報告了在未見任務上對現有代理框架如 SkillOS 和 SkillRL 的改進。EvoHarness-RL 在熟悉環境與新穎環境之間的性能差距約為 10 個百分點,而競爭對手的方法則出現了大得多的下降。
這對企業 AI 部署意味著什麼
在受控環境中,成功率從約 48% 跳升至 97%,這並非微小的改進。86.6% 的泛化率同樣重要,因為現實世界中的企業任務很少與訓練數據完全相同。
GRPO 訓練階段內建的成本意識優化也解決了一個實際問題。外部工具呼叫並非免費,它們會消耗計算資源並增加延遲。透過工具退火讓代理學習最小化不必要的呼叫,該框架能在不犧牲準確性的前提下,隨時間變得更高效。
