メタAIとイリノイ大学アーバナ・シャンペーン校の研究者たちは、EvoHarness-RLと呼ばれる学習可能な調整レイヤーを導入する新しい論文を発表しました。このレイヤーにより、大規模言語モデルエージェントは独自の外部状態を生成し、アクセスし、管理できるようになります。その結果、標準的なベンチマークでの成功率はベースラインモデル(これを使用しない場合)の47.9%から96.9%へと向上しました。
EvoHarness-RLが実際に行うこと
LLMエージェントは制限されたコンテキストウィンドウを持っています。タスクが多くのステップにわたり、動的なAPI接続、サーバーログ、保留中のサブゴール、エラー回復を伴う場合、モデルの内部メモリでは不十分です。モデルは、世界についての信念、これまでの進捗、過去の失敗から学んだことを追跡するための外部の支援構造を必要とします。
このフレームワークは、信念(Belief)、進捗(Progress)、経験(Experience)の3つのコンポーネントを中心に構築された構造化された外部状態を導入します。これらを総称してBPEと呼びます。信念は、エージェントが環境について現在持つ理解を捉えます。進捗は、完了済みおよび保留中のサブゴールを追跡することで、エージェントがステップを飛ばしたり作業を重複させたりしないようにします。経験は、APIレート制限によりバッチがAPIで拒否されたようなエラーから得られた教訓を保存し、エージェントがアプローチを適応できるようにします。
トレーニングは二段階で行われます。まず、専門家のデモを使用した監督付き微調整により、モデルにハーネスとのやり方を学習させます。その後、グループ相対方策最適化(GRPO)と呼ばれるコスト認識型最適化手法を用いて、タスクパフォーマンスとハーネス呼び出しの計算コストとのバランスを取るようにエージェントの行動を微調整します。
研究者は、エMBODIED AIのベンチマークであるALFWorldでQwen3-8Bモデルを使用してこのアプローチをテストしました。ALFWorldでは、エージェントが複数のステップにわたって家庭内タスクを完了する必要があります。既知の環境での成功率96.9%はすでに印象的ですが、未知の環境での成功率86.6%はさらに注目に値します。
研究者が明示的にプログラムしなかった2つの行動
この論文は、訓練中に直接設計されなかった二つの新興現象を強調している。
最初は「ハーネス退火」です。時間とともにエージェントは通常のハーネス操作を内面化し、外部状態を参照する頻度が減ります。ハーネス呼び出しが減少するのは、システムが劣化しているからではなく、モデルがパターンを吸収したためです。
二つ目は「進化の活用」です。エージェントが学習するにつれて、外部状態を特定のタスクタイプに適したよりコンパクトな形式に圧縮・再構築します。BPE表現は、人間の介入なしに、より洗練され、専門化されます。
以前の作業を基に構築
EvoHarness-RLは、2026年3月に発表されたMeta-Harnessを基盤としています。Meta-Harnessは、エージェント検索技術を用いてハーネスコードの最適化に焦点を当てていました。Meta-Harnessがハーネスを検索によって改善すべきコードと見なしたのに対し、EvoHarness-RLは、全体の調整レイヤーをモデル自体が学習して構築・洗練できるものと捉えています。
また、この論文は、既存のエージェントフレームワークであるSkillOSやSkillRLと比較して、未見のタスクにおける改善を報告しています。EvoHarness-RLでは、馴染みのある環境と新規環境との間のパフォーマンス差が約10パーセンテージポイントであるのに対し、競合アプローチでははるかに大きな低下が見られます。
これが企業向けAIの導入に与える意味
制御された環境で成功率が約48%から97%に跳ね上がることは、わずかな改善ではありません。実世界の企業タスクはトレーニングデータとまったく同じになることはめったにないため、86.6%の汎化率も重要です。
GRPOトレーニング段階に組み込まれたコスト意識の最適化は、実用的な課題にも対応しています。外部ハーネス呼び出しは無料ではありません。計算リソースを消費し、遅延を追加します。ハーネスアニーリングを通じてエージェントが不要な呼び出しを最小限に抑えるように訓練することで、精度を犠牲にすることなく、フレームワークの効率が時間とともに向上します。
