Дослідники з Meta AI та Університету Іллінойсу в Урбані-Шампейн опублікували нову статтю, в якій представили EvoHarness-RL — навчальний шар координації, який дозволяє агентам на основі великих мовних моделей створювати, отримувати доступ до та керувати власним зовнішнім станом. Результат: 96,9% успішності на стандартному тесті, що на 47,9% вище, ніж у базової моделі, яка працювала без нього.
Що насправді робить EvoHarness-RL
У LLM агентів обмежені вікна контексту. Коли завдання розтягується на багато кроків, включаючи динамічні підключення до API, серверні логи, очікуючі підцілі та відновлення після помилок, внутрішня пам’ять моделі є недостатньою. Їй потрібен зовнішній каркас для відстеження того, що вона вважає за істинне у світі, який прогрес вона зробила та що вона дізналася з минулих помилок.
Каркас вводить структурований зовнішній стан, побудований навколо трьох компонентів: Переконання, Прогрес та Досвід, які разом називаються BPE. Переконання відображає поточне розуміння агентом свого середовища. Прогрес відстежує завершені та очікувані підцілі, щоб агент не пропускав кроки чи не виконував роботу двічі. Досвід зберігає уроки, здобуті з помилок, наприклад, коли база даних відхилила пакет через обмеження швидкості API, щоб агент міг адаптувати свій підхід.
Навчання відбувається у дві етапи. Спочатку надзиральне доналаштування за допомогою демонстрацій експертів вчить модель, як взаємодіяти з інструментом. Потім технологія оптимізації, орієнтована на витрати, під назвою Group Relative Policy Optimization (GRPO), вдосконалює поведінку агента, щоб збалансувати продуктивність завдання з обчислювальними витратами на виклики інструменту.
Дослідники протестували свій підхід за допомогою моделі Qwen3-8B у ALFWorld — еталоні для втіленого ШІ, який вимагає від агентів виконувати побутові завдання через кілька кроків. Рівень успішності 96,9% у знайомих середовищах сам по собі вражає, але, можливо, ще більш значущим є рівень успішності 86,6% у невиданих середовищах.
Дві поведінки, яких дослідники не програмували відкрито
У статті зазначено дві виниклі явища, що з’явилися під час навчання, жодне з яких не було безпосередньо запрограмовано.
Перше — «загартування через використання». З часом агент починає інтегрувати звичайні операції з використанням, зменшуючи частоту, з якою йому потрібно звертатися до зовнішнього стану. Виклики використання зменшуються не тому, що система деградує, а тому, що модель засвоїла шаблони.
Друге — «використання еволюції». Під час навчання агент вчиться стискати та перебудовувати свій зовнішній стан у більш стислий формат, що підходить для конкретних типів завдань. Представлення BPE стає стислішим і більш спеціалізованим без будь-якої людської участі у його дизайні.
Будуючи на попередніх роботах
EvoHarness-RL базується на Meta-Harness — попередньому проекті з березня 2026 року, який зосереджувався на оптимізації коду оболонки за допомогою агентних методів пошуку. Якщо Meta-Harness розглядав оболонку як код, який можна покращити за допомогою пошуку, то EvoHarness-RL вважає весь координаційний шар чимось, що модель може навчитися будувати та вдосконалювати самостійно.
У статті також повідомляється про покращення порівняно з існуючими фреймворками агентів, такими як SkillOS та SkillRL, зокрема на невиданих завданнях. Різниця в продуктивності між знайомими та новими середовищами становить приблизно 10 відсоткових пунктів для EvoHarness-RL, на відміну від значно більших падінь у конкуруючих підходів.
Що це означає для розгортання корпоративного ШІ
Зростання показника успішності з приблизно 48% до 97% у контролюваних умовах — це не незначне покращення. Важливий також показник узагальнення 86,6%, оскільки завдання підприємств у реальному світі рідко точно відповідають навчальним даним.
Оптимізація, спрямована на зменшення витрат, вбудована в етап навчання GRPO, також вирішує практичну проблему. Виклики зовнішніх оболонок не безкоштовні. Вони споживають обчислювальні ресурси та збільшують затримки. Навчаючи агента мінімізувати непотрібні виклики за допомогою охолодження оболонки, фреймворк стає більш ефективним із часом, не поступаючись у точності.
