Исследователи из Meta AI и Университета Иллинойса в Урбане-Шампейне опубликовали новую статью, представляющую EvoHarness-RL — обучаемый слой координации, позволяющий агентам на основе больших языковых моделей создавать, получать доступ и управлять собственным внешним состоянием. Результат: 96,9% успешности на стандартном тесте, по сравнению с 47,9% у базовой модели, работающей без него.
Что на самом деле делает EvoHarness-RL
У LLM-агентов ограниченные окна контекста. Когда задача охватывает множество шагов, включая динамические API-подключения, серверные логи, ожидающие подцели и восстановление после ошибок, внутренней памяти модели недостаточно. Ей нужна внешняя структура для отслеживания того, что она считает истинным о мире, какого прогресса она добилась и чего она научилась на прошлых ошибках.
Фреймворк вводит структурированное внешнее состояние, основанное на трех компонентах: Убеждение, Прогресс и Опыт, совокупно называемых BPE. Убеждение отражает текущее понимание агентом своей среды. Прогресс отслеживает завершенные и ожидающие подцели, чтобы агент не пропускал шаги и не дублировал работу. Опыт хранит уроки, извлеченные из ошибок, например, когда база данных отклоняет пакет из-за ограничений скорости API, чтобы агент мог адаптировать свой подход.
Обучение проходит в два этапа. Сначала супервизированная тонкая настройка с использованием демонстраций экспертов учит модель взаимодействовать с системой. Затем метод оптимизации, учитывающий стоимость, называемый Group Relative Policy Optimization (GRPO), совершенствует поведение агента, чтобы сбалансировать производительность задачи и вычислительные затраты на вызовы системы.
Исследователи протестировали свой подход с использованием модели Qwen3-8B на ALFWorld — эталоне для встраиваемого ИИ, требующего от агентов выполнения бытовых задач в несколько этапов. Уровень успеха в 96,9% в знакомых средах впечатляет сам по себе, но, возможно, более показателен уровень успеха в 86,6% в незнакомых средах.
Два поведения, которые исследователи не программировали явно
В статье рассматриваются два возникших явления, проявившихся в процессе обучения, ни одно из которых не было специально спроектировано.
Первый — «отжиг с использованием фиксации». Со временем агент начинает внутренне усваивать рутинные операции с фиксацией, снижая частоту обращений к внешнему состоянию. Количество вызовов фиксации уменьшается не потому, что система деградирует, а потому, что модель усвоила закономерности.
Второй — «использование эволюции». По мере обучения агент учится сжимать и перестраивать свое внешнее состояние в более компактный формат, адаптированный для конкретных типов задач. Представление BPE становится более легким и специализированным без какого-либо вмешательства человека в его дизайн.
Основываясь на предыдущей работе
EvoHarness-RL развивает Meta-Harness — более ранний проект от марта 2026 года, ориентированный на оптимизацию кода гарнитуры с помощью агентных методов поиска. В то время как Meta-Harness рассматривал гарнитуру как код, подлежащий улучшению через поиск, EvoHarness-RL рассматривает весь координационный слой как нечто, что модель может самостоятельно обучиться создавать и совершенствовать.
В статье также сообщается о улучшениях по сравнению с существующими фреймворками агентов, такими как SkillOS и SkillRL, особенно на незнакомых задачах. Разница в производительности между знакомыми и новыми средами составляет примерно 10 процентных пунктов для EvoHarness-RL, в то время как у конкурирующих подходов наблюдается гораздо более значительное падение.
Что это означает для внедрения корпоративного ИИ
Рост показателя успешности с примерно 48% до 97% в контролируемых условиях — это не незначительное улучшение. Важен также показатель обобщения 86,6%, поскольку реальные корпоративные задачи редко точно совпадают с обучающими данными.
Оптимизация, учитывающая стоимость, встроенная в этап обучения GRPO, также решает практическую проблему: вызовы внешних харнессов не бесплатны. Они потребляют вычислительные ресурсы и увеличивают задержку. Обучая агента минимизировать ненужные вызовы с помощью аннеалинга харнесса, фреймворк со временем становится более эффективным, не жертвуя точностью.
