Meta и Университет Иллинойса разработали EvoHarness-RL, повысив成功率 AI-агентов до 96,9%

iconCryptoBriefing
Поделиться
AI summary iconСводка
Исследователи из Meta и Университета Иллинойса разработали EvoHarness-RL — саморазвивающийся слой выполнения для ИИ-агентов. Система показала уровень успешности 96,9% на стандартном тестовом наборе, по сравнению с 47,9% без нее. Фреймворк использует структурированное внешнее состояние «Верования, Прогресс, Опыт» (BPE) для выполнения сложных задач. Он демонстрирует возникающие поведенческие паттерны, такие как закалка и эволюция. Это достижение может повлиять на усилия по CFT и улучшить ликвидность на криптовалютных рынках.

Исследователи из Meta AI и Университета Иллинойса в Урбане-Шампейне опубликовали новую статью, представляющую EvoHarness-RL — обучаемый слой координации, позволяющий агентам на основе больших языковых моделей создавать, получать доступ и управлять собственным внешним состоянием. Результат: 96,9% успешности на стандартном тесте, по сравнению с 47,9% у базовой модели, работающей без него.

Что на самом деле делает EvoHarness-RL

У LLM-агентов ограниченные окна контекста. Когда задача охватывает множество шагов, включая динамические API-подключения, серверные логи, ожидающие подцели и восстановление после ошибок, внутренней памяти модели недостаточно. Ей нужна внешняя структура для отслеживания того, что она считает истинным о мире, какого прогресса она добилась и чего она научилась на прошлых ошибках.

Фреймворк вводит структурированное внешнее состояние, основанное на трех компонентах: Убеждение, Прогресс и Опыт, совокупно называемых BPE. Убеждение отражает текущее понимание агентом своей среды. Прогресс отслеживает завершенные и ожидающие подцели, чтобы агент не пропускал шаги и не дублировал работу. Опыт хранит уроки, извлеченные из ошибок, например, когда база данных отклоняет пакет из-за ограничений скорости API, чтобы агент мог адаптировать свой подход.

Обучение проходит в два этапа. Сначала супервизированная тонкая настройка с использованием демонстраций экспертов учит модель взаимодействовать с системой. Затем метод оптимизации, учитывающий стоимость, называемый Group Relative Policy Optimization (GRPO), совершенствует поведение агента, чтобы сбалансировать производительность задачи и вычислительные затраты на вызовы системы.

Реклама

Исследователи протестировали свой подход с использованием модели Qwen3-8B на ALFWorld — эталоне для встраиваемого ИИ, требующего от агентов выполнения бытовых задач в несколько этапов. Уровень успеха в 96,9% в знакомых средах впечатляет сам по себе, но, возможно, более показателен уровень успеха в 86,6% в незнакомых средах.

Два поведения, которые исследователи не программировали явно

В статье рассматриваются два возникших явления, проявившихся в процессе обучения, ни одно из которых не было специально спроектировано.

Первый — «отжиг с использованием фиксации». Со временем агент начинает внутренне усваивать рутинные операции с фиксацией, снижая частоту обращений к внешнему состоянию. Количество вызовов фиксации уменьшается не потому, что система деградирует, а потому, что модель усвоила закономерности.

Второй — «использование эволюции». По мере обучения агент учится сжимать и перестраивать свое внешнее состояние в более компактный формат, адаптированный для конкретных типов задач. Представление BPE становится более легким и специализированным без какого-либо вмешательства человека в его дизайн.

Основываясь на предыдущей работе

EvoHarness-RL развивает Meta-Harness — более ранний проект от марта 2026 года, ориентированный на оптимизацию кода гарнитуры с помощью агентных методов поиска. В то время как Meta-Harness рассматривал гарнитуру как код, подлежащий улучшению через поиск, EvoHarness-RL рассматривает весь координационный слой как нечто, что модель может самостоятельно обучиться создавать и совершенствовать.

В статье также сообщается о улучшениях по сравнению с существующими фреймворками агентов, такими как SkillOS и SkillRL, особенно на незнакомых задачах. Разница в производительности между знакомыми и новыми средами составляет примерно 10 процентных пунктов для EvoHarness-RL, в то время как у конкурирующих подходов наблюдается гораздо более значительное падение.

Что это означает для внедрения корпоративного ИИ

Рост показателя успешности с примерно 48% до 97% в контролируемых условиях — это не незначительное улучшение. Важен также показатель обобщения 86,6%, поскольку реальные корпоративные задачи редко точно совпадают с обучающими данными.

Оптимизация, учитывающая стоимость, встроенная в этап обучения GRPO, также решает практическую проблему: вызовы внешних харнессов не бесплатны. Они потребляют вычислительные ресурсы и увеличивают задержку. Обучая агента минимизировать ненужные вызовы с помощью аннеалинга харнесса, фреймворк со временем становится более эффективным, не жертвуя точностью.

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.