ИИ-агент только что победил примерно 3 992 человеческие команды в их собственной игре. AIRA₂ — автономный ИИ-исследовательский агент, разработанный учеными из лаборатории FAIR Meta, Университетского колледжа Лондона и Оксфордского университета, занял 8-е место из 4 000 команд в соревновании Kaggle, посвященном ИИ-рассуждениям, и получил золотую медаль.
Что на самом деле делает AIRA
Линейка агентов AIRA (название означает AI Research Agent) предназначена для автономного решения сложных задач машинного обучения. Вместо того чтобы просто запускать одну модель и надеяться на лучшее, AIRA использует асинхронную стратегию выполнения на нескольких GPU, работающую на 8 GPU Nvidia H200.
Система использует протокол, который исследовательская команда называет «Скрытая последовательная оценка», метод, предотвращающий манипуляции агента с собственными тестовыми результатами. Агент также использует динамические операторы в стиле ReAct, что означает, что он может пошагово анализировать проблемы, корректировать свой подход в реальном времени и одновременно выполнять код на нескольких процессорах.
На MLE-bench-30 — структурированном бенчмарке, построенном на основе 30 реальных соревнований Kaggle — AIRA₂ показала средний перцентиль 81,5% после 24 часов вычислений. При увеличении времени до 72 часов этот показатель вырос до 83,1%. Лучший предыдущий базовый результат других агентов составлял 72,7%, что делает улучшение AIRA₂ примерно на 9 процентных пунктов выше конкурентов.
Почему это важно помимо права похвастаться
AIRA₂ превзошла передовые человеческие результаты на 6 из 20 задач в оценке AIRS-Bench. Она также завоевала золотые медали на отдельных задачах Kaggle, где предыдущие версии агента не смогли получить никаких наград.
Фреймворк основан на подходе, который команда называет AIRA-dojo, разработанном специально для устранения ограничений ранних агентов. Эти ограничения включали ограниченную вычислительную пропускную способность, переобучение при оценке, пробелы в обобщении между различными типами задач и статические операционные ограничения, препятствовавшие адаптации стратегии агента в процессе выполнения задачи.
Конкурентная среда исследований в области ИИ
Сотрудничество между Meta FAIR, UCL и Оксфордом примечательно своим институциональным авторитетом. Исследовательская команда распространила свои выводы через препринты arXiv — стандартный канал для передовых исследований в области ИИ.
