AIRA₂ AI-агент превосходит предыдущие модели на 9 процентных пунктов в ML-тесте

iconCryptoBriefing
Поделиться
AI summary iconСводка
Новости ИИ и криптовалют: AIRA₂, автономный агент ИИ от лаборатории FAIR Meta, Университетского колледжа Лондона и Оксфордского университета, показал результат 81,5% на бенчмарке MLE-bench-30 через 24 часа и поднялся до 83,1% через 72 часа. Это на 9 процентных пунктов выше предыдущих моделей. AIRA₂ также занял 8-е место в соревновании Kaggle с 4000 командами, завоевав золотую медаль. Активность в блокчейне подчеркивает растущую интеграцию ИИ в области, основанные на данных.

ИИ-агент только что победил примерно 3 992 человеческие команды в их собственной игре. AIRA₂ — автономный ИИ-исследовательский агент, разработанный учеными из лаборатории FAIR Meta, Университетского колледжа Лондона и Оксфордского университета, занял 8-е место из 4 000 команд в соревновании Kaggle, посвященном ИИ-рассуждениям, и получил золотую медаль.

Что на самом деле делает AIRA

Линейка агентов AIRA (название означает AI Research Agent) предназначена для автономного решения сложных задач машинного обучения. Вместо того чтобы просто запускать одну модель и надеяться на лучшее, AIRA использует асинхронную стратегию выполнения на нескольких GPU, работающую на 8 GPU Nvidia H200.

Реклама

Система использует протокол, который исследовательская команда называет «Скрытая последовательная оценка», метод, предотвращающий манипуляции агента с собственными тестовыми результатами. Агент также использует динамические операторы в стиле ReAct, что означает, что он может пошагово анализировать проблемы, корректировать свой подход в реальном времени и одновременно выполнять код на нескольких процессорах.

На MLE-bench-30 — структурированном бенчмарке, построенном на основе 30 реальных соревнований Kaggle — AIRA₂ показала средний перцентиль 81,5% после 24 часов вычислений. При увеличении времени до 72 часов этот показатель вырос до 83,1%. Лучший предыдущий базовый результат других агентов составлял 72,7%, что делает улучшение AIRA₂ примерно на 9 процентных пунктов выше конкурентов.

Почему это важно помимо права похвастаться

AIRA₂ превзошла передовые человеческие результаты на 6 из 20 задач в оценке AIRS-Bench. Она также завоевала золотые медали на отдельных задачах Kaggle, где предыдущие версии агента не смогли получить никаких наград.

Фреймворк основан на подходе, который команда называет AIRA-dojo, разработанном специально для устранения ограничений ранних агентов. Эти ограничения включали ограниченную вычислительную пропускную способность, переобучение при оценке, пробелы в обобщении между различными типами задач и статические операционные ограничения, препятствовавшие адаптации стратегии агента в процессе выполнения задачи.

Конкурентная среда исследований в области ИИ

Сотрудничество между Meta FAIR, UCL и Оксфордом примечательно своим институциональным авторитетом. Исследовательская команда распространила свои выводы через препринты arXiv — стандартный канал для передовых исследований в области ИИ.

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.