AI-агент здобув перемогу над приблизно 3 992 людськими командами у їхній власній грі. AIRA₂, автономний AI-дослідницький агент, розроблений дослідниками з лабораторії FAIR компанії Meta, Університетського коледжу Лондона та Оксфордського університету, посів 8-ме місце з 4 000 команд у змаганні Kaggle, присвяченому AI-міркуванню, і здобув золоту медаль.
Що насправді робить AIRA
Лінійка агентів AIRA (назва означає AI Research Agent) створена для автономного вирішення складних інженерних завдань у галузі машинного навчання. Замість того щоб просто запускати одну модель і сподіватися на краще, AIRA використовує асинхронну стратегію виконання на багатьох GPU, яка працює на 8 GPU Nvidia H200.
Система використовує так званий протокол «Прихованої послідовної оцінки», який запроваджено дослідницькою командою для запобігання маніпулюванню агентом власними тестовими результатами. Агент також використовує динамічні оператори стилю ReAct, що означає, що він може розмірковувати над проблемами крок за кроком, гнучко коригувати свій підхід у реальному часі та виконувати код одночасно на кількох процесорах.
На MLE-bench-30 — структурованому тесті, побудованому на основі 30 реальних змагань Kaggle — AIRA₂ досягла середнього перцентиля 81,5% після 24 годин обчислень. Якщо надати їй 72 години, цей показник зрос до 83,1%. Найкращий попередній базовий показник інших агентів становив 72,7%, що робить покращення AIRA₂ приблизно на 9 процентних пунктів вищим за конкурентів.
Чому це має значення крім права похвалитися
AIRA₂ перевищила найкращі результати людини у 6 із 20 завдань оцінки AIRS-Bench. Вона також отримала золоті медалі на окремих завданнях Kaggle, де попередні версії агента не змогли отримати жодних нагород.
Фреймворк базується на підході, який команда називає AIRA-dojo, розробленому спеціально для вирішення обмежень раніших агентів. Ці обмеження включали обмежену обчислювальну пропускну здатність, переоснащення під час оцінки, розриви у узагальненні між різними типами завдань та статичні операційні обмеження, які не дозволяли агенту адаптувати свою стратегію в процесі виконання завдання.
Конкурентний ландшафт досліджень штучного інтелекту
Співпраця між Meta FAIR, UCL та Оксфордом відзначається своїм інституційним авторитетом. Дослідницька команда поширила свої висновки через пре-принти arXiv — стандартний канал для передових досліджень у галузі ШІ.
