AIRA₂ AI-агент перевищує попередні моделі на 9 відсоткових пунктів у ML-тесті

iconCryptoBriefing
Поділитися
AI summary iconКороткий зміст
Новини штучного інтелекту та криптовалют: AIRA₂, автономний агент досліджень на основі ШІ від лабораторії FAIR Meta, Університетського коледжу Лондона та Оксфордського університету, показав результат 81,5% на бенчмарку MLE-bench-30 через 24 години, підвищивши його до 83,1% через 72 години. Це означає зростання на 9 відсоткових пунктів порівняно з попередніми моделями. AIRA₂ також посів 8-е місце в конкурсі Kaggle з 4000 командами, здобувши золоту медаль. Активність на ланцюгу підкреслює зростаючу інтеграцію ШІ в сфері, що базується на даних.

AI-агент здобув перемогу над приблизно 3 992 людськими командами у їхній власній грі. AIRA₂, автономний AI-дослідницький агент, розроблений дослідниками з лабораторії FAIR компанії Meta, Університетського коледжу Лондона та Оксфордського університету, посів 8-ме місце з 4 000 команд у змаганні Kaggle, присвяченому AI-міркуванню, і здобув золоту медаль.

Що насправді робить AIRA

Лінійка агентів AIRA (назва означає AI Research Agent) створена для автономного вирішення складних інженерних завдань у галузі машинного навчання. Замість того щоб просто запускати одну модель і сподіватися на краще, AIRA використовує асинхронну стратегію виконання на багатьох GPU, яка працює на 8 GPU Nvidia H200.

Реклама

Система використовує так званий протокол «Прихованої послідовної оцінки», який запроваджено дослідницькою командою для запобігання маніпулюванню агентом власними тестовими результатами. Агент також використовує динамічні оператори стилю ReAct, що означає, що він може розмірковувати над проблемами крок за кроком, гнучко коригувати свій підхід у реальному часі та виконувати код одночасно на кількох процесорах.

На MLE-bench-30 — структурованому тесті, побудованому на основі 30 реальних змагань Kaggle — AIRA₂ досягла середнього перцентиля 81,5% після 24 годин обчислень. Якщо надати їй 72 години, цей показник зрос до 83,1%. Найкращий попередній базовий показник інших агентів становив 72,7%, що робить покращення AIRA₂ приблизно на 9 процентних пунктів вищим за конкурентів.

Чому це має значення крім права похвалитися

AIRA₂ перевищила найкращі результати людини у 6 із 20 завдань оцінки AIRS-Bench. Вона також отримала золоті медалі на окремих завданнях Kaggle, де попередні версії агента не змогли отримати жодних нагород.

Фреймворк базується на підході, який команда називає AIRA-dojo, розробленому спеціально для вирішення обмежень раніших агентів. Ці обмеження включали обмежену обчислювальну пропускну здатність, переоснащення під час оцінки, розриви у узагальненні між різними типами завдань та статичні операційні обмеження, які не дозволяли агенту адаптувати свою стратегію в процесі виконання завдання.

Конкурентний ландшафт досліджень штучного інтелекту

Співпраця між Meta FAIR, UCL та Оксфордом відзначається своїм інституційним авторитетом. Дослідницька команда поширила свої висновки через пре-принти arXiv — стандартний канал для передових досліджень у галузі ШІ.

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.