Isang AI agent ang nakalaban sa higit sa 3,992 na tao sa kanilang sariling laro. Ang AIRA₂, isang autonomo na AI research agent na binuo ng mga siyentipiko sa FAIR lab ng Meta, University College London, at University of Oxford, ay nakuha ang ika-8 na pwesto sa pagitan ng 4,000 na ekipa sa isang Kaggle competition na nakatuon sa AI reasoning, at nakuha ang ginto medal bilang resulta.
Ano ang tunay na ginagawa ng AIRA
Ang AIRA line ng mga agent (ang pangalan ay nangangahulugan ng AI Research Agent) ay disenyo upang makatugon nang awtonomo sa mga kumplikadong problema sa machine learning engineering. Sa halip na simple lang na patakbuhin ang isang modelo at maghintay ng pinakamabuting resulta, gumagamit ang AIRA ng asynchronous multi-GPU execution strategy na nagpapatakbo sa 8 Nvidia H200 GPUs.
Gumagamit ang sistema ng isang protokolo na tinatawag ng panel ng panel na “Hidden Consistent Evaluation”, isang paraan upang pigilan ang agent na manloko sa sariling mga marka sa pagsusulit. Gumagamit din ang agent ng dynamic ReAct-style operators, kaya maaari itong mag-isip nang hakbang-hakbang, i-adjust ang kanyang paraan sa real-time, at i-execute ang code nang одночасно sa maraming processor.
Sa MLE-bench-30, isang structured benchmark na binuo mula sa 30 totoong Kaggle competitions, nakamit ng AIRA₂ ang mean percentile rank na 81.5% pagkatapos ng 24 oras ng computation. Bigyan mo ito ng 72 oras, at tumaas ang numero sa 83.1%. Ang pinakamahusay na nakaraang baseline mula sa iba pang agents ay nasa 72.7%, na ginagawa ang pagpapabuti ng AIRA₂ na halos 9 percentage points sa itaas ng kalaban.
Bakit mahalaga ito kaysa sa pagpapakita ng kakayahan
Lumampas ang AIRA₂ sa pinakamataas na performans ng tao sa 6 sa 20 mga gawain sa pagtataya ng AIRS-Bench. Nakakuha rin ito ng mga ginto sa mga indibidwal na gawain sa Kaggle kung saan ang mga dating bersyon ng agent ay hindi nakakakuha ng anumang parangal.
Ang framework ay nagtatayo sa kung ano ang tinatawag ng koponan na AIRA-dojo approach, na disenyo upang harapin ang mga limitasyon ng mga nakaraang agent. Ang mga limitasyong iyon ay kasama ang limitadong computational throughput, evaluation overfitting, generalization gaps sa iba’t ibang uri ng problema, at static operational constraints na nagpapalit sa kakayahan ng agent na baguhin ang kanyang estratehiya sa gitna ng gawain.
Ang kompetitibong landscape ng AI research
Ang kolaborasyon sa pagitan ng Meta FAIR, UCL, at Oxford ay nakakatangi dahil sa bigat ng kanilang institusyon. Ang pangkat ng mga mananaliksik ay nagkamalay ng kanilang mga natuklasan sa pamamagitan ng mga arXiv preprints, ang pamantayang channel para sa pinakabagong pananaliksik sa AI.
