Ang AIRA₂ AI Agent ay lumampas sa mga nakaraang modelo ng 9 puntos porsyento sa ML Benchmark

iconCryptoBriefing
I-share
AI summary iconSummary
AI + balita sa crypto: Ang AIRA₂, isang autonomous AI research agent mula sa FAIR lab ng Meta, University College London, at University of Oxford, ay nakakuha ng 81.5% sa MLE-bench-30 benchmark pagkatapos ng 24 oras, at tumaas sa 83.1% pagkatapos ng 72 oras. Ito ay nagmarka ng 9 puntos na pagtaas kumpara sa mga nakaraang model. Ang AIRA₂ ay naka-ranking sa ika-8 lugar sa isang Kaggle competition na may 4,000 koponan, at nakakuha ng ginto. Ang aktibidad sa on-chain news ay nagpapakita ng paglago ng integrasyon ng AI sa mga data-driven na larangan.

Isang AI agent ang nakalaban sa higit sa 3,992 na tao sa kanilang sariling laro. Ang AIRA₂, isang autonomo na AI research agent na binuo ng mga siyentipiko sa FAIR lab ng Meta, University College London, at University of Oxford, ay nakuha ang ika-8 na pwesto sa pagitan ng 4,000 na ekipa sa isang Kaggle competition na nakatuon sa AI reasoning, at nakuha ang ginto medal bilang resulta.

Ano ang tunay na ginagawa ng AIRA

Ang AIRA line ng mga agent (ang pangalan ay nangangahulugan ng AI Research Agent) ay disenyo upang makatugon nang awtonomo sa mga kumplikadong problema sa machine learning engineering. Sa halip na simple lang na patakbuhin ang isang modelo at maghintay ng pinakamabuting resulta, gumagamit ang AIRA ng asynchronous multi-GPU execution strategy na nagpapatakbo sa 8 Nvidia H200 GPUs.

Pamamahayag

Gumagamit ang sistema ng isang protokolo na tinatawag ng panel ng panel na “Hidden Consistent Evaluation”, isang paraan upang pigilan ang agent na manloko sa sariling mga marka sa pagsusulit. Gumagamit din ang agent ng dynamic ReAct-style operators, kaya maaari itong mag-isip nang hakbang-hakbang, i-adjust ang kanyang paraan sa real-time, at i-execute ang code nang одночасно sa maraming processor.

Sa MLE-bench-30, isang structured benchmark na binuo mula sa 30 totoong Kaggle competitions, nakamit ng AIRA₂ ang mean percentile rank na 81.5% pagkatapos ng 24 oras ng computation. Bigyan mo ito ng 72 oras, at tumaas ang numero sa 83.1%. Ang pinakamahusay na nakaraang baseline mula sa iba pang agents ay nasa 72.7%, na ginagawa ang pagpapabuti ng AIRA₂ na halos 9 percentage points sa itaas ng kalaban.

Bakit mahalaga ito kaysa sa pagpapakita ng kakayahan

Lumampas ang AIRA₂ sa pinakamataas na performans ng tao sa 6 sa 20 mga gawain sa pagtataya ng AIRS-Bench. Nakakuha rin ito ng mga ginto sa mga indibidwal na gawain sa Kaggle kung saan ang mga dating bersyon ng agent ay hindi nakakakuha ng anumang parangal.

Ang framework ay nagtatayo sa kung ano ang tinatawag ng koponan na AIRA-dojo approach, na disenyo upang harapin ang mga limitasyon ng mga nakaraang agent. Ang mga limitasyong iyon ay kasama ang limitadong computational throughput, evaluation overfitting, generalization gaps sa iba’t ibang uri ng problema, at static operational constraints na nagpapalit sa kakayahan ng agent na baguhin ang kanyang estratehiya sa gitna ng gawain.

Ang kompetitibong landscape ng AI research

Ang kolaborasyon sa pagitan ng Meta FAIR, UCL, at Oxford ay nakakatangi dahil sa bigat ng kanilang institusyon. Ang pangkat ng mga mananaliksik ay nagkamalay ng kanilang mga natuklasan sa pamamagitan ng mga arXiv preprints, ang pamantayang channel para sa pinakabagong pananaliksik sa AI.

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.