一個 AI 代理剛剛在自己的遊戲中擊敗了約 3,992 支人類隊伍。由 Meta 的 FAIR 實驗室、倫敦大學學院和牛津大學的研究人員開發的自主 AI 研究代理 AIRA₂,在一場專注於 AI 推理的 Kaggle 比賽中,從 4,000 支隊伍中排名第 8,並因此贏得金牌。
AIRA 實際上做什麼
AIRA 系列代理(名稱代表 AI 研究代理)旨在自主解決複雜的機器學習工程問題。與僅運行單一模型並寄望於最佳結果不同,AIRA 採用異步多 GPU 執行策略,運行於 8 塊 Nvidia H200 GPU 上。
該系統採用研究團隊所稱的「隱藏一致評估」協議,用以防止代理程式操縱其測試分數。該代理程式還使用動態 ReAct 式運算子,意味著它能逐步推理問題、即時調整策略,並同時在多個處理器上執行代碼。
在由 30 個真實 Kaggle 競賽構建的結構化基準 MLE-bench-30 上,AIRA₂ 在 24 小時的計算後達到平均百分位排名 81.5%。若給予 72 小時,該數字上升至 83.1%。此前其他代理的最佳基線為 72.7%,使 AIRA₂ 的提升約高出競爭對手 9 個百分點。
為何這不僅僅是為了炫耀
AIRA₂ 在 AIRS-Bench 評估的 20 項任務中,有 6 項超越了人類的最先进表現。它還在個別的 Kaggle 任務中贏得金牌,而早期版本的代理在這些任務中完全未能獲得任何獎項。
該框架基於團隊所稱的 AIRA-dojo 方法,專為解決早期代理的限制而設計。這些限制包括計算吞吐量有限、評估過度擬合、不同問題類型之間的泛化差距,以及靜態的操作限制,導致代理無法在任務中間調整策略。
競爭激烈的 AI 研究領域
Meta FAIR、UCL 與牛津大學的合作因其機構份量而引人注目。研究團隊透過 arXiv 預印本發布其研究成果,這是前沿人工智慧研究的標準管道。
