AIRA₂ AI 執行個體在機器學習基準測試中比先前模型高出 9 個百分點

iconCryptoBriefing
分享
AI summary icon精華摘要
AI 與加密貨幣新聞:由 Meta 的 FAIR 實驗室、倫敦大學學院和牛津大學開發的自主 AI 研究代理 AIRA₂,在 24 小時內於 MLE-bench-30 基準測試中取得 81.5% 的分數,72 小時後提升至 83.1%,較先前模型提升了 9 個百分點。AIRA₂ 還在有 4,000 支隊伍參與的 Kaggle 競賽中排名第 8 名,贏得金牌。鏈上新聞活動凸顯了 AI 在數據驅動領域的整合日益增加。

一個 AI 代理剛剛在自己的遊戲中擊敗了約 3,992 支人類隊伍。由 Meta 的 FAIR 實驗室、倫敦大學學院和牛津大學的研究人員開發的自主 AI 研究代理 AIRA₂,在一場專注於 AI 推理的 Kaggle 比賽中,從 4,000 支隊伍中排名第 8,並因此贏得金牌。

AIRA 實際上做什麼

AIRA 系列代理(名稱代表 AI 研究代理)旨在自主解決複雜的機器學習工程問題。與僅運行單一模型並寄望於最佳結果不同,AIRA 採用異步多 GPU 執行策略,運行於 8 塊 Nvidia H200 GPU 上。

廣告

該系統採用研究團隊所稱的「隱藏一致評估」協議,用以防止代理程式操縱其測試分數。該代理程式還使用動態 ReAct 式運算子,意味著它能逐步推理問題、即時調整策略,並同時在多個處理器上執行代碼。

在由 30 個真實 Kaggle 競賽構建的結構化基準 MLE-bench-30 上,AIRA₂ 在 24 小時的計算後達到平均百分位排名 81.5%。若給予 72 小時,該數字上升至 83.1%。此前其他代理的最佳基線為 72.7%,使 AIRA₂ 的提升約高出競爭對手 9 個百分點。

為何這不僅僅是為了炫耀

AIRA₂ 在 AIRS-Bench 評估的 20 項任務中,有 6 項超越了人類的最先进表現。它還在個別的 Kaggle 任務中贏得金牌,而早期版本的代理在這些任務中完全未能獲得任何獎項。

該框架基於團隊所稱的 AIRA-dojo 方法,專為解決早期代理的限制而設計。這些限制包括計算吞吐量有限、評估過度擬合、不同問題類型之間的泛化差距,以及靜態的操作限制,導致代理無法在任務中間調整策略。

競爭激烈的 AI 研究領域

Meta FAIR、UCL 與牛津大學的合作因其機構份量而引人注目。研究團隊透過 arXiv 預印本發布其研究成果,這是前沿人工智慧研究的標準管道。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露