AIエージェントが、自らのゲームで約3,992の人類チームを打ち負かした。MetaのFAIR研究所、ロンドン大学学院、オックスフォード大学の研究者らが開発した自律型AI研究エージェント「AIRA₂」は、AI推論に焦点を当てたKaggleコンペティションで4,000チーム中8位となり、金メダルを獲得した。
AIRAが実際に何をするか
AIRAエージェントライン(AI Research Agentの略)は、複雑な機械学習エンジニアリングの課題を自律的に解決することを目的として設計されています。単一のモデルを実行して結果を待つのではなく、AIRAは8台のNvidia H200 GPU上で非同期マルチGPU実行戦略を使用します。
このシステムは、研究チームが「隠された一貫した評価」プロトコルと呼ぶ手法を採用しており、エージェントが自らのテストスコアを操作するのを防ぎます。エージェントは動的なReActスタイルのオペレーターも使用しており、問題を段階的に推論し、アプローチをその場で調整し、複数のプロセッサ上で同時にコードを実行できます。
MLE-bench-30(30の実際のKaggleコンペティションから構築された構造化ベンチマーク)において、AIRA₂は24時間の計算後に平均パーセンタイル順位81.5%を達成しました。72時間与えると、この数値は83.1%まで上昇しました。これまでの他のエージェントによる最良のベースラインは72.7%であり、AIRA₂の改善は競合他社を約9パーセンテージポイント上回っています。
これは自慢以上の意味を持つ理由
AIRA₂は、AIRS-Bench評価の20タスクのうち6タスクで、人間の最先端パフォーマンスを上回りました。また、以前のバージョンが一切賞を獲得できなかった個別のKaggleタスクでも金メダルを獲得しました。
このフレームワークは、チームがAIRA-dojoアプローチと呼ぶ手法を基盤としており、従来のエージェントの制限を特定的に解決することを目的としています。これらの制限には、計算スループットの限界、評価における過剰適合、異なる問題タイプ間での一般化のギャップ、およびタスク中に戦略を適応させることができない静的な運用制約が含まれます。
競争の激しいAI研究の景観
Meta FAIR、UCL、オックスフォードの協力は、その機関的な重みで注目されている。研究チームは、最先端のAI研究の標準的なチャネルであるarXivのプレプリントを通じて研究成果を発表した。
