Seorang agen AI baru sahaja mengalahkan kira-kira 3,992 pasukan manusia dalam permainan mereka sendiri. AIRA₂, agen penyelidikan AI autonom yang dibangunkan oleh penyelidik di lab FAIR Meta, University College London, dan Universiti Oxford, menempati kedudukan ke-8 daripada 4,000 pasukan dalam kompetisi Kaggle yang berfokus pada penaakulan AI, dan berjaya memenangi pingat emas.
Apa yang sebenarnya dilakukan AIRA
Garis agen AIRA (nama ini bermaksud AI Research Agent) direka untuk menangani masalah kejuruteraan pembelajaran mesin yang kompleks secara autonom. Bukan sekadar menjalankan satu model sahaja dan berharap yang terbaik, AIRA menggunakan strategi pelaksanaan multi-GPU asinkron yang berjalan pada 8 GPU Nvidia H200.
Sistem ini menggunakan apa yang dipanggil oleh pasukan penyelidik sebagai protokol "Penilaian Tersembunyi Konsisten", satu kaedah untuk mencegah agen memanipulasi skor ujiannya sendiri. Agen tersebut juga menggunakan operator gaya ReAct dinamik, bermakna ia boleh berfikir melalui masalah langkah demi langkah, menyesuaikan pendekatannya secara pantas, dan menjalankan kod secara serentak melalui beberapa pemproses.
Di MLE-bench-30, satu tolok ukur terstruktur yang dibina daripada 30 pertandingan Kaggle sebenar, AIRA₂ mencapai pangkat persentil purata 81.5% selepas 24 jam pengiraan. Berikan ia 72 jam, dan nombor itu meningkat kepada 83.1%. Tolok ukur terbaik sebelum ini daripada agen-agen lain berada pada 72.7%, menjadikan peningkatan AIRA₂ kira-kira 9 peratusan di atas pesaing.
Mengapa ini penting selain sekadar untuk pamer
AIRA₂ melebihi prestasi terkini manusia pada 6 daripada 20 tugas dalam penilaian AIRS-Bench. Ia juga memenangi pingat emas pada tugas-tugas Kaggle individu di mana versi-versi sebelumnya agen gagal memperoleh sebarang anugerah sama sekali.
Rangka kerja ini dibina berdasarkan pendekatan AIRA-dojo yang dipanggil oleh pasukan, direka khas untuk mengatasi kelemahan agen-agen sebelumnya. Kelemahan-kelemahan tersebut termasuk throughput pengiraan yang terhad, penyesuaian berlebihan semasa penilaian, jurang generalisasi di antara jenis-jenis masalah yang berbeza, dan batasan operasi statik yang menghalang agen daripada menyesuaikan strateginya semasa tugas.
Lanskap penyelidikan AI yang kompetitif
Kerjasama antara Meta FAIR, UCL, dan Oxford adalah menonjol kerana berat institusi. Pasukan penyelidik menyebarkan dapatan mereka melalui preprint arXiv, saluran piawai untuk penyelidikan AI terkini.
