Agen AI AIRA₂ Mengungguli Model Sebelumnya sebanyak 9 Peratus Dalam Ujian ML

iconCryptoBriefing
Kongsi
AI summary iconRingkasan
Berita AI + kripto: AIRA₂, agen penyelidikan AI autonomi dari lab FAIR Meta, University College London, dan Universiti Oxford, mendapat skor 81.5% pada tolok MLE-bench-30 selepas 24 jam, naik kepada 83.1% selepas 72 jam. Ini menandakan lompatan 9 peratusan berbanding model sebelumnya. AIRA₂ juga mendapat tempat ke-8 dalam pertandingan Kaggle dengan 4,000 pasukan, memenangi pingat emas. Aktiviti berita di rantai menonjolkan integrasi AI yang semakin meningkat dalam bidang berdasarkan data.

Seorang agen AI baru sahaja mengalahkan kira-kira 3,992 pasukan manusia dalam permainan mereka sendiri. AIRA₂, agen penyelidikan AI autonom yang dibangunkan oleh penyelidik di lab FAIR Meta, University College London, dan Universiti Oxford, menempati kedudukan ke-8 daripada 4,000 pasukan dalam kompetisi Kaggle yang berfokus pada penaakulan AI, dan berjaya memenangi pingat emas.

Apa yang sebenarnya dilakukan AIRA

Garis agen AIRA (nama ini bermaksud AI Research Agent) direka untuk menangani masalah kejuruteraan pembelajaran mesin yang kompleks secara autonom. Bukan sekadar menjalankan satu model sahaja dan berharap yang terbaik, AIRA menggunakan strategi pelaksanaan multi-GPU asinkron yang berjalan pada 8 GPU Nvidia H200.

Iklan

Sistem ini menggunakan apa yang dipanggil oleh pasukan penyelidik sebagai protokol "Penilaian Tersembunyi Konsisten", satu kaedah untuk mencegah agen memanipulasi skor ujiannya sendiri. Agen tersebut juga menggunakan operator gaya ReAct dinamik, bermakna ia boleh berfikir melalui masalah langkah demi langkah, menyesuaikan pendekatannya secara pantas, dan menjalankan kod secara serentak melalui beberapa pemproses.

Di MLE-bench-30, satu tolok ukur terstruktur yang dibina daripada 30 pertandingan Kaggle sebenar, AIRA₂ mencapai pangkat persentil purata 81.5% selepas 24 jam pengiraan. Berikan ia 72 jam, dan nombor itu meningkat kepada 83.1%. Tolok ukur terbaik sebelum ini daripada agen-agen lain berada pada 72.7%, menjadikan peningkatan AIRA₂ kira-kira 9 peratusan di atas pesaing.

Mengapa ini penting selain sekadar untuk pamer

AIRA₂ melebihi prestasi terkini manusia pada 6 daripada 20 tugas dalam penilaian AIRS-Bench. Ia juga memenangi pingat emas pada tugas-tugas Kaggle individu di mana versi-versi sebelumnya agen gagal memperoleh sebarang anugerah sama sekali.

Rangka kerja ini dibina berdasarkan pendekatan AIRA-dojo yang dipanggil oleh pasukan, direka khas untuk mengatasi kelemahan agen-agen sebelumnya. Kelemahan-kelemahan tersebut termasuk throughput pengiraan yang terhad, penyesuaian berlebihan semasa penilaian, jurang generalisasi di antara jenis-jenis masalah yang berbeza, dan batasan operasi statik yang menghalang agen daripada menyesuaikan strateginya semasa tugas.

Lanskap penyelidikan AI yang kompetitif

Kerjasama antara Meta FAIR, UCL, dan Oxford adalah menonjol kerana berat institusi. Pasukan penyelidik menyebarkan dapatan mereka melalui preprint arXiv, saluran piawai untuk penyelidikan AI terkini.

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.