AIRA₂ AI Agent Mengungguli Model Sebelumnya dengan 9 Poin Persentase dalam Benchmark ML

iconCryptoBriefing
Bagikan
AI summary iconRingkasan
Berita AI + kripto: AIRA₂, agen penelitian AI otonom dari laboratorium FAIR Meta, University College London, dan University of Oxford, mendapatkan skor 81,5% pada benchmark MLE-bench-30 setelah 24 jam, naik menjadi 83,1% setelah 72 jam. Ini menandai lonjakan 9 poin persentase dibandingkan model sebelumnya. AIRA₂ juga menempati peringkat ke-8 dalam kompetisi Kaggle dengan 4.000 tim, meraih medali emas. Aktivitas berita on-chain menyoroti meningkatnya integrasi AI di bidang-bidang berbasis data.

Sebuah agen AI baru saja mengalahkan sekitar 3.992 tim manusia dalam permainan mereka sendiri. AIRA₂, agen penelitian AI otonom yang dikembangkan oleh peneliti di laboratorium FAIR Meta, University College London, dan University of Oxford, menempati peringkat ke-8 dari 4.000 tim dalam kompetisi Kaggle yang berfokus pada penalaran AI, sekaligus memenangkan medali emas.

Apa yang sebenarnya dilakukan AIRA

Rangkaian agen AIRA (nama ini singkatan dari AI Research Agent) dirancang untuk secara otomatis menangani masalah teknik pembelajaran mesin yang kompleks. Alih-alih hanya menjalankan satu model dan berharap yang terbaik, AIRA menggunakan strategi eksekusi multi-GPU asinkron yang berjalan pada 8 GPU Nvidia H200.

Iklan

Sistem ini menggunakan apa yang disebut tim peneliti sebagai protokol "Evaluasi Tersembunyi Konsisten", sebuah metode untuk mencegah agen memanfaatkan skor ujiannya sendiri. Agen juga menggunakan operator dinamis bergaya ReAct, yang berarti ia dapat bernalar melalui masalah langkah demi langkah, menyesuaikan pendekatannya secara real-time, dan mengeksekusi kode secara simultan di beberapa prosesor.

Di MLE-bench-30, sebuah benchmark terstruktur yang dibangun dari 30 kompetisi Kaggle nyata, AIRA₂ mencapai peringkat persentil rata-rata 81,5% setelah 24 jam komputasi. Berikan waktu 72 jam, dan angka tersebut naik menjadi 83,1%. Baseline terbaik sebelumnya dari agen lain berada di 72,7%, sehingga peningkatan AIRA₂ sekitar 9 poin persentase di atas pesaing.

Mengapa hal ini penting selain sekadar pamer

AIRA₂ melebihi kinerja terbaik manusia pada 6 dari 20 tugas dalam evaluasi AIRS-Bench. Selain itu, AIRA₂ memenangkan medali emas pada tugas-tugas Kaggle individu di mana versi sebelumnya dari agen gagal memperoleh penghargaan sama sekali.

Kerangka kerja ini membangun pendekatan AIRA-dojo yang disebut oleh tim, dirancang khusus untuk mengatasi keterbatasan agen sebelumnya. Keterbatasan tersebut mencakup throughput komputasi yang terbatas, overfitting evaluasi, kesenjangan generalisasi di berbagai jenis masalah, dan batasan operasional statis yang mencegah agen menyesuaikan strateginya selama tugas berlangsung.

Lanskap penelitian AI yang kompetitif

Kolaborasi antara Meta FAIR, UCL, dan Oxford patut diperhatikan karena bobot institusionalnya. Tim peneliti menyebarkan temuan mereka melalui preprint arXiv, saluran standar untuk penelitian AI terkini.

Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini. Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.