Bir AI aracısı, kendi oyununda yaklaşık 3.992 insan ekibini yendi. Meta'nın FAIR laboratuvarı, University College London ve Oxford Üniversitesi araştırmacıları tarafından geliştirilen özerk AI araştırma aracısı AIRA₂, AI muhakemesine odaklanan bir Kaggle yarışmasında 4.000 ekip arasında 8. oldu ve bu süreçte altın madalya kazandı.
AIRA'nın aslında ne yaptığını
AIRA agent serisi (adı AI Araştırma Agentini ifade eder), karmaşık makine öğrenimi mühendisliği problemlerini özerk olarak çözmek için tasarlanmıştır. Sadece tek bir model çalıştırmak ve en iyi sonucu ummak yerine, AIRA, 8 adet Nvidia H200 GPU üzerinde çalışan asenkron çoklu GPU yürütme stratejisini kullanır.
Sistem, araştırma ekibinin “Gizli Tutarlı Değerlendirme” protokolü dediği bir yöntemi kullanır; bu yöntem, ajanın kendi test puanlarını manipüle etmesini önler. Ajan aynı zamanda dinamik ReAct tarzı operatörler de kullanır; bu da ona sorunları adım adım düşünmesine, yaklaşımını anlık olarak ayarlamasına ve birden fazla işlemci üzerinde aynı anda kod çalıştırmasına olanak tanır.
MLE-bench-30 üzerinde, 30 gerçek Kaggle yarışmasından oluşturulan yapılandırılmış bir performans testi, AIRA₂ 24 saatlik hesaplama sonrası 81,5% ortalama persentil sıralaması elde etti. 72 saat verildiğinde bu sayı 83,1% olarak yükseldi. Diğer ajantlardan önceki en iyi temel değer 72,7% idi ve bu da AIRA₂'nin rekabette yaklaşık 9 puanlık bir avantaj sağladığını gösteriyor.
Bu, sadece gurur duymaktan öte neden önemli
AIRA₂, AIRS-Bench değerlendirmesindeki 20 görevden 6'sında insanların en ileri seviye performansını aştı. Daha önce hiçbir ödül kazanamayan bireysel Kaggle görevlerinde de altın madalya kazandı.
Çerçeve, ekip tarafından daha önceki agenterin sınırlamalarını gidermek için tasarlanan AIRA-dojo yaklaşımına dayanmaktadır. Bu sınırlamalar, sınırlı hesaplama verimliliği, değerlendirme aşırı uyumu, farklı problem türleri arasında genelleme boşlukları ve agentin görev sırasında stratejisini değiştirmesini engelleyen statik operasyonel kısıtlamaları içeriyordu.
Rekabetçi Yapay Zeka Araştırmaları Ortamı
Meta FAIR, UCL ve Oxford arasındaki iş birliği, kurumsal ağırlığıyla dikkat çekiyor. Araştırma ekibi bulgularını, ileri düzey AI araştırmaları için standart kanal olan arXiv ön baskıları yoluyla yaydı.
