Một tác nhân AI vừa đánh bại khoảng 3.992 đội ngũ con người trong chính trò chơi của họ. AIRA₂, một tác nhân nghiên cứu AI tự chủ được phát triển bởi các nhà nghiên cứu tại phòng thí nghiệm FAIR của Meta, Đại học College London và Đại học Oxford, đã xếp thứ 8 trong số 4.000 đội tham gia một cuộc thi Kaggle tập trung vào khả năng suy luận của AI, đồng thời giành huy chương vàng.
AIRA thực sự làm gì
Dòng tác nhân AIRA (tên viết tắt của AI Research Agent) được thiết kế để tự động giải quyết các vấn đề kỹ thuật học máy phức tạp. Thay vì chỉ chạy một mô hình duy nhất và hy vọng kết quả tốt nhất, AIRA sử dụng chiến lược thực thi đa GPU bất đồng bộ trên 8 GPU Nvidia H200.
Hệ thống sử dụng một giao thức được nhóm nghiên cứu gọi là “Đánh giá Ẩn nhất quán”, một phương pháp ngăn chặn tác nhân thao túng điểm số kiểm tra của chính nó. Tác nhân cũng sử dụng các bộ xử lý kiểu ReAct động, nghĩa là nó có thể suy luận từng bước qua các vấn đề, điều chỉnh cách tiếp cận linh hoạt và thực thi mã đồng thời trên nhiều bộ xử lý.
Trên MLE-bench-30, một bộ tiêu chuẩn có cấu trúc được xây dựng từ 30 cuộc thi Kaggle thực tế, AIRA₂ đạt hạng phần trăm trung bình 81,5% sau 24 giờ tính toán. Cho nó 72 giờ, con số này tăng lên 83,1%. Mức cơ sở tốt nhất trước đó từ các tác nhân khác là 72,7%, khiến sự cải tiến của AIRA₂ cao hơn khoảng 9 điểm phần trăm so với đối thủ.
Tại sao điều này lại quan trọng hơn chỉ để khoe khoang
AIRA₂ đã vượt qua hiệu suất tiên tiến nhất của con người trên 6 trong số 20 nhiệm vụ trong đánh giá AIRS-Bench. Nó cũng giành huy chương vàng trên các nhiệm vụ Kaggle cá nhân, nơi các phiên bản trước đó của tác nhân không giành được bất kỳ giải thưởng nào.
Khung làm việc này xây dựng trên phương pháp AIRA-dojo mà nhóm gọi là, được thiết kế đặc biệt để giải quyết các hạn chế của các tác nhân trước đó. Những hạn chế đó bao gồm thông lượng tính toán hạn chế, quá khớp khi đánh giá, khoảng cách tổng quát hóa giữa các loại vấn đề khác nhau và các ràng buộc vận hành tĩnh ngăn cản tác nhân điều chỉnh chiến lược giữa chừng.
Bối cảnh nghiên cứu AI cạnh tranh
Sự hợp tác giữa Meta FAIR, UCL và Oxford nổi bật nhờ trọng lượng thể chế của nó. Nhóm nghiên cứu đã phổ biến các phát hiện của mình thông qua các bản preprint trên arXiv, kênh tiêu chuẩn cho các nghiên cứu AI tiên tiến.
