AIRA₂ AI Agent vượt trội 9 điểm phần trăm so với các mô hình trước đây trong bảng xếp hạng ML

iconCryptoBriefing
Chia sẻ
AI summary iconTóm tắt
Tin tức AI + tiền mã hóa: AIRA₂, một tác nhân nghiên cứu AI tự chủ từ phòng thí nghiệm FAIR của Meta, Đại học College London và Đại học Oxford, đạt 81,5% trên bộ kiểm tra MLE-bench-30 sau 24 giờ, tăng lên 83,1% sau 72 giờ. Điều này đánh dấu bước nhảy 9 điểm phần trăm so với các mô hình trước đó. AIRA₂ cũng xếp thứ 8 trong một cuộc thi Kaggle với 4.000 đội, giành huy chương vàng. Hoạt động tin tức trên chuỗi cho thấy sự tích hợp ngày càng tăng của AI trong các lĩnh vực dựa trên dữ liệu.

Một tác nhân AI vừa đánh bại khoảng 3.992 đội ngũ con người trong chính trò chơi của họ. AIRA₂, một tác nhân nghiên cứu AI tự chủ được phát triển bởi các nhà nghiên cứu tại phòng thí nghiệm FAIR của Meta, Đại học College London và Đại học Oxford, đã xếp thứ 8 trong số 4.000 đội tham gia một cuộc thi Kaggle tập trung vào khả năng suy luận của AI, đồng thời giành huy chương vàng.

AIRA thực sự làm gì

Dòng tác nhân AIRA (tên viết tắt của AI Research Agent) được thiết kế để tự động giải quyết các vấn đề kỹ thuật học máy phức tạp. Thay vì chỉ chạy một mô hình duy nhất và hy vọng kết quả tốt nhất, AIRA sử dụng chiến lược thực thi đa GPU bất đồng bộ trên 8 GPU Nvidia H200.

Quảng cáo

Hệ thống sử dụng một giao thức được nhóm nghiên cứu gọi là “Đánh giá Ẩn nhất quán”, một phương pháp ngăn chặn tác nhân thao túng điểm số kiểm tra của chính nó. Tác nhân cũng sử dụng các bộ xử lý kiểu ReAct động, nghĩa là nó có thể suy luận từng bước qua các vấn đề, điều chỉnh cách tiếp cận linh hoạt và thực thi mã đồng thời trên nhiều bộ xử lý.

Trên MLE-bench-30, một bộ tiêu chuẩn có cấu trúc được xây dựng từ 30 cuộc thi Kaggle thực tế, AIRA₂ đạt hạng phần trăm trung bình 81,5% sau 24 giờ tính toán. Cho nó 72 giờ, con số này tăng lên 83,1%. Mức cơ sở tốt nhất trước đó từ các tác nhân khác là 72,7%, khiến sự cải tiến của AIRA₂ cao hơn khoảng 9 điểm phần trăm so với đối thủ.

Tại sao điều này lại quan trọng hơn chỉ để khoe khoang

AIRA₂ đã vượt qua hiệu suất tiên tiến nhất của con người trên 6 trong số 20 nhiệm vụ trong đánh giá AIRS-Bench. Nó cũng giành huy chương vàng trên các nhiệm vụ Kaggle cá nhân, nơi các phiên bản trước đó của tác nhân không giành được bất kỳ giải thưởng nào.

Khung làm việc này xây dựng trên phương pháp AIRA-dojo mà nhóm gọi là, được thiết kế đặc biệt để giải quyết các hạn chế của các tác nhân trước đó. Những hạn chế đó bao gồm thông lượng tính toán hạn chế, quá khớp khi đánh giá, khoảng cách tổng quát hóa giữa các loại vấn đề khác nhau và các ràng buộc vận hành tĩnh ngăn cản tác nhân điều chỉnh chiến lược giữa chừng.

Bối cảnh nghiên cứu AI cạnh tranh

Sự hợp tác giữa Meta FAIR, UCL và Oxford nổi bật nhờ trọng lượng thể chế của nó. Nhóm nghiên cứu đã phổ biến các phát hiện của mình thông qua các bản preprint trên arXiv, kênh tiêu chuẩn cho các nghiên cứu AI tiên tiến.

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.