لقد هزم وكيل ذكاء اصطناعي حوالي 3,992 فريقًا بشريًا في لعبتهم الخاصة. وقد حصل AIRA₂، وهو وكيل بحث ذكي ذاتي تم تطويره من قبل باحثين في مختبر FAIR التابع لشركة ميتا، وكلية لندن الجامعية، وجامعة أكسفورد، على المركز الثامن من بين 4,000 فريق في منافسة Kaggle المخصصة لاستدلال الذكاء الاصطناعي، وحصل على ميدالية ذهبية في العملية.
ما الذي تفعله AIRA فعليًا
تم تصميم سلسلة وكلاء AIRA (الاسم يرمز إلى وكيل أبحاث الذكاء الاصطناعي) للتعامل بشكل مستقل مع مشكلات هندسة التعلم الآلي المعقدة. بدلاً من تشغيل نموذج واحد فقط والاعتماد على الحظ، يستخدم AIRA استراتيجية تنفيذ متزامنة متعددة GPU تعمل على 8 وحدات معالجة رسومية Nvidia H200.
يستخدم النظام ما تسميه فريق البحث ببروتوكول "التقييم الخفي المتسق"، وهو أسلوب لمنع العامل من التلاعب بدرجات اختباره. كما يستخدم العامل عوامل ديناميكية على نمط ReAct، مما يعني أنه يمكنه التفكير في المشكلات خطوة بخطوة، وتعديل نهجه في الوقت الفعلي، وتنفيذ التعليمات البرمجية عبر معالجات متعددة في نفس الوقت.
على MLE-bench-30، وهو معيار منظم مبني من 30 منافسة حقيقية على Kaggle، حقق AIRA₂ متوسط رتبة مئوية قدرها 81.5% بعد 24 ساعة من الحساب. وعند إعطائه 72 ساعة، ارتفع هذا الرقم إلى 83.1%. وكانت أفضل نقطة مرجعية سابقة من وكلاء آخرين عند 72.7%، مما يجعل تحسن AIRA₂ أعلى بحوالي 9 نقاط مئوية من المنافسة.
لماذا هذا مهم أكثر من مجرد التفاخر
تجاوزت AIRA₂ الأداء القياسي البشري في 6 من أصل 20 مهمة في تقييم AIRS-Bench. كما فازت بميداليات ذهبية في مهام Kaggle الفردية التي فشلت فيها الإصدارات السابقة من الوكيل في تحقيق أي جوائز على الإطلاق.
يعتمد الإطار على ما تسميه الفريق منهجية AIRA-dojo، المصممة خصيصًا لمعالجة قيود الوكلاء السابقين. شملت هذه القيود انخفاض الإنتاجية الحسابية، والتحيز في التقييم، والفجوات في التعميم عبر أنواع مختلفة من المشكلات، والقيود التشغيلية الثابتة التي منعت الوكيل من تغيير استراتيجيته أثناء المهمة.
مشهد البحث التنافسي في الذكاء الاصطناعي
التعاون بين Meta FAIR وUCL وأكسفورد يُميزه الوزن المؤسسي. وقد نشر فريق البحث نتائجه من خلال مطبوعات arXiv، وهي القناة القياسية لأبحاث الذكاء الاصطناعي المتقدمة.
