एक AI एजेंट ने अपने ही खेल में लगभग 3,992 मानव टीमों को हरा दिया। AIRA₂, जो मेटा के FAIR लैब, यूनिवर्सिटी कॉलेज लंदन और ऑक्सफोर्ड विश्वविद्यालय के शोधकर्ताओं द्वारा विकसित एक स्वायत्त AI शोध एजेंट है, एआई तर्क पर केगल प्रतियोगिता में 4,000 टीमों में से 8वें स्थान पर रहा और इस प्रक्रिया में स्वर्ण पदक जीता।
AIRA वास्तव में क्या करती है
AIRA एजेंट्स की लाइन (जिसका नाम AI Research Agent के लिए है) को जटिल मशीन लर्निंग इंजीनियरिंग समस्याओं को स्वयं हल करने के लिए डिज़ाइन किया गया है। एकल मॉडल चलाकर बेस्ट के लिए उम्मीद करने के बजाय, AIRA 8 Nvidia H200 GPU पर चलने वाली एक असिंक्रोनस मल्टी-GPU निष्पादन रणनीति का उपयोग करता है।
प्रणाली एक "छिपा हुआ सुसंगठित मूल्यांकन" प्रोटोकॉल का उपयोग करती है, जिसे अनुसंधान टीम द्वारा एजेंट को अपने परीक्षण स्कोर को गेम करने से रोकने के लिए बुलाया गया है। एजेंट डायनामिक ReAct-शैली के ऑपरेटर्स का भी उपयोग करता है, जिसका अर्थ है कि यह समस्याओं को कदम दर कदम सोच सकता है, अपने दृष्टिकोण को बिना किसी देरी के समायोजित कर सकता है, और एक साथ कई प्रोसेसर्स पर कोड निष्पादित कर सकता है।
MLE-bench-30 पर, जो 30 वास्तविक Kaggle प्रतियोगिताओं से बनाया गया एक संरचित बेंचमार्क है, 24 घंटे की गणना के बाद AIRA₂ ने 81.5% की माध्य प्रतिशतक रैंक प्राप्त की। इसे 72 घंटे दें, और यह संख्या बढ़कर 83.1% हो गई। अन्य एजेंट्स से पिछला सर्वश्रेष्ठ आधार 72.7% पर था, जिससे AIRA₂ का सुधार प्रतिस्पर्धा से लगभग 9 प्रतिशत बिंदु अधिक है।
इसका महत्व घमंड करने से आगे क्यों है
AIRA₂ ने AIRS-Bench मूल्यांकन में 20 में से 6 कार्यों पर मानव शीर्ष प्रदर्शन को पार कर लिया। इसने व्यक्तिगत Kaggle कार्यों पर स्वर्ण पदक भी जीते, जहां पिछले संस्करणों को कोई पुरस्कार प्राप्त नहीं हुआ था।
यह ढांचा टीम द्वारा एआईआरए-डोजो दृष्टिकोण के नाम से जाना जाने वाला दृष्टिकोण है, जिसे पिछले एजेंट्स की सीमाओं को संबोधित करने के लिए विशेष रूप से डिज़ाइन किया गया है। उन सीमाओं में सीमित गणना थ्रूपुट, मूल्यांकन का अतिसमायोजन, विभिन्न समस्या प्रकारों के बीच सामान्यीकरण के अंतर, और स्थिर संचालन सीमाएँ शामिल थीं, जिनके कारण एजेंट किसी कार्य के दौरान अपनी रणनीति को अनुकूलित नहीं कर सकता था।
प्रतिस्पर्धी AI शोध परिदृश्य
मेटा FAIR, UCL और ऑक्सफोर्ड के बीच की सहयोगिता इसके संस्थागत भार के लिए उल्लेखनीय है। शोध टीम ने अपनी खोजों को arXiv प्रीप्रिंट्स के माध्यम से प्रसारित किया, जो अग्रणी AI शोध के लिए मानक चैनल है।
