माइक्रोसॉफ्ट और शंघाई जियाओटोंग विश्वविद्यालय ने आर्गस, 1548-घंटे के स्वायत्त अनुसंधान प्रणाली को ओपन सोर्स किया

icon MarsBit
साझा करें
AI summary iconसारांश
माइक्रोसॉफ्ट और शंघाई जियाओतोंग विश्वविद्यालय ने आर्गस, एक सामान्य-उद्देश्य एजेंट रनटाइम सिस्टम को ओपन-सोर्स किया है, जो लंबे समय तक के शोध कार्यों के लिए डिज़ाइन किया गया है। यह सिस्टम साक्ष्य-आधारित निर्णय लेने के माध्यम से कई दिनों तक स्वायत्त शोध का समर्थन करता है। 27 अभियानों और 1,548 घंटों के परीक्षण में, इसने 95.1% से 98.7% कार्य ड्यूटी साइकिल प्राप्त किया। आर्गस ने AI4AI, GPU कर्नेल अनुकूलन और AI4Math में परिणाम प्राप्त किए। ओपन इंटरेस्ट विश्लेषण से पता चलता है कि सिस्टम के प्रदर्शन मेट्रिक्स में मजबूत तकनीकी समर्थन और प्रतिरोध स्तर हैं।

"कार्यान्वित करने" से "नेतृत्व करने" तक, लंबी अवधि के एजेंट को क्या अभी चाहिए?

आज के समय में, जहां एजेंट तेजी से विकसित हो रहे हैं, Harness ने बड़े मॉडल को वास्तविक दुनिया तक पहुंचाया है, जो टूल्स का उपयोग कर सकते हैं, कोड में बदलाव कर सकते हैं और प्रयोग चला सकते हैं। लेकिन जब कार्य कई घंटों से लेकर कई दिनों तक बढ़ जाता है, तो सिस्टम को अभी भी किसी व्यक्ति को स्क्रीन के सामने लंबे समय तक बैठकर अगला कदम कहां उठाना है, यह निर्णय लेने की आवश्यकता होती है।

इस बॉटलनेक का मुख्य कारण केवल मॉडल की क्षमता का अभाव नहीं है, बल्कि वर्तमान एजेंट अधिकांशतः 'निष्पादन' को स्वचालित करते हैं, लेकिन निष्पादन से ऊपर के 'नियंत्रण' को वास्तव में स्वचालित नहीं करते। हारनेस मॉडल को कार्रवाई की क्षमता प्रदान करता है, जबकि मानव निर्णय लेते हैं। जैसे ही मानव चले जाते हैं, प्रोजेक्ट भी रुक जाता है। और, घने पुरस्कार प्रतिक्रिया के बिना, एजेंट का निष्पादन और प्रतिक्रिया धीमी और असमर्थ लगती है।

इस समस्या को हल करने के लिए, माइक्रोसॉफ्ट, शंघाई जियाओटोंग विश्वविद्यालय आदि संस्थानों ने Argus को ओपन सोर्स किया है, जो लंबे समय तक के अनुसंधान कार्यों के लिए एक सामान्य एजेंट निष्पादन रनटाइम है, और एक तकनीकी रिपोर्ट प्रकाशित की है। प्रणाली, साक्ष्य-आधारित, स्व-विकास, बहु-एजेंट सहयोग, मूल और क्षेत्र-विशिष्ट अलगाव जैसे डिज़ाइन के माध्यम से, एजेंट को सघन मानक प्रतिक्रिया के बिना कई क्षेत्रों में कई दिनों तक निरंतर अनुसंधान करने की अनुमति देती है।

रिपोर्ट में 27 कैंपेन और 1,548 घंटे घड़ी का समय शामिल है। औसतन प्रति 40.7 घंटे में एक बार मानव हस्तक्षेप की आवश्यकता हुई; रिपोर्ट का कार्य दक्षता 95.1% से 98.7% थी। इस Argus डिलीवरी ने केवल उच्च स्कोर वाले बेंचमार्क के बजाय एक पूर्ण उत्पादन-स्तरीय परिणाम संग्रह प्रदान किया। टीम ने AI4AI, GPU Kernel, मॉडल प्रशिक्षण, AI4Science, चिप डिज़ाइन, AI4math, AI4System जैसे विस्तृत कार्यों पर परिणाम प्रस्तुत किए हैं, जो Argus की सार्वभौमिकता और वास्तविक शोध-स्तरीय बुद्धिमत्ता को दर्शाते हैं।

शंघाई जियाओटोंग विश्वविद्यालय

चित्र 1: आर्गस रनटाइम, क्षमता बेंचमार्क और डिलीवरी परिणामों का सारांश।

शंघाई जियाओटोंग विश्वविद्यालय

  • शीर्षक: आर्गस: दिनों के लिए हैरनेस को कौन चलाता है?
  • पेपर: https://arxiv.org/abs/2608.05144
  • कोड: https://github.com/lbx154/Argus
  • प्रोजेक्ट होमपेज: https://argusbot.cn/
  • प्रोजेक्ट अपनाया गया खुला स्रोत कूट: https://github.com/Argus-AiTeam
  • प्रोजेक्ट मैथ लाइव सॉल्विंग: https://open.argusbot.cn/#counterexample-live

01

गोल-आधारित से साक्ष्य-आधारित ओर जाएं:

एजेंट की अगली कार्रवाई कौन तय करता है?

पिछले दो वर्षों में, एजेंट इंजीनियरिंग की मुख्य प्रगति हार्नेस पर केंद्रित रही है: ऑटोनॉमस ड्राइविंग के FSD के साथ तुलना करें, मॉडल इंजन की तरह है, हार्नेस ट्रांसमिशन सिस्टम की तरह है, लेकिन वाहन कहाँ जाएगा, यह अभी भी स्क्रीन के सामने बैठे व्यक्ति द्वारा निर्धारित होता है। छोटे कार्यों में, जैसे सामान्य स्वचालित पार्किंग, कार्य स्वयं स्पष्ट प्रतिक्रिया प्रदान कर सकता है; लेकिन जब कार्य कई दिनों तक बढ़ जाता है, तो अनुसंधान समस्याएँ अक्सर स्थिर पुरस्कार के बिना होती हैं, और शुरुआत से ही स्पष्ट रूप से परिभाषित लक्ष्य भी नहीं होते। इससे मौजूदा एजेंट की वास्तविक सीमा सामने आती है: वे कार्य करना सीख चुके हैं, लेकिन अनिश्चितता में लगातार निर्णय लेना अभी भी नहीं सीख पाए हैं।

शंघाई जियाओटोंग विश्वविद्यालय

चित्र 2: आर्गस, ऑटो-रिसर्च के माध्यम से स्वायत्त अनुसंधान को लागू करके, मानवीय भूमिका को निरंतर ड्राइविंग सीट से सह-ड्राइवर में बदल देता है।

Argus इस पहले स्वचालित नहीं हुए स्थान को Harness के ऊपर ड्राइवर कहता है। इसका काम यह है कि जब योजना और वास्तविकता में टकराव हो, तो भी साक्ष्य के आधार पर नियंत्रण बनाए रखे। अध्ययन की शुरुआत में लिखे गए लक्ष्य केवल जानकारी के न्यूनतम स्तर की प्रारंभिक परिकल्पना होते हैं; यदि एजेंट केवल लक्ष्य-आधारित ढंग से पूर्वनिर्धारित अंतिम बिंदु की ओर बढ़ता है, और असंभव लक्ष्यों पर बार-बार टोकन बर्बाद करता है, तो लक्ष्य-कठोरता हो जाती है। इसके बजाय, साक्ष्य-आधारित दृष्टिकोण नियंत्रण तर्क को पलट देता है: अगला कदम प्रारंभिक योजना की परिकल्पनाओं के बजाय मौजूदा साक्ष्यों से निर्धारित होता है। सभी परिणाम, जो संचालन के दौरान प्राप्त होते हैं, साक्ष्य के रूप में कार्य करते हैं और मार्ग को बदल सकते हैं; प्रणाली साक्ष्यों से ही संचालित होती है। विशेष रूप से, ड्राइवर को वर्तमान साक्ष्यों के आधार पर निम्नलिखित चार प्रश्नों का बार-बार उत्तर देना होगा:

क्या यह कार्य पूरा हो चुका है और इसकी गुणवत्ता पर्याप्त अच्छी है?

2. वर्तमान साक्ष्य के संदर्भ में, अगला सबसे अच्छा कदम क्या होना चाहिए?

3. इस चरण से प्राप्त अनुभव को भविष्य के सिस्टम व्यवहार को बदलने के लिए कैसे उपयोग किया जाए?

4. शेष प्रश्न क्या केवल मानव द्वारा लिए जाने वाले निर्णयों से संबंधित हैं?

02

Build a universal customizable long-running runtime

अर्गस लंबे समय तक चलने वाले प्रोजेक्ट्स को स्थायी कैंपेन में संगठित करता है और फिर उन्हें स्पष्ट सीमाओं वाली मिशनों में विभाजित करता है। इसका मूल चक्र Manager → Planner → Engineer ⇄ Reviewer → Manager है:

OpenAI Codex के /goal मोड के संदर्भ में, Argus की डिज़ाइन दिशा को अधिक स्पष्ट रूप से समझा जा सकता है। /goal एक एजेंट के एकल चक्र को एक goal state के साथ दीर्घकालिक चक्र में बदल देता है; Argus शोध परियोजनाओं को बहु-भूमिका, बहु-हारनेस, और ज्ञान के स्थायी भंडारण वाले दीर्घकालिक रनटाइम के रूप में संगठित करता है। पहला प्रश्न करता है — "एजेंट को कैसे रोके बिना रखें", जबकि दूसरा प्रश्न करता है — "एजेंट को रोके बिना रखने के बाद, उसे कैसे प्रभावी ढंग से काम कराएं"। यही रनटाइम स्तर पर Goal-Driven से Evidence-Driven में परिवर्तन की संरचनात्मक भिन्नता है।

1. प्रबंधक चरण परिवर्तन, प्रक्रिया अनुमोदन और सामान्य रणनीति पर नियंत्रण रखता है;

2. प्लानर वर्तमान साक्ष्य के आधार पर विशिष्ट कार्यों की योजना बनाता है;

3. इंजीनियर वास्तविक कोड रिपॉजिटरी, प्रयोग और निष्पादन में शामिल होते हैं;

4. समीक्षक स्वतंत्र रूप से कार्यान्वयन की समीक्षा करता है और नवीनता तथा प्रभावशीलता की जांच करता है, फिर प्रबंधक को रिपोर्ट करता है या इंजीनियर को वापस भेज देता है।

यहाँ मुख्य बात बहु-भूमिकाएँ नहीं हैं, बल्कि संदर्भ को अलग करना है — कई भूमिकाएँ एक-दूसरे के साथ समन्वय करती हैं, ताकि एजेंट सिर्फ एक साधारण स्थानीय चढ़ाई एल्गोरिथम न बन जाए; प्रत्येक भूमिका के पास अपना अद्वितीय संदर्भ होता है, लेकिन वे साझा कार्यक्षेत्र का उपयोग करते हैं, जिससे योजना, निष्पादन और सत्यापन को एक ही एजेंट पर नहीं छोड़ा जाता, जिससे टोकन की दक्षता में सुधार होता है। इसी कारण, Argus के एक कार्य में, Pi, Codex, Claude Code को एक साथ सक्षम किया जा सकता है, DeepSeek हार्नेस विभिन्न हैरन्स, जो उच्च स्तर की कस्टमाइजेशन को सुनिश्चित करते हैं।

सिस्टम एक पूर्ण आर्टिफैक्ट सेट सहेजता है; केवल साक्ष्य दर को पार करने वाले अनुभव ही Wiki और Skill में शामिल होते हैं और भविष्य के कार्यों के लिए Project, Vertical या Global स्कोप के अनुसार पुनः उपयोग किए जाते हैं।

इसी समय, Core और Vertical अलग रहते हैं: Core भूमिका अधिकारों, साक्ष्य प्रस्तुति और मानवीय सीमाओं के लिए जिम्मेदार है, जबकि Vertical, क्षेत्र विशेषज्ञों द्वारा गणित, GPU, सामग्री आदि कार्यों में क्या मान्य साक्ष्य है और संबंधित मानवीय कौशल और ज्ञान को परिभाषित करता है; Vertical अनुसंधान कार्यों की गुणवत्ता में स्पष्ट रूप से सुधार कर सकता है, और मानव विशेषज्ञों और एजेंट के सह-विकास, और कस्टमाइज़ड कार्य प्रवाह प्रदान करने के लिए एक इंटरफ़ेस प्रदान करता है।

शंघाई जियाओटोंग विश्वविद्यालय

चित्र 3: आर्गस की लंबी अवधि की क्रियाविधि। चार प्रकार के भूमिकाएँ स्थायी अवस्था के चक्र के चारों ओर घूमती हैं, और कैंपेन आठ अध्ययन चरणों के बीच आगे बढ़ाया या पीछे हटाया जा सकता है।

03

1548 घंटे के बाद, आर्गस ने क्या छोड़ दिया?

लंबी अवधि के एजेंट के सफल होने का निर्णय यह है कि समय को वास्तविक शोध परिणामों में परिवर्तित किया जा सकता है या नहीं। आर्गस के ओपन सोर्स होने के एक महीने से भी कम समय में, हमने बुनियादी ढांचे, सामग्री, चिप, गणित और AI सिस्टम शोध में उत्कृष्ट योगदान दिया है, और हम पहली टीम हैं जिन्होंने पूर्ण एंड-टू-एंड गणितीय अनुमान हल करने की छांटने की प्रक्रिया का लॉग प्रकाशित किया है, सभी रनिंग ट्रैजेक्टरी सेशन आदि को खुला कर दिया है। नीचे आर्गस के ओपन सोर्स होने के बाद के सभी प्राप्ति सारांश हैं:

शंघाई जियाओटोंग विश्वविद्यालय

चित्र 4: आर्गस के प्रतिनिधि शोध परिणाम, मुख्य सूचकांक और स्वीकृति मानदंड

जैसा कि ऊपर की तालिका में दर्शाया गया है, आर्गस पहले AI4System & Infra में निरंतर चलने को स्वीकार्य वास्तविक डिलीवरी में बदलता है, जिससे स्वचालित निष्पादन से स्वायत्त अनुसंधान की ओर पहला स्पष्ट इंजीनियरिंग परिणाम के साथ कदम उठाया जाता है; फिर, कार्य AI बुनियादी ढांचे से AI4Science, AI4Hardware, AI4Math तक विस्तारित होता है, और मूल्यांकन मापदंड “निर्धारित कार्य पूरा हुआ क्या” से “क्या अनसुलझे वास्तविक अनुसंधान सवालों की खोज की जा सकती है” में बदल जाता है, जिससे स्वचालित अनुसंधान स्वचालित डिलीवरी से आगे बढ़कर स्वचालित खोज में परिणत होता है; इसके आधार पर, आर्गस AI4AI दिशा में एकल परिणाम से पूर्ण अनुसंधान प्रक्रिया तक विस्तार करता है, जहां सबूतों के साथ कार्य को निरंतर प्रगति मिलती है, जिससे मनुष्य को हमेशा स्क्रीन के सामने बैठे रहने की आवश्यकता नहीं पड़ती, और इस प्रकार एक वास्तविक डिलीवरी, क्रॉस-डोमेन खोज, और पूर्ण प्रक्रिया स्वायत्त अनुसंधान की आगे बढ़ती हुई पथ प्रणाली बनती है।

शंघाई जियाओटोंग विश्वविद्यालय

चित्र 5: आर्गस द्वारा पूर्ण प्रक्रिया शोध पत्र उत्पादन में दिए गए परिणाम।

उपरोक्त परिणाम सभी 1 महीने के भीतर प्राप्त किए गए हैं, इन उपलब्धियों को जोड़कर, आर्गस एक क्रमिक रूप से गहराती मूल्य श्रृंखला है: स्वचालित वस्तुओं का एकल निष्पादन से गवाही-आधारित अनुसंधान प्रगति तक विस्तार किया गया है, जिससे अनुसंधान प्रगति में बड़ी तेजी आई है, और यही “जब इंसान स्क्रीन से दूर हो जाए, तो एजेंट को कौन चलाएगा?” का सबसे सीधा उत्तर है।

अंतिम शब्द

स्क्रीन बंद होने के बाद, प्रोजेक्ट शून्य नहीं हुआ

लॉन्ग-रेंज इंटेलिजेंस टोकन को इंटेलिजेंस में बदलता है और फिर इस इंटेलिजेंस का उपयोग एक शोध परियोजना को लगातार आगे बढ़ाने और वास्तविक मूल्य पैदा करने के लिए किया जाता है। आर्गस मॉडल के बीच के अलग-अलग कॉल को एक लगातार काम करने वाली शोध प्रणाली में संगठित करता है, जहाँ Evidence-Driven दिशा निर्धारित करता है और स्व-विकास के माध्यम से अनुभव को क्षमता में परिवर्तित किया जाता है।

Argus सिर्फ एक लंबे समय तक चलने वाला Agent नहीं दिखाता, बल्कि अनुसंधान के एक नए तरीके को दर्शाता है: Harness मॉडल के कार्य कैसे करने का निर्णय लेता है, Driver सिस्टम को कैसे लगातार आगे बढ़ाए रखना है, यह अब मानवीय कार्य और मनोरंजन के समय पर निर्भर नहीं है। इसका मतलब हो सकता है कि अनुसंधान के त्वरितकाल की शुरुआत हो रही है। स्क्रीन बंद हो सकती है, लेकिन अनुसंधान जारी रहता है।

लेखक परिचय

Argus को माइक्रोसॉफ्ट और शंघाई जियाओटोंग विश्वविद्यालय के शोधकर्ताओं द्वारा नेतृत्व दिया जा रहा है, और कई विश्वविद्यालयों के शोधकर्ता मिलकर इसे आगे बढ़ा रहे हैं।

यह लेख वेचेन ग्रुप "मशीन इंटेलिजेंस" से आया है

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।