हुआवेई नोआ के तोते प्रयोगशाला ने बहु-रणनीति रोबोट समन्वय के लिए रोबोहार्नेस प्रणाली लॉन्च की

iconMetaEra
साझा करें
AI summary iconसारांश
हुआवेई के नोआ के तोते लैब ने रोबोहार्नेस सिस्टम का अनावरण किया, जिसे लंबे समय तक के कार्यों के लिए VLA, WAM, RL और TAMP जैसी कई रणनीतियों को समन्वयित करने के लिए डिज़ाइन किया गया है। यह सिस्टम समझ, स्मृति और विकास को जोड़ता है, जिसमें एक मेमोरी ब्रिज मॉड्यूल है जो रणनीति संक्रमण में सुधार करता है। प्रयोगों में 86% सफलता दर पाई गई। जैसे-जैसे क्रिप्टो में TA की लोकप्रियता बढ़ रही है, ऐसे नवाचार क्रिप्टो रणनीतियों में मूल्य निवेश को प्रभावित कर सकते हैं।
हुआवेई नोआ के आर्क लैब ने RoboHarness सिस्टम जारी किया, जो Coding Agent के माध्यम से VLA, WAM, RL, TAMP जैसी विविध रणनीतियों को समन्वयित करता है और शून्य-नमूना लंबे समय तक के कार्यों को पूरा करता है। सिस्टम में समझ, स्मृति और विकास नामक तीन प्रकार के कौशल शामिल हैं, जिसमें Memory Bridge मॉड्यूल रणनीति स्विच करते समय स्थिति वितरण के असंगति की समस्या को हल करता है, जिसमें प्रयोग में 86% सफलता प्राप्त हुई। यह कार्य स्थानिक बुद्धिमत्ता की दिशा में एकल मॉडल से प्रणालीगत समन्वय की ओर विकास का प्रतिनिधित्व करता है।

लेखक, स्रोत: लेफेंगवेन

एक ऐसा कार्य कल्पना करें: कैबिनेट का दरवाजा खोलें, अंदर छुपाए गए ब्लॉक्स ढूंढें, और फिर उन्हें एक पुल बनाने के लिए इकट्ठा करें।

इसे मनुष्य के लिए बहुत सरल है, कुछ हरकतें प्राकृतिक रूप से जुड़ जाती हैं, और बालक भी इसे आसानी से पूरा कर सकते हैं।

लेकिन रोबोट के लिए, यह कार्य पूरी तरह से अलग-अलग क्षमताओं को कवर करता है: ब्लॉक ढूंढना, जिसमें दृश्य समझ और भाषा निर्देशों का पालन शामिल है; कैबिनेट का दरवाजा खोलना, जिसमें पर्यावरण के साथ जटिल बातचीत शामिल है; और ब्लॉक जोड़ना, जिसमें ज्यामितीय योजना और सटीक नियंत्रण के साथ-साथ पर्यावरण में परिवर्तन का अनुमान लगाना शामिल है।

अधिक जटिल बात यह है कि ये क्षमताएँ विभिन्न “परंपराओं” के मॉडलों से संबंधित हैं—VLA (विजुअल-लैंग्वेज-एक्शन मॉडल), WAM (वर्ल्ड-एक्शन मॉडल), RL पॉलिसी (रीइनफोर्समेंट लर्निंग), और TAMP (टास्क एंड मोशन प्लानिंग)। इनमें से प्रत्येक की अपनी ताकत है, लेकिन वे एक-दूसरे से अलग हैं, उनकी ट्रेनिंग विधियाँ, इनपुट फॉर्मेट और स्टेट स्पेस भिन्न हैं।

आज के रोबोटिक्स क्षेत्र में क्षमताएँ कम नहीं हैं, लेकिन सहयोग की कमी है।

हुआवेई के नोआ आर्क लैब ने हाल ही में एक पेपर जारी किया, जिसमें विभिन्न रणनीतियों के बीच सहयोग की समस्या को हल करने के लिए RoboHarness नामक एक प्रणाली प्रस्तुत की गई है। इस कार्य के चारों ओर, पेपर के लेखकों ने हम (लेफेंगवेन) के साथ संवाद किया।

एजेंट शरीरिक दुनिया की ओर बढ़ रहा है: भाषाई बुद्धिमत्ता से रोबोट के 'मस्तिष्क कमांडर' तक

कागजात: https://arxiv.org/abs/2607.18060

प्रोजेक्ट होमपेज: https://www.robo-harness.com/

01 यूनिवर्सल मॉडल के हॉलूसिनेशन और वास्तविकता के बीच की खाई

इस गर्मियों में, हार्नेस के चारों ओर कई कार्य रोबोटिक्स शोध क्षेत्र में घने ढंग से आए, जिन्होंने एक जागरूकता की ओर इशारा किया: सभी समस्याओं को बड़े मॉडल से हल करना अभी के लिए संभव नहीं है, रोबोट को एक निष्पादन संगठन प्रणाली की आवश्यकता है।

7 में, त्सिंगहुआ विश्वविद्यालय के प्रोफेसर यू चाओ की टीम ने Harness VLA जारी किया, जिसने डिजिटल बुद्धिमत्ता में व्यापक रूप से उपयोग किए जाने वाले Harness Layer को एम्बॉडीड इंटेलिजेंस में शामिल किया, जिससे एक फ्रीज़ किए गए VLA को सबसे अच्छा करने में सक्षम बनाया जा सके, जबकि Harness की एक परत सीखती है कि कब, कैसे इसे कॉल करना है, और VLA विफल होने के बाद इसे कैसे रीसेट करना है और पुनः प्रयास करना है। LIBERO-Pro परेशानी मूल्यांकन में, इस प्रणाली ने सफलता की दर को 50% से बढ़ाकर 82.4% कर दिया।

दृष्टिकोण के अनुसार, Harness VLA एक मॉडल के बाहरी विक्षेपण के तहत स्थिरता प्राप्त करने की समस्या को हल करता है। इसकी समस्या एकल रणनीति की स्थिरता है।

हुआवेई नोआ आर्क के रोबोहार्नेस का सामना एक अलग स्तर की समस्या से है: जब कोई कार्य किसी भी मॉडल की क्षमता की सीमा से आगे निकल जाए, तो क्या करें?

दोनों का नाम Harness है, और दोनों Coding Agent का उपयोग संगठन स्तर के रूप में करते हैं, लेकिन वे अलग-अलग आयामों की चुनौतियों को हल करते हैं। पहला एक विशेषज्ञ को अधिक स्थिर बनाता है, जबकि दूसरा विभिन्न क्षमताओं वाले कई विशेषज्ञों को सहयोग से काम करने के लिए सक्षम बनाता है। जैसे-जैसे रोबोट के कार्यों की जटिलता बढ़ती जा रही है, दूसरी समस्या अब अनदेखी नहीं की जा सकती।

इस समस्या की जड़ को विभिन्न मॉडलों की क्षमता की सीमाओं से समझा जा सकता है।

VLA मॉडल का लाभ खुले भाषा निर्देशों को समझने और नए परिवेश में सामान्यीकरण में है, लेकिन इसका एंड-टू-एंड कार्रवाई उत्पादन तरीका लंबे समय तक के कार्यों में सुसंगठितता बनाए रखने में कठिनाई पैदा करता है; रीइनफोर्समेंट लर्निंग रणनीति विशिष्ट प्रशिक्षण परिदृश्यों में स्थिर बंद लूप व्यवहार प्राप्त कर सकती है, लेकिन यह स्थिरता प्रशिक्षण वितरण पर अत्यधिक निर्भर करती है, और परिवेश में हल्का सा परिवर्तन होने पर यह असफल हो सकती है; TAMP प्रतीकात्मक तर्क और ज्यामितीय प्रतिबंधों में कुशल है, लेकिन इसे पहले से परिभाषित कार्रवाई प्राइमिटिव्स की आवश्यकता होती है, और खुले परिदृश्यों और अस्पष्ट लक्ष्यों के सामने प्लानर जल्द ही कठिनाई में पड़ जाता है; WAM भविष्य की स्थिति का अनुमान लगाकर लंबे समय तक के निर्णयों में सहायता कर सकता है, लेकिन अनुमानित समय क्षेत्र बढ़ने के साथ यह त्रुटि संचय के प्रति संवेदनशील है।

जटिले वास्तविक कार्यों को एक साथ अर्थबोध, ज्यामितीय योजना, बंद लूप नियंत्रण, दीर्घकालिक अनुक्रम तर्क और परिवेश परिवर्तन का अनुमान लगाने की आवश्यकता होती है, जिनके प्रशिक्षण लक्ष्य अलग-अलग होते हैं और कभी-कभी परस्पर विरोधी भी होते हैं। प्रत्येक क्षमता में अलग-अलग क्रांति लाने से लेकर एकल मॉडल द्वारा खुले परिवेश में दीर्घकालिक स्थिरता के साथ सभी क्षमताओं का समन्वय करने तक, एक ऐसा गहरा अंतराल है जिसे अभी तक सचमुच पार नहीं किया गया है।

रोबोहार्नेस का आधार यही है: इस अंतर को भरने का इंतजार करने के बजाय, बेहतर होगा कि पहले से मौजूद, अलग-अलग ताकतों वाले मॉडलों को वास्तविक रूप से सहकार्य करने दिया जाए। लेखक का मानना है कि जब तक कोई एक मॉडल अन्य सभी मॉडलों को पूरी तरह से दबा नहीं देता और पूर्ण शक्ति प्रदर्शित नहीं करता, तब तक ऐसी व्यवस्था काफी महत्वपूर्ण है।

यह काम अचानक नहीं बना। लेखक (LeiFeng.com) के अनुसार, RoboHarness का प्रारंभिक रूप पिछले वर्ष BEHAVIOR Challenge ग्लोबल रोबोटिक्स चैलेंज में भाग लेने के अनुभव से उत्पन्न हुआ। उस समय, चुनौती का कार्य लंबा और कठिन था, और टीम ने पाया कि या तो VLA को एंड-टू-एंड प्रशिक्षित करना या व्यवहार क्लोनिंग जैसे मॉडल का उपयोग करना, कार्य की कठिनाई को पूरी तरह से कवर नहीं कर सकता था। इस असफलता से, टीम को वास्तविक समस्या की पहचान हुई।

02 स्केड्यूलिंग ब्रेन कैसे तय करता है कि कौन खेले

RoboHarness का मूल विचार है कि VLA, WAM, RL रणनीतियों, TAMP आदि स्वतंत्र रूप से विकसित नियंत्रण प्रणालियों को एकीकृत नियोजन के लिए agentic कौशल के रूप में पैकेज किया जाए, जिसकी उच्च स्तरीय निर्णय लेने की जिम्मेदारी Coding Agent की होगी।

इस डिज़ाइन की एक महत्वपूर्ण पूर्वधारणा है: कोई भी निचले स्तर की रणनीति को न बदलें और न ही पुनः प्रशिक्षित करें। सभी रणनीतियाँ अपने मूल कार्यान्वयन को बनाए रखती हैं, और उन्हें मॉडल संरचना, क्रिया स्थान या प्रशिक्षण डेटा को साझा करने की आवश्यकता नहीं है। RoboHarness केवल उनके ऊपर एक संगठनात्मक क्षमता जोड़ता है।

सही रणनीति चुनना आसान नहीं है।

एक कोडिंग एजेंट के लिए, केवल मूल छवि इनपुट के आधार पर, यह निर्णय लेना कि यह कार्य किसे असाइन किया जाए, विश्वसनीय रूप से लगभग असंभव है। क्योंकि इस निर्णय के पीछे कई मात्रात्मक प्रश्न छिपे हुए हैं जिनका उत्तर भाषा मॉडल की अर्थ समझ क्षमता से नहीं दिया जा सकता। यह समझ सकता है कि एक कप को प्लेट पर रखना है, लेकिन RGB छवि से वर्तमान परिदृश्य की किसी रणनीति प्रशिक्षण वितरण के समानता की गणना नहीं कर सकता, और न ही वर्तमान सेंसर डेटा की विश्वसनीयता का मूल्यांकन कर सकता है।

इस समस्या को हल करने के लिए, सिस्टम ने तीन प्रकार की सहायक कौशल डिज़ाइन किए हैं, जो Coding Agent के लिए निर्णय के लिए आवश्यक जानकारी को अलग करते हैं।

एजेंट शरीरिक दुनिया की ओर बढ़ रहा है: भाषाई बुद्धिमत्ता से रोबोट के 'मस्तिष्क कमांडर' तक

समझ कौशल, मूल इनपुट को मापने योग्य संकेतों में बदलने के लिए जिम्मेदार है, जैसे: चित्र एम्बेडिंग और विभिन्न रणनीतियों के प्रशिक्षण डेटा की समानता, समय अवधि के भीतर वस्तु की स्थिति की स्थिरता, वर्तमान प्रकाश और छवि गुणवत्ता क्या मानकों को पूरा करती है। ये सूचक रणनीति रूटिंग के वास्तविक आधार हैं। लेखक का मानना है कि इस मॉड्यूल की मूल प्रकृति, प्रत्येक रणनीति को मापना है कि वह वर्तमान कार्य के लिए कितनी उपयुक्त है।

मेमोरी स्किल्स, इतिहास के निष्पादन अनुभव को रिट्रीव करता है, जिससे रणनीति चयन के लिए संदर्भ प्रदान होता है, और मेमोरी ब्रिज के माध्यम से रणनीतियों के बीच स्थिति वितरण के असंगति को संभालता है—यह प्रणाली का सबसे मूलभूत डिज़ाइन है, जिसका नीचे अलग से विस्तार से वर्णन किया गया है।

Evolution Skills, ऑनलाइन फीडबैक का उपयोग करके रणनीति के मेटाडेटा और ऑर्केस्ट्रेशन लॉजिक को निरंतर अपडेट करता है, ताकि सिस्टम प्रत्येक नए स्थिति के सामने शून्य से निर्णय लेने के बजाय प्रत्येक निष्पादन से सीख सके।

तीन प्रकार के कौशल के डेटा प्रवाह एक-दूसरे से बातचीत करते हैं और कोडिंग एजेंट के निर्णय लेने में सहायता करते हैं। वास्तविक निष्पादन में, इस तंत्र के मुख्य रूप से दो कार्य हैं: पहला, कार्य विघटन, जिसमें लंबे निर्देशों को विभिन्न रणनीतियों द्वारा स्वीकार किए जाने योग्य उप-कार्यों में विभाजित किया जाता है; दूसरा, गतिशील स्विचिंग, जब वर्तमान रणनीति अपनी क्षमता की सीमा के करीब पहुँचती है, तो प्रणाली समय पर अधिक उपयुक्त रणनीति पर स्विच हो जाती है, जिससे विभिन्न रणनीतियों के बीच क्षमता का पूरकत्व होता है।

एक सेट ऑफ एब्लेशन एक्सपेरिमेंट्स ने इन दो स्तरों के अलग-अलग योगदान को स्पष्ट किया: केवल भाषा मॉडल का उपयोग करके pi0.5 को कार्य को विघटित करने और उसे भेजने से सफलता की दर स्पष्ट रूप से बढ़ गई; इसके आधार पर कई हेटरोजीनस स्ट्रैटेजीज को जोड़ने से सफलता की दर और बढ़ गई। सही तरीके से विघटित करना पहला कदम है, और सही तरीके से भेजना दूसरा कदम है—दोनों अनिवार्य हैं।

लेकिन एक तीसरा सवाल भी है, जो सबसे कठिन है और जिसे सिर्फ स्ट्रैटेजी चुनकर हल नहीं किया जा सकता।

03 रिले दौड़ की जीत का निर्णय स्थानांतरण के क्षण में होता है

दो स्वतंत्र रूप से प्रशिक्षित रणनीतियाँ, आमतौर पर अपने-अपने डेटा दुनिया में रहती हैं। उनके इनपुट फॉर्मेट अलग-अलग होते हैं, और रोबोट की स्थिति के अनुभवजन्य वितरण भी अलग-अलग होते हैं। TAMP ऑपरेशन पूरा होने के बाद जहाँ रुकता है, वह स्थिति अक्सर ऐसी होती है जहाँ VLA कभी नहीं आया होता है और जिसे स्थिर रूप से शुरू नहीं किया जा सकता है।

यह असमान रणनीति ऑर्केस्ट्रेशन की अनूठी समस्या है।

इसलिए, दोनों रणनीतियों को स्थिर रूप से हस्तांतरित करने के लिए जिम्मेदार Memory Bridge को लेखक ने RoboHarness में सबसे महत्वपूर्ण मॉड्यूल के रूप में शामिल किया है। उन्होंने स्वीकार किया कि यदि भविष्य में कोई सामान्य मॉडल सभी स्थिति स्थान को पूरी तरह से कवर कर सकता है, तो Memory Bridge शायद आवश्यक नहीं होगा; लेकिन वर्तमान स्थिति में, कोई भी मॉडल हस्तांतरण के क्षण में आसानी से क्षमता वितरण से बाहर गिर सकता है।

एजेंट शरीरिक दुनिया की ओर बढ़ रहा है: भाषाई बुद्धिमत्ता से रोबोट के 'मस्तिष्क कमांडर' तक

मेमोरी ब्रिज का कार्य तीन चरणों में होता है।

खोजें: अगले उप-कार्य और वर्तमान अवलोकन के आधार पर, टेक्स्ट और विजुअल समानता के माध्यम से, मल्टीमॉडल मेमोरी बैंक से लक्ष्य रणनीति द्वारा पहले सफलतापूर्वक निष्पादित Top-K समान ट्रैजेक्टरीज़ ढूंढें, और रोबोट स्थिति जैसे एंड-एफेक्टर पोज़, जॉइंट कोण आदि निकालें।

मॉडलिंग: ट्रैजेक्टरी में विभिन्न स्थितियों के सापेक्ष प्रगति के आधार पर नियंत्रण संकेत दें, और ऑनलाइन रिग्रेशन के माध्यम से लक्ष्य नीति के "स्वाभाविक रूप से लेने वाली" स्थिति सीमा को वास्तविक समय में फिट करें।

ब्रिजिंग: उम्मीदवार स्थितियों का नमूना लें और उनका मूल्यांकन करें, लक्ष्य रणनीति के आरामदायक क्षेत्र में प्रवेश करने की विश्वसनीयता और गति लागत को ध्यान में रखते हुए, सबसे उपयुक्त ब्रिजिंग लक्ष्य चुनें और संक्रमण ट्रैजेक्टरी उत्पन्न करें; जब रोबोट इस स्थिति पर पहुंच जाता है, तो नियंत्रण अगली रणनीति को सौंप दिया जाता है।

यह तंत्र पूरी तरह से इतिहास के निष्पादन डेटा पर ऑनलाइन सीखने पर निर्भर करता है, किसी भी रणनीति के लिए प्लग-एंड-प्ले समर्थित है, बिना नींव के कार्यान्वयन में कोई परिवर्तन किए बिना, और बिना सहयोगी प्रशिक्षण के।

एबलेशन परीक्षण में, मेमोरी ब्रिज को हटाने के बाद, कार्य प्रगति में बहुत अधिक कमी नहीं आई, जिससे पता चलता है कि रणनीति चयन अभी भी मूल रूप से सही है, लेकिन पूर्ण सफलता दर 86.0% से गिरकर 60.4% हो गई। कई कार्य अंतिम कदम तक पहुँच गए, लेकिन स्थिति हस्तांतरण की असंगति के कारण विफल हो गए, जिससे मेमोरी ब्रिज के महत्व की पुष्टि होती है।

04 दो तकनीकी परंपराएँ, एक चुपचाप हो रही अभिसरण

इस पेपर से दृष्टिकोण को दूर खींचकर, हम एक बड़ी शारीरिक प्रौद्योगिकी की छवि बनाना चाहते हैं।

रोबोहार्नेस के लेखक ने देखा कि पिछले तीन वर्षों में VLA के तेजी से विकास के संदर्भ में, पारंपरिक TAMP और परतबद्ध योजनाकरण, जो खुले परिदृश्यों में एंड-टू-एंड VLA की तुलना में सामान्यीकरण क्षमता में स्पष्ट रूप से कमजोर थे, एक समय विकास समुदाय की ध्यान से बाहर हो गए। हालाँकि, इस वर्ष agentic systems और coding agents के तेजी से प्रगति के साथ, परतबद्ध आर्किटेक्चर को नई जीवन प्राप्त हुई है: उच्च-स्तरीय agent, संयोज्य कौशल का उपयोग करके, कार्यों को विघटित कर सकते हैं, उपकरणों को कॉल कर सकते हैं और गतिशील योजना बना सकते हैं, जिससे पारंपरिक परतबद्ध विधियों की सामान्यीकरण क्षमता और अनुकूलनशीलता में महत्वपूर्ण वृद्धि हुई है। इस प्रकार, शैक्षणिक समुदाय पुनः ध्यान केंद्रित कर रहा है और मजबूत सामान्यीकरण क्षमता वाले उच्च-स्तरीय तर्क को विषम निचले-स्तरीय नीतियों के साथ कैसे जोड़ा जाए, इसकी खोज करने लगा है।

इस लेख के लेखक कई कनाडाई पूर्वी विश्वविद्यालयों और अनुसंधान संस्थानों से संबंधित हैं। लेखक ने देखा है कि उत्तरी अमेरिकी रोबोटिक्स अनुसंधान में लंबे समय से दो स्पष्ट शैक्षणिक मूलों वाली तकनीकी परंपराएँ मौजूद हैं: संयुक्त राज्य अमेरिका के पश्चिमी तट, जिसमें स्टैनफोर्ड, बर्कले आदि शामिल हैं, जो learning और scaling पर अधिक जोर देते हैं, और एंड-टू-एंड लर्निंग, डेटा स्केल और मॉडल जनरलाइज़ेशन पर ध्यान केंद्रित करते हैं; जबकि संयुक्त राज्य अमेरिका के उत्तरी पूर्व और कनाडा, जिसमें MIT, टोरंटो विश्वविद्यालय, MILA आदि शामिल हैं, लंबे समय से हियरार्किकल आर्किटेक्चर, सिंबोलिक रीजनिंग, लॉजिकल प्लानिंग और स्ट्रक्चर्ड डिसीजन-मेकिंग पर अधिक महत्व देते हैं।

रोबोहार्नेस के लेखक, बाद वाली श्रृंखला के विस्तार पर हैं।

एम्बॉडिड इंटेलिजेंस के उद्योग में तकनीकी रास्तों का विभाजन स्पष्ट छाप छोड़ गया है। पिछले कुछ वर्षों में तेजी से विकसित हो रही टीमों ने foundation model scaling से agentic hierarchy तक की तकनीकी श्रृंखला का निर्माण किया है: एक वर्ग आम एम्बॉडिड फाउंडेशन मॉडल, VLA और world model पर अधिक जोर देता है, और एकीकृत मॉडल, डेटा स्केल और मॉडल क्षमता में सुधार के माध्यम से सामान्यीकरण की सीमाओं को लगातार विस्तारित करता है; दूसरा वर्ग पुन:उपयोगयोग्य ऑपरेशन स्किल्स और परतदार संरचना पर अधिक ध्यान केंद्रित करता है, और कार्य योजना, स्किल संयोजन और निचले स्तर के नियंत्रण के सहयोग से जटिल कार्यों को पूरा करता है। भारत में, Zhiyuan की टीमें पहले प्रकार के करीब हैं, जबकि Sudo Tech, Magic Atom आदि दूसरे प्रकार को प्रमुखता देते हैं; विदेशों में, Physical Intelligence की pi सीरीज़ लंबे समय से scaling रास्ते का प्रतिनिधित्व करती रही है, जबकि Gemini Robotics, “उच्च-स्तरीय तर्क और योजना + निचले-स्तरीय स्किल निष्पादन” की परतदार परंपरा को जारी रखती है।

दिलचस्प बात यह है कि इस तकनीकी वंशावली का विभाजन स्थिर विरोधाभास नहीं है, बल्कि लगातार विकसित होते हुए पूरक बन रहा है। पिछले कुछ महीनों में, दोनों तकनीकी दिशाओं में स्पष्ट संगम का संकेत दिखाई दे रहा है। उदाहरण के लिए, Physical Intelligence ने pi0.7 में नियंत्रणीयता और कौशल समूह को अधिक केंद्रीय स्थान दिया है; इसी समय, NVIDIA जैसी टीमें भी अधिक परतदार robot agentic systems को लगातार लॉन्च कर रही हैं, जो बेस मॉडल की समझ और तर्क क्षमता को VLA के साथ जोड़ती हैं। समग्र रूप से, foundation model scaling और agentic hierarchy धीरे-धीरे दो स्वतंत्र तकनीकी पथों से एक ही रोबोट सिस्टम में पूरक क्षमताओं में विकसित हो रहे हैं।

05 को संरचना के माध्यम से, अधिक सामान्य बुद्धिमत्ता की ओर बढ़ें

RoboHarness के स्वयं की स्पष्ट सीमाएँ हैं: यह केवल मौजूदा रणनीतियों को शेड्यूल कर सकता है, और ऐसी कोई रणनीति नहीं बना सकता जो सभी रणनीतियों के लिए असंभव हो। Memory Bridge की विश्वसनीयता पर्याप्त ऐतिहासिक निष्पादन डेटा पर निर्भर करती है, और नए जुड़े रणनीतियों के प्रारंभिक चरण में क्षमता मूल्यांकन में अधिक अनिश्चितता होती है।

पेपर का मुख्य तर्क एकीकृत विशाल मॉडल की आवश्यकता को नकारना नहीं है।

लेखक ने जोर देकर कहा कि लंबे समय तक चलने वाले कार्यों का ऑर्केस्ट्रेशन केवल मौजूदा क्षमताओं का संयोजन नहीं है, बल्कि इससे ऐसे क्रॉस-क्षमता और क्रॉस-सीनेरियो निष्पादन डेटा का निरंतर उत्पादन होता है जिन्हें अकेले मॉडल स्वयं प्राप्त नहीं कर सकते। ऐसे डेटा में विभिन्न रणनीतियों के बीच स्विचिंग, संयोजन, विफलता से बचाव और सहयोग की प्रक्रियाएँ दर्ज होती हैं, जो अगली पीढ़ी के सामान्य रोबोट मॉडल के प्रशिक्षण के लिए महत्वपूर्ण स्रोत साबित हो सकती हैं। इस विचार के आधार पर, RoboHarness टीम मिश्रित रणनीति ऑर्केस्ट्रेशन और निष्पादन प्रक्रिया में उत्पन्न डेटा को फिर से नीचली स्तर की रणनीति प्रशिक्षण में पुनः उपयोग करने की दिशा में अनुसंधान कर रही है, जिससे हेटरोजेनियस ऑर्केस्ट्रेशन के निष्पादन का अनुभव मॉडल की मूलभूत क्षमताओं को आगे बढ़ाने में सहायता करता है।

सबसे मजबूत मॉडल की तलाश से लेकर सबसे उपयुक्त क्षमताओं के संगठन तक, एम्बॉडीड इंटेलिजेंस की प्रतिस्पर्धा, सिस्टम स्तरीय डिजाइन में धीरे-धीरे विस्तार हो रही है। हेटरोजिनियस स्ट्रैटेजी ऑर्केस्ट्रेशन और यूनिफाइड लार्ज मॉडल, दो अलग-अलग पहाड़ियों के साथ चलने जैसे हैं, जो अंततः एक ही दूर के लक्ष्य की ओर इशारा करते हैं: रोबोट्स को अधिक सामान्य और अधिक विश्वसनीय बुद्धिमत्ता प्रदान करना।

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।