मेटा और इलिनोइस विश्वविद्यालय ने EvoHarness-RL विकसित किया, जिससे AI एजेंट की सफलता की दर 96.9% तक बढ़ गई

iconCryptoBriefing
साझा करें
AI summary iconसारांश
मेटा और इलिनोइस विश्वविद्यालय के शोधकर्ताओं ने एवोहार्नेस-आरएल, एआई एजेंट्स के लिए एक स्व-विकसित रनटाइम लेयर विकसित किया है। इस प्रणाली ने मानक बेंचमार्क पर 47.9% से बढ़कर 96.9% सफलता की दर हासिल की। यह ढांचा जटिल कार्यों को संभालने के लिए विश्वास, प्रगति और अनुभव (BPE) के संरचित बाहरी स्टेट का उपयोग करता है। इसमें हार्नेस एनीलिंग और विकास जैसे उभरते हुए व्यवहार दिखाई देते हैं। यह प्रगति CFT प्रयासों को प्रभावित कर सकती है और क्रिप्टो बाजारों में तरलता में सुधार कर सकती है।

मेटा एआई और इलिनोइस यूनिवर्सिटी अर्बाना-चैम्पेन के शोधकर्ताओं ने एक नया पेपर प्रकाशित किया है, जिसमें इवोहार्नेस-आरएल को पेश किया गया है, एक ट्रेनेबल कोऑर्डिनेशन लेयर जो बड़े भाषा मॉडल एजेंट्स को अपना बाहरी स्टेट बनाने, एक्सेस करने और प्रबंधित करने की अनुमति देता है। परिणाम: एक मानक बेंचमार्क पर 47.9% से बढ़कर 96.9% सफलता की दर।

EvoHarness-RL वास्तव में क्या करता है

LLM एजेंट्स के पास सीमित संदर्भ विंडोज होती हैं। जब कोई कार्य कई चरणों में फैला होता है, जिसमें डायनामिक API कनेक्शन, सर्वर लॉग, लंबित उपलक्ष्य और त्रुटि पुनर्प्राप्ति शामिल होती हैं, तो मॉडल की आंतरिक स्मृति पर्याप्त नहीं होती। इसे बाहरी सहारे की आवश्यकता होती है ताकि यह ट्रैक कर सके कि वह दुनिया के बारे में क्या मानता है, उसने कितनी प्रगति की है, और अतीत की गलतियों से उसने क्या सीखा है।

इस ढांचे में तीन घटकों—विश्वास, प्रगति और अनुभव—के आसपास एक संरचित बाहरी अवस्था शामिल है, जिसे सामूहिक रूप से BPE कहा जाता है। विश्वास एजेंट की अपने परिवेश के बारे में वर्तमान समझ को पकड़ता है। प्रगति पूर्ण और लंबित उपलक्ष्यों को ट्रैक करती है, ताकि एजेंट कदम छोड़ने या काम को दोहराने से बच सके। अनुभव त्रुटियों से सीखे गए पाठों को संग्रहीत करता है, जैसे कि API दर सीमाओं के कारण API एक बैच को अस्वीकार कर देता है, ताकि एजेंट अपनी दृष्टिकोण को अनुकूलित कर सके।

प्रशिक्षण दो चरणों में होता है। पहले, विशेषज्ञ प्रदर्शनों का उपयोग करके नियंत्रित सूक्ष्म-समायोजन मॉडल को हैरनेस के साथ बातचीत करना सिखाता है। फिर, एक लागत-जागरूक अनुकूलन तकनीक, जिसे समूह सापेक्ष नीति अनुकूलन या GRPO कहा जाता है, कार्य प्रदर्शन और हैरनेस कॉल की गणना लागत के बीच संतुलन बनाने के लिए एजेंट के व्यवहार को सुधारती है।

विज्ञापन

शोधकर्ताओं ने अपने दृष्टिकोण का परीक्षण ALFWorld पर Qwen3-8B मॉडल का उपयोग करके किया, जो एक बेंचमार्क है जिसमें एजेंट्स को बहुत सारे चरणों में घरेलू कार्य पूरा करने की आवश्यकता होती है। परिचित वातावरण में 96.9% सफलता दर अपने आप में प्रभावशाली है, लेकिन शायद अधिक महत्वपूर्ण अज्ञात वातावरण में 86.6% सफलता दर है।

दो व्यवहार जिन्हें शोधकर्ताओं ने स्पष्ट रूप से प्रोग्राम नहीं किया

कागजात में दो उभरती हुई घटनाओं पर जोर दिया गया है, जो प्रशिक्षण के दौरान सामने आईं, जिनमें से कोई भी सीधे रूप से डिज़ाइन नहीं की गई थी।

पहला है "हैरेस एनीलिंग।" समय के साथ, एजेंट रूटीन हैरेस ऑपरेशन्स को अंतर्निहित करना शुरू कर देता है, जिससे बाहरी स्टेट की जांच करने की आवृत्ति कम हो जाती है। हैरेस कॉल्स कम होती हैं इसलिए नहीं कि सिस्टम खराब हो रहा है, बल्कि इसलिए कि मॉडल ने पैटर्न्स को समझ लिया है।

दूसरा है "विकास का उपयोग करना।" जैसे-जैसे एजेंट प्रशिक्षण लेता है, यह अपने बाहरी राज्य को संपीड़ित और पुनर्गठित करना सीखता है, ताकि यह विशिष्ट कार्य प्रकारों के लिए अधिक उपयुक्त हो जाए। BPE प्रतिनिधित्व मानव हस्तक्षेप के बिना ही अधिक पतला और विशिष्ट हो जाता है।

पिछले कार्य पर आधारित

EvoHarness-RL, मार्च 2026 के एक पिछले प्रोजेक्ट, मेटा-हार्नेस पर आधारित है, जो एजेंटिक सर्च तकनीकों के माध्यम से हार्नेस कोड को अनुकूलित करने पर केंद्रित था। जहां मेटा-हार्नेस हार्नेस को सर्च के माध्यम से सुधारने योग्य कोड के रूप में मानता था, वहीं EvoHarness-RL पूरी समन्वय परत को ऐसा कुछ मानता है जिसे मॉडल स्वयं सीखकर बना सकता है और सुधार सकता है।

पेपर में SkillOS और SkillRL जैसे मौजूदा एजेंट फ्रेमवर्क्स की तुलना में अनदेखे कार्यों पर सुधार की भी रिपोर्ट की गई है। EvoHarness-RL के लिए परिचित और नए वातावरणों पर प्रदर्शन के बीच अंतर लगभग 10 प्रतिशत बिंदु है, जबकि प्रतिस्पर्धी दृष्टिकोणों के लिए यह गिरावट काफी अधिक है।

एंटरप्राइज एआई डिप्लॉयमेंट के लिए इसका क्या अर्थ है

नियंत्रित परिवेश में सफलता की दर 48% से बढ़कर 97% हो जाना कोई सामान्य सुधार नहीं है। 86.6% सामान्यीकरण दर भी महत्वपूर्ण है, क्योंकि वास्तविक दुनिया के उद्यम कार्य लगभग कभी ट्रेनिंग डेटा के समान नहीं होते।

GRPO प्रशिक्षण चरण में एक्सटर्नल हैरनेस कॉल्स की लागत को ध्यान में रखते हुए बनाई गई अनुकूलन प्रक्रिया एक व्यावहारिक चिंता को भी सुलझाती है। बाहरी हैरनेस कॉल्स मुफ्त नहीं होतीं। ये कंप्यूटिंग संसाधनों का उपयोग करती हैं और लेटेंसी बढ़ाती हैं। हैरनेस एनीलिंग के माध्यम से एजेंट को अनावश्यक कॉल्स को कम करने के लिए प्रशिक्षित करके, फ्रेमवर्क समय के साथ अधिक कुशल हो जाता है बिना सटीकता को प्रभावित किए।

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।