वांग युनहेन ने अपने उद्यम के बाद पहली बार बड़े मॉडल के परिणाम प्रस्तुत किए।
क्वांटम पोजिशन के अनुसार, हुआवेई नोआ के आर्क के पूर्व निदेशक, Pangu Large Model प्रबंधक वांग युनहेद्वारा स्थापित किए गए बेसिक रिदम ने अपना पहला एजेंट-नेटिव मॉडल NeoHorse लॉन्च किया।
इस मॉडल के नींव की बुनियादी बातों और इन्फ्रास्ट्रक्चर अनुकूलन क्षमताओं को Wuwen Xinqiong प्रदान करता है, जबकि त्सिंहुआ विश्वविद्यालय और पeking विश्वविद्यालय के टीमें एल्गोरिदम और प्रशिक्षण विधियों के अनुसंधान में शामिल हैं, ताकि Agent के पोस्ट-ट्रेनिंग के दौरान डेटा के उपयोग की दक्षता और प्रशिक्षण परिणामों में सुधार किया जा सके।
NeoHorse-1 में 4B और 9B दो संस्करण शामिल हैं, जो Agent के कार्य प्रक्रिया के दौरान आवश्यक क्षमताओं पर केंद्रित हैं, जिनमें उपकरणों का उपयोग करना, वातावरण की प्रतिक्रिया पढ़ना, त्रुटियों की पहचान करना, मार्ग समायोजित करना और अंततः कार्य पूरा करना शामिल है।

हैरनेस एजेंट, टूल उपयोग, कोड और निर्देश अनुसरण सहित 10 मूल्यांकनों में, एजेंटिक पोस्ट-ट्रेनिंग के बाद, 4B मॉडल का समग्र प्रदर्शन 9B बेस मॉडल के बराबर या थोड़ा अधिक हो गया है।

एक कंपनी जो हमेशा से बहु-मॉडल सहयोग पर जोर देती रही है, अचानक अपने मॉडल ट्रेन करना क्यों शुरू कर रही है? प्राइमल रिदम बेस मॉडल टेबल में शामिल होने की तैयारी कर रहा है?
निओहॉर्स के उत्तर से देखा जा सकता है कि दिशा में ऐसा कोई परिवर्तन नहीं हुआ है।
यह मॉडल अधिक तरह से प्रारंभिक लय के अतीत के बहु-मॉडल निष्पादन के अनुभव को दर्शाता है, जो पहली बार मॉडल पैरामीटर में प्रवेश करता है।
एजेंट के लिए मॉडल चुनने वाली कंपनी भी मॉडल का प्रशिक्षण शुरू कर रही है
लंबे समय तक, स्कोर अक्सर मॉडलों की तुलना का मुख्य आधार रहा है।
लेकिन जब मॉडल को एजेंट सिस्टम में डाला जाता है और पूर्ण कार्य सौंपे जाते हैं, तो एकल स्कोर की व्याख्यात्मक क्षमता कम हो जाती है।
एक कार्य में, मॉडल को केवल एक तर्कसंगत उत्तर देना ही नहीं, बल्कि प्रक्रिया के दौरान निरंतर पर्यावरण प्रतिक्रिया पढ़नी होती है, त्रुटियों को संभालना होता है, और वास्तविक प्रगति के आधार पर भविष्य के पथ को समायोजित करना होता है; विभिन्न चरणों में मॉडल क्षमताओं की आवश्यकताएँ भिन्न होती हैं।
इससे, प्राइमल रिदम टीम ने एक निष्कर्ष निकाला।
अनन्यकरण न होना AI उद्योग में एक दीर्घकालिक संरचना होगी।
जितने अधिक मॉडल होंगे, उतना ही अधिक विशेषीकरण होगा, और उतना ही स्पष्ट रूप से कीमत और क्षमता में अंतर दिखेगा, इसलिए कुछ प्रश्नों के उत्तर देने के लिए एक प्रणाली की आवश्यकता होगी—
इस चरण के लिए कौन सा मॉडल उपयुक्त है? कौन से चरणों को कम लागत वाले मॉडल पर सौंपा जा सकता है? कब तक अधिक शक्तिशाली निष्पादन और निष्पादन क्षमता वाले मॉडल पर अपग्रेड करने की आवश्यकता होती है? एक निष्पादन पथ अवरुद्ध होने पर, किसे इसे संभालना चाहिए? क्या कई मॉडल समानांतर रूप से समाधान प्रस्तुत कर सकते हैं और फिर परिणामों को एकत्रित किया जा सकता है?
वांग युनहेटीम ने इस स्तर की प्रणाली को रूटिंग हार्नेस कहा है (उनके अंतर्गत आने वाले संबंधित ओपन सोर्स प्रोजेक्ट OpenSquilla ने कई मॉडल्स को एकीकृत इंटरफेस के माध्यम से जोड़ दिया है, जिससे एजेंट के चलने के दौरान सूक्ष्म स्तर पर रूटिंग, मॉडल स्विचिंग और बहु-मॉडल सहयोग संभव होता है)।

इसी विचार के आधार पर, प्राइम लीप अपना मॉडल ट्रेन करने का कोई विशेष कारण नहीं लगता। बाजार में पर्याप्त मॉडल उपलब्ध हैं, और आवश्यकता के अनुसार उनका उपयोग करना अधिक लचीला लगता है।
जब स्केड्यूलिंग सिस्टम लगातार चल रहा होता है, तो एक अन्य प्रकार के संपत्ति संचित होने लगती हैं, जैसे "किस कार्य के लिए कौन सी क्षमता आवश्यक है", "मॉडल किस चरण में विफल होता है", "कौन सा ठीक करने का मार्ग प्रभावी है", "कौन सा परिणाम पर्यावरण सत्यापन से गुजर सकता है".
ये जानकारी एक ओर रूटिंग निर्णय में सुधार करती है, दूसरी ओर प्रशिक्षण मूल्य भी प्राप्त करने लगती है।
यह एक ऐसा प्लेटफॉर्म की तरह है जो कई ब्रांडों और उपभोक्ताओं को जोड़ता है। व्यापार के दौरान जमा होने वाली मांग, समीक्षाएँ और उपयोग प्रतिक्रियाएँ, उत्पादों को अधिक उपयुक्त उपभोक्ताओं तक पहुँचाने में मदद कर सकती हैं और उत्पाद विकास को भी आगे प्रतिक्रिया दे सकती हैं।
The process of the platform service marketplace thus becomes a data source for the next round of product improvements.
NeoHorse का कार्य है कि Harness में जमा हुए कुछ निष्पादन अनुभवों को मॉडल क्षमताओं में परिवर्तित करना।
Multi-model के द्वारा तय की गई यात्रा को Agent-Native मॉडल में अभ्यास करें
NeoHorse के डेटा स्रोत का उल्लेख करना योग्य है।
इसका केंद्रीय अभिलेख Routing Harness द्वारा उत्पन्न Agent निष्पादन संकेतों को जनसामान्य डेटा के साथ मिलाकर, Agent के बाद प्रशिक्षण के लिए डेटा प्रणाली बनाना है।
एजेंट हैरनेस में एक कार्य पूरा करने पर, पूरा निष्पादन रिकॉर्ड छोड़ देता है।
- टास्क इनपुट → राउटर को किन क्षमताओं की आवश्यकता है
- → किसी मॉडल का चयन करें
- मॉडल निष्कर्ष निकालता है और उपकरणों को कॉल करता है
- → परिवेश द्वारा परिणाम लौटाया गया
- → मॉडल जारी रखता है या त्रुटि होती है
- → सिस्टम मॉडल बदलता है या पथ समायोजित करता है
- → कार्य पूरा हो जाता है या असफल हो जाता है
आम तौर पर, आम प्रश्नों के उत्तर डेटा केवल "प्रश्न" और "उत्तर" दोनों छोरों पर केंद्रित होता है।
रूटिंग हार्नेस के डेटा में अतिरिक्त कुछ स्तरों की जानकारी भी शामिल है: कार्य को किन क्षमताओं की आवश्यकता है, सिस्टम ने कौन सा निष्पादन निर्णय लिया, और परिवेश ने अंततः क्या प्रतिक्रिया दी।
उदाहरण के लिए, राउटर शुरू में यह निर्णय लेता है कि कोई कार्य केवल सामान्य मॉडल की आवश्यकता रखता है, लेकिन जब निष्पादन के दौरान लगातार विफलताएँ आती हैं, तो यह अधिक क्षमता वाले मॉडल पर अपग्रेड हो जाता है, जिससे कार्य पूरा हो पाता है।
इस ट्रैक में एक असफलता से बहुत अधिक जानकारी शामिल है।
सिस्टम जान सकता है कि प्रारंभिक क्षमता आकलन निम्न हो सकता है, मॉडल किस चरण में समस्या का सामना कर रहा है, अधिक शक्तिशाली मॉडल ने कौन सी रणनीति अपनाई, कौन सा निष्पादन मार्ग अंततः पर्यावरण सत्यापन से गुजरा, और कार्य पूरा करने के लिए कितने अतिरिक्त टोकन और समय का उपयोग हुआ।

महत्वपूर्ण बात यह है कि प्राइमल रिदम द्वारा देखा गया कोई भी मॉडल की अपनी क्षमता का आकलन नहीं है, बल्कि कई मॉडल्स द्वारा समान कार्यों के सामने छोड़े गए क्षैतिज प्रदर्शन हैं।
इसमें सफल मार्ग के साथ-साथ बीच में विफल होकर अन्य मॉडल द्वारा संभाले गए निष्पादन रिकॉर्ड भी शामिल हैं।
From a training perspective, failure trajectories may even provide more information.
अंतिम उत्तर मॉडल को एक कार्यान्वयन योग्य मार्ग बता सकता है, जबकि विफलता और ठीक करने की प्रक्रिया अन्य दो प्रकार के ज्ञान—जहाँ त्रुटियाँ होने की संभावना है और त्रुटि के बाद कैसे समायोजित करें—को पूरक करती है।
अलग-अलग मॉडल द्वारा दिए गए परिणामों के अलावा, अलग-अलग मॉडल द्वारा कार्य परिवेश में वास्तविक रूप से अनुसरण की गई पथों को भी सीखना, यह NeoHorse की एक पहचान वाली बात है।
Agent का कार्य दिनचर्या मॉडल क्षमता में कैसे बदलता है?
सभी लॉग को ट्रेनिंग में डालने से स्वतः एक मजबूत एजेंट मॉडल प्राप्त नहीं होता।
एजेंट की ट्रैजेक्टरी आमतौर पर लंबी होती है, जिसमें सिस्टम प्रॉम्प्ट, उपयोगकर्ता अनुरोध, उपकरण पैरामीटर, निष्पादन परिणाम, दोहराए गए प्रयास, त्रुटि संदेश और बहुत सारे मध्यवर्ती आउटपुट मिले होते हैं।
कुछ चरणों में प्रशिक्षण का मूल्य होता है, कुछ अधिक शोर के करीब होते हैं। कुछ ट्रैजेक्टरी प्रक्रियाएँ पूर्ण होती हैं, लेकिन परिणाम स्वयं सही नहीं होते।
प्राइमल रिदम को सबसे पहले यह समस्या हल करनी होगी कि "कौन से डेटा मॉडल के लिए अध्ययन के योग्य हैं"।
टेक्निकल रिपोर्ट के अनुसार, प्रत्येक ट्रैक की संरचनात्मक जांच की जाती है, जिससे यह सुनिश्चित होता है कि अनुरोध, मॉडल प्रतिक्रिया, उपकरण आह्वान और पर्यावरण परिणाम एक-दूसरे से मेल खाते हैं।
फिर, सिस्टम छह आयामों के आधार पर कार्यक्षमता का मूल्यांकन करेगा, जिसमें उपयोगकर्ता लक्ष्य पूरा हुआ या नहीं, निर्देशों का पालन हुआ या नहीं, उपकरणों का उपयोग उचित था या नहीं, निष्कर्ष का समर्थन साक्ष्यों से हुआ या नहीं, त्रुटि के बाद पुनर्स्थापन संभव थी या नहीं, और मॉडल ने क्या समय पर कार्य समाप्त किया।
यहाँ एजेंट प्रशिक्षण में आमतौर पर भ्रमित होने वाली समस्याएँ भी शामिल हैं।
कार्य समाप्त होना उपयोगकर्ता के लक्ष्य को पूरा करने के बराबर नहीं है—मॉडल का आउटपुट “कार्य पूरा हो गया है” केवल यह दर्शाता है कि निष्पादन प्रक्रिया रुक गई है, लेकिन यह साबित नहीं करता कि डिलीवरेबल उपयोगकर्ता की आवश्यकताओं के अनुरूप है।
इसलिए, पूर्णता स्थिति, लक्ष्य संतुष्टि, पर्यावरण साक्ष्य और उपयोगकर्ता प्रतिक्रिया को अलग-अलग संकेतों के रूप में दर्ज किया जाना चाहिए।
डेटा के फिल्टरिंग के बाद, रूटिंग सिग्नल एक अन्य भूमिका निभाना शुरू करता है।
राउटर कार्य के लिए आवश्यक क्षमता का अनुमान लगाता है और विभिन्न क्षमता स्तरों के संकेत बनाता है। निओहॉर्स प्रशिक्षण के दौरान इसके आधार पर नमूनों के क्रम को व्यवस्थित करता है, पहले कम क्षमता आवश्यकता वाले कार्यों को सीखता है, फिर धीरे-धीरे अधिक जटिल निष्पादन पथों को जोड़ता है, जबकि मूल कार्यों को भी कवर किए रखता है।
इस विधि को रूटिंग-गाइडेड करिकुलम कहा जाता है, यानी रूटिंग द्वारा निर्देशित करिकुलम लर्निंग।
सरल शब्दों में समझें, रूटिंग सिग्नल ऑनलाइन यह तय करता है कि कौन सा कार्य किसे सौंपा जाए, और ट्रेनिंग चरण में यह मॉडल को बता सकता है कि कौन से कार्य पहले सीखने के लिए अधिक उपयुक्त हैं और कौन से बाद में।

नियमित निरीक्षण सूक्ष्म समायोजन के अलावा, नियोहॉर्स ने ऑन-पॉलिसी डिस्टिलेशन का भी उपयोग किया है।
इसे इस प्रकार समझा जा सकता है कि पहले छात्र अपने तरीके से समस्या को हल करें, और फिर शिक्षक छात्र के वास्तविक कदमों के आधार पर मार्गदर्शन दें।
इस तरह, टीचर मॉडल एक पूर्वनिर्धारित सेट के स्थान पर छात्र मॉडल के वर्तमान वितरण के अंतर्गत आने वाली समस्याओं को संभालता है।

इन चरणों के बाद, बहु-मॉडल लंबे समय तक किए गए कार्यों से जमा अनुभव को NeoHorse के पोस्ट-ट्रेनिंग के लिए उपयोग किया जाने लगा है।
After training, what is improved?
वर्तमान तकनीकी रिपोर्ट के परिणामों के अनुसार, Agentic Post-Training 4B और 9B दोनों स्केल पर स्थिर सुधार लाता है।
इसमें, NeoHorse-1-4B का समग्र प्रदर्शन (मैक्रो-औसत स्कोर 58.94 से बढ़कर 64.87 हो गया) समान आकार के SOTA के बराबर है—यह सभी तुलनात्मक बेंचमार्क पर अपने आधार मॉडल Qwen3.5-4B को पार कर गया है और 4B समान आकार के मॉडल्स में समग्र रूप से अग्रणी है।

लेकिन SOTA का अर्थ यह नहीं है कि क्षमता समान रूप से फैली हुई है।
अधिक विस्तार से परिणाम देखने पर, 4B मॉडल के सुधार मुख्य रूप से एक प्रकार के कार्य पर केंद्रित हैं।
इस तरह के कार्यों के लिए आमतौर पर एक अपेक्षाकृत स्पष्ट कार्य प्रवाह होता है, जिसमें परिवेश की प्रतिक्रिया देखी जा सकती है, सफलता और असफलता की पुष्टि की जा सकती है, और अंतिम डिलीवरी मानदंड भी स्पष्ट होते हैं।
उदाहरण के लिए, एक प्रोजेक्ट स्केड्यूलिंग टास्क में, बेस मॉडल ने वर्किंग डायरेक्टरी में फाइलें ढूंढ लीं, लेकिन नवीनतम निर्भरता सीमाओं को शामिल करने वाले ईमेल को पढ़ना जारी नहीं रखा।
परिणामस्वरूप, यह समाप्त हो चुकी जानकारी के आधार पर योजना बनाता है और फ़ाइल को गलत स्थान पर सहेजता है।
पोस्ट-ट्रेन्ड मॉडल नए साक्ष्य को जारी रखता है, पाता है कि प्रतिबंध बदल गए हैं, शेड्यूल को पुनः गणना करता है, परिणामों की पुष्टि करता है, और आउटपुट को सही स्थान पर सहेजता है।
अंतर Agent निष्पादन श्रृंखला में दिखाई देता है।
एक मॉडल को लगभग पता है कि कार्य कैसे करना है, दूसरा मॉडल प्रमाण प्राप्त करने, प्रतिबंधों को अपडेट करने, निष्पादित करने, सत्यापित करने और डिलीवर करने को एक अधिक पूर्ण कार्य प्रवाह में जोड़ चुका है।
समान आकार के SOTA को प्राप्त करना इस बात का अर्थ नहीं है कि NeoHorse-1-4B सभी कार्यों को संभाले। प्राइमल रिदम विभिन्न मॉडलों की क्षमता की सीमाओं को कैसे सूक्ष्मता से विभाजित किया जाए, इस पर अधिक ध्यान देता है।
जो कार्य 4B स्थिर रूप से पूरा कर सकता है, उसके लिए बड़े मॉडल को कॉल करने की आवश्यकता नहीं होती; जो कार्य अधिक शक्तिशाली मॉडल द्वारा पूरा किया जा सकता है, उसे लगातार सबसे महंगे फ्लैगशिप मॉडल तक अपग्रेड करने की आवश्यकता नहीं होती; जब कठिनाई आगे बढ़ती है, तो उसे मॉडल पूल में अधिक क्षमता वाले मॉडल को सौंपा जाता है।
यहाँ रूटिंग हार्नेस और स्व-विकसित मॉडल के बीच का संबंध सटीक रूप से जुड़ता है।
मॉडल लगातार अपने द्वारा संभाले जा सकने वाले कार्यों की लागत सीमा को बाहर की ओर विस्तारित करता है, जबकि रूटिंग सिस्टम कार्य की कठिनाई और निष्पादन के आधार पर विभिन्न क्षमताओं को उचित स्थान पर रखता है।

API कॉल शुल्क के अलावा, इस मॉडल का क्या अन्य मूल्य है?
इसके साथ, प्राइम लीव्स के विभिन्न उत्पाद रेखाओं के बीच का संबंध धीरे-धीरे स्पष्ट हो रहा है।
पहला स्तर OpenSquilla ओपन सोर्स संस्करण है।
प्रिमिटिव बीट फ्री, ओपन सोर्स, लोकल डिप्लॉय और डेस्कटॉप उत्पादों के माध्यम से बहु-मॉडल एजेंट का उपयोग करने के लिए डेवलपर्स के लिए बाधाओं को कम करता है और डेवलपर्स और कार्य प्रवेश बिंदुओं को जोड़ता है।
दूसरी परत TokenRhythm API है।
इसकी स्थिति "चीन का OpenRouter" के समान है, जो एक समान इंटरफ़ेस के माध्यम से विभिन्न मॉडल्स के कॉल क्षमता प्रदान करता है, डेवलपर्स और उद्यमों की मॉडल उपयोग की आवश्यकताओं को पूरा करता है, और मॉडल निर्माताओं को अधिक अनुप्रयोग परिदृश्यों से जोड़ने में मदद करता है।
एंटरप्राइज को बड़ी संख्या में मॉडल इंटरफेस को अलग-अलग अनुकूलित करने की आवश्यकता नहीं है, ताकि वे मॉडल का मूल्यांकन, चयन और स्विच करने में आसानी हो।
तीसरा स्तर व्यवसायों के लिए सेवाओं और डिप्लॉयमेंट क्षमता है।
फाइनेंस, मैन्युफैक्चरिंग आदि उद्योगों को अधिकार, स्थिरता, प्राइवेट डिप्लॉयमेंट और सर्विस गारंटी के लिए अलग-अलग आवश्यकताएँ होती हैं, जिससे आगे का व्यावसायिक स्थान बनता है।
चौथी परत नियोहॉर्स है।
NeoHorse ने पहले एक महत्वपूर्ण कनेक्शन की पुष्टि की: हैरनेस निष्पादन के दौरान उत्पन्न वैध अनुभव, चयन और प्रशिक्षण के बाद, वास्तव में मॉडल की क्षमता में परिवर्तित होने का अवसर होता है।
इस प्रकार, प्राइमल लीव्स द्वारा पहले प्रस्तावित व्यावसायिक फ्लाइव्हील ने पहली बार मॉडल स्तर पर परिणाम दिए।
यह बिंदु अनुमानित लेखांकन को अनुकूलित करने की संभावना भी लाता है।
यदि नियोहॉर्स भविष्य में एक स्थिर, उच्च आवृत्ति और स्पष्ट मानकों वाले एजेंट कार्यों को संभाल पाता है, तो प्लेटफॉर्म के पास एक स्वतंत्र रूप से नियोजित करने की क्षमता बढ़ जाएगी।
ये कार्य तर्क लागत, प्रतिक्रिया गति और स्थिरता को आगे अनुकूलित कर सकते हैं और मॉडल आपूर्ति कॉन्फ़िगरेशन को अधिक लचीला बनाते हैं। जैसे-जैसे मॉडल आगे विकसित होता है, इसके द्वारा कवर किए जा सकने वाले कार्यों की सीमा और विस्तारित हो सकती है।
इस दृष्टिकोण से, प्राइम रिदम जो करना चाहता है, वह निर्माण प्रणाली में प्रक्रिया के स tíchुभव के समान है।
बाहरी मॉडल इकोसिस्टम विभिन्न क्षमताएँ प्रदान करता है, जिसे Harness संगठित और निष्पादित करता है; निष्पादन प्रक्रिया के दौरान प्राप्त अनुभव, अगली चक्र मॉडल सुधार में शामिल किए जाते हैं।
संयोजन मॉडल, सेवाएँ प्रदान करने से लेकर सेवाओं से उत्पन्न अनुभव को मॉडल क्षमताओं में बदलना और फिर दक्षता और गुणवत्ता में सुधार करना, यही प्राइमल मूवमेंट द्वारा API संग्रह प्लेटफॉर्म के बाहर एक और कदम है।
What is the primitive rhythm building beyond the model?
प्राइम रिदम की कल्पना में चक्र को लगभग कुछ व्यावसायिक रेखाओं से जोड़ा जा सकता है:
- राउटिंग हार्नेस डेवलपर्स को एजेंट कार्यों से जोड़ता है
- → टोकनरिदम API कनेक्शन मॉडल आपूर्ति और कॉल डिमांड
- → हार्नेस संगठन द्वारा निष्पादित, रूटिंग और कार्य ट्रैक एकत्रित करें
- उपलब्ध ट्रैजेक्टरी को मॉडल प्रशिक्षण के लिए छांटा गया है
- → अपडेटेड मॉडल हारनेस लौटाता है, अनुकूलन कार्य में भाग लें
- → कार्य अनुभव में सुधार करें, बेहतर प्रतिक्रिया गति और लागत कुशलता का पता लगाएं
- → निरंतर उपयोग, भुगतान और संचालन की दक्षता में सुधार
- → अगले चरण की सेवा सुधार और अनुसंधान एवं विकास के लिए समर्थन
एक महत्वपूर्ण परिवर्तन यह है कि मॉडल द्वारा उत्पन्न ट्रैजेक्टरी केवल उपभोग और कॉल चरणों तक सीमित नहीं रहती, बल्कि यह अगली पीढ़ी के मॉडल प्रशिक्षण का स्रोत भी बन सकती है।
एजेंट एक कार्य पूरा करता है, तो हारनेस को क्षमता की सीमाओं के बारे में एक और अवलोकन मिलता है।
एक मॉडल विफल हो गया, प्रणाली जानती है कि क्षमता का अंतर कहाँ हो सकता है; दूसरा मॉडल सफलतापूर्वक ले लेता है, प्रणाली को एक नया ठीक करने का रास्ता मिलता है; उपयोगकर्ता अंततः परिणाम स्वीकार करता है या अस्वीकार करता है, जिससे एक बाहरी प्रतिक्रिया की एक और परत मिलती है।
जितने अधिक कार्य एकत्रित होंगे, उतना ही सटीक होगा रूटिंग निर्णय; जब रूटिंग निर्णय अधिक सटीक हो जाएंगे, तो चयनित प्रशिक्षण ट्रैजेक्टरी वास्तविक कार्यों के अधिक समीप होंगी; जब मॉडल कार्यों के अनुकूल हो जाएगा, तो API सेवा को बेहतर लागत और अनुभव प्राप्त होने का अवसर मिलेगा।
यदि यह चक्र लंबे समय तक लागू हो सकता है, तो प्राथमिक लहर और सामान्य API संग्रहण प्लेटफॉर्म के बीच का अंतर धीरे-धीरे रूटिंग नियमों और मॉडल सूची से ट्रेनिंग कार्य डिज़ाइन, ट्रेनिंग विधियों और मॉडल पैरामीटर्स में चला जाएगा।
अंत में उत्पाद प्रदर्शन के माध्यम से प्रस्तुत किया जाएगा।
RSI तक कितनी दूरी है?
उपरोक्त RSI (Recursive Self-Improvement, आवर्ती स्व-सुधार) की चर्चा शुरू करने का संदर्भ है।
Primal Rhythm currently verifies the RSI range, which is closer to an engineering闭环, and can be divided into two parts.
पहला Data-RSI है।
मॉडल Harness में लगातार कार्य निष्पादित करता रहता है, और प्रत्येक रूटिंग, टूल कॉल, विफलता पुनर्स्थापना और अंतिम परिणाम से नए संरचित रिकॉर्ड बनते हैं।
इन रिकॉर्ड्स को फिल्टर करके और प्रोसेस करके बाद के ट्रेनिंग डेटा पूल में शामिल किया जा सकता है। इस प्रकार, ट्रेनिंग डेटा को सिर्फ मैनुअल रूप से पहले से तैयार करने पर ही निर्भर रहना आवश्यक नहीं है, बल्कि यह सिस्टम के लगातार उपयोग के साथ बढ़ सकता है।
दूसरा Model-RSI है।
सिस्टम परीक्षण परिणामों के आधार पर वर्तमान मॉडल की क्षमता के कमजोर पहलुओं की पहचान करता है, अगले प्रशिक्षण डेटा वितरण को समायोजित करता है, मॉडल को अपडेट करता है, और फिर नया मॉडल Harness में वापस लौटाकर निष्पादन के लिए रख देता है।
इसका अर्थ है कि मॉडल निष्पादन के अनुभव से सीखता है, और अद्यतन मॉडल नए कार्यों को निष्पादित करके अगले प्रशिक्षण चक्र के लिए नए प्रतिक्रिया उत्पन्न करता है।

हालांकि, निओहॉर्स द्वारा अभी तक सार्वजनिक जानकारी के आधार पर, इस व्यवस्था को पूर्ण RSI माना नहीं जा सकता।
वर्तमान तकनीकी रिपोर्ट एक “निष्पादित—मूल्यांकन—चयन—अद्यतन” बंद चक्र की पुष्टि करती है। सिग्नल डिज़ाइन, पुरस्कार डिज़ाइन और प्रशिक्षण प्रक्रिया अभी भी मानव द्वारा निर्धारित हैं, और कई पीढ़ियों के मॉडल आवर्तन के बाद भी लाभ का स्थिर रूप से प्राप्त होना सुनिश्चित करने के लिए अधिक प्रयोगों की आवश्यकता है।
इसलिए अधिक सटीक व्यक्ति यह है कि नियोहॉर्स ने इस प्रकाशन के लिए दो स्तरों की पुष्टि पूरी की है।
एक व्यावसायिक स्तर है, जहाँ सिस्टम द्वारा इकट्ठा किए गए डेटा को मॉडल ट्रेनिंग में उपयोग किया जा सकता है और इसे मापने योग्य क्षमता वृद्धि में परिवर्तित किया जा सकता है।
एक और परत तकनीकी है, जिसमें वांग युनहेन की अगुवाई में स्टार्टअप टीम ने RSI दिशा की ओर एक चरण का इंजीनियरिंग प्रमाणण पूरा किया।
अधिक मॉडल होने से कंपनी अधिक मूल्यवान हो जाती है?
Of course, for the story of Primal Rhythm to hold true, several hurdles still need to be overcome.
पहला, ओपन सोर्स इकोसिस्टम क्या लगातार API उपयोग और आय में परिवर्तित हो सकता है।
दूसरा, क्या प्रक्रिया प्रकारों की वृद्धि के साथ, प्रणाली लगातार पर्याप्त उच्च गुणवत्ता वाले, प्रशिक्षण के लिए उपयोग के योग्य एजेंट ट्रैजेक्टरी प्राप्त कर सकती है।
तीसरा, मॉडल क्षमता में सुधार के बाद, क्या यह स्थिर रूप से बेहतर कार्य अनुभव और कार्यक्षमता में परिवर्तित हो सकता है, और इसे आगे व्यापार डेटा पर दर्शाया जा सकता है।
चौथा, बहु-चरण मॉडल आवर्तन के बाद, क्षमता में वृद्धि कितने समय तक जारी रहेगी।
इन सभी प्रश्नों के लिए अधिक समय तक निरीक्षण की आवश्यकता है।
और एक और अनिवार्य चर— DeepSeek Qwen MiniMax मॉडल निर्माता भी Harness और Agent उत्पादों की ओर बढ़ रहे हैं, और मॉडल और Agent बुनियादी ढांचे का ऊर्ध्वाधर एकीकरण का प्रवाह स्पष्ट होता जा रहा है।
उदाहरण के लिए, प्राइमल रिदम के संदर्भ में, इस कंपनी का वर्तमान में एक अंतर यह है कि यह मॉडल-निरपेक्ष है और मॉडल के बीच निष्पादन के दौरान उत्पन्न क्रॉस-मॉडल तुलनात्मक डेटा है।
लेकिन यदि मॉडलों के बीच क्षमता का अंतर पर्याप्त बड़ा है, तो मॉडल-क्रॉस स्केड्यूलिंग एक स्वतंत्र व्यवसाय बन सकती है; यदि शीर्ष मॉडल धीरे-धीरे अधिक कार्यों को कवर करने लगते हैं, या निर्माता स्वयं Routing, टूल कॉल और Agent फ्रेमवर्क को एक साथ पैक कर देते हैं, तो मध्यवर्ती स्तर के लिए छोड़ा गया स्थान संकुचित हो जाएगा।
जब ऊपरी क्षमताएँ और अधिक मजबूत और सस्ती होती जा रही हों, तो इस मध्य स्तर को क्यों बनाए रखना चाहिए?
For Primal Rhythm, NeoHorse has added at least one new perspective to this issue.
पहले यह साबित कर चुका था कि यह "मॉडल का उपयोग कर सकता है", अब यह प्रयास कर रहा है कि लंबे समय तक मॉडल के उपयोग से जमा हुए डेटा को भी अपनी मॉडल क्षमता में बदला जा सके।
अगर यह रास्ता काम करता है, तो प्राइमल रिदम की रक्षा केवल रूटिंग स्ट्रैटेजी तक ही सीमित नहीं होगी; अगर यह काम नहीं करता है, तो यह अभी भी सभी मॉडल मिडलेयर्स के सामने आने वाली समस्याओं का सामना करेगा।
GitHub: https://github.com/TokenRhythm/NeoHorse
हग फेस: https://huggingface.co/collections/TokenRhythm/neohorse-1
यह लेख वेचेन ग्रुप "क्वांटम बिट" से आया है, लेखक: हेंगयू
