चीनी स्टार्टअप माइंड लैब ने 748B पैरामीटर्स के साथ मैकारॉन-वी1 मॉडल लॉन्च किया, जो कोड टास्क्स में ऑपस 4.8 को पीछे छोड़ देता है

iconMetaEra
साझा करें
AI summary iconसारांश
ऑन-चेन समाचार सामने आया है, जिसमें चीनी स्टार्टअप माइंड लैब ने मैकारॉन-V1, एक 748B पैरामीटर मॉडल का अनावरण किया है, जिसमें मिक्सचर-ऑफ-LoRA डिज़ाइन है। एआई + क्रिप्टो समाचार स्पॉटलाइट मॉडल SWE-bench Verified पर 85.6 स्कोर करता है, जो DeepSeek-V4-Pro और Kimi-K2.6 को पीछे छोड़ देता है। मेइटुआन द्वारा नेतृत्व किए गए $50M के A-राउंड के समर्थन में, लैब दावा करती है कि वास्तविक दुनिया की सीख मॉडल को सशक्त बनाती है। ARR दो हफ्तों में $10 मिलियन पहुँच गया।
माइंड लैब ने Macaron-V1 मॉडल लॉन्च किया है, जो 748B पैरामीटर के साथ 4 स्वतंत्र LoRA के Mixture-of-LoRA आर्किटेक्चर का उपयोग करता है और SWE-bench Verified में 85.6 अंकों के साथ कोडिंग क्षमता में शीर्ष स्थान प्राप्त किया है। इस एक साल से भी कम समय में स्थापित चीनी प्रयोगशाला ने 50 मिलियन डॉलर के फंडिंग के साथ सिलिकॉन वैली के 20 बिलियन डॉलर के टीम के बराबर तकनीकी स्तर हासिल किया है, और उनकी LoRA रीइनफोर्समेंट लर्निंग पथ पर ट्यूरिंग पुरस्कार विजेता रिचर्ड सटन, डीपसीक के लियांग वेनफेंग जैसे उद्योग नेताओं ने भरोसा किया है। माइंड लैब ने "निरंतर सीखना" और "समूह बुद्धि" की अवधारणाओं को भी प्रस्तुत किया है, जिसके अनुसार मॉडल प्रयोगशाला से बाहर निकलने के बाद भी वास्तविक परिवेश में निरंतर सीखने और सहयोग कर सकता है। 2 सप्ताह में ही इसकी व्यावसायिकता 10 मिलियन डॉलर ARR प्राप्त कर चुकी है, जो इस तकनीकी पथ की वास्तविक समस्याओं को हल करने की पुष्टि करती है।

लेखक, स्रोत: न्यूज़िज़यन

पिछले हफ्ते AI दुनिया एक बात पर चर्चा कर रही थी, लेकिन अधिकांश लोगों ने केवल आधा ही देखा।

15 जुलाई को, पूर्व OpenAI CTO Mira Murati ने सैन फ्रांसिस्को में Thinking Machines Lab का पहला मॉडल Inkling लॉन्च किया।

20 अरब डॉलर की फंडिंग, 975B पैरामीटर, 100 सदस्यों की शीर्ष टीम—सिलिकॉन वैली की सबसे अधिक ध्यान आकर्षित AI स्टार्टअप अंततः अपना पासा उठा चुकी है।

लगभग उसी दिन, प्रबलन शिक्षा के पिता, 2024 के ट्यूरिंग पुरस्कार विजेता रिचर्ड सटन, जो लगभग सत्तर के हैं, ने Oak Lab की स्थापना की घोषणा की।

वर्तमान डीप लर्निंग विधियाँ कमजोर और अक्षम हैं, जिन्हें सुधार की आवश्यकता नहीं, बल्कि मूल स्तर पर पुनः शुरू करने की आवश्यकता है।

सिर्फ सटन ही नहीं, डीपसीक के संस्थापक लियांग वेनफेंग ने लगभग एक ही निर्णय दिया है।

उन्होंने AI के विकास को एक-एक करके बढ़ते सीढ़ियों की तरह तुलना की: भाषा मॉडल, CoT, एजेंट... और एजेंट के बाद, अगला अनिवार्य चरण सतत अधिगम है।

उसका मानना है कि अगली पीढ़ी के मॉडल की मूल क्षमता यह होनी चाहिए कि इसमें निरंतर अध्ययन की क्षमता हो, तभी इसे अगली पीढ़ी का मॉडल कहा जा सकता है। यदि पहले निरंतर अध्ययन को विकसित कर लिया जाए, तो सामान्य बुद्धिमत्ता संभवतः आसान हो जाएगी।

जब एक तकनीकी रास्ते पर ट्यूरिंग पुरस्कार विजेता, सिलिकॉन वैली की सबसे अधिक ध्यान आकर्षित AI स्टार्टअप और चीन के सबसे नवीनतम मॉडल के संस्थापक सभी ने निवेश किया हो, तो यह केवल एक तकनीकी विकल्प नहीं, बल्कि एक उद्योग सहमति बन जाता है।

वायु की दिशा बदल चुकी है।

जब सभी सिलिकॉन वैली पर नजर डाल रहे थे, तो इस प्रशांत के इस ओर, एक ऐसा चीनी प्रयोगशाला जिसकी स्थापना एक साल से भी कम समय पहले हुई थी, उसने एक ही प्रतियोगिता में एक आश्चर्यजनक जवाब पेश किया।

Mind Lab, Macaron-V1 का आधिकारिक रूप से लॉन्च किया गया।

माइंड लैब की स्थापना अक्टूबर 2025 में माइंडवर्स (माइंडवर्स टेक्नोलॉजी) के अंतर्गत एक अग्रणी अनुसंधान प्रयोगशाला के रूप में की गई। पूरी टीम में तीस से अधिक सदस्य हैं, जो xAI, DeepMind, DeepSeek, 字节Seed, MIT और त्सिंहुआ विश्वविद्यालय से आए हैं। इसने वर्ष की शुरुआत में 5000 डॉलर की A-चरण की फंडिंग पूरी की, जिसमें मेन्गुआन नेतृत्व किया और अंटी, सीक्वोया चाइना, ज़ेने आदि ने भाग लिया।

इस संख्या का ध्यान रखें: 5000 डॉलर, जिसका बाद में उपयोग किया जाएगा।

748B पैरामीटर के साथ सीधे रीइनफोर्समेंट लर्निंग

4 LoRA प्रत्येक अपना काम करता है

पहले मॉडल देखें।

Macaron-V1 के दो संस्करण हैं:

  • Venti फ्लैगशिप संस्करण, 748B पैरामीटर, 744B के GLM-5.2 बेस पर आधारित और चार 1B LoRA के साथ, मूल रूप से 2M अत्यधिक लंबा कंटेक्स्ट;
  • स्टैंडर्ड वर्जन Tall, 35B, Qwen-3.7 पर आधारित, Mac पर चलाया जा सकता है।

लेकिन कुंजी पैरामीटर में नहीं है—वो चार LoRA में हैं।

पिछले समय में, LoRA पूर्ण पैरामीटर फाइन-ट्यूनिंग का "गरीबों का विकल्प" था। बचत तो होती थी, लेकिन छूट भी मिलती थी।

Mind Lab ने इसे पुनः परिभाषित किया है: बेस मॉडल 'सामान्यता' है, LoRA 'व्यक्तिगतता' है।

इसका क्या मतलब है? जैसे सभी iPhone एक ही iOS सिस्टम का उपयोग करते हैं, लेकिन आपके द्वारा इंस्टॉल किए गए ऐप्स, आपकी टाइपिंग की आदतें, और आपकी अक्सर की जाने वाली क्रियाएँ आपके iPhone को «आपका iPhone» बना देती हैं।

बातचीत प्राकृतिक और सहानुभूतिपूर्ण होनी चाहिए, प्रोग्रामिंग कठोर और सटीक होनी चाहिए, एजेंट को बहु-चरण योजना बनानी चाहिए, जनरेटिव UI को इंटरैक्शन के साथ डिज़ाइन करना चाहिए—इन सबको एक ही पैरामीटर में प्रशिक्षित करने से वे आपस में टकराएंगे।

Macaron-V1 का तरीका सरल और सीधा है: तोड़ना।

चार स्वतंत्र LoRA, जो चैट, एजेंट, प्रोग्रामिंग और GenUI के लिए अलग-अलग जिम्मेदार हैं, प्रत्येक का अलग प्रशिक्षण, अलग मूल्यांकन और अलग रोलबैक।

रनटाइम रूटर डायनेमिक स्विचिंग — आप कहते हैं «मुझे समय सारिणी बनाएं», तो Agent LoRA चलता है; आप कहते हैं «इस कोड में बग है», तो Coding LoRA पर स्विच हो जाता है। यह उपयोगकर्ता के लिए पूरी तरह से पारदर्शी है।

इस आर्किटेक्चर का एक औपचारिक नाम है: Mixture-of-LoRA (MoL) — विभिन्न क्षमताएँ साझा बेस पर स्वतंत्र रूप से प्रशिक्षित, लचीले ढंग से संयोजित और आवश्यकता के अनुसार उपयोग की जाती हैं। एक मॉडल को सब कुछ करने के लिए मजबूर नहीं किया जाता, बल्कि कई विशेषज्ञ मिलकर काम करते हैं।

Macaron-V1 अभी तक सभी क्षमताओं में सबसे शक्तिशाली बंद स्रोत मॉडल के स्तर तक नहीं पहुँचा है। हालाँकि, सभी मूल्यांकनों में, यह अधिकांश कार्यों में Opus 4.8, GPT-5.5 और Gemini 3.1 Pro के बराबर या उनसे आगे निकल गया है—विशेष रूप से दैनिक जीवन के संदर्भों, कोडिंग क्षमता और जनरेटिव UI दिशाओं में इसका प्रदर्शन उल्लेखनीय है।

SWE-bench सत्यापित—व्यावसायिक रूप से मान्यता प्राप्त सबसे कठिन कोडिंग क्षमता मूल्यांकनों में से एक, Macaron-V1-Venti ने 85.6 अंकों के साथ पहला स्थान हासिल किया, जो दूसरे स्थान पर रहे 3 अंकों से आगे है, और DeepSeek-V4-Pro (80.6), MiniMax-M3 (80.5), Kimi-K2.6 (80.2) को पीछे छोड़ दिया।

अधिक कठोर बात यह है कि Deep-SWE का उपयोग लंबी दूरी के जटिल सॉफ्टवेयर इंजीनियरिंग कार्यों के लिए किया जाता है। Macaron-V1-Venti ने 58.4 अंक प्राप्त किए, जबकि दूसरे स्थान पर इसका आधार मॉडल GLM-5.2 है—46.2 अंक। एक ही आधार के साथ, LoRA रीइनफोर्समेंट लर्निंग के बाद प्रशिक्षित करने से सीधे 12 अंकों का अंतर हो गया। यही पोस्ट-ट्रेनिंग द्वारा प्राप्त होने वाला अतिरिक्त मूल्य है।

अधिक महत्वपूर्ण बात: ओपन-वेट, स्वयं के सर्वर पर डिप्लॉय करने की सुविधा। बंद स्रोत मॉडल जितना भी मजबूत क्यों न हो, डेटा को दूसरे के सर्वर से होकर जाना पड़ता है। Macaron-V1 आपको मॉडल को अपने घर पर ले आने की सुविधा देता है, और आपका डेटा एक बाइट भी बाहर नहीं जाता।

एंड्रयू ने WAIC स्पीच के दौरान एक मामला प्रस्तुत किया: उपयोगकर्ता एक बिखरा हुआ क्यूब फोटो लेता है और भेजता है, मॉडल स्थिति की पहचान करता है, एल्गोरिथम द्वारा समाधान निकालता है, और इंटरएक्टिव 3D रिस्टोर गाइड जनरेट करता है—इसके लिए विजुअल बुद्धिमत्ता, एल्गोरिथम, एजेंट टूल कॉल और GenUI की चार क्षमताओं का समन्वय आवश्यक है।

एक और आसानी से नजरअंदाज किया जाने वाला लेकिन अत्यंत उन्नत डिज़ाइन: मॉडल और हैरनेस का साझा डिज़ाइन।

क्या इसका मतलब है? अधिकांश मॉडल ट्रेनिंग और वास्तविक डिप्लॉयमेंट दो अलग-अलग वातावरण होते हैं—ट्रेनिंग के दौरान उपयोग किए जाने वाले टूल इंटरफेस और निष्पादन प्रक्रियाएँ, लाइव वातावरण के साथ मेल नहीं खाती हैं, जिससे प्रदर्शन प्रभावित होता है।

Macaron-V1 ने शुरू से ही मॉडल और उत्पादन वातावरण के Harness के साथ प्रशिक्षण और अनुकूलन किया, इसलिए प्रशिक्षण के दौरान टूल्स कैसे कॉल किए जाते हैं, टर्मिनल कैसे ऑपरेट किए जाते हैं, और लंबी अवधि के कार्य कैसे चलाए जाते हैं, लाइव होने के बाद वही होता है।

संबंधित REPL Harness के साथ मॉडल को टूल्स को कोड के माध्यम से संयोजित करने, मध्यवर्ती स्थितियों को सहेजने और प्रभावी प्रक्रियाओं को पुनः उपयोग करने की अनुमति मिलती है—प्रत्येक बार शुरू से नहीं, दोहराए जाने वाले कॉल और संदर्भ के व्यर्थ होने को कम करते हुए।

यह केवल बातें करने वाला मॉडल नहीं है, यह एक कार्य करने वाला बुद्धिमान एजेंट है।

यह क्यों 「विश्व का एकमात्र दो」 है?

आप कह सकते हैं: LoRA फाइन-ट्यूनिंग क्या खास है? यह तो हर जगह मिल जाता है।

शानदार बात दो शब्दों में है: पैमाना।

30B मॉडल के लिए LoRA रीइनफोर्समेंट लर्निंग कई टीमें कर सकती हैं। लेकिन जब पैरामीटर की संख्या ट्रिलियन स्तर तक पहुँच जाती है, तो कठिनाई घातीय रूप से बढ़ जाती है।

मुख्य कठिनाई "ट्रेनिंग और इन्फरेंस में असंगति" है। रिइनफोर्समेंट लर्निंग को ट्रेन करते समय इन्फरेंस करके फीडबैक एकत्र करना होता है, जब ट्रिलियन पैरामीटर के MoE मॉडल को कई GPU पर विभाजित किया जाता है, तो ट्रेनिंग और इन्फरेंस की सटीकता में थोड़ा अंतर होने पर ग्रेडिएंट विस्थापित हो जाते हैं और ट्रेनिंग कर्व सीधे कन्वर्ज नहीं होता।

एक उदाहरण दें: 30 लोगों की एक इंडोर ऑर्केस्ट्रा के साथ, थोड़ी सी ताल में अंतर होने पर भी बचाया जा सकता है। लेकिन जब सौ लोगों की ऑर्केस्ट्रा हो जाए, तो किसी भी एक वाद्ययंत्र का ताल से भटकना पूरे प्रदर्शन के लिए आपदा बन जाता है।

दुनिया भर में केवल दो टीमें ही ट्रिलियन पैरामीटर स्केल पर LoRA रिइनफोर्समेंट लर्निंग चला पाई हैं।

एक Mira Murati का Thinking Machines Lab है। एक Mind Lab है।

कोई तीसरा नहीं है।

दिसंबर 2025 में, माइंड लैब ने किमी K2—कुल पैरामीटर 1.04 ट्रिलियन के अत्यधिक विरल MoE मॉडल पर—LoRA रीइनफोर्समेंट लर्निंग को सफलतापूर्वक चलाया। गणना क्षमता केवल पूर्ण पैरामीटर फाइन-ट्यूनिंग की दसवीं हिस्सा थी, और ट्रेनिंग कर्व स्थिर रूप से अभिसरित हुई।

इस महीने के LongStraw ने, स्थिर GPU की गणना क्षमता के तहत, रीइनफोर्समेंट लर्निंग के बाद के प्रशिक्षण को 2M कंटेक्स्ट तक आगे बढ़ाया। Macaron-V1, ये सभी उपलब्धियों की एक समेकित प्रस्तुति है।

यह रास्ता केवल Mind Lab ही नहीं चल रहा है। TML के मुख्य वैज्ञानिक जॉन शुलमैन—OpenAI के सह-संस्थापक और PPO एल्गोरिथम के आविष्कारक—ने 2025 में "LoRA without Regret" प्रकाशित किया, जिसमें प्रयोगों ने साबित किया कि LoRA अधिकांश पोस्ट-ट्रेनिंग स्थितियों में पूर्ण सूक्ष्म-समायोजन के समान प्रदर्शन देता है। उन्होंने इसे 'लो रिग्रेट ज़ोन' कहा।

उद्योग भी वास्तविक धन के साथ मतदान कर रहा है। पिछले हफ्ते 15 बिलियन डॉलर के D-चरण को पूरा करने वाली Fireworks AI का मूल्यांकन 175 बिलियन डॉलर है और यह सैकड़ों LoRA को होस्ट कर सकती है; Together AI ने 8 बिलियन डॉलर के C-चरण को पूरा किया है और अब LoRA को डिफ़ॉल्ट फाइन-ट्यूनिंग तरीका बना दिया है।

सिलिकॉन वैली 20 अरब डॉलर का आधार बनाती है, इसने उसका दसवाँ हिस्सा खर्च करके दिग्गज के कंधे पर खड़ा हो गया

यहाँ एक बहुत दिलचस्प तुलना है।

Mind Lab और TML एक ही तकनीकी राह पर चलते हैं, लेकिन बेस स्ट्रैटेजी पूरी तरह से अलग है।

TML ने विभिन्न कारणों से खुद ही शून्य से आधार मॉडल को प्रशिक्षित करने का फैसला किया। Inkling, 975B पैरामीटर, 45 ट्रिलियन टोकन—लेकिन Murati ने खुद भी स्वीकार किया: 'यह वर्तमान में सबसे शक्तिशाली मॉडल नहीं है।'

मूल्यांकन दर्शाता है कि Inkling, GLM, Kimi जैसे चीनी ओपन-सोर्स मॉडल्स की तुलना में स्पष्ट रूप से कमजोर है। शून्य से बेस मॉडल बनाने के लिए उन्होंने बहुत सारी ऊर्जा और कैलकुलेशन पावर खर्च की।

माइंड लैब उल्टा काम करता है। यह स्वयं बेस मॉडल को ट्रेन नहीं करता, बल्कि चीनी ओपन सोर्स मॉडल इकोसिस्टम के कंधों पर सीधे खड़ा होता है।

Kimi K2 ट्रिलियन पैरामीटर LoRA RL की पुष्टि करता है, V1-Preview GLM-5.1 पर आधारित है, फॉर्मल वर्जन Venti GLM-5.2 का उपयोग करता है, Tall Qwen-3.7 का उपयोग करता है—प्रत्येक बेस मॉडल अपग्रेड के साथ, बाद के प्रशिक्षण की शुरुआत की रेखा एक स्तर ऊपर चली जाती है।

चीन के ओपन सोर्स मॉडल अब वैश्विक स्तर पर लगभग SOTA तक पहुंच चुके हैं। इन लगभग शीर्ष स्तर के आधारों के साथ, LoRA रीइनफोर्समेंट लर्निंग के माध्यम से महत्वपूर्ण क्षमताओं को वास्तविक SOTA तक पहुंचाया जा सकता है।

आपको खुद गेहूं नहीं उगाना पड़ता, ताकि आप सबसे बेस्ट ब्रेड बेक कर सकें।

कितना क्रूर तुलना है?

TML: 20 अरब डॉलर की फंडिंग, 100 सदस्यीय टीम, निविडा के मेगावॉट स्तर की कैलकुलेशन सहयोग—Inkling की क्षमता GLM-5.2 से पिछड़ी हुई है।

माइंड लैब: तीस से अधिक लोग, 5000 डॉलर से कम की फंडिंग—Chat, Agent, Coding जैसे कई पहलुओं पर अधिक शक्तिशाली मॉडल बनाए गए।

LoRA रीइनफोर्समेंट लर्निंग में, माइंड लैब संभवतः विश्व का सबसे अधिक निवेश-उत्पादन अनुपात वाला टीम है। कोई नहीं।

निरंतर सीखें: क्यों मॉडल जितना अधिक उपयोग किया जाता है, उतना ही बुद्धिमान होता जाता है?

टेक्नोलॉजी और तुलना के बाद, सबसे महत्वपूर्ण प्रश्न आता है: माइंड लैब वास्तव में क्या खेल रहा है?

उत्तर Richard Sutton और AlphaGo के पूर्व प्रमुख शोधकर्ता David Silver द्वारा संयुक्त रूप से प्रकाशित एक लेख के शीर्षक में छिपा है—Welcome to the Era of Experience।

प्री-ट्रेनिंग "डेटा एज" है: मॉडल मानव द्वारा उपलब्ध पाठ से सीखता है।

अगला युग “अनुभव युग” होगा: AI की क्षमताएँ अब पहले से मौजूद डेटा से नहीं, बल्कि एजेंट्स के वास्तविक वातावरण में लंबे समय तक किए गए कार्यों, प्रतिक्रियाओं और निरंतर सीखने से आएंगी।

आज के बड़े मॉडल का मूल विरोधाभास यही है—ट्रेन करने के बाद इसे जमा दिया जाता है।

एक उपयोगकर्ता ने एक ही त्रुटि को दस बार सुधारा, अगली बार मॉडल को फिर से चैट इतिहास पढ़ना पड़ेगा। एक कोडिंग एजेंट एक ही कोडबेस में बार-बार विफल हो रहा है, लेकिन विफलता नई क्षमता में नहीं बदल रही है। मॉडल प्रतिदिन असंख्य कार्यों को संभालता है, लेकिन अनुभव पूरी तरह से खो जाता है।

यह केवल एक असीमित रूप से दोहराने वाला निष्कर्ष निकालने वाला इंजन है, एक विकासशील बुद्धिमान प्रतिनिधि नहीं।

माइंड लैब का उद्देश्य इस बंद चक्र को तोड़ना है। उनका लक्ष्य एक "अनुभवी बुद्धिमान मशीन" बनाना है—जिस मॉडल को लैब से बाहर निकालने के बाद भी वह वास्तविक दुनिया में लगातार सीखता रहे।

अनुभव नए क्षमताओं में बदल जाता है, नए क्षमताएँ इसे अधिक कठिन समस्याओं को हल करने में सक्षम बनाती हैं, और अधिक कठिन समस्याएँ फिर से अधिक समृद्ध अनुभव लाती हैं।

बुद्धिमत्ता एक बार के प्रशिक्षण का परिणाम नहीं है, बल्कि लगातार विकसित होने की प्रक्रिया बन गई है।

LoRA अब «बचत का उपकरण» नहीं है, बल्कि एक लिखने योग्य, रोलबैक करने योग्य और स्वतंत्र रूप से विकसित होने योग्य स्थायी स्थिति है।

बेस जनरल ज्ञान को धारण करता है, LoRA आपकी पसंद, आपकी कोडिंग शैली और आपकी व्यावसायिक तर्कशक्ति को धारण करता है। यह स्थिर पैच नहीं है, बल्कि बातचीत के साथ विकसित होने वाली स्मृति है।

प्रयोगों ने साबित किया है कि हल्का अनुकूलन मॉड्यूल बेस मॉडल के पैरामीटर के 0.5% से कम में संपीड़ित किया जा सकता है, फिर भी यह स्थिर और विश्वसनीय रहता है—बेस मॉडल जितना मजबूत होगा, छोटे अपडेट उतने ही प्रभावी होते हैं।

माइंड लैब ने इस रास्ते को तीन साल तक अपनाया। 2023 में, संस्थापक एंड्र्यू ने GPT-1 के लेखक कार्तिक नारसिम्हन और याओ शुनयू के साथ मिलकर FireAct प्रकाशित किया—यह पहला कार्य था जिसमें पैरामीटर सीखने का उपयोग एजेंट की क्षमता बढ़ाई गई। एजेंट की ट्रैजेक्टरी को पैरामीटर में लिखने के बाद, एकल निष्पादन समय 9.0 सेकंड से घटकर 2.7 सेकंड हो गया।

एक बार शिक्षा के लिए लागत दें, और फिर प्रत्येक उपयोग लाभ देता है। फायरएक्ट से मैकारॉन-V1 तक, यह तर्क ट्रिलियन पैरामीटर के स्तर तक बढ़ाया गया है।

ग्रुप इंटेलिजेंस: तीसरा स्केलिंग कर्व

लगातार सीखना कहानी का सिर्फ आधा हिस्सा है। मैकरॉन-वी-1 द्वारा दर्शाया गया दूसरा केंद्रीय सिद्धांत, जो अधिक विप्लवकारी हो सकता है—समूह बुद्धिमत्ता।

प्रत्येक मॉडल अपने अनुभव के साथ लगातार सीखता रहता है, जिससे विभिन्न उदाहरण अलग-अलग दिशाओं की ओर बढ़ते हैं। विभिन्न उपयोगकर्ता प्रतिक्रियाएँ, विभिन्न कार्य, और विभिन्न डेटा अलग-अलग क्षमताओं को आकार देते हैं। एक ही आधार से शुरू होकर, समय के साथ वे «अलग-अलग लोगों» में बदल जाते हैं।

इस विविधता को बग मानें या फीचर? परिणाम बहुत शानदार हैं।

एक ही Qwen3-30B बेस पर आधारित, ट्रेनिंग लक्ष्य और एल्गोरिथम पूरी तरह समान हैं, केवल डेटा क्रम और मास्किंग बदला गया है।

AIME24 पर एकल एडेप्टर की सटीकता: 36.44%। 198 अलग-अलग एडेप्टर्स का मेजरिटी वोटिंग: 48.67%। एक ही एडेप्टर को 198 बार दोहराकर नमूना लेने पर अधिकतम: 43.78%।

विभिन्न "अनुभवों" ने एकल मॉडल द्वारा न दिए जा सकने वाली पूरकता लाई। यह "कई बार प्रयास करना" नहीं है—बल्कि विविध शिक्षण पथों के बीच वास्तविक सहयोगात्मक प्रभाव उत्पन्न हुआ है।

एंड्रयू ने WAIC में इसे तीसरी स्केलिंग कर्व कहा।

पहला नियम: GPT-3 जैसे स्केल पैरामीटर—बड़े पैरामीटर अधिक बुद्धिमत्ता लाते हैं।

दूसरा: डीपसीक R1 शैली के स्केल थिंकिंग टोकन — अधिक निष्कर्षण टोकन अधिक बुद्धिमत्ता लाते हैं।

तीसरा नियम: मॉडलों की संख्या को बढ़ाएं—अधिक मॉडलों के बीच सहयोग उच्चतर बुद्धिमानी की सीमा लाता है।

प्रयोग में, मॉडल की संख्या कुछ से बढ़ाकर 200 कर दी गई, और लॉग स्केल पर प्रदर्शन रेखीय रूप से सुधरा। यदि यह वक्र सत्य है, तो अगला कदम 200 से 20,000, 20 लाख तक बढ़ाना है।

माइंड लैब द्वारा स्वयं विकसित MinT प्लेटफॉर्म ने लाखों उपलब्ध LoRA निर्देशिका स्थापित कर ली है। 10 लाख LoRA एक ही ट्रिलियन पैरामीटर बेस मॉडल को साझा करते हैं।

ध्यान दें — यह 100 लाख छोटे मॉडल नहीं है, यह 100 लाख एक ट्रिलियन पैरामीटर वाले बड़े मॉडल हैं।

मनुष्य एक दूसरे के साथ 99% से अधिक जीनोम साझा करते हैं, लेकिन लगभग समान जैविक आधार ने समान मानसिकता का निर्माण नहीं किया है। बुद्धिमत्ता की विविधता और उसकी सहकार्यता ही मानव सभ्यता की सबसे महान उपलब्धियों का कारण है।

2 सप्ताह में 10 मिलियन डॉलर का ARR: सबसे तेज़ व्यावसायिक सत्यापन

जितना भी तकनीकी रास्ता सुंदर हो, अगर बाजार इसे खरीदे नहीं, तो यह केवल PPT है। Mind Lab ने जुलाई के पहले सप्ताह में API का व्यावसायिकीकरण शुरू किया।

दो सप्ताह में, 1000 डॉलर का ARR।

यह संभवतः सभी मॉडल कंपनियों में पहले मॉडल के लॉन्च से लेकर करोड़ डॉलर ARR तक पहुंचने का सबसे तेज़ रिकॉर्ड है।

डिजिटल महत्वपूर्ण हैं, लेकिन उससे भी अधिक महत्वपूर्ण है गति। एक तकनीकी रास्ता इतनी जल्दी वास्तविक पैसे से मतदान किए जाने का मतलब है कि यह वास्तविक, दर्दनाक समस्याओं का समाधान कर रहा है।

माइंड लैब केवल टोकन नहीं बेचता है। इसका केंद्रीय व्यावसायिक तर्क है: ग्राहक अपने स्वयं के स्थिति में मॉडल की निरंतर सीखने और अपडेट करने की क्षमता खरीदते हैं।

मोबाइल निर्माता अपने उत्पाद ज्ञान को एक विशिष्ट LoRA में प्रशिक्षित करते हैं, हेडफोन कंपनी अपनी इंटरैक्शन प्राथमिकताओं को मॉडल स्टेट में शामिल करती है—मूल डेटा को बेस मॉडल कंपनी को पुनः प्रशिक्षित करने के लिए नहीं देना पड़ता, ग्राहक स्वयं नियंत्रण रखता है।

Shaoyin Technology, AI hardware startup Odyss, and a leading smartphone manufacturer are already on the collaboration list.

API कॉल संरचना भी समस्या को दर्शाती है: 20% चैट, 30% एजेंट वर्कफ्लो, 30% कोड जेनरेशन, शेष GenUI से — परिदृश्य वितरण संतुलित है, एकल ब्रेकआउट पर निर्भर नहीं है।

Premium版 6 डॉलर/मिलियन टोकन, Standard版 4 डॉलर, Ultra版 2 डॉलर।

माइंड लैब द्वारा दी गई दृष्टि केवल एक वाक्य है: जो टोकन का उपयोग कर सकते हैं, वे टोकन को प्रशिक्षित कर सकते हैं।

मॉडल ट्रेन करना अंततः मॉडल कॉल करने जितना सरल होना चाहिए। बड़ी मात्रा में प्री-सेल्स की आवश्यकता नहीं है, न ही कस्टमाइज्ड मानव संसाधनों की। लगातार सीखना ही स्केलेबल मॉडल क्षमता है।

दरवाजा खुल गया

रिचर्ड सटन ने टोरंटो में "अनुभव का युग" की घोषणा की। लियांग वेनफेंग का मानना है कि अगली पीढ़ी के मॉडल को ऐसा कहा जा सकता है, जिसमें निरंतर सीखने की क्षमता हो। मिरा मुराटी ने सैन फ्रांसिस्को में ट्रिलियन पैरामीटर LoRA रीइनफोर्समेंट लर्निंग इंफ्रास्ट्रक्चर बनाया। Fireworks AI का आकलन 175 अरब डॉलर है।

सभी लोग एक ही दिशा में बेट लगा रहे हैं: मॉडल को डिप्लॉय करने के बाद भी सीखना चाहिए। LoRA इसे ट्रिलियन पैरामीटर स्केल पर संभव बनाने की कुंजी प्रौद्योगिकी है।

माइंड लैब इस प्रतियोगिता का सबसे युवा प्रतियोगी है। लेकिन शुरुआती स्थिति सबसे कुशल हो सकती है—बेस के बिना, चीनी ओपन सोर्स इकोसिस्टम पर खड़े होकर, तीस से अधिक लोगों और 5000 डॉलर से कम के फंडिंग के साथ, उन्होंने सिलिकॉन वैली के बिलियन डॉलर के टीम के समान तकनीकी क्षमता प्राप्त की है।

इसके पीछे एक सरल लेकिन गहरा निर्णय है:

बड़े मॉडल की प्रतिस्पर्धा का अंतिम लक्ष्य, “जो सबसे बड़ा बेस मॉडल ट्रेन करता है” नहीं, बल्कि “जो मॉडल को लगातार अधिक बुद्धिमान बना सकता है” है।

प्री-ट्रेनिंग एक बार की बुनियादी ढांचा है। निरंतर सीखना ही वास्तविक प्रतिस्पर्धात्मक लाभ है।

माइंड लैब एक अनुभवजन्य बुद्धिमान मशीन बनाना चाहता है—जिसमें मॉडल प्रयोगशाला से बाहर निकलने के बाद भी वास्तविक दुनिया में लगातार सीखता रहे और जितना अधिक उपयोग किया जाए, उतना ही बुद्धिमान बनता जाए। जब काफी संख्या में ऐसे बुद्धिमान सहयोग करने लगें, तो एक उच्चतर बुद्धिमत्ता की ओर जाने का एक नया मार्ग खुल जाएगा।

Murati ने सैन फ्रांसिस्को में 20 बिलियन डॉलर और 100 लोगों की टीम के साथ इस दरवाजे को धकेला।

और जिसने पहले दरवाजे को थोड़ा सा खोला, वह शांतिमहासागर के इस पार, चीनी ओपन सोर्स इकोसिस्टम के कंधों पर खड़ी एक युवा प्रयोगशाला है।

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।