शीर्षक: अलीबाबा ने Qwen 3.8-Flash-Next का टीज़र दिया — एक 125 बिलियन पैरामीटर का प्रीव्यू जो प्रति टोकन केवल 6 बिलियन सक्रिय करता है, जो Qwen 4 की ओर इशारा करता है अलीबाबा इस बुधवार को Qwen 3.8-Flash-Next का अनावरण करेगा — कंपनी इसे एक पूर्ण फ्लैगशिप मॉडल के बजाय अगली पीढ़ी के Qwen 4 आर्किटेक्चर का एक प्रारंभिक प्रीव्यू बता रही है। अलीबाबा की टीम और एक प्रचलित ट्वीट के अनुसार, मॉडल में 125 बिलियन पैरामीटर हैं, लेकिन प्रति टोकन केवल लगभग 6 बिलियन पैरामीटर सक्रिय होते हैं (ट्वीट में “+51B N-gram” कंपोनेंट का भी उल्लेख किया गया)। ये संख्याएँ और मॉडल का वास्तविक प्रदर्शन अभी सत्यापित नहीं हुए हैं; अलीबाबा और हगिंग फेस दोनों इसे एक आर्किटेक्चर प्रीव्यू के रूप में संदर्भित करते हैं और साइड-बाय-साइड बेंचमार्क स्कोर प्रकाशित नहीं किए हैं। इन संख्याओं का महत्व क्यों है - पैरामीटर मॉडल के उन सेटिंग्स हैं जिनका उपयोग सीखने और अनुकूलित करने के लिए किया जाता है। सामान्यतः, अधिक पैरामीटर का मतलब है अधिक क्षमता, लेकिन साथ ही अधिक कंप्यूटेशनल लागत। - यहाँ की समझदारी मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) आर्किटेक्चर में है: हर प्रवेश पर एक विशाल नेटवर्क के हर हिस्से को चलाने के बजाय, मॉडल प्रत्येक अनुरोध को कुछ विशेष “एक्सपर्ट” सब-मॉडल्स के सूचीबद्ध समूह को संचालित करता है। इससे 125B पैरामीटर मॉडल, कंप्यूटेशनल लागत के मामले में, कम से कम मॉडल की तरह ही कार्य कर सकता है, क्योंकि प्रति टोकन केवल संबंधित एक्सपर्ट्स ही सक्रिय होते हैं। संक्षेप में: संभवतः समानयोग्य कंप्यूटेशनल लागत पर, सीमा-उन्मुख क्षमता — अगर MoE का प्रदर्शन सच साबित होता है। अलीबाबा क्या कहता है, और क्या स्पष्ट नहीं है - अलीबाबा Qwen 3.8-Flash-Next को मल्टीमॉडल मॉडल के रूप में प्रस्तुत करती है, जो आगमनवाले Qwen 4 डिज़ाइन पर आधारित है, और इसे पहले ही प्रकाशित किया है, taki developers पूरे परिवार के लिए तैयार हो सकें। - हगिंग फेस, जहाँ वज़न प्रकट होने की संभावना है, भी इसे Qwen 4 आर्किटेक्चर का प्रीव्यू कहता है। - Qwen 3 पंक्ति ya पश्चिमी प्रतिद्वंद्वियों के साथ स्वतंत्र प्रदर्शन समीक्षा ya head-to-head समीक्षा अभी तक प्रकाशित नहीं हुई है, इसलिए प्रदर्शन aur संसाधनों में समझौते अभी कल्पना पर ही हैं। संदर्भ: China’s open-weight momentum चीन का open-weight समुदाय बहुत सक्रिय है। हाल ही में, anonyomous aur institutional releases (एक riddle-like Ox Alpha model, jiska coding tests mein Anthropic ke Fable se better performance tha, aur Alibaba, DeepSeek aur Moonshot ke open weights) powerful models ko downloadable, fine-tunable aur locally runnable banate hain. Open weights closed APIs par nirbharata ko kam karte hain, hosting costs ko kam karte hain, aur developers ko sensitive data ko third-party services ke paas bhejne se bachate hain — jisme general AI aur crypto projects dono ke liye mahatvapurna factors hain। Crypto audiences ke liye yeh kyun mahatvapurna hai - On-chain tooling aur bots: sasta, locally runnable bade models on-chain agents, auditing tools, trading aur MEV strategies ko power kar sakte hain bina constant API fees ke। - Privacy aur custody: models ko self-hosting karna private keys, transaction graphs, ya proprietary trading signals ke data leakage ke khatre ko kam karta hai। - Decentralized AI infra: open weights decentralized inference layers aur trust-minimized oracles ke vikas ko tezi se badha sakte hain jo single-provider lock-in se bache। - सावधानी: jab tak benchmarks aur real-world cost figures na aaye, yeh maan lena jaldi hai ki model frontier quality ko low cost par deliver karta hai। अंतिम सार Qwen 3.8-Flash-Next Qwen 4 के design philosophy ka ek sneak peek ke roop mein prastut kiya ja raha hai — mixture-of-experts efficiency aur multimodal capability ka vaada karta hai। Is release ka mahatvapurna karan yeh hai ki agar dawa sach hai, toh ek 125B-parameter MoE model ka open weight jo bas ~6B per token activate karta hai, developers aur crypto projects ke liye powerful AI ko democratize kar sakta hai। Lekin hume verified benchmarks aur hands-on tests ki zaroorat hai taki hype ki pusti ho। Official release, Hugging Face weights, aur independent evaluations ke liye nazar rakhein।
अलीबाबा 6B पैरामीटर प्रति टोकन के साथ 125B Qwen 3.8-Flash-Next का टीज़र देता है, MoE के माध्यम से
ChainGPTसाझा करें
अलीबाबा ने Qwen 3.8-Flash-Next के टोकन लॉन्च की घोषणा की है, जिसका रिलीज इस बुधवार किया जाएगा। यह मॉडल 125B पैरामीटर्स का उपयोग करता है, लेकिन MoE का उपयोग करके प्रति टोकन केवल 6B सक्रिय करता है। हगिंग फेस और अलीबाबा इसे Qwen 4 का प्रीव्यू कहते हैं। अभी तक कोई बेंचमार्क उपलब्ध नहीं हैं। ओपन-वेट डिजाइन नए टोकन सूचीकरण और ऑन-चेन टूल्स को समर्थन दे सकता है। प्रदर्शन और लागत कुशलता अभी अप्रमाणित हैं।
स्रोत:मूल दिखाएं
डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा।
डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।