ज़हपू ने 100,000 घरेलू चिप्स पर GLM-5.3-Flash मॉडल लॉन्च किया, जो NVIDIA के साथ प्रतिस्पर्धा कर रहा है

iconMetaEra
साझा करें
AI summary iconसारांश
Zhipu AI ने GLM-5.3-Flash मॉडल लॉन्च किया है, जो अब 1,00,000 से अधिक घरेलू चिप्स के क्लस्टर पर डिप्लॉय किया गया है। पहले Ox Alpha के नाम से जाना जाने वाला यह मॉडल NVIDIA GPU की दक्षता और टोकन लागत के समान है और AA बुद्धिमत्ता सूचकांक पर 57 अंक प्राप्त करता है। यह प्रमुख प्रतिद्वंद्वियों की तुलना में कम कीमत पर उपलब्ध है और GLM-5 श्रृंखला में पहला मूल बहुआयामी मॉडल है। ऑन-चेन डेटा से पता चलता है कि AI इंफ्रास्ट्रक्चर में रुचि बढ़ रही है, जिसमें ऑन-चेन विश्लेषण लागत-प्रभावी घरेलू समाधानों की ओर बढ़ते प्रवृत्ति को उजागर करता है।
Zhipu ने नवीनतम मॉडल GLM-5.3-Flash जारी किया है, जिसे पहले अज्ञात नाम Ox Alpha के तहत परीक्षण प्लेटफॉर्म पर मुफ्त में उपलब्ध कराया गया था, जिसमें 5 दिनों में 50 ट्रिलियन टोकन से अधिक ट्रैफ़िक आया। मॉडल के लिए 100,000 से अधिक घरेलू चिप्स के क्लस्टर का उपयोग निष्कर्षण सेवाओं के लिए किया गया है, जिससे हार्डवेयर की दक्षता और प्रति टोकन लागत नाइविडिया GPU के समान हो गई है। प्रदर्शन के मामले में, यह मॉडल AA समग्र बुद्धिमत्ता सूचकांक में 57 अंक प्राप्त करता है, जो Claude Opus 4.8 के समान है। मूल्यनिर्धारण के संदर्भ में, प्रति मिलियन टोकन प्रवेश 0.8 युआन और निर्गम 2.8 युआन है, जो प्रतिद्वंद्वीयों की तुलना में काफी कम है। इसकी संरचना में विरल और रैखिक ध्यान का मिश्रण है, जो GLM-5 श्रृंखला का पहला मूल बहुमॉडल मॉडल है। घरेलू AI मॉडलों के समूहगत मूल्यवृद्धि के संदर्भ में, Zhipu बाजार पर कब्जा करने के लिए कम कीमत की रणनीति का प्रयोग कर रहा है।

लेखक, स्रोत: वेस्टर्न लेटपोस्ट

26 अगस्त को, ZhiPu ने आधिकारिक रूप से पुष्टि की: विकासक समुदाय में चर्चा का विषय बने अज्ञात मॉडल Ox Alpha (चीनी समुदाय में "नियूलाई" के नाम से जाना जाता है), वही है जो उनके द्वारा हाल ही में लॉन्च किया गया GLM-5.3-Flash है। मॉडल का कोडनेम देश में हाल ही में प्रदर्शित फिल्म "नियूलाई" से प्रेरित है।

इस मॉडल को आधिकारिक लॉन्च से पहले, OpenRouter और OpenCode पर अनामिक रूप से मुफ्त टेस्टिंग के लिए उपलब्ध कराया गया, जिसमें 5 दिनों में कुल 50 ट्रिलियन टोकन का ट्रैफ़िक जमा हुआ, जिससे दोनों प्लेटफ़ॉर्मों के ट्रैफ़िक वृद्धि के रिकॉर्ड तोड़ दिए गए, और वर्तमान में इसका उपयोग DeepSeek से दोगुना से अधिक हो गया है। लेकिन बाजार का ध्यान आकर्षित करने वाली वास्तविक बात यह थी कि Zhipu ने बाद में एक विस्तार से जानकारी साझा की: यह सारा ट्रैफ़िक पूरी तरह से घरेलू चिप्स द्वारा संचालित हुआ।

ज़ह्पु ने अपनी आधिकारिक तकनीकी दस्तावेज़ में बताया कि इस मॉडल के निष्कर्षण सेवा के लिए 100,000 से अधिक घरेलू चिप्स के क्लस्टर का उपयोग किया गया है, "हार्डवेयर की दक्षता और प्रति टोकन लागत प्रमुख निविडा GPU के स्तर के समान हो गई है।"

सेमीएनालिसिस ने X प्लेटफॉर्म पर एक पोस्ट में टिप्पणी की: "सभी ट्रैफिक घरेलू चिप्स द्वारा संचालित हो रहा है, हार्डवेयर की दक्षता और प्रति टोकन लागत अब निविडा GPU के समान हो गई है। जलपेन्यो (OpenAI का स्व-विकसित इन्फरेंस चिप) की घोषणा के बाद, CUDA की खाई फिर से परीक्षण में है।"

10 लाख देशी कार्ड: टेस्टिंग से उत्पादन तक, Zhipu ने इस देशी चिप क्लस्टर के डिप्लॉयमेंट विवरण को तकनीकी दस्तावेज़ में वर्णित किया है।

एकल चिप का मुख्य बाधक कारक मेमोरी क्षमता और बैंडविड्थ है, जिसके कारण 10 लाख टोकन तक की संदर्भ लंबाई का समर्थन करना विशेष रूप से कठिन है। इसके लिए, Zhipu ने SGLang पर आधारित एक विशेष निष्पादन इंजन बनाया है, जिसमें W8A8 क्वांटाइजेशन, INT8/FP8/BF16 मिश्रित कैश क्वांटाइजेशन और नोड-अंतर्गत टेंसर पैरललिज़म जैसी तकनीकों का उपयोग किया गया है, साथ ही उत्पादन-स्तरीय Encode–Prefill–Decode (EPD) अलग-अलग आर्किटेक्चर शामिल किया गया है, जिससे मल्टीमोडल कोडिंग, prompt प्रीफिलिंग और टोकन-दर-टोकन डिकोडिंग को स्वतंत्र रूप से शेड्यूल किए जा सकने वाले कार्य पूल में विभाजित किया गया है।

ZhiPu के अनुसार, एक ही हार्डवेयर पर प्रारंभिक बेसलाइन की तुलना में एंड-टू-एंड सेवा प्रदर्शन में 3 गुना की वृद्धि हुई है।

लेटपोस्ट के अनुसार, इन चिप्स के आपूर्तिकर्ता हुआवेई, मोएर लाइनटेन और हैगुआंग से हो सकते हैं। ज़हीपु ने इसके बारे में कोई टिप्पणी नहीं की है, और तकनीकी दस्तावेज़ों में कोई विशिष्ट चिप मॉडल भी नहीं बताया गया है।

SemiAnalysis ने टिप्पणी में विशेष रूप से उल्लेख किया कि पहले ऐसा माना जाता था कि केवल शीर्ष अग्रणी प्रयोगशालाओं ही प्रतिदिन 100 ट्रिलियन टोकन की कैलकुलेशन क्षमता रखती हैं, "जबकि यहाँ प्रतिदिन 100 ट्रिलियन टोकन की मुफ्त ट्रैफिक, सभी घरेलू चिप्स पर चल रही है।"

मॉडल स्वयं: DeepSeek के समान, कीमत Claude Opus 4.8 की 1/40 है। GLM-5.3-Flash का कुल पैरामीटर स्केल 320B है, सक्रिय पैरामीटर 18B हैं, और पैरामीटर मात्रा पिछली पीढ़ी के फ्लैगशिप GLM-5.3 की लगभग 40% है, जो DeepSeek V4 Flash के लगभग समान है।

प्रदर्शन के मामले में, Zhipu की आधिकारिक मूल्यांकन रिपोर्ट के अनुसार, GLM-5.3-Flash ने Artificial Analysis Intelligence Index (AA समग्र बुद्धिमत्ता सूचकांक) में 57 अंक प्राप्त किए, जो पिछली पीढ़ी के फ्लैगशिप GLM-5.2 से अधिक है, Anthropic के Claude Opus 4.8 के बराबर है, और DeepSeek के फ्लैगशिप मॉडल V4 Pro स्थिर संस्करण के 53 अंकों से भी अधिक है।

मूल्य निर्धारण के संदर्भ में, GLM-5.3-Flash के लिए प्रति एक मिलियन टोकन इनपुट 0.8 युआन और आउटपुट 2.8 युआन है, जबकि कैश हिट मूल्य 0.23 युआन है, जो GLM-5.3 का दसवाँ हिस्सा है। लॉन्च के पहले दो सप्ताह तक आधी कीमत लागू होगी।

ज़ह्पु ने कहा कि GLM-5.3-Flash की कीमत GLM-5.3 की 1/10 है, सीमित समय के छूट के दौरान GLM-5.3 की 1/20 है, और Claude Opus 4.8 की 1/40 है।

DeepSeek V4 Flash के समायोजित मूल्य (रात्रि के समय इनपुट 1.5 युआन, आउटपुट 4.5 युआन) की तुलना में, GLM-5.3-Flash अधिकांश सामान्य उपयोग के संदर्भों में सस्ता है।

आर्किटेक्चर इनोवेशन: पैरामीटर और परतों की संख्या लगभग आधी हो गई—GLM-5.3-Flash, GLM-5.3 के पूरी तरह से अलग आर्किटेक्चर डिज़ाइन का उपयोग करता है, जो इसके लिए कम लागत पर उच्चतर प्रदर्शन प्राप्त करने का मुख्य कारण है।

GLM-4.5 की तुलना में, GLM-5.3-Flash की कुल पैरामीटर मात्रा लगभग समान है (355B बनाम 320B), लेकिन सक्रिय पैरामीटर मात्रा 32B से घटकर 18B हो गई है, और स्तरों की संख्या 92 से घटकर 45 हो गई है, जो लगभग आधी है।

ज़ही पिंग के अनुसार, GLM-5.3-Flash पहला ओपन-सोर्स अग्रणी मॉडल है जो विरल ध्यान और रैखिक ध्यान के मिश्रित आर्किटेक्चर का उपयोग करता है। GLM-5.3 की तुलना में, इसकी ध्यान गणना और KV कैश आकार क्रमशः 3.01 गुना और 4.44 गुना कम हैं।

इसके अलावा, यह मॉडल GLM-5 श्रृंखला का पहला मूल बहुआयामी मॉडल है, जो छवि और वीडियो इनपुट का समर्थन करता है, और यह बुद्धिमान प्रतिष्ठान द्वारा coding पर केंद्रित होने के बाद पहला बहुआयामी क्षमता वाला नया मॉडल है।

चीनी AI मॉडल बाजार में एक सामूहिक कीमत वृद्धि के बाद GLM-5.3-Flash के लॉन्च के साथ कम कीमत पर ब्रेकआउट।

किमी K3 की आउटपुट कीमत प्रति मिलियन टोकन 100 युआन तक पहुँच गई है, जो पिछले K2.6 से तीन गुना से अधिक है; ज़ही पिछले छह महीनों में कीमत बढ़ाने के बाद आउटपुट कीमत 28 युआन तक पहुँच गई; डीपसीक V4 Pro की कीमत 6 युआन से बढ़कर 13.5 युआन हो गई, शीर्ष समय पर 27 युआन; डीपसीक V4 Flash की आउटपुट कीमत 2 युआन से बढ़कर 4.5 युआन हो गई, शीर्ष समय पर 9 युआन।

मूल्य वृद्धि का सीधा परिणाम मांग का बाहरी प्रवाह है। द वेनपोइन्टलेटपोस्ट ने बताया कि डीपसीक V4 फ्लैश की कीमत बढ़ने के बाद, OpenCode प्लेटफॉर्म पर उपयोग की मात्रा आधी रह गई, और यह मांग देशी मॉडल निर्माताओं के लिए एक नया विकास क्षेत्र बन गई।

GLM-5.3-Flash की मूल्य नीति, इस अंतर को लक्षित करती है।

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।