Zhipu ने नवीनतम मॉडल GLM-5.3-Flash जारी किया है, जिसे पहले अज्ञात नाम Ox Alpha के तहत परीक्षण प्लेटफॉर्म पर मुफ्त में उपलब्ध कराया गया था, जिसमें 5 दिनों में 50 ट्रिलियन टोकन से अधिक ट्रैफ़िक आया। मॉडल के लिए 100,000 से अधिक घरेलू चिप्स के क्लस्टर का उपयोग निष्कर्षण सेवाओं के लिए किया गया है, जिससे हार्डवेयर की दक्षता और प्रति टोकन लागत नाइविडिया GPU के समान हो गई है। प्रदर्शन के मामले में, यह मॉडल AA समग्र बुद्धिमत्ता सूचकांक में 57 अंक प्राप्त करता है, जो Claude Opus 4.8 के समान है। मूल्यनिर्धारण के संदर्भ में, प्रति मिलियन टोकन प्रवेश 0.8 युआन और निर्गम 2.8 युआन है, जो प्रतिद्वंद्वीयों की तुलना में काफी कम है। इसकी संरचना में विरल और रैखिक ध्यान का मिश्रण है, जो GLM-5 श्रृंखला का पहला मूल बहुमॉडल मॉडल है। घरेलू AI मॉडलों के समूहगत मूल्यवृद्धि के संदर्भ में, Zhipu बाजार पर कब्जा करने के लिए कम कीमत की रणनीति का प्रयोग कर रहा है।लेखक, स्रोत: वेस्टर्न लेटपोस्ट
26 अगस्त को, ZhiPu ने आधिकारिक रूप से पुष्टि की: विकासक समुदाय में चर्चा का विषय बने अज्ञात मॉडल Ox Alpha (चीनी समुदाय में "नियूलाई" के नाम से जाना जाता है), वही है जो उनके द्वारा हाल ही में लॉन्च किया गया GLM-5.3-Flash है। मॉडल का कोडनेम देश में हाल ही में प्रदर्शित फिल्म "नियूलाई" से प्रेरित है।
इस मॉडल को आधिकारिक लॉन्च से पहले, OpenRouter और OpenCode पर अनामिक रूप से मुफ्त टेस्टिंग के लिए उपलब्ध कराया गया, जिसमें 5 दिनों में कुल 50 ट्रिलियन टोकन का ट्रैफ़िक जमा हुआ, जिससे दोनों प्लेटफ़ॉर्मों के ट्रैफ़िक वृद्धि के रिकॉर्ड तोड़ दिए गए, और वर्तमान में इसका उपयोग DeepSeek से दोगुना से अधिक हो गया है। लेकिन बाजार का ध्यान आकर्षित करने वाली वास्तविक बात यह थी कि Zhipu ने बाद में एक विस्तार से जानकारी साझा की: यह सारा ट्रैफ़िक पूरी तरह से घरेलू चिप्स द्वारा संचालित हुआ।
ज़ह्पु ने अपनी आधिकारिक तकनीकी दस्तावेज़ में बताया कि इस मॉडल के निष्कर्षण सेवा के लिए 100,000 से अधिक घरेलू चिप्स के क्लस्टर का उपयोग किया गया है, "हार्डवेयर की दक्षता और प्रति टोकन लागत प्रमुख निविडा GPU के स्तर के समान हो गई है।"
सेमीएनालिसिस ने X प्लेटफॉर्म पर एक पोस्ट में टिप्पणी की: "सभी ट्रैफिक घरेलू चिप्स द्वारा संचालित हो रहा है, हार्डवेयर की दक्षता और प्रति टोकन लागत अब निविडा GPU के समान हो गई है। जलपेन्यो (OpenAI का स्व-विकसित इन्फरेंस चिप) की घोषणा के बाद, CUDA की खाई फिर से परीक्षण में है।"

10 लाख देशी कार्ड: टेस्टिंग से उत्पादन तक, Zhipu ने इस देशी चिप क्लस्टर के डिप्लॉयमेंट विवरण को तकनीकी दस्तावेज़ में वर्णित किया है।
एकल चिप का मुख्य बाधक कारक मेमोरी क्षमता और बैंडविड्थ है, जिसके कारण 10 लाख टोकन तक की संदर्भ लंबाई का समर्थन करना विशेष रूप से कठिन है। इसके लिए, Zhipu ने SGLang पर आधारित एक विशेष निष्पादन इंजन बनाया है, जिसमें W8A8 क्वांटाइजेशन, INT8/FP8/BF16 मिश्रित कैश क्वांटाइजेशन और नोड-अंतर्गत टेंसर पैरललिज़म जैसी तकनीकों का उपयोग किया गया है, साथ ही उत्पादन-स्तरीय Encode–Prefill–Decode (EPD) अलग-अलग आर्किटेक्चर शामिल किया गया है, जिससे मल्टीमोडल कोडिंग, prompt प्रीफिलिंग और टोकन-दर-टोकन डिकोडिंग को स्वतंत्र रूप से शेड्यूल किए जा सकने वाले कार्य पूल में विभाजित किया गया है।
ZhiPu के अनुसार, एक ही हार्डवेयर पर प्रारंभिक बेसलाइन की तुलना में एंड-टू-एंड सेवा प्रदर्शन में 3 गुना की वृद्धि हुई है।
लेटपोस्ट के अनुसार, इन चिप्स के आपूर्तिकर्ता हुआवेई, मोएर लाइनटेन और हैगुआंग से हो सकते हैं। ज़हीपु ने इसके बारे में कोई टिप्पणी नहीं की है, और तकनीकी दस्तावेज़ों में कोई विशिष्ट चिप मॉडल भी नहीं बताया गया है।
SemiAnalysis ने टिप्पणी में विशेष रूप से उल्लेख किया कि पहले ऐसा माना जाता था कि केवल शीर्ष अग्रणी प्रयोगशालाओं ही प्रतिदिन 100 ट्रिलियन टोकन की कैलकुलेशन क्षमता रखती हैं, "जबकि यहाँ प्रतिदिन 100 ट्रिलियन टोकन की मुफ्त ट्रैफिक, सभी घरेलू चिप्स पर चल रही है।"

मॉडल स्वयं: DeepSeek के समान, कीमत Claude Opus 4.8 की 1/40 है। GLM-5.3-Flash का कुल पैरामीटर स्केल 320B है, सक्रिय पैरामीटर 18B हैं, और पैरामीटर मात्रा पिछली पीढ़ी के फ्लैगशिप GLM-5.3 की लगभग 40% है, जो DeepSeek V4 Flash के लगभग समान है।
प्रदर्शन के मामले में, Zhipu की आधिकारिक मूल्यांकन रिपोर्ट के अनुसार, GLM-5.3-Flash ने Artificial Analysis Intelligence Index (AA समग्र बुद्धिमत्ता सूचकांक) में 57 अंक प्राप्त किए, जो पिछली पीढ़ी के फ्लैगशिप GLM-5.2 से अधिक है, Anthropic के Claude Opus 4.8 के बराबर है, और DeepSeek के फ्लैगशिप मॉडल V4 Pro स्थिर संस्करण के 53 अंकों से भी अधिक है।

मूल्य निर्धारण के संदर्भ में, GLM-5.3-Flash के लिए प्रति एक मिलियन टोकन इनपुट 0.8 युआन और आउटपुट 2.8 युआन है, जबकि कैश हिट मूल्य 0.23 युआन है, जो GLM-5.3 का दसवाँ हिस्सा है। लॉन्च के पहले दो सप्ताह तक आधी कीमत लागू होगी।
ज़ह्पु ने कहा कि GLM-5.3-Flash की कीमत GLM-5.3 की 1/10 है, सीमित समय के छूट के दौरान GLM-5.3 की 1/20 है, और Claude Opus 4.8 की 1/40 है।
DeepSeek V4 Flash के समायोजित मूल्य (रात्रि के समय इनपुट 1.5 युआन, आउटपुट 4.5 युआन) की तुलना में, GLM-5.3-Flash अधिकांश सामान्य उपयोग के संदर्भों में सस्ता है।

आर्किटेक्चर इनोवेशन: पैरामीटर और परतों की संख्या लगभग आधी हो गई—GLM-5.3-Flash, GLM-5.3 के पूरी तरह से अलग आर्किटेक्चर डिज़ाइन का उपयोग करता है, जो इसके लिए कम लागत पर उच्चतर प्रदर्शन प्राप्त करने का मुख्य कारण है।
GLM-4.5 की तुलना में, GLM-5.3-Flash की कुल पैरामीटर मात्रा लगभग समान है (355B बनाम 320B), लेकिन सक्रिय पैरामीटर मात्रा 32B से घटकर 18B हो गई है, और स्तरों की संख्या 92 से घटकर 45 हो गई है, जो लगभग आधी है।
ज़ही पिंग के अनुसार, GLM-5.3-Flash पहला ओपन-सोर्स अग्रणी मॉडल है जो विरल ध्यान और रैखिक ध्यान के मिश्रित आर्किटेक्चर का उपयोग करता है। GLM-5.3 की तुलना में, इसकी ध्यान गणना और KV कैश आकार क्रमशः 3.01 गुना और 4.44 गुना कम हैं।
इसके अलावा, यह मॉडल GLM-5 श्रृंखला का पहला मूल बहुआयामी मॉडल है, जो छवि और वीडियो इनपुट का समर्थन करता है, और यह बुद्धिमान प्रतिष्ठान द्वारा coding पर केंद्रित होने के बाद पहला बहुआयामी क्षमता वाला नया मॉडल है।

चीनी AI मॉडल बाजार में एक सामूहिक कीमत वृद्धि के बाद GLM-5.3-Flash के लॉन्च के साथ कम कीमत पर ब्रेकआउट।
किमी K3 की आउटपुट कीमत प्रति मिलियन टोकन 100 युआन तक पहुँच गई है, जो पिछले K2.6 से तीन गुना से अधिक है; ज़ही पिछले छह महीनों में कीमत बढ़ाने के बाद आउटपुट कीमत 28 युआन तक पहुँच गई; डीपसीक V4 Pro की कीमत 6 युआन से बढ़कर 13.5 युआन हो गई, शीर्ष समय पर 27 युआन; डीपसीक V4 Flash की आउटपुट कीमत 2 युआन से बढ़कर 4.5 युआन हो गई, शीर्ष समय पर 9 युआन।
मूल्य वृद्धि का सीधा परिणाम मांग का बाहरी प्रवाह है। द वेनपोइन्टलेटपोस्ट ने बताया कि डीपसीक V4 फ्लैश की कीमत बढ़ने के बाद, OpenCode प्लेटफॉर्म पर उपयोग की मात्रा आधी रह गई, और यह मांग देशी मॉडल निर्माताओं के लिए एक नया विकास क्षेत्र बन गई।
GLM-5.3-Flash की मूल्य नीति, इस अंतर को लक्षित करती है।
