चीन की कंपनी Z.ai, जो पहले Zhipu AI के नाम से जानी जाती थी, ने 26 अगस्त को GLM-5.3-Flash जारी किया, जिससे यह GLM-5 श्रृंखला में पहला स्वदेशी बहुआयामी मॉडल बन गया। इस लॉन्च का महत्व मॉडल के अलावा भी है: यह पूरी तरह से घरेलू रूप से निर्मित AI त्वरकों पर चलता है, जो एक स्पष्ट प्रदर्शन है कि चीनी हार्डवेयर गंभीर बड़े पैमाने के कार्यों को संभाल सकता है।
समय का महत्व है। अमेरिका के निर्यात नियंत्रणों ने चीनी खरीददारों के लिए NVIDIA के सबसे उन्नत चिप्स तक पहुँच को सीमित कर दिया है, जिससे Z.ai जैसी कंपनियों को अपने पास जो कुछ है, उसके आसपास बनाने के लिए मजबूर किया गया है।
मॉडल वास्तव में क्या करता है
GLM-5.3-Flash एक हाइब्रिड आर्किटेक्चर का उपयोग करता है जो स्पार्स और लीनियर ध्यान को मिलाता है, जो एक ऐसा डिज़ाइन विकल्प है जो कंप्यूटिंग की आवश्यकताओं को काफी कम करता है। मॉडल में कुल 320 अरब पैरामीटर हैं, लेकिन प्रति टोकन केवल 18 अरब सक्रिय होते हैं, जिसका अर्थ है कि यह प्रत्येक इन्फरेंस पर पूरी गणना लागत का भुगतान किए बिना एक विशाल ज्ञान आधार पर निर्भर करता है।
कॉन्टेक्स्ट विंडो 1 मिलियन टोकन पर स्थित है, जो इसे किसी भी खुले मॉडल में उपलब्ध सबसे लंबे में से एक बनाता है। इमेज और वीडियो इनपुट के लिए नेटिव समर्थन इसे आर्किटेक्चर स्तर पर वास्तविक रूप से मल्टीमॉडल बनाता है, बस एक जुड़ा हुआ क्षमता के रूप में नहीं।
DeepSWE v1.1 कोडिंग बेंचमार्क पर, GLM-5.3-Flash ने 63.4 का स्कोर प्राप्त किया, जबकि इसके पूर्ववर्ती GLM-5.2 ने 46.2 का स्कोर प्राप्त किया। मॉडल ने कृत्रिम विश्लेषणात्मक बुद्धिमत्ता सूचकांक पर 57 का स्कोर भी प्राप्त किया।
कीमतें आक्रामक हैं। API एक्सेस की लागत $0.15 प्रति मिलियन इनपुट टोकन और $0.50 प्रति मिलियन आउटपुट टोकन है, जबकि कैश्ड इनपुट $0.03 पर उपलब्ध हैं। Z.ai इस लागत को कुछ प्रतिस्पर्धी विकल्पों की लगभग एक-दसवीं के रूप में वर्णित करता है।
चीनी चिप्स वास्तविक कार्य कर रहे हैं
Z.ai ने घरेलू रूप से निर्मित AI त्वरकों के क्लस्टर पर GLM-5.3-Flash को डिप्लॉय किया, फिर उस हार्डवेयर के लिए अनुकूलित सर्विंग स्टैक्स बनाए और क्वांटाइजेशन तकनीकों का उपयोग किया। परिणामस्वरूप, एक सामान्य डिप्लॉयमेंट दृष्टिकोण की तुलना में एंड-टू-एंड प्रदर्शन में तीनगुना सुधार हुआ।
मॉडल MIT लाइसेंस के तहत खुले वजन के साथ आता है, जो Hugging Face और ModelScope पर FP8 और BF16 फॉर्मेट में उपलब्ध है। MIT लाइसेंस सबसे अधिक अनुमतिशील लाइसेंस में से एक है: डेवलपर्स और कंपनियाँ बिना किसी प्रतिबंध के वजन का व्यावसायिक उपयोग, संशोधन और वितरण कर सकते हैं।
