ज़हिपुAI ने दो सप्ताह में 1,00,000 घरेलू AI त्वरकों के डिप्लॉयमेंट को पूरा कर लिया

iconMetaEra
साझा करें
AI summary iconसारांश
ZhipuAI ने AI + क्रिप्टो समाचार के अनुसार, केवल दो हफ्तों में अपना GLM-5.3-Flash निष्पादन प्रणाली 1,00,000 से अधिक घरेलू AI त्वरकों के क्लस्टर पर डिप्लॉय कर दिया। इस प्रणाली की एंड-टू-एंड थ्रूपुट 3.2 गुना बढ़ गई, जिसमें एक AI-संचालित Infra Agent उन कार्यों को संभाल रहा है जिन्हें सामान्यतः सीनियर इंजीनियर करते हैं। ऑन-चेन समाचार में AI के बुनियादी ढांचे में त्वरित एकीकरण पर प्रकाश डाला गया है, जो दर्शाता है कि स्वचालन कैसे तकनीकी प्रवाहों को पुनर्गठित कर रहा है। इस डिप्लॉयमेंट से चीन के AI + क्रिप्टो समाचार क्षेत्र में बढ़ती हुई गति का प्रतिबिंब मिलता है।
दो सप्ताह में, 100,000 घरेलू AI त्वरक, एक अपने मॉडल को अनुकूलित करना शुरू करता है।

लेखक: APPSO

स्रोत: वॉल स्ट्रीट विजन

अभी-अभी, ज़ही पु साइंटिस्ट टैंग जिए ने X प्लेटफॉर्म पर GLM-5.3-Flash इन्फरेंस सिस्टम ऑप्टिमाइजेशन के बारे में एक अध्ययन साझा किया।

उन्होंने बताया कि GLM-5.3-Flash को पहली बार घरेलू AI त्वरक पर चलाने से लेकर पूरे उत्पादन ट्रैफ़िक को संभालने तक केवल दो सप्ताह लगे। इस प्रक्रिया में, सिस्टम की एंड-टू-एंड थ्रूपुट क्षमता 3.2 गुना बढ़ गई।

जो चीज तांग जिए को सबसे अधिक प्रभावित करती है, वह यह है कि बस बुनियादी ढांचा इंजीनियर ही नहीं, बल्कि GLM-5.3 द्वारा संचालित एक Infra Agent भी बड़ी मात्रा में अनुकूलन कार्य पूरा करता है।

"एक मॉडल जो अपनी सेवाओं को अनुकूलित करने में मदद करता है।" टैंग जिए ने इस परिवर्तन का वर्णन किया।

उनके अनुसार, इसका अर्थ है कि AI अपने संचालन को संचालित करने वाले प्रणाली के अनुकूलन में शामिल होना शुरू कर रहा है। हालाँकि, वास्तविक रूप से आत्म-पुनरावृत्ति सुधार (Recursive Self-Improvement, RSI) तक पहुँचने के लिए अभी बहुत दूर है, लेकिन एक प्रारंभिक रूप पहले से ही उभर चुका है।

ज़ह्पु टीम ने भी उल्लेख किया कि पिछले वर्ष के दौरान, उन्होंने देखा कि GLM की भूमिका बदल रही है।

शुरू में, टीम ने GLM की कोड समझ और साइबर सुरक्षा क्षेत्रों में क्षमताओं का अन्वेषण किया, जिससे मॉडल को जटिल कोड में दरारों का विश्लेषण करने में मदद मिल सके। लेकिन मॉडल की क्षमताओं में वृद्धि के साथ, GLM ने AI प्रणालियों के निर्माण में भाग लेना शुरू कर दिया।

टीम ने कहा कि उन्होंने देखा कि मॉडल कुछ ऐसे कार्य पूरा कर रहे हैं जिन्हें पहले अनुभवी इंफ्रास्ट्रक्चर इंजीनियर टीम को कई सप्ताह लगते थे, और ये कार्य पीढ़ी के मॉडल के प्रशिक्षण और डिप्लॉयमेंट तरीकों पर सीधा प्रभाव डालते हैं।

दो सप्ताह में घरेलू कैलकुलेशन क्लस्टर डिप्लॉय किया गया

एक बड़े मॉडल को नए हार्डवेयर पर पहली बार चलाने से लेकर स्थिर उत्पादन अनुरोधों को संभालने वाली निष्कर्षण सेवा तक पहुँचाने के लिए बहुत सारा सिस्टम इंजीनियरिंग कार्य आवश्यक है।

GLM-5.3-Flash इस डिप्लॉयमेंट को 10 लाख से अधिक देशी AI त्वरकों के क्लस्टर पर चलाया गया है। ज़ही पीटीम ने कहा कि यह एक ऐसा बड़ा डिप्लॉयमेंट था जिसके लिए पहले कोई परिपक्व अनुभव उपलब्ध नहीं था।

टीम को कई समस्याओं का समाधान करना होगा, जिनमें देशी चिप की VRAM क्षमता और इंटरकनेक्ट बैंडविड्थ सीमाएँ, नए मॉडल आर्किटेक्चर के अनुकूलन, 10 लाख टोकन लंबे संदर्भ समर्थन, और मल्टीमॉडल अनुरोधों को संभालना शामिल हैं। इसके बीच, देशी AI त्वरक का सॉफ्टवेयर पारिस्थिति अभी विकास के चरण में है, कुछ कर्नेल समर्थन अपर्याप्त है, और बहुत सारी जानकारी को इंजीनियरिंग टीम को स्वयं खोजना पड़ता है।

टैंग जिए ने कहा कि इन सीमाओं के तहत, GLM-5.3 द्वारा संचालित Infra Agent ने निष्कर्ष निकालने वाली प्रणाली अनुकूलन प्रक्रिया में भाग लिया, जिसने प्रदर्शन की सीमाओं का विश्लेषण किया, अनुकूलन सुझाव प्रस्तुत किए और कुछ कोड संशोधन पूरा किए।

पूरी अनुकूलन प्रक्रिया केवल गणना संसाधनों को बढ़ाने की बजाय, गणना क्षमता, स्मृति, संचार और नियोजन के बीच एक नया संतुलन ढूंढना है।

ज़ह्पु टीम ने एक श्रृंखला अनुकूलन योजनाओं का उपयोग किया है। उदाहरण के लिए, ReplaySSM के माध्यम से गणना के लिए मेमोरी स्थान, नोड-अंतर्गत टेंसर पैरललिज़म के माध्यम से वीजीपी मेमोरी दबाव को कम करना, INT8, FP8, BF16 मिश्रित परिशुद्धता कैशिंग के माध्यम से क्षमता उपयोग दक्षता में सुधार, और विभिन्न अनुमान चरणों को अधिक लचीले ढंग से शेड्यूल करने के लिए Encode-Prefill-Decode (EPD) अलगारचना का परिचय।

अंततः, GLM-5.3-Flash की एंड-टू-एंड सेवा प्रदर्शन शुरुआती संस्करण की तुलना में लगभग 3 गुना बेहतर हो गया है, और हार्डवेयर उपयोग और प्रति टोकन लागत प्रमुख NVIDIA GPU प्लेटफॉर्म के स्तर के करीब पहुंच गए हैं।

डिप्लॉय करने के बाद, GLM-5.3-Flash को वास्तविक उपयोग परीक्षण में शामिल किया गया। ज़ही टीम ने बताया कि इस मॉडल को पहले OpenCode और OpenRouter प्लेटफॉर्म पर अज्ञात मॉडल नाम Ox-Alpha के साथ चलाया गया था, जिसने एक सप्ताह में दोनों प्लेटफॉर्म पर सबसे अधिक उपयोग किए जाने वाले मॉडलों में से एक बन गया और छह दिनों में 62 ट्रिलियन टोकन्स को प्रोसेस किया।

हालांकि, इस प्रयोग का वास्तविक परिवर्तन केवल एआई द्वारा कोड लिखना नहीं है, बल्कि एआई के लिए जटिल प्रणालियों में प्रदर्शन में परिवर्तन क्यों होता है, इसे समझना है।

उदाहरण के लिए, जब सिस्टम द्वारा "थ्रूपुट 20% घट गया" का प्रतिक्रिया दिया जाता है, तो यह केवल यह बता सकता है कि कहीं असामान्यता हुई है, लेकिन यह सीधे एजेंट को नहीं बता सकता कि कौन-सी परत में समस्या है, वर्तमान अनुमान गलत है या नहीं, और अगला कदम क्या सत्यापित करना चाहिए।

अनुभवी इंजीनियरों के लिए, ऐसे निर्णय लंबे समय के अनुभव पर निर्भर करते हैं। इंजीनियर जानते हैं कि कब निष्पादन लाइन देखनी है, कब माइक्रो बेंचमार्क चलाने हैं, और किस मॉड्यूल के आउटपुट की तुलना करनी है।

ZhiPu टीम इस इंजीनियरिंग अनुभव को AI द्वारा उपयोग किए जाने वाले फीडबैक मैकेनिज़म में बदलना चाहती है और इसे «dense feedback» कहती है।

इस तंत्र का केंद्र यह है कि एजेंट को इंजीनियरिंग निर्णय प्रक्रिया के अधिक निकट जानकारी प्राप्त हो।

जब मॉडल को यह पुष्टि करने की आवश्यकता होती है कि गणना सही है या नहीं, तो यह सही प्रतिक्रिया प्राप्त कर सकता है; जब मॉडल को प्रदर्शन में कमी का कारण विश्लेषण करने की आवश्यकता होती है, तो यह सिस्टम के चलने के दौरान समय खर्च को देख सकता है; जब मॉडल नए अनुकूलन योजनाओं का प्रयास करता है, तो यह प्रयोगों के माध्यम से यह निर्णय ले सकता है कि यह योजना वर्तमान परिदृश्य के लिए उपयुक्त है या नहीं।

ज़ही पी टीम का मानना है कि वास्तविक रूप से प्रभावी प्रतिक्रिया के लिए कुछ शर्तें पूरी होनी चाहिए: इसे विशिष्ट समस्या के बहुत करीब होना चाहिए, जिसे त्वरित रूप से प्राप्त किया जा सके और जिसे वस्तुनिष्ठ प्रयोगों द्वारा सत्यापित किया जा सके। अन्यथा, बड़ी मात्रा में लॉग और सूचक एजेंट को अगला कदम उठाने की दिशा निर्धारित करने में कठिनाई पैदा कर सकते हैं।

मॉडल ऑप्टिमाइजेशन सिस्टम, सिस्टम सर्विस मॉडल

डेंस फीडबैक की सहायता से, इन्फ्रा एजेंट छिपे समस्याओं को पहचानने वाले रीजनिंग सिस्टम में शामिल होने लगा।

KDA के संदर्भ में समानांतर पथ में, एजेंट ने लंबे संदर्भ गणना की सटीकता को प्रभावित करने वाली समस्या का पता लगाया।

चूंकि विभिन्न संदर्भ शार्ड्स के बीच स्थिति मैट्रिक्स को लगातार मर्ज करने की आवश्यकता होती है, TF32 गणना द्वारा उत्पन्न गोलाई की त्रुटि अनुक्रम की लंबाई के साथ जुड़ती रहती है और अंततः गणना परिणाम में विचलन उत्पन्न करती है।

एजेंट ने विभिन्न निष्पादन पथों के परिणामों की तुलना करके समस्या को स्थिति प्रसार और संयोजन प्रक्रिया में शुद्धता के संस्करण में स्थानांतरित कर दिया है। संबंधित ठीक किए गए परिवर्तन Flash Linear Attention प्रोजेक्ट PR #1180 में शामिल कर दिए गए हैं।

KV ट्रांसफ़र और DeepEP शेड्यूलिंग के बीच एक अन्य समस्या उत्पन्न हुई।

टेस्टिंग के दौरान, एजेंट ने पाया कि KV ट्रांसफ़र, DeepEP डिस्पैच के साथ प्रभावी ढंग से ओवरलैप नहीं हो रहा है, जिससे कुछ परिदृश्यों में ट्रांसमिशन ओवरहेड 30% से अधिक हो गया।

इसके बाद, एजेंट ने Python और C++ कॉल चेन का विश्लेषण जारी रखा और पाया कि नोड के भीतर पथ को Python GIL को समय पर छोड़ा नहीं गया था, जिससे ट्रांसमिशन कार्य समय पर आगे नहीं बढ़ पा रहा था।

संशोधन पूरा होने के बाद, KV ट्रांसफ़र के कारण अतिरिक्त लागत 30% से अधिक से कम से कम 1% तक कम हो गई।

इसके अलावा, एजेंट ने एक डिकोड कर्नेल को भी अनुकूलित किया है।

यह पाया गया कि Kernel के विभाजन तरीके के कारण, एक ही सेट के नॉर्मलाइजेशन कैलकुलेशन को चार बार दोहराया जा रहा था। गणना संरचना को पुनर्व्यवस्थित करके, दोहराए गए कैलकुलेशन को कम करके, इस Kernel को अंततः 1.71 गुना की प्रदर्शन वृद्धि प्राप्त हुई।

यह अनुकूलन विचार Agent द्वारा SGLang, Flash Linear Attention और DeepGEMM जैसी परियोजनाओं के मौजूदा Kernel के अध्ययन से आया है। इसमें इन कोड में से अनुकूलन के अनुभव को 'optimization skeleton' में संकलित किया जाता है, और फिर वर्तमान प्रणाली की प्रतिक्रिया के साथ मेल खाने की जांच की जाती है।

पिछले समय में, इस तरह के अनुकूलन का अनुभव मुख्य रूप से इंजीनियरों के व्यक्तिगत अनुभव पर निर्भर करता था।

इस प्रक्रिया के दौरान, एजेंट सीखने लगता है कि कैसे मौजूदा कोड से अनुकूलन विधियाँ प्राप्त की जाएँ, और फिर प्रयोगों के माध्यम से यह जाँचता है कि ये विधियाँ नए हार्डवेयर और मॉडल वातावरण के लिए उपयुक्त हैं या नहीं।

टैं जिए ने कहा कि मानव इंजीनियर अभी भी लक्ष्य निर्धारित करने, प्रतिक्रिया वातावरण बनाने और उच्च जोखिम वाले संशोधनों की समीक्षा करने के लिए जिम्मेदार हैं।

लेकिन इंजीनियरों की भूमिका धीरे-धीरे हर समस्या को सीधे हल करने वाले से, प्रतिक्रिया प्रणालियों को डिज़ाइन करने वाले में बदल रही है।

ज़ह्पु टीम का मानना है कि वास्तविक बुनियादी ढांचे के कार्यों पर आधारित एक सत्यापित प्रतिक्रिया वातावरण, अगली पीढ़ी के मॉडल के प्रशिक्षण के लिए एक महत्वपूर्ण आधार भी हो सकता है। प्रत्येक एजेंट द्वारा पूरा किया गया इंजीनियरिंग कार्य, अगली पीढ़ी के मॉडल के लिए सीखने का डेटा बन सकता है।

वर्तमान में, GLM-5.3-Flash के मामले वास्तविक आत्म-सुधार की दिशा में अभी भी दूर हैं। लेकिन टैंग जिए का मानना है कि एक न्यूनतम चक्र पहले से ही उभर चुका है।

मॉडल ऑप्टिमाइजेशन सिस्टम, जबकि सिस्टम सर्विस मॉडल।

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।