मूनशॉट AI ने किमी K3 मॉडल को ओपन सोर्स कर दिया, 401 योगदानकर्ताओं का खुलासा

iconMetaEra
साझा करें
AI summary iconसारांश
मूनशॉट एआई ने 27 जुलाई, 2026 को अपने किमी K3 मॉडल को ओपन-सोर्स करने की घोषणा की, जिसमें 401 योगदानकर्ताओं की सूची शामिल है। अब कंपनी का $31.5 बिलियन का मूल्यांकन है, जो 300 से अधिक 30 वर्ष से कम उम्र के पेशेवरों की टीम द्वारा समर्थित है। संस्थापक झोउ शिनयू, वु यूशिन और सीटीओ ज़हांग यूताओ एक समूह का नेतृत्व करते हैं, जिसमें त्सिंगहुआ और कार्नेगी मेलन के शोधकर्ता शामिल हैं। MoBA, Mooncake और Muon जैसे नवाचारों के कारण टीम को FAST 2025 का बेस्ट पेपर पुरस्कार मिला। यह एआई + क्रिप्टो समाचार अपडेट शीर्ष अल्टकॉइन समाचार विकासों पर प्रकाश डालता है।
AI द्वारा उत्पन्न सारांश: जुलाई 2026 में, Moon Shadow ने Kimi K3 मॉडल को ओपन सोर्स किया और पहली बार 401 योगदानकर्ताओं की सूची प्रकाशित की। कंपनी का नवीनतम मूल्यांकन 315 अरब डॉलर है, टीम में लगभग 300 से अधिक लोग हैं, औसत आयु 30 वर्ष से कम है, और प्रति व्यक्ति 7 अरब डॉलर के मूल्यांकन का जिम्मा संभाल रहे हैं। मुख्य टीम में तीन सह-संस्थापक शामिल हैं: एल्गोरिदम प्रमुख झोउ शिनयू, आर्किटेक्ट वु यूशिन और CTO ज़ांग युताओ, और त्सिंहुआ, CMU जैसे शीर्ष विश्वविद्यालयों से आए मुख्य सदस्य। टीम ने MoBA मिश्रित ब्लॉक ध्यान तंत्र, Mooncake डिकपल्ड इनफ़रेंस आर्किटेक्चर, Muon ऑप्टिमाइज़र जैसी नींव की प्रौद्योगिकियों में कई नवाचार किए हैं, जिनके परिणामों को FAST 2025 में सर्वश्रेष्ठ पेपर सहित कई सम्मान प्राप्त हुए। यह युवा हैकर टीम समतल प्रबंधन के लिए प्रसिद्ध है, जो "लंबा, तेज़, सस्ता" के इंजीनियरिंग कुशलता को अधिकतम सीमा तक पहुँचाती है, और चीन के बड़े मॉडल क्षेत्र में महत्वपूर्ण शक्ति बन गई है।

लेखक, स्रोत: लेयेफेंगवांग

27 जुलाई को, मून ऑफ डार्कनेस ने पूरी ईमानदारी से पूरी तरह से विकसित 2.8T मॉडल Kimi K3 को ओपन सोर्स कर दिया। तकनीकी रिपोर्ट के अंत में, उन्होंने पहली बार Kimi K3 के पीछे के वास्तविक योगदानकर्ताओं की सूची प्रकाशित की, हमने गिना तो 401 सदस्य थे, जिससे स्पष्ट होता है कि यह मून ऑफ डार्कनेस की प्रतिभाशाली टीम का एक समग्र प्रदर्शन है।

शुरुआती टीम जिसका मूल्य केवल कुछ अरब डॉलर था, आज वह वास्तविक रूप से 'घरेलू बड़े मॉडल की रोशनी' बन चुकी है; मून ऑफ डार्कनेस अब वैश्विक मेज पर कुछ ही ऐसे गैजेट्स में से एक है जो Claude Fable 5 और GPT-5.6 Sol जैसे शीर्ष मॉडल के साथ प्रतिस्पर्धा कर सकते हैं।

K3 के लॉन्च के साथ, मून के अंधेरे का नवीनतम आकलन 315 अरब डॉलर, लगभग 2100 अरब युआन तक पहुँच गया है, और इस 2100 अरब के आकलन को एक अत्यंत युवा टीम द्वारा समर्थित किया जाता है।

उपलब्ध जानकारी के अनुसार, मून ऑफ द डार्क साइड में लगभग 300 से अधिक लोग हैं, जिनकी औसत आयु 30 वर्ष से कम है, और उनमें से 80% I प्रकार के हैं। यदि इसे गणना की जाए, तो प्रति व्यक्ति लगभग 700 मिलियन चीनी युआन का मूल्यांकन होता है।

मून ऑफ द डार्क साइड की संगठनात्मक संरचना बहुत समतल है। मून ऑफ द डार्क साइड के पांच संस्थापक हैं, जिनमें से प्रत्येक सीधे 40-50 लोगों से जुड़ा हुआ है। आंतरिक रूप से इसे "कोई पदोन्नति नहीं, कोई KPI नहीं, कोई विभागीय दीवारें नहीं" के लिए जाना जाता है, और कर्मचारी किसी भी समय अपने बॉस को चुनौती दे सकते हैं। एक छोटा विवरण यह है कि 2025 की शुरुआत में प्रतिबिंब सम्मेलन में, एक कर्मचारी ने एक उत्कट सुझाव दिया, और यांग ज़हीलिन ने इस सुझाव से भी अधिक उत्कट कदम उठाया—उन्होंने K1 छोड़कर सीधे K2 पर काम करना शुरू कर दिया।

इस अनोखापन को कंपनी के "आत्मा" में भी देखा जा सकता है। रॉक प्रेमी यांग ज़हानलिन ने मीटिंग रूम को रोलिंग स्टोन्स, निर्वाना, रेडियोहेड जैसे लीजेंडरी बैंड्स के नाम दिए हैं, और यहां तक कि किमी के सदस्यता प्लान को भी एडाजियो, एलेग्रो जैसे संगीत शब्दों से नामित किया गया है।

मून ऑफ द डार्क साइड मानती है कि आज के समय, जब कैलकुलेशन पावर और डेटा एक जैसे होते जा रहे हैं, "स्वाद" ही भिन्नता की बाधा बनाने की मुख्य शक्ति है। यह स्वाद केवल मॉडल के सुधार में ही नहीं, बल्कि उनके प्रति लोगों के प्रति उनकी निर्वाचनशीलता और इच्छा में भी गहराई से प्रतिबिंबित होता है।

मून ऑफ द डार्क साइड के सीईओज़ को नियुक्त करना पसंद है, और वे "उद्यमी प्रभाव" या "जुएबाज़ जीन" वाले लोगों को बहुत पसंद करते हैं। उपलब्ध जानकारी के अनुसार, कंपनी के अंदर कम से कम 50 लोगों ने किसी स्टार्टअप की स्थापना की है या उसमें शामिल हुए हैं। और पिछले वर्ष में, मून ऑफ द डार्क साइड द्वारा भर्ती किए गए नए कर्मचारियों में से 100 से अधिक लोग आंतरिक सिफारिश के माध्यम से आए हैं।

आज, हम सूची के अनुसार, K3 योगदानकर्ताओं से संबंधित सभी प्रामाणिक और विश्वसनीय जानकारी को एकत्रित करते हैं। इस शीर्ष टेक टीम की मूल पृष्ठभूमि और कठोर क्षमताएँ पूरी तरह से प्रदर्शित होती हैं।

01 किमी तकनीकी ढांचे की शीर्ष नींव

जोउ शिनयू:

ZHOU Xinyu एक प्रमुख सह-संस्थापक हैं और एल्गोरिदम टीम के प्रमुख हैं।

जो शिनयू और यांग ज़हेलिन पहले से ही परिचित थे, एक दिलचस्प बात यह है कि जो शिनयू क्विंगहुआ विश्वविद्यालय के Splay बैंड के गिटारिस्ट थे, और ड्रमर यांग ज़हेलिन थे।

मून ऑफ द डार्क से पहले, जोउ शिनयू ने मेगविज़न में एल्गोरिदम उत्पादन और मोबाइल मॉडल अनुसंधान पर काम किया। उन्होंने मेगविज़न के तत्कालीन बुनियादी अनुसंधान प्रमुख, वर्तमान जियाये स्टार्स के मुख्य वैज्ञानिक ज़हांग शियांगयू के साथ घनिष्ठ रूप से सहयोग किया और हल्के नेटवर्क के प्रसिद्ध कार्य ShuffleNet को मुख्य लेखक के रूप में सीधे लिखा।

जो शिनयू का मुख्य ध्यान बड़े मॉडल एल्गोरिदम के बड़े पैमाने पर उत्पादन पर है, और वह सबसे अग्रणी प्रयोगशाला एल्गोरिदम को उच्च दक्षता और कम लागत पर बड़े पैमाने पर उत्पादन प्रणाली में परिवर्तित करने में कुशल है। वह मिश्रित आर्किटेक्चर अनुकूलन में भी कुशल है, और Reddit समुदाय के तकनीकी साक्षात्कार (AMA) में, उन्होंने पहली बार Kimi K3 KDA मिश्रित आर्किटेक्चर को NoPE MLA के साथ तुलना करके इसके लाभों को समझाया, जिससे साबित हुआ कि यह आर्किटेक्चर प्री-ट्रेनिंग और रीइनफोर्समेंट लर्निंग में कम कंप्यूटेशनल संसाधनों का उपयोग करता है और तेज़ है।

वु युक्सिन:

वु युसिन मून ऑफ द डार्क साइड के सह-संस्थापकों में से एक हैं। इसके अलावा, वह कृत्रिम बुद्धिमत्ता के क्षेत्र में एक शीर्ष विशेषज्ञ और प्रसिद्ध आर्किटेक्ट हैं, जिनके पास डीप लर्निंग, कंप्यूटर विज़न (CV) और बड़े भाषा मॉडल (LLM) के नींव के इंजीनियरिंग आर्किटेक्चर और बुनियादी ढांचे में गहरी विशेषज्ञता है।

वु युसिन और यांग ज़हलिन का शैक्षणिक पृष्ठभूमि समान है, जिन्होंने चीन के त्सिंहुआ विश्वविद्यालय के कंप्यूटर विज्ञान विभाग से स्नातक किया और फिर संयुक्त राज्य अमेरिका के कार्नेगी मेलन विश्वविद्यालय (CMU) में अध्ययन किया। उन्होंने मेटा AI अनुसंधान प्रयोगशाला (FAIR) में अनुसंधान इंजीनियर के रूप में काम किया, जहाँ उन्होंने कई कंप्यूटर दृष्टि की मील के पत्थर तकनीकों का नेतृत्व किया और योगदान दिया।

यू यूशेन ने यांग ज़हानलिन के साथ मून ऑफ द डार्क साइड की स्थापना करने से पहले ही डीप लर्निंग और कंप्यूटर विज़न के क्षेत्र में दो उद्योग-मानक स्तर के प्रमुख योगदान दिए थे:

एक तो, Detectron2 के मुख्य स्थापक और विकासकर्ताओं में से एक के रूप में, यह प्रोजेक्ट ने वैश्विक कंप्यूटर दृष्टि के ग्रेजुएट इकोसिस्टम को पुनर्परिभाषित किया और दुनिया भर के हजारों विजुअल बड़े मॉडल और ऑब्जेक्ट डिटेक्शन प्रोजेक्ट्स के लिए एक “सामान्य आधार” बन गया।

उन्होंने 2018 में शीर्ष शोधकर्ता हेकैमिंग के साथ ग्रुप नॉर्मलाइजेशन पर एक प्रमुख कार्य प्रकाशित किया, जिसे ECCV 2018 का बेस्ट पेपर ऑनरेबल मेंशन मिला।

यह क्लासिक पेपर छोटे नमूनों के प्रशिक्षण के दौरान पारंपरिक Batch Normalization की मारात्मक सीमा को तोड़ देता है। एक या दो पंक्तियों के निचले स्तर के नवाचार के साथ "वैश्विक AI प्रशिक्षण नियमों को पुनः लिखने" की इस क्षमता ने वु यूशेन को ओपन सोर्स दुनिया में उच्च तकनीकी आकर्षण प्रदान किया है।

मून के अंधेरे पक्ष पर, वह वह व्यक्ति था जिसने नींव रखी। उन्होंने बड़े मॉडल आर्किटेक्चर और प्रशिक्षण की दक्षता में सुधार के कार्य में गहराई से भाग लिया, और उन्होंने वैश्विक PyTorch डेवलपर्स कॉन्फ्रेंस में भाग लेकर दुनिया को Kimi द्वारा वैश्विक ओपन सोर्स इंफ्रास्ट्रक्चर पर किए गए मूलभूत योगदान को स्पष्ट रूप से समझाया।

वु युशेन की विशेषज्ञता, किमी को अगली पीढ़ी के बहुमॉडल लंबे टेक्स्ट सीमाओं को चुनौती देने के लिए अंतिम टुकड़ा प्रदान करती है। वह उच्च-प्रदर्शन गहरी शिक्षा प्रणाली अनुकूलन में निपुण हैं, जो यह सुनिश्चित करता है कि बड़े मॉडल ट्रिलियन पैरामीटर्स के साथ अधिक स्थिर, तेज़ और कम मेमोरी का उपयोग करके चलें—यही किमी को लंबे टेक्स्ट और उच्च समानांतरता के दौरान चिकनी अनुभव प्रदान करने के लिए तकनीकी कवच है।

उन्होंने डीप लर्निंग के एक मील का पत्थर MoCo v1 के प्रमुख लेखकों में से एक के रूप में, किमी को न केवल उद्योग के सबसे शक्तिशाली दिमाग (प्राकृतिक भाषा समझ) प्रदान किया है, बल्कि वास्तविक भौतिक दुनिया को गहराई से समझने की क्षमता (बहुमोडल दृश्य) भी विकसित कर रहा है।

ज़हांग युताओ:

ज़हांग युताओ मून ऑफ द डार्क साइड के सह-संस्थापकों में से एक हैं और मून ऑफ द डार्क साइड के CTO भी हैं। वे यांग ज़हीलिन के साथ त्सिंहुआ विश्वविद्यालय के सहपाठी हैं, और ज़ही पुर के संस्थापक तांग जिए उनके शिक्षक हैं।

2016 में, ज़हांग युताओ और यांग ज़हिलिन ने "सर्कुलर इंटेलिजेंस" की स्थापना की, और बाद में, उन्होंने "मून के अंधेरे पक्ष" की स्थापना की। अगर यांग ज़हिलिन "मून के अंधेरे पक्ष" के "नेविगेटर" हैं, तो ज़हांग युताओ उस प्रमुख इंजीनियर हैं जो "इंटेलिजेंस" नामक विशालकाय जहाज के ड्राइव सिस्टम को अधिकतम स्तर तक समायोजित करते हैं। किमी क्षमता लंबे पाठ, जटिल तर्क और एजेंट कार्य निष्पादन में क्रांतिकारी विकास करने में सक्षम हुई, इसमें ज़हांग युताओ का अमूल्य योगदान है।

मून ऑफ द डार्क से पहले, उन्होंने ज्ञान ग्राफ और हेटरोजीनियस डेटा फ्यूजन के क्षेत्र में कई "उद्योग-स्तरीय" महत्वपूर्ण उपलब्धियाँ प्राप्त की हैं।

उनके सबसे ज्ञात तकनीकी योगदानों में से एक यह है कि वे तकनीकी जिम्मेदार के रूप में AMiner नामक वैज्ञानिक बड़े डेटा विश्लेषण प्लेटफॉर्म के विकास का नेतृत्व कर रहे थे। आज, इस प्लेटफॉर्म का उपयोग दुनिया भर के करोड़ों शोधकर्ता करते हैं, और इसकी केंद्रीय असमान डेटा समेकन तकनीक में ज़ंग युताओ द्वारा त्सिंहुआ विश्वविद्यालय में डॉक्टरेट के दौरान विकसित की गई मूलभूत क्षमताएँ शामिल हैं। "विशाल ज्ञान को मशीन कैसे समझी और खोजी जाए" की इस गहन समझ ने Kimi की अत्यधिक लंबे पाठ प्रसंस्करण क्षमता के लिए तकनीकी आधार प्रदान किया है।

उसने KDD, CIKM जैसे कंप्यूटर विज्ञान के शीर्ष सम्मेलनों में कई उच्च-उद्धरण वाले पेपर प्रकाशित किए हैं। वह केवल ज्ञान ग्राफ़ का उपयोग करके AI को "तार्किकता" प्रदान करने में कुशल ही नहीं है, बल्कि चक्रीय बुद्धिमत्ता के समय में ही "हजार चक्र शून्य-नमूना AI प्लेटफॉर्म" के विकास का नेतृत्व किया, जिससे उद्योग के बड़े मॉडल का उद्यम सेवा परिदृश्यों में स्केल पर लागू होना संभव हुआ।

ज़हांग युताओ की विशेषज्ञता ने AI के "बात करने क्षमता" से "काम करने क्षमता" में परिवर्तन के प्रत्येक बिंदु का सटीक अनुमान लगाया। उन्होंने लंबे संदर्भ विंडो तकनीक और गतिशील विस्तार नेटवर्क आर्किटेक्चर को आगे बढ़ाने पर ध्यान केंद्रित किया, जो AI को विशाल मात्रा में जानकारी में "जागरूक" रखने की समस्या को हल करता है।

2026 के जुलाई में आयोजित नवीनतम तकनीकी सम्मेलन पर, उन्होंने उद्योग के इंजीनियरिंग की तीन तकनीकी प्रवृत्तियों को स्पष्ट किया: 2023 में "कैसे पूछें" के लिए Prompt का युग था, 2024 में "पर्याप्त जानकारी दें" के Context के युग में विकास हुआ, और 2026 में, बड़े मॉडल ने Harness इंजीनियरिंग के नए चरण में प्रवेश किया। अब, वह अपनी टीम के साथ "AI के लिए रनटाइम वातावरण कैसे बनाएं, ताकि अगर समस्या आए तो यह स्वयं बंद चक्र में सुधार कर सके" के अंतिम मुद्दे पर काम कर रहे हैं।

हस शिनरन:

हस शिनरेन मूनशॉट एआई की इंजीनियरिंग उपाध्यक्ष और एआई इंफ्रास्ट्रक्चर की प्रमुख हैं।

उसके पास पूर्ण-स्टैक निचले स्तर के विकास का अनुभव है, जिसमें पहले उसने मेगविज़न में मेगएंजिन (टियानयुआन) डीप लर्निंग फ्रेमवर्क और अरबों सदिश खोज प्रणाली के विकास की जिम्मेदारी संभाली थी। वर्तमान में, वह मून ऑफ द डार्क साइड के बड़े मॉडल प्रशिक्षण, अनुमान और बुनियादी ढांचे के समग्र डिज़ाइन की जिम्मेदारी संभाल रहा है।

बड़े मॉडल इन्फरेंस पर, किमी के लंबे टेक्स्ट बिजनेस सीनेरियो के लिए, उसने अपनी टीम के साथ मिलकर KV Cache पर आधारित अलग इन्फरेंस आर्किटेक्चर Mooncake डिज़ाइन किया। इस उपलब्धि ने प्रीफिल (Prefill) और डिकोड (Decode) चरणों को पूरी तरह से अलग करके, लाखों स्तर के अत्यधिक लंबे कॉन्टेक्स्ट के लिए GPU मेमोरी और I/O दबाव को कम किया, जिसके कारण इसे स्टोरेज के शीर्ष सम्मेलन FAST 2025 का सर्वश्रेष्ठ पेपर पुरस्कार मिला।

इसी समय, MoBA (मिक्स्ड ब्लॉक अटेंशन) मैकेनिज़म के मुख्य लेखकों में से एक के रूप में, उन्होंने ब्लॉक-स्तरीय अटेंशन विभाजन के माध्यम से किमी के लिए प्रशिक्षण और निष्कर्ष दोनों पर लागत में भारी कमी और दक्षता में वृद्धि प्राप्त की।

मॉडल ट्रेनिंग के लिए, उन्होंने ओपन सोर्स प्रोजेक्ट Moonlight और इसके नीचे के ऑप्टिमाइज़र Muon के विकास में भाग लिया, जिसमें पारंपरिक AdamW के स्थान पर मैट्रिक्स ऑर्थोगोनलाइज़ेशन का उपयोग करके डिस्ट्रीब्यूटेड ट्रेनिंग में ट्रिलियन पैरामीटर मॉडल की कैलकुलेशन लागत को कम किया गया।

इस श्रृंखला के आधार पर, जिसमें बड़े पैमाने पर लंबे टेक्स्ट ट्रैफ़िक के लिए वितरित स्टोरेज और इन्फ़रेंस का अभ्यास शामिल है, उन्हें GOSIM China वैश्विक ओपन सोर्स सम्मेलन में भाषण देने के लिए आमंत्रित किया गया था। उनका फोकस हमेशा पूर्ण स्टैक लेयर मॉडल आर्किटेक्चर पर केंद्रित रहा है, जिसमें कम FLOPs खर्च और KV Cache उपयोग के साथ उच्च-बुद्धिमान लंबे टेक्स्ट इन्फ़रेंस को समर्थन देने पर जोर दिया जाता है।

हे वेइरान:

मून ऑफ द डार्क सिस्टम के प्रमुख के रूप में, वह FAST 2025 के सर्वश्रेष्ठ पेपर के मुख्य लेखक हैं, और किमी के लंबे टेक्स्ट रीजनिंग आर्किटेक्चर के इंजीनियरिंग लागूकरण के मुख्य तकनीकी स्तंभ हैं। किमी k1.5, Kimi-VL, K2 से लेकर Kimi Linear, Kimi-Audio, और फिर MoBA, Muon, AttnRes जैसे मुख्य आर्किटेक्चर पेपर्स तक, उनका नाम छह पीढ़ियों की तकनीकी उपलब्धियों में शामिल है, और उनका सभी कार्य एक ही केंद्रीय लक्ष्य पर केंद्रित है: सिस्टम डिज़ाइन के माध्यम से कुशलता प्राप्त करना, ताकि बड़े मॉडल सचमुच सस्ते हो सकें।

मून ऑफ द डार्क के साथ जुड़ने से पहले, हे वेइरान ने हाई-परफॉरमेंस कॉम्प्यूटिंग के क्षेत्र में कई वर्षों तक काम किया था। उन्होंने त्सिंगहुआ विश्वविद्यालय के कंप्यूटर विज्ञान विभाग से स्नातक किया और शुरुआत में चिप राउटिंग और लो-लेवल परफॉरमेंस ऑप्टिमाइजेशन पर काम किया; क्वानशी के समय उन्होंने अपने आप के AI चिप और लो-बिटविड्थ न्यूरल नेटवर्क पर काम किया, जबकि मून ऑफ द डार्क के सह-संस्थापक झोउ शिनयू के साथ समान समय पर काम कर रहे थे—झोउ शिनयू वास्तव में क्लासिक OCR टेक्स्ट डिटेक्शन सॉल्यूशन EAST के पहले आविष्कारक हैं।

2023 में मून ऑफ द डार्क साइड में शामिल होने के बाद, उन्होंने अपने वर्षों के सिस्टम इंजीनियरिंग के अनुभव को ट्रिलियन पैरामीटर मॉडल के इन्फरेंस सर्विस पर लागू किया।

उनका सबसे प्रतिनिधित्वपूर्ण योगदान KVCache के अलग निष्पादन आर्किटेक्चर Mooncake है। यह प्रणाली पारंपरिक निष्पादन सेवा आर्किटेक्चर को तोड़ती है और बड़े मॉडल के सबसे अधिक GPU मेमोरी खपत करने वाले मेमोरी कैश को अलग करके केंद्रीय रूप से स्केड्यूल करती है, जिससे वैश्विक कैश पुनःउपयोग और सूक्ष्म रूटिंग के माध्यम से, कैलकुलेशन संसाधनों के स्तर को अपरिवर्तित रखते हुए, Kimi के लिए अनुरोध क्षमता में 75% से अधिक की वृद्धि हुई। 2024 के QCon सम्मेलन में उन्होंने प्रकट किया कि इस आर्किटेक्चर और निरंतर इंजीनियरिंग अनुकूलन के आधार पर, Kimi निष्पादन क्लस्टर की प्रति इकाई लागत में एक वर्ष में 20 गुना से अधिक की कमी हुई।

फरवरी 2025 में, मूनकेक से संबंधित पेपर ने FAST कॉन्फ्रेंस का एरिक रीडल बेस्ट पेपर अवॉर्ड जीता—यह स्टोरेज सिस्टम क्षेत्र के सबसे बड़े सम्मानों में से एक है। इसकी इंजीनियरिंग मूल्य को और अधिक स्पष्ट करता है कि पेपर को आधिकारिक रूप से पुरस्कृत करने से पहले ही, यह आर्किटेक्चर Kimi के उत्पादन वातावरण में हजारों नोड्स पर स्थिर रूप से चल रहा था और रोजाना अरबों टोकन के उपयोगकर्ता अनुरोधों को संभाल रहा था।

हालांकि K3 तकनीकी रिपोर्ट में व्यक्तिगत भूमिकाओं का विवरण नहीं दिया गया है, लेकिन कई मुख्य उपलब्धियाँ उनकी टीम की तकनीकी परंपरा को जारी रखती हैं: KDA+MLA मिश्रित आर्किटेक्चर के तहत पारंपरिक प्रीफिक्स कैश असफलता की समस्या के लिए, टीम ने vLLM समुदाय को आधिकारिक अनुकूलन का योगदान दिया है; लाखों टोकन वाली लंबी अनुरोधों के लिए, क्लस्टर ने कैश-संवेदनशील रूटिंग स्केड्यूलिंग रणनीति का उपयोग किया है, जिससे कैश पुन:उपयोग की दक्षता को अधिकतम किया गया है। अंततः K3 ने Claude Fable 5 की तुलना में केवल 38% निष्कर्षण लागत प्रस्तुत की, और KVCache अनुकूलन, प्रीफिक्स कैश, और लागत नियंत्रण, सभी Mooncake प्रणाली के मुख्य मुद्दे हैं।

चिप वायरिंग से लेकर ट्रिलियन पैरामीटर मॉडल इन्फरेंस तक, हे वेयान का तकनीकी मार्ग हमेशा स्पष्ट रहा है: सिस्टम की दक्षता पर काम करना, और कम गणना लागत के लिए इंजीनियरिंग डिज़ाइन का उपयोग करना। अगर शीर्ष एल्गोरिदम शोधकर्ता Kimi की क्षमता की सीमा को ऊपर उठाते हैं, तो वह और उसकी टीम इस फ्लैगशिप स्तर की क्षमता को वास्तविकता में बदल रहे हैं, ताकि अधिक सामान्य उपयोगकर्ता इसे सस्ते और स्थिर ढंग से उपयोग कर सकें।

02 मध्यस्तरीय हमला · व्यावहारिक आधारभूत ढांचा

डू युलुन:

डू युलुन मून ऑफ द डार्क साइड में प्री-ट्रेनिंग और स्केलिंग के क्षेत्र में काम करते हैं।

उन्होंने अमेरिका के इलिनोइस विश्वविद्यालय, शिकागो और कार्नेगी मेलन विश्वविद्यालय से कृत्रिम बुद्धिमत्ता में अध्ययन किया। इसके बाद उन्होंने सर्कुलर इंटेलिजेंस में शामिल होकर शोधकर्ता और AI लैब प्रमुख के पदों पर कार्य किया, और वे मून ऑफ डार्कनेस के मुख्य प्रौद्योगिकी सदस्य हैं।

उन्होंने मॉडल बेस के प्री-ट्रेनिंग और स्केलिंग दिशा के प्रमुख जिम्मेदार के रूप में, किमी के सभी पीढ़ियों के मुख्य फ्लैगशिप बेस, और VL, ऑडियो आदि सभी मल्टीमॉडल श्रृंखला के आर्किटेक्चर डिजाइन में पूर्ण तकनीकी योगदान दिया है।

उन्होंने नींव की तकनीकी क्रांति में, "Attention Residuals", "MoBA (Mixture of Block Attention)" और प्री-ट्रेनिंग ऑप्टिमाइज़र पेपर "Muon is Scalable for LLM Training" के सह-लेखक के रूप में योगदान दिया है। उनका कार्य मुख्य रूप से: ब्लॉक-स्तरीय ध्यान विभाजन और ट्रेनिंग प्रवाह पुनर्गठन के माध्यम से, अत्यधिक गहरे नेटवर्क में सिग्नल डिके की समस्या को कम करना है, जिससे ट्रिलियन-स्तरीय मॉडल की वितरित ट्रेनिंग की दक्षता में महत्वपूर्ण वृद्धि होती है।

इंजीनियरिंग ओपन सोर्स स्तर पर, वह MoonshotAI के औपचारिक ओपन सोर्स प्रोजेक्ट के सक्रिय कोर कंट्रिब्यूटर हैं। कोड सहयोग रिकॉर्ड्स के अनुसार, डू युलुन, एल्गोरिथम विशेषज्ञ सु जियानलिन और रीजनिंग सिस्टम प्रमुख हे वेईरान के बीच उच्च आवृत्ति का सह-विकास और कोड रिव्यू सहयोग है, जो तीनों मिलकर Kimi को लाखों स्तर की लंबी टेक्स्ट और सभी मॉडल्स के दक्ष प्रवाह के लिए नींव का तकनीकी बंद चक्र प्रदान करते हैं।

ज़हांग यू:

ज़हंग यू मोन्थ ऑफ द डार्कनेस के कोर आर्किटेक्ट हैं, जो बड़े भाषा मॉडल के दक्ष, स्केलेबल और हार्डवेयर-अनुकूल आर्किटेक्चर डिज़ाइन पर केंद्रित हैं। ट्रांसफॉर्मर और लीनियर अटेंशन पथ के प्रारंभिक विकासकर्ता के रूप में, वे लंबे टेक्स्ट के "जितना लंबा, उतना धीमा, बेहद महंगा" इंजीनियरिंग श्राप को दूर करने पर काम करते हैं।

शैक्षणिक और इंजीनियरिंग अभ्यास में, ज़हांग यू के बहुत सारे उपलब्धियाँ हैं। वह न केवल रेजिड्यूअल कनेक्शन "Attention Residuals" पेपर के सह-प्रथम लेखक हैं, बल्कि मून के डार्क साइड के दक्ष मॉडल आर्किटेक्चर के मुख्य शोध लेखक भी हैं।

उनके द्वारा ओपन सोर्स किया गया Kimi Linear मॉडल, पहली बार रेखीय ध्यान तंत्र को अत्यंत लंबे संदर्भ कार्यों में सफलतापूर्वक लागू करके एक विप्लवात्मक कुशलता में वृद्धि प्राप्त की। इसके अलावा, उनके द्वारा ज़हुई जैसे तकनीकी समुदायों में साझा किया गया "Kimi Linear विकास की यात्रा" अभी तक असंख्य बड़े मॉडल डेटा इंजीनियर्स द्वारा अनिवार्य पठनीय मार्गदर्शिका के रूप में माना जाता है।

7B मॉडल के निचले स्तर पर भेद करने से लेकर एक युद्ध में ट्रिलियन पैरामीटर वाले मॉडल को वैश्विक प्रथम समूह में ले जाने तक, ज़ांग यू शैक्षिक और औद्योगिक दुनिया के बीच आसानी से आवाजाही करते हैं और शीर्ष शैक्षिक सम्मेलनों और ओपन-सोर्स समुदायों में कई कठिन कोड छोड़ गए हैं।

यह सीरीज़ क्रांति उनके मूलभूत प्रौद्योगिकी पर गहराई से काम करने के कारण हुई: उन्होंने दक्ष मॉडल आर्किटेक्चर डिज़ाइन पर ध्यान केंद्रित किया, जिसमें मॉडल की गहराई बढ़ाने के दौरान संचार और मेमोरी बॉटलनेक का अनुकूलन शामिल है; ट्रेनिंग डायनामिक्स और दक्षता में सुधार के लिए, उन्होंने नीचले स्तर के रेजिड्यूअल फ्लो को पुनर्गठित करके, PreNorm के कारण होने वाली ग्रेडिएंट डाइल्यूशन और हिडन स्टेट एक्सप्लोजन की मूल समस्या को हल किया।

लाई गुओकुन:

Lai Guokun is a dual alumnus of Tsinghua University and Carnegie Mellon University of Yang Zhilin.

वह किमी टीम के सबसे अधिक शोध पत्र लिखने वाले शोधकर्ताओं में से एक हैं, जिनके पास दस से अधिक पत्र हैं। वह केवल मून ऑफ डार्कनेस के "जीनियस क्लब" के प्रतिनिधि में से एक ही नहीं हैं, बल्कि किमी K3 के मुख्य योगदानकर्ता भी हैं और शैक्षणिक समुदाय में "परिभाषात्मक" परिणामों के लिए जाने जाते हैं।

लाई गुओकुन ने मून ऑफ द डार्क से पहले NLP (नेचुरल लैंग्वेज प्रोसेसिंग) क्षेत्र में दो उद्योग-मानक स्तर के प्रमुख उपलब्धियाँ छोड़ीं।

एक ने विश्व के सबसे बड़े मशीन रीडिंग कॉम्प्रिहेंशन डेटासेट में से एक, "RACE डेटासेट" बनाया, जिसे चीनी छात्रों की अंग्रेजी परीक्षा के प्रश्नों के साथ AI को प्रशिक्षित करने के लिए सीधे उपयोग किया गया और यह विश्व के मशीन रीडिंग कॉम्प्रिहेंशन का मानक बन गया।

और अधिक आश्चर्यजनक बात यह है कि उनके स्नातक काल के दौरान लिखी गई रिकमेंडेशन एल्गोरिथम पर एक पेपर, "Explicit factor models for explainable recommendation", दस साल बाद 2024 में SIGIR टाइम-टेस्टेड अवॉर्ड जीता, जो सूचना खोज के क्षेत्र में से एक सर्वोच्च सम्मान है और जिसे 10 साल पहले प्रकाशित, समय के परीक्षण से गुजरने वाली और उद्योग पर दीर्घकालिक प्रभाव डालने वाली पेपर्स के लिए दिया जाता है।

महाविद्यालय के स्नातक स्तर पर ही 'अगले दशक की तकनीकी दिशा को परिभाषित करने' की क्षमता रखने वाले यह व्यक्ति मोंग ऑफ डार्कनेस में अकेले नहीं हैं।

लाई गुओकुन की विशेषज्ञता किमी की कोर क्षमताओं के साथ बहुत अच्छी तरह मेल खाती है, जैसे कि वह "मशीन रीडिंग कंप्रिहेंशन" में निपुण हैं, जो यह सुनिश्चित करने के बारे में है कि AI लंबे दस्तावेज़ को कैसे समझे और प्रश्नों के उत्तर दे, जो किमी की लंबे पाठ क्षमता की मूल तकनीकी आधारशिला है।

उसके CMU के दौरान के अध्ययन के प्रमुख क्षेत्रों में से एक प्री-ट्रेन्ड बड़े मॉडल थे, इसके अलावा उन्होंने न्यूरल आर्किटेक्चर सर्च पर ध्यान केंद्रित किया, जिसमें AI को स्वयं बेहतर नेटवर्क स्ट्रक्चर डिज़ाइन करने के तरीके पर शोध किया गया। साथ ही, व्याख्यायोग्य रिकमेंडेशन सिस्टम पर काम किया, जिसमें AI केवल सामग्री का सुझाव देने के बजाय, उपयोगकर्ता को यह भी बताता है कि इसे क्यों सुझाया गया।

गुओ हैकिंग:

गुओ हाईचिंग (Haiqing Guo) मून ऑफ द डार्क साइड के किमी टीम के प्रारंभिक कोर रिसर्च और डेवलपमेंट सदस्य हैं, जो टीम के सीनियर सदस्य माने जाते हैं और किमी के सभी पीढ़ियों के कोर प्रोजेक्ट्स के रिसर्च और इटरेशन में पूरी तरह से शामिल रहे हैं।

सार्वजनिक रूप से सत्यापित भागीदारी परियोजनाएँ शामिल हैं: Kimi k1.5 तकनीकी रिपोर्ट, Kimi K2 तकनीकी रिपोर्ट, ध्यान अवशेष (AttnRes) कोर आर्किटेक्चर पेपर, Kimi K3 तकनीकी रिपोर्ट। इनमें से AttnRes, Kimi K3 के दो मुख्य आर्किटेक्चर नवाचारों में से एक है।

साइनेचर ट्रेस के अनुसार, उन्होंने Kimi के k1.5 से K3 तक के सभी तीन पीढ़ियों के फ्लैगशिप वर्जन के पूरे इटरेशन साइकिल को कवर किया है, और उनकी भागीदारी बहुत सारी पीढ़ियों के प्रोडक्ट के कोर रिसर्च एंड डेवलपमेंट चरणों में फैली हुई है; वे Kimi टेक्निकल टीम के लगातार कोर सदस्य हैं। वर्तमान में, सार्वजनिक चैनलों पर उनकी सटीक पद और विस्तृत रिसर्च और डेवलपमेंट भूमिका का खुलासा नहीं किया गया है।

चेन गुआंयु:

चेन गुआंयू संभवतः मून ऑफ द डार्क सबसे युवा शोधकर्ता है, 2009 में पैदा हुआ, 17 साल का, एक ऐसा युवक जिसने एलन मस्क को X पर सार्वजनिक रूप से "Impressive" कहने के लिए प्रेरित किया।

जब मून ऑफ द डार्क साइड ने 2.8 ट्रिलियन पैरामीटर वाले अभूतपूर्व फ्लैगशिप Kimi K3 को लॉन्च किया, तब उन्होंने तकनीकी विशेषज्ञ सु जियानलिन और अन्य के साथ मिलकर Kimi K3 के कोर आर्किटेक्चर के आधारभूत कार्य, “Attention Residuals” के सह-प्रथम लेखक के रूप में स्थान प्राप्त किया।

उसने ध्यान अवशेष (Attention Residuals) तंत्र में भाग लिया, जिसने गहन शिक्षा के क्षेत्र में दशकों से चले आ रहे मानक शेष संयोजन को सीधे बदल दिया, "सीखने योग्य गहरी ध्यान" के माध्यम से मॉडल को समझदारी से "पीछे मुड़कर देखने" की क्षमता प्रदान की, जिससे मॉडल की विस्तार क्षमता 1.25 गुना बढ़ गई, जिससे चीनी कंपनियाँ ट्रिलियन स्तर की शीर्ष कैलकुलेशन प्रतियोगिता में कम लागत से तेज़ी से आगे बढ़ पाईं। उसका "मून ऑफ़ डार्कनेस" में शामिल होने का कहानी बहुत अद्भुत है। एक साल पहले, वह यहीं नहीं जानता था कि Transformer क्या है, लेकिन एक हैकथॉन में "मानव का तीसरा मैकेनिकल सहायक हाथ" की अवधारणा देने के कारण उसे सिलिकॉन वैली के स्टार्टअप ने पहचाना। 7 सप्ताह के बाद, उसे Kimi टीम द्वारा पूरी तरह से पहचाना गया और कंपनी के कोर अनुसंधान समूह में असामान्य रूप से शामिल कर लिया गया। पद पर प्रवेश के पहले सप्ताह में ही, उसने सभी परंपराओं को तोड़ते हुए Kimi के 48-घंटे के सीमा हैकथॉन में कुल विजेता का पुरस्कार हासिल किया।

Du Angang:

किमी की तकनीकी रिपोर्ट में, डू आंगआंग का नाम हमेशा सबसे आगे आता है। वह मून ऑफ द डार्क के मल्टीमॉडल सिस्टम के प्रमुख स्तंभों में से एक हैं, और किमी तकनीकी रिपोर्ट में एकमात्र व्यक्ति हैं जिन्होंने पांचों पीढ़ियों में पूर्ण सहभागिता दी है। उन्होंने टीम के नाम के बाद पहला स्थान दो बार प्राप्त किया है, जिससे अनुमान लगाया जा सकता है कि उनका किमी K3 में मुख्य योगदान दृश्य क्षेत्र में है।

डू अंगांग ने मून ऑफ द डार्क से पहले ही कंप्यूटर विज़न क्षेत्र में दो महत्वपूर्ण आधार बना लिए थे।

एक जलीय सूक्ष्म दृश्यता की दिशा में गहराई से शोध। मैंने चीनी समुद्री विश्वविद्यालय के जलीय दृश्यता प्रयोगशाला में सात वर्ष तक अपनी बैचलर और मास्टर की डिग्री पूरी की, जहाँ मैंने अत्यंत कठिन प्लवक सूक्ष्म छवियों के वर्गीकरण पर काम किया—जहाँ धुंधली छवियों, सीमित नमूनों और अत्यंत सूक्ष्म प्रजाति अंतरों के साथ सूक्ष्मदर्शी दृश्यों में AI को समुद्र के सबसे छोटे जीवों की सटीक पहचान करनी होती है।

2020 में, उन्होंने Global OCEANS में प्रथम लेखक के रूप में संबंधित शोध प्रकाशित किया, जिसमें द्वितीय क्रम की विशेषताओं का उपयोग करके सूक्ष्म वर्गीकरण की समस्या को हल किया गया, जो प्रयोगशाला के दस वर्षों के इस दिशा में शोध का एकमात्र परिणाम है जिसमें एक मास्टर्स का छात्र प्रथम लेखक के रूप में शामिल हुआ।

उसके क्वांगशी टेक्नोलॉजी के समय के योगदान ने उसे और अधिक उद्योग प्रभाव दिया। उनके द्वारा भाग लिया गया बहु-व्यक्ति शरीर स्थिति अनुमान अनुसंधान ECCV 2020, कंप्यूटर दृष्टि के शीर्ष सम्मेलन में सम्मिलित किया गया, जिसके पेपर के कुल 300 से अधिक संदर्भ हैं और यह मानव शरीर स्थिति अनुमान के क्षेत्र में एक महत्वपूर्ण संदर्भ बन गया। इस कार्य के सह-लेखकों की सूची में सुन जियान, ज़हांग शियांगयू जैसे दृश्य क्षेत्र के नेतृत्वकर्ता शामिल हैं, साथ ही मून ऑफ़ डार्कनेस के सह-संस्थापक ज़ोउ शिनयू भी हैं।

किमी में आने के बाद, उन्होंने विजुअल एन्कोडर डिजाइन, मल्टीमॉडल अलाइनमेंट और विजुअल एजेंट तकनीक पर गहराई से काम किया, विशेष रूप से उच्च-रिज़ॉल्यूशन इमेज अंतर्ज्ञान, लंबे समय तक के वीडियो विश्लेषण और मल्टीमॉडल रिइनफोर्समेंट लर्निंग में निपुणता रखते हैं, जो किमी की मूल मल्टीमॉडल क्षमता की मूलभूत तकनीकी आधारशिला है। इसके अलावा, उनकी क्षमताएँ बड़े मॉडल प्रशिक्षण बुनियादी ढांचे तक नीचे तक फैली हुई हैं—ऑप्टिमाइज़र स्थिरता से लेकर एजेंट डेटा सिंथेसिस तक, जिससे नीचले स्तर के विजुअल एल्गोरिदम से लेकर मॉडल प्रशिक्षण और फिर ऊपरी स्तर के एजेंट लागूकरण तक की पूर्ण स्टैक क्षमता बनती है।

2025 में, उन्होंने पहले लेखक के रूप में Kimi-VL ओपन-सोर्स मल्टीमॉडल मॉडल जारी किया, जिसमें उन्होंने अपने द्वारा विकसित MoonViT विजुअल एंकोडर का उपयोग किया, जो मूल रूप से अत्यधिक उच्च रिज़ॉल्यूशन इनपुट को समर्थन करता है, और 128K लंबे कॉन्टेक्स्ट क्षमता के साथ, Kimi को पहली बार लंबे वीडियो और लंबे दस्तावेज़ को पढ़ने की मल्टीमॉडल लंबे टेक्स्ट समझ की क्षमता प्राप्त हुई, जिसने Kimi की पूरी मल्टीमॉडल क्षमता के लिए तकनीकी आधार तैयार किया।

K2 चरण में, उन्होंने MuonClip ऑप्टिमाइज़र विकास में गहरी भागीदारी की, QK-Clip तंत्र के साथ मिलकर बड़े मॉडल प्रशिक्षण के कंपन के उद्योग-स्तरीय समस्या को हल किया, जिससे 15.5 ट्रिलियन टोकन के अत्यधिक विशाल प्रशिक्षण को "शून्य हानि शिखर" प्राप्त हुआ, जिससे प्रशिक्षण की कैलकुलेशन लागत और जोखिम में भारी कमी आई; K3 चरण में, उनके नेतृत्व में बनाई गई स्मार्ट एजेंट डेटा सिंथेसिस पाइपलाइन ने मॉडल को स्वयं उच्च गुणवत्ता वाले प्रशिक्षण डेटा उत्पन्न करने की क्षमता प्रदान की, जिससे K3 को प्रोग्रामिंग, स्मार्ट एजेंट आदि कठिन कार्यों में वैश्विक प्रथम समूह में स्थान प्राप्त हुआ।

किमी के लिए, उनका योगदान बहुआयामी क्षमताओं की पूरी विकास यात्रा में फैला हुआ है।

Qu Bo Wen:

क्व बोवेन (Bowen Qu / Brian Qu) मॉडल पोस्ट-ट्रेनिंग टीम के सदस्य हैं, जिन्होंने हुआज़ोंग विज्ञान और प्रौद्योगिकी विश्वविद्यालय के इलेक्ट्रॉनिक्स, इनफॉर्मेशन और संचार कॉलेज से स्नातक किया और बीजिंग विश्वविद्यालय के इलेक्ट्रॉनिक्स कॉलेज से स्नातकोत्तर किया। उनके शोध का केंद्र बहुमॉडल बड़े मॉडल से संबंधित दिशाओं पर है, जिसमें बहुमॉडल रीइनफोर्समेंट लर्निंग, विजुअल-लैंग्वेज मॉडल, AI एजेंट और AIGC कंटेंट क्वालिटी एवलुएशन शामिल हैं।

मून ऑफ द डार्क के जुड़ने के बाद, चु बोवेन का मुख्य कार्य किमी सीरीज मॉडल की मल्टीमॉडल क्षमताओं के निर्माण पर केंद्रित रहा, जिसमें उन्होंने किमी-K2.5 प्रोजेक्ट में गहराई से भाग लिया और नेटिव मल्टीमॉडल रिइनफोर्समेंट लर्निंग दिशा में अनुसंधान में भाग लिया। किमी-K2.5 मून ऑफ द डार्क द्वारा लॉन्च किया गया एक नेटिव मल्टीमॉडल इंटेलिजेंट एजेंट मॉडल है, जिसका कुल पैरामीटर स्केल 1T है और सक्रिय पैरामीटर 32B है।

कु बोवेन द्वारा विकसित मूल बहुमोडल रीइनफोर्समेंट लर्निंग सिस्टम, पारंपरिक बहुमोडल मॉडल के आम दृष्टिकोण को छोड़ देता है जिसमें पहले दृश्य निरीक्षित सूक्ष्म-समायोजन किया जाता है और फिर रीइनफोर्समेंट लर्निंग शुरू की जाती है; इसके बजाय, यह शून्य दृश्य निरीक्षित सूक्ष्म-समायोजन के साथ शुद्ध पाठ निष्कर्षण मॉडल से शुरू होता है और सीधे दृश्य रीइनफोर्समेंट लर्निंग के माध्यम से दृश्य निष्कर्षण क्षमता प्राप्त करने का समाधान प्रस्तावित करता है, जिससे कम गुणवत्ता वाले दृश्य डेटा के कारण मॉडल की मूल भाषा निष्कर्षण क्षमता प्रभावित न हो।

कु बोवेन का शोध AIGC कंटेंट क्वालिटी एवलुएशन की दिशा में शुरू हुआ, जिसके संबंधित परिणाम ICME 2024, CVPRW 2024 जैसे अंतरराष्ट्रीय सम्मेलनों में प्रकाशित हुए। ICME 2024 में प्रकाशित संबंधित पेपर में, जब एआई-जनित छवियों के मूल्यांकन प्रणाली केवल दृश्य सुंदरता और स्पष्टता पर ध्यान केंद्रित करती थी और जनित सामग्री और उपयोगकर्ता निर्देशों के मेल को नज़रअंदाज़ करती थी, उस समय टेक्स्ट प्रॉम्प्ट को जनित छवि क्वालिटी मूल्यांकन प्रणाली में शामिल करने का प्रस्ताव रखा गया, जिससे दृश्य गुणवत्ता और निर्देश पालन को समेटने वाला मूल्यांकन मानदंड बनाया गया, जिससे एआई-जनित सामग्री के मूल्यांकन की व्यापकता और मानवीय अनुभव के साथ समन्वय में सुधार हुआ।

चु बोवेन को किमी सीरीज के मल्टीमॉडल संस्करण के योगदानकर्ताओं की सूची में भी शामिल किया गया है। युवा शोधकर्ता के रूप में, चु बोवेन का शोध मार्ग मूल्यांकन प्रणाली के निर्माण से शुरू होकर मॉडल क्षमता विकास तक जाता है, और फिर उच्च-स्तरीय एजेंट क्षमता विकास तक पहुंचता है, जिसके परिणाम उद्योग की वास्तविक आवश्यकताओं के साथ सटीक रूप से मेल खाते हैं और उत्पादन-स्तरीय मॉडल के अपग्रेड और अद्यतन की सीधी सेवा करते हैं।

लू एनज़े:

किमी K3 की 400 से अधिक योगदानकर्ता सूची में, लू एनज़े नाम सबसे आगे नहीं था, लेकिन उनकी गतिविधियाँ असाधारण रूप से सटीक थीं। प्रत्येक उपलब्धि बड़े मॉडल के व्यावहारिक लागू होने की मुख्य समस्याओं पर सीधे प्रहार करती थी, और वे किमी की कुशल कैलकुलेशन सिस्टम के मुख्य निर्माता थे।

लू एनज़े के शोध क्षेत्र को तीन शब्दों में सटीक रूप से सारांशित किया जा सकता है: लंबा, तेज़, सस्ता। मुख्य लक्ष्य यह है कि बड़े मॉडल कम लागत, तेज़ गति से अधिक लंबे पाठ को संसाधित कर सकें। किमी के लिए, उनका जिम्मेदारी ट्रेनिंग से लेकर इन्फ़रेंस तक की पूरी लाइन एफ़िशिएंसी अपग्रेड है।

2025 फरवरी में, उन्होंने पहले लेखक के रूप में MoBA मिश्रित ब्लॉक ध्यान के तंत्र को प्रकाशित किया, जिसने MoE के विशेषज्ञ चयन के विचार को ध्यान परत पर स्थानांतरित किया, ताकि मॉडल अनुरोध को संभालते समय केवल सबसे संबंधित संदर्भ ब्लॉक्स को गणना के लिए सक्रिय करे। 95% विरलता पर, इसका प्रदर्शन पूर्ण ध्यान के समान है, जिससे लाखों टोकन के अनुमान में 6.5 गुना और करोड़ों टोकन के अनुमान में 16 गुना की गति में वृद्धि हुई, जिससे Kimi की अत्यधिक लंबी संदर्भ क्षमता की नींव का निर्माण हुआ।

प्रकाशन के दिन, यह पेपर DeepSeek के NSA पेपर के साथ समान समय पर पेश किया गया और उस वर्ष भारतीय बड़े मॉडल समुदाय में सबसे अधिक चर्चित तकनीकी टक्कर बन गया; इसके इंजीनियरिंग मूल्य को यह भी दर्शाता है कि NeurIPS 2025 द्वारा Spotlight पेपर के रूप में स्वीकृत होने से पहले, यह समाधान पहले से ही Kimi के उत्पादन परिवेश में लगभग एक वर्ष तक लंबे संदर्भ उपयोगकर्ता अनुरोधों को स्थिरता से संभाल चुका था।

इसके अलावा, MoBA से लेकर Kimi Linear तक के KDA ध्यान केंद्रित करने के साथ, उन्होंने हार्डवेयर निष्पादन दक्षता पर पूरी तरह ध्यान केंद्रित किया; ट्रेनिंग साइड पर, उनके द्वारा भाग लिया गया Muon ऑप्टिमाइज़र का वितरित कार्यान्वयन मेमोरी उपयोग को न्यूनतम और संचार लागत को कुशल बनाता है, जिससे बड़े मॉडल ट्रेनिंग की कैलकुलेशन लागत को वास्तविक रूप से कम किया जा सकता है। AttnRes और K1.5, K2, Kimi-VL जैसी कई पीढ़ियों की तकनीकी रिपोर्ट्स को मिलाकर, उनके पेपर्स उच्च दक्षता वाले बड़े मॉडल की पूरी लंबी श्रृंखला तकनीक को समेटते हैं।

टीम के अंदर, वह MoBA पेपर के संचार लेखकों में से एक, चियू जिएज़हों के साथ नियमित जोड़ी बनाता है, एक आक्रमण करता है और दूसरा दिशा निर्धारित करता है, और वे बहुत अच्छी तरह से मिलते हैं।

वांग युज़ी:

वांग युज़ी मूनशॉट एआई के एक शोधकर्ता हैं और किमी श्रृंखला की तकनीकी रिपोर्ट्स में सबसे अधिक बार नाम दिए जाने वाले लेखकों में से एक हैं।

2025 जनवरी के K1.5 से लेकर 2026 जुलाई के Kimi K3 तक, उनका नाम इस कंपनी के लगभग हर तकनीकी दस्तावेज़ पर मौजूद है, जिसमें दृश्य, ऑडियो, ध्यान ढांचे, प्रशिक्षण अनुकूलक, फ्लैगशिप मॉडल और अग्रणी AI जोखिम प्रबंधन ढांचे शामिल हैं।

वह शियान डिजिटल विज्ञान और प्रौद्योगिकी विश्वविद्यालय से स्नातक हैं और त्सिंगहुआ विश्वविद्यालय के इलेक्ट्रॉनिक इंजीनियरिंग विभाग से डॉक्टरेट किया है; खुंगशी रिसर्च इंस्टीट्यूट में शामिल होने के बाद उन्होंने अनुसंधान इंजीनियर का पद संभाला; 2024 में उन्होंने मून ऑफ डार्कनेस में अनुसंधानकर्ता के रूप में शामिल होना शुरू किया और आज तक इस पद पर हैं।

मून ऑफ द डार्क के साथ जुड़ने से पहले, उनका शोध कैलकुलेटिव फोटोग्राफी और लो-लेवल विजुअल पर केंद्रित था। प्रतिनिधि उपलब्धियाँ शामिल हैं: ECCV 2020 में पहले लेखक के रूप में मोबाइल RAW इमेज डी-नॉइजिंग पेपर प्रकाशित करना, जो आज तक मोबाइल इमेजिंग के लिए एक मानक कार्य है; NTIRE 2019 रियल-इमेज डी-नॉइजिंग चैलेंज में मेगविज़न टीम के सदस्य के रूप में raw-RGB ट्रैक में विश्व चैंपियनशिप हासिल करना; और OCR क्षेत्र के क्लासिक कार्य EAST (CVPR 2017, 2500 से अधिक संदर्भ) में सह-लेखक के रूप में योगदान देना।

मून ऑफ द डार्क समय के दौरान, उन्होंने कुल दस तकनीकी दस्तावेजों पर हस्ताक्षर किए, जिनमें k1.5, K2, K3, Kimi-VL, Kimi-Audio, MoBA, Muon, Kimi Linear, Attention Residuals के चार आर्किटेक्चर और दक्षता पेपर, और अग्रणी AI जोखिम प्रबंधन ढांचा शामिल हैं।

ध्यान देने योग्य बात यह है कि कंपनी के चारों आर्किटेक्चर और एफिशिएंसी पेपर्स में वह सभी में लेखक के रूप में शामिल हैं, जो लगभग चार सौ सदस्यों की योगदानकर्ता सूची में दुर्लभ है। K3 में उनकी विशिष्ट भूमिका के बारे में कोई सार्वजनिक जानकारी उपलब्ध नहीं है।

माओ शाओगुआंग:

माओ शाओगुang किमी एजेंट तकनीक रेखा के केंद्रीय स्तंभ हैं, जिन्होंने K2, K2-Thinking, K2.5 और K3 चार पीढ़ियों के प्रमुख विकास में पूरी तरह से भाग लिया है, और वे एजेंट उद्योग के दो बार के परिप्रेक्ष्य परिवर्तनों को पूरी तरह से अनुभव करने वाले कुछ ही शोधकर्ता हैं।

मून ऑफ द डार्क से पहले, वह देश के सबसे पहले एजेंट लॉन्च करने वालों में से एक था।

चिंगहुआ कंप्यूटर मास्टर्स की डिग्री प्राप्त करने वाले, जिन्होंने कॉलेज में 0.2% के शीर्ष में स्थान प्राप्त किया और राष्ट्रीय छात्रवृत्ति प्राप्त की, उन्होंने हांगकांग के चीनी विश्वविद्यालय में अनुसंधान सहायक के रूप में और माइक्रोसॉफ्ट एशिया रिसर्च इंस्टीट्यूट के स्पीच ग्रुप में इंटर्नशिप की। स्नातक के बाद, उन्होंने माइक्रोसॉफ्ट में लगभग छह साल काम किया, जहां वे अनुसंधान इंजीनियर से बढ़कर सीनियर रिसर्च इंजीनियर बने।

2023 की शुरुआत में TaskMatrix.AI के विकास में भाग लिया, जिसमें ChatGPT को लाखों API क्षमताओं के साथ जोड़ा गया; इसके बाद Solo Performance Prompting विधि का साझा रूप से प्रस्ताव दिया, जिससे एकल मॉडल बहुत सारे भूमिकाओं को निभाकर बहु-बुद्धिमान सहयोग का अनुकरण कर सके, जिस संबंधित तकनीक Microsoft 365 Word में लागू की गई।

वह एजेंट के "फ्रेमवर्क काल" का था—सभी क्षमताएँ बाहरी उपकरणों से जोड़ी जाती थीं और प्रॉम्प्ट द्वारा निर्देशित होती थीं, और वह इस तकनीकी दिशा का साक्षी और निर्माता था।

लेकिन इस राह को अपने हाथों से चलने वाले माओ शाओगुआंग ने सबसे पहले पुराने प्रतिरूप की सीमाओं को समझा। 2025 जून में, उन्होंने Zhihu पर एक उद्योग-स्वीकृति लिखी: "इस दिशा में अब और भी कम दिलचस्पी हो रही है, ऐसा लग रहा है जैसे यह तेजी से लुप्त हो रहा है।"

फरवरी 2025 में मून ऑफ द डार्क साइड में शामिल होने के बाद, उन्होंने "मॉडल एजेंट" की ओर एंड-टू-एंड दिशा में पूरी तरह से स्थानांतरित कर दिया। केवल चार महीनों में, उन्होंने Kimi के पहले Agent उत्पाद Kimi Researcher के वितरण में भाग लिया:

बिना किसी प्रक्रिया डिफ़ॉल्ट के, केवल एंड-टू-एंड रीइनफोर्समेंट लर्निंग के माध्यम से प्रशिक्षित, एकल कार्य की औसतन 23 चरणों का निष्कर्ष निकालता है, स्वयं 206 वेबसाइटों की स्कैनिंग करता है, और मानक संदर्भों के साथ 10,000 शब्दों की शोध रिपोर्ट तैयार कर सकता है, HLE बेंचमार्क पर 26.9% प्राप्त करता है, जो उस समय विश्व स्तर पर सर्वोच्च प्रदर्शन है। वह इस उत्पाद की आधिकारिक तकनीकी स्व-विवरणी के दो सह-लेखकों में से एक है।

इसके बाद, K2 से K3 तक की चार पीढ़ियों के फ्लैगशिप रिसर्च और विकास में उन्होंने पूरी तरह से गहरी भागीदारी की। HLE सूचक 8.6% से बढ़कर 26.9% हो गया, और यह लगभग पूरी तरह से रिइनफोर्समेंट लर्निंग द्वारा संचालित प्रदर्शन वक्र, उनकी नई तकनीकी राह का परिणाम है।

अपने दशकों के करियर के दौरान, माओ शाओगुआंग ने बड़े मॉडल के लिए बाहरी API के माध्यम से क्षमताओं का विस्तार करने से लेकर मॉडल को अंतर्निहित रूप से उपकरणों का उपयोग करना और स्वतंत्र रूप से जटिल कार्यों को पूरा करना सीखने तक का अनुभव प्राप्त किया, जिससे एजेंट उद्योग के "संयोजन" से "मूलभूत विकास" तक के पूर्ण विकास का चित्रण हुआ। उन्होंने पुराने प्रारूप में सक्रिय रूप से हिस्सा लिया है और नए मार्ग का निर्माण भी किया है, जिससे उनके उद्योग के बारे में निर्णयों को सबसे मजबूत व्यावहारिक परिणामों द्वारा समर्थन मिलता है।

किन रुओयू:

चिन रुओयू त्सिंहुआ विश्वविद्यालय के कंप्यूटर विज्ञान विभाग के MADSys प्रयोगशाला में एक वर्तमान डॉक्टरल छात्र हैं, जिनके मार्गदर्शक डॉ. ज़हांग मिंगक्सिंग हैं। उनका शोध कुशल मशीन लर्निंग सिस्टम पर केंद्रित है, जिसमें बड़े पैमाने पर वितरित भाषा मॉडल निष्पादन सेवाएँ और पुनर्बलन सीखने के rollouts सिस्टम शामिल हैं।

किन रुओयू और मून ऑफ द डार्क साइड टीम के सहयोग से विकसित मूनकेक, KVCache पर केंद्रित एक डिकप्ल्ड इन्फरेंस आर्किटेक्चर है। यह आर्किटेक्चर Prefill और Decode चरणों को अलग-अलग क्लस्टर पर चलाता है और GPU क्लस्टर में अव्यस्त CPU, मेमोरी और SSD संसाधनों को वितरित कैश पूल के रूप में एकीकृत करता है। यह उपलब्धि स्टोरेज क्षेत्र की शीर्ष सम्मेलन FAST 2025 का एरिक राइडेल सर्वश्रेष्ठ पेपर पुरस्कार प्राप्त कर चुकी है।

Mooncake एक वास्तविक उत्पादन-स्तरीय सेवा प्लेटफॉर्म है जिसका उपयोग किया जा रहा है, और शोध पत्र के सारांश की शुरुआत में स्पष्ट रूप से उल्लेख किया गया है कि "Mooncake, Kimi के लिए सेवा प्लेटफॉर्म है।" वास्तविक व्यावसायिक भार के तहत, Mooncake किमी के अनुरोध संसाधन क्षमता में 75% की वृद्धि करता है; लंबे संदर्भ परिदृश्यों में, प्रभावी अनुरोध संसाधन क्षमता 59% से 498% तक बढ़ जाती है। वर्तमान में, यह प्रणाली हजारों नोड्स पर स्थापित है और प्रतिदिन 100 अरब से अधिक टोकन संसाधित करती है।

2024 में, मून ऑफ द डार्क साइड और त्सिंहुआ मैडसिस प्रयोगशाला ने मूनकेक प्रोजेक्ट (ओपन सोर्स रिपॉजिटरी kvcache-ai/Mooncake) को ओपन सोर्स किया, जिसकी अब तक GitHub स्टार संख्या 6000 से अधिक हो चुकी है। संबंधित डेटा और जानकारी arXiv पेपर (संख्या 2407.00079), त्सिंहुआ कंप्यूटर विज्ञान विभाग की आधिकारिक वेबसाइट के घोषणा पत्र और प्रोजेक्ट के ओपन सोर्स रिपॉजिटरी में उपलब्ध हैं।

मूनकेक के बाद, चिन रुयु के शोध का केंद्र तर्क प्रणाली की दिशा में आगे बढ़ा। उन्होंने पहले लेखक के रूप में Seer पेपर तैयार किया, जिसे OSDI 2026 में चुना गया। इस कार्य ने रीइनफोर्समेंट लर्निंग में rollout प्रदर्शन की बॉटलनेक को दूर करने के लिए rollout विभाजन, संदर्भ-सजग नियोजन और समूहित स्पेकुलेटिव डिकोडिंग तकनीकों का उपयोग करके एंड-टू-एंड rollout थ्रूपुट में अधिकतम 2.04 गुना की वृद्धि और लॉन्ग-टेल लेटेंसी में 72% से 94% तक की कमी प्राप्त की। एक अन्य पहले लेखक के पेपर Prefill-as-a-Service में, KVCache को क्रॉस-डेटासेंटर साझा करने की अगली पीढ़ी के इन्फरेंस आर्किटेक्चर डिज़ाइन की अवधारणा प्रस्तुत की गई।

किन युए भी K3 प्रोजेक्ट के योगदानकर्ता सूची में शामिल हैं। बड़े मॉडल के उत्पाद प्रदर्शन को दो पहलुओं की क्षमताओं द्वारा समर्थित किया जाता है: मॉडल विकास मॉडल की क्षमता की सीमा निर्धारित करता है, जबकि सिस्टम इंजीनियरिंग उच्च समानांतर स्थितियों में सेवा की उपलब्धता और संचालन लागत को निर्धारित करती है।

वर्तमान में बड़े मॉडल उद्योग की प्रतिस्पर्धा, अब केवल प्रशिक्षण क्षमता की तुलना से आगे बढ़कर सेवा इंजीनियरिंग क्षमता की तुलना तक पहुँच गई है। एक वर्तमान डॉक्टरल छात्र के रूप में, चिन रुओयू की इस क्षेत्र में शीर्ष कॉन्फ्रेंस के सर्वश्रेष्ठ पेपर स्तर के परिणाम प्राप्त करने का मुख्य कारण यह है कि उनका अनुसंधान सीधे उत्पादन परिदृश्यों की ओर उन्मुख है और उनके परिणाम वास्तविक व्यावसायिक प्रणालियों में लागू होते हैं।

युआन एनमिंग:

मून ऑफ द डार्क साइड किमी टीम के कोर रिसर्च और डेवलपमेंट सदस्य, जिनका शोध गणनात्मक जीवविज्ञान, अनुशंसा प्रणाली और बड़े मॉडल तीन क्षेत्रों में फैला हुआ है, जिन्होंने किमी के सभी पीढ़ियों के कोर मॉडल के तकनीकी अपग्रेड में पूरी तरह से भाग लिया है।

उन्होंने शुरुआत में चिंगहुआ विश्वविद्यालय के क्रॉस-डिसिप्लिनरी इनफॉरमेशन इंस्टीट्यूट में जियानयांग चियान के टीम में AI-आधारित दवा शोध पर काम किया। 2020 से 2021 के बीच, उनके द्वारा शामिल किए गए इन्फ्लूएंजा दवा पुनर्स्थापना फ्रेमवर्क की अध्ययन रिपोर्ट bioRxiv प्रीप्रिंट और जर्नल "Signal Transduction and Targeted Therapy" पर प्रकाशित हुई, और न्यूक्लियोकैप्सिड प्रोटीन से संबंधित परिणाम "Protein & Cell" में प्रकाशित हुए।

2022 से 2023 तक, युआन एनमिंग हुआवेई नोआ के लैब में कार्यरत रहे, जहां उन्होंने रिकमेंडेशन सिस्टम की दिशा में शोध पर केंद्रित किया, जिसके परिणाम कई अंतरराष्ट्रीय शीर्ष शैक्षणिक सम्मेलनों में शामिल हुए। उनके द्वारा प्रथम लेखक के रूप में तैयार की गई बहु-व्यवहार अनुक्रम अनुशंसा से संबंधित पेपर SIGIR 2022 में शामिल की गई, और अन्य सहयोगी परिणाम CIKM 2022 और WWW 2023 में शामिल किए गए।

मून ऑफ द डार्क में शामिल होने के बाद, युआन एनमिंग ने किमी के कई पीढ़ियों के कोर मॉडल और तकनीकी प्रोजेक्ट्स के विकास में गहराई से भाग लिया। जिन प्रोजेक्ट्स के नाम सार्वजनिक रूप से पुष्टि किए जा सकते हैं, उनमें किमी k1.5 रीइनफोर्समेंट लर्निंग टेक्निकल रिपोर्ट, MoBA टेक्निकल रिसर्च, किमी-वीएल टेक्निकल रिपोर्ट, किमी K2 लार्ज मॉडल टेक्निकल रिपोर्ट, किमी लीनियर टेक्निकल रिपोर्ट, किमी K2.5 मल्टीमॉडल मॉडल टेक्निकल रिपोर्ट और किमी K3 फ्लैगशिप लार्ज मॉडल टेक्निकल रिपोर्ट शामिल हैं।

उनकी भागीदारी रीइनफोर्समेंट लर्निंग ट्रेनिंग, मल्टीमॉडल क्षमताएँ, बेसिक मॉडल आर्किटेक्चर, लंबे कॉन्टेक्स्ट सिस्टम जैसे कई केंद्रीय तकनीकी दिशाओं को कवर करती है, जो Kimi के k1.5 से K3 तक के तीन पीढ़ियों के फ्लैगशिप मॉडल अपग्रेड चक्र को पूरी तरह से शामिल करती है, और यह टीम में सबसे व्यापक तकनीकी कवरेज वाले प्रमुख रिसर्च और डेवलपमेंट सदस्य हैं।

अभी तक, जनता के सामने उपलब्ध चैनलों में युआन एनमिंग की मून ऑफ द डार्क में विशिष्ट भूमिका और विस्तृत अनुसंधान विभाजन का उल्लेख नहीं किया गया है। जनता के सामने उपलब्ध हस्ताक्षर के ट्रेक से पता चलता है कि उनकी बहु-क्षेत्रीय शोध पृष्ठभूमि ने बड़े मॉडल की कई प्रौद्योगिकीय दिशाओं में उनकी भागीदारी को समर्थन प्रदान किया है, और वे किमी तकनीकी प्रणाली के अपग्रेड प्रक्रिया में एक महत्वपूर्ण निरंतर भागीदार हैं।

ह्वेईशिन:

एक वेई वर्तमान में मूनशॉट एआई के शोधकर्ता हैं, जिनके शोध के क्षेत्र में बड़े मॉडल बुनियादी ढांचा, कुशल प्रशिक्षण तंत्र और अटेंशन मैकेनिज्म अनुकूलन शामिल हैं।

एक वेईक्सिन ने किमी के कई पीढ़ियों के कोर मॉडल और नींव की तकनीक के विकास में गहरी भागीदारी की है, और उनके नाम वाले सार्वजनिक प्रोजेक्ट्स k1.5 से K3 तक के पूरे उत्पाद अपग्रेड साइकिल को कवर करते हैं। मून ऑफ द डार्कनेस ने K3 के लॉन्च के बाद तीन प्रमुख स्व-विकसित तकनीकों—म्यूऑन ऑप्टिमाइज़र, किमी लीनियर लीनियर अटेंशन, और अटेंशन रेसिडुअल्स का खुलासा किया। एक वेईक्सिन, जो वर्तमान में पुष्टि किए जा सकने वाले, एकमात्र योगदानकर्ता हैं, जिनके नाम इन तीनों कोर तकनीकों के संबंधित शोध पत्रों में सम्मिलित हैं और जिनका स्थान प्रत्येक में 15वें स्थान से पहले है, K3 आर्किटेक्चर के प्रदर्शन अपग्रेड के लिए मुख्य विकासकर्ताओं में से एक हैं।

विशिष्ट परिणामों के संदर्भ में, 2025 के फरवरी में प्रकाशित Muon ऑप्टिमाइज़र पेपर में, उन्होंने लेखक सूची में आठवां स्थान लिया, जिसकी कैलकुलेशन दक्षता लगभग AdamW की दोगुनी है, और इसके बाद ओपन-सोर्स Moonlight ट्रेनिंग इम्प्लीमेंटेशन में भी उनका योगदान रहा;

2025 अक्टूबर में प्रकाशित Kimi Linear तकनीकी पेपर में, उन्होंने 15वां स्थान प्राप्त किया, जिसमें प्रस्तावित KDA तंत्र KV Cache के आकार को अधिकतम 75% तक कम कर सकता है और लाखों token के संदर्भ में डिकोडिंग थ्रूपुट को अधिकतम 6 गुना तक बढ़ा सकता है;

2026 मार्च में प्रकाशित Attention Residuals पेपर (K3 के दो प्रमुख आधारभूत नवाचारों में से एक) में, वह तीन सह-प्रथम लेखकों के बाद पहले प्रमुख योगदानकर्ता के रूप में चौथे स्थान पर हैं, और संबंधित तकनीक को Kimi K3 बेस मॉडल आर्किटेक्चर में गहराई से एकीकृत किया गया है।

इसके अलावा, उनका नाम Kimi k1.5 रिइनफोर्समेंट लर्निंग टेक्निकल रिपोर्ट, Kimi-VL टेक्निकल रिपोर्ट, Kimi K2 और K2.5 टेक्निकल रिपोर्ट, और सबसे हालिया Kimi K3 फ्लैगशिप मॉडल टेक्निकल रिपोर्ट के योगदानकर्ता सूची में भी शामिल है, जिसमें बेस मॉडल, मल्टीमॉडल, और रिइनफोर्समेंट लर्निंग सहित कई केंद्रीय अनुसंधान दिशाओं में शामिलता शामिल है। स्पष्ट रूप से बताया जाए कि MoBA पेपर के लेखक सूची में उनका नाम शामिल नहीं है, और दोनों के बीच कोई सार्वजनिक रूप से जांचने योग्य अनुसंधान संबंध नहीं है।

इसके अलावा, उन्होंने OccDepth 3D सेमेंटिक सीन कंप्लीशन, PVD-AL एक्टिव लर्निंग डिस्टिलेशन, ACCV 2024 इम्प्लिसिट SDF रिकन्स्ट्रक्शन जैसी कई 3D विज़ुअल दिशाओं के शोध में भाग लिया है, जिसके शैक्षणिक परिणाम मॉडल कम्प्रेशन, 3D रिकन्स्ट्रक्शन, सेमेंटिक सीन अवबोध जैसे कई उप-क्षेत्रों को कवर करते हैं।

पब्लिक साइनेचर ट्रैक के अनुसार, शु वेईशिन का शोध मार्ग क्लाइंट-साइड मॉडल डिप्लॉयमेंट और 3D विजुअल परसेप्शन से शुरू होकर लार्ज मॉडल बेसिक आर्किटेक्चर इनोवेशन तक विस्तारित हुआ है, जिसमें उन्होंने लंबे समय तक उच्च कुशल कंप्यूटिंग की दिशा में गहराई से काम किया है, और उनकी तकनीकी कवरेज व्यापक है; वे मून ऑफ द डार्क के बेसिक टेक्नोलॉजी स्टैक के इटरेशन में मुख्य सतत सहभागी हैं।

दु चेनज़ुआंग:

Du Chenzhuang is a core researcher at Moonshot AI and a key member of the team responsible for reinforcement learning and expanding reasoning capabilities.

उन्होंने अपनी स्नातक की डिग्री बीजिंग एयरोस्पेस विश्वविद्यालय के इनफॉर्मेशन मैनेजमेंट एंड इनफॉर्मेशन सिस्टम्स प्रोग्राम से प्राप्त की, और फिर बड़े मॉडल विशेषज्ञों के हुआंगपू सैन्य अकादमी—त्सिंगहुआ विश्वविद्यालय के इंटरडिसिप्लिनरी इनफॉर्मेशन इंस्टीट्यूट में डॉक्टरेट के लिए दाखिला लिया।

चिंगहुआ के दौरान, उन्होंने क्षेत्र के प्रसिद्ध शोधकर्ता झाओ एक्सिंग से शिक्षा ली और प्रतिष्ठित MARS लैब (बहुमोडल और स्वायत्त तर्क प्रयोगशाला) में शामिल हो गए, जहां उन्होंने बहुमोडल मशीन लर्निंग, रीइनफोर्समेंट लर्निंग और बड़े भाषा मॉडल के रीइनफोर्समेंट मैकेनिज़म पर ध्यान केंद्रित किया।

डॉक्टरेट के दौरान, उन्होंने प्रमुख लेखक के रूप में प्रसिद्ध "ChatDB" आर्किटेक्चर विकसित किया, जिसने "डेटाबेस को सिंबोलिक मेमोरी मॉड्यूल के रूप में बड़े मॉडल को बढ़ावा देना" का नवीनतम प्रस्ताव रखा और उस समय AI शैक्षणिक और औद्योगिक समुदाय में वायरल हो गया।

अपने डॉक्टरेट के दौरान, उन्होंने बीजिंग हाईहुआ आर्टिफिशियल इंटेलिजेंस रिसर्च इंस्टीट्यूट में इंटर्न के रूप में शामिल होकर, शून्य से नीचले सिस्टम के निर्माण में गहराई से भाग लिया, जिससे उन्हें मल्टीमॉडल और रीइनफोर्समेंट लर्निंग के क्षेत्र में काफी अनुभव प्राप्त हुआ और उन्हें सिस्टम और एल्गोरिथम का नीचला दृष्टिकोण प्राप्त हुआ।

उसने स्नातक के बाद मून ऑफ द डार्क से जुड़ा और कोर मॉडल की तकनीकी रिपोर्ट्स में अक्सर दिखाई दिया। उसने रीइनफोर्समेंट लर्निंग के स्केलिंग लॉ की खोज में महत्वपूर्ण पेपर “Kimi k1.5: Scaling Reinforcement Learning with LLMs” में सीधे योगदान दिया, और Kimi K2 और K2.5 जैसे फ्लैगशिप मॉडल सीरीज की तकनीकी रिपोर्ट्स में भी मुख्य योगदानकर्ता के रूप में कार्य किया।

उन्होंने Kimi बहुआयामी विजुअल लार्ज मॉडल, "Kimi-VL Technical Report" के विकास में मुख्य सह-लेखक के रूप में गहरी भागीदारी की, जिसमें जटिल छवियों, चार्टों और वास्तविक दुनिया की विजुअल जानकारी की अनुभूति और बहुआयामी गहन तर्क क्षमता में सुधार पर ध्यान केंद्रित किया गया।

डू चेनज़ुआं का मुख्य ध्यान बड़े भाषा मॉडल (LLM) ट्रेनिंग इंजीनियरिंग पर है, जिसमें ट्रिलियन-स्तरीय मॉडल (MoE आर्किटेक्चर) के लिए सुपरक्लस्टर में संसाधन नियोजन, स्थिर ट्रेनिंग और सीमा तक के सिस्टम अनुकूलन शामिल हैं; और पुनर्बलन सीखने और बहुमॉडल संयोजन पर, जिसमें मॉडल कैसे जटिल लंबे निष्कर्षण कार्यों में स्व-निरीक्षण और पुनर्बलन सीखने के माध्यम से बुद्धिमत्ता की सीमा को पार करता है और दृश्य जानकारी और भाषा मॉडल का कुशलतापूर्वक निचले स्तर पर समेकन होता है, इसका अध्ययन किया जाता है।

यानरू चेन:

यानरू चेन मून ऑफ द डार्क साइड के प्रमुख शोधकर्ता हैं, जो बड़े मॉडल आधारभूत आर्किटेक्चर, लंबे टेक्स्ट तकनीक, कैलकुलेशन ऑप्टिमाइजेशन और मल्टीमॉडल इंजीनियरिंग के विकास और कार्यान्वयन पर केंद्रित हैं।

उन्होंने "Attention Residuals" पेपर के सह-लेखक के रूप में भाग लिया और बड़े मॉडल की गहराई की दिशा में जानकारी के प्रवाह को पुनर्गठित किया, जिससे अत्यधिक गहरे नेटवर्क की प्रशिक्षण दक्षता और जानकारी प्रवाह अवरोध के उद्योग-स्तरीय समस्याओं को सफलतापूर्वक हल किया गया।

उन्होंने MoBA (मिश्रित ब्लॉक ध्यान) के सह-लेखक के रूप में, किमी के सबसे महत्वपूर्ण नींव तंत्र के विकास का नेतृत्व किया और भाग लिया, जिसमें ब्लॉक-स्तरीय ध्यान विभाजन के माध्यम से लाखों स्तर के अत्यधिक लंबे संदर्भ के प्रशिक्षण और निष्कर्ष चरण में अत्यधिक कैलकुलेशन खर्च को सीधे हल किया गया, जिससे किमी के लिए सीमा तक लागत कम करने और कुशलता बढ़ाने की मुख्य नींव बनी।

इसके अलावा, वह "Muon is Scalable for LLM Training" पेपर के सह-लेखक हैं और महत्वपूर्ण ओपन-सोर्स प्रोजेक्ट Moonlight और इसके नीचे के Muon ऑप्टिमाइज़र के विकास में गहराई से शामिल रहे हैं, जहाँ उन्होंने मैट्रिक्स ऑर्थोगोनलाइज़ेशन के माध्यम से पारंपरिक AdamW को चुनौती दी और वितरित प्रशिक्षण में ट्रिलियन-स्केल मॉडल की कम्प्यूटेशनल लागत को प्रभावी ढंग से कम किया।

उसने फ्लैगशिप मॉडल के अपग्रेड में, किमी के पिछले कोर फ्लैगशिप (k1.5, K2, K2.5, K3) के पूरे विकास जीवन चक्र को गहराई से एम्बेड किया, जिससे बड़े पैमाने पर रीइनफोर्समेंट लर्निंग और ट्रिलियन पैरामीटर स्केलिंग के तहत मॉडल की स्थिरता और संसाधन आवंटन की समस्याओं का समाधान हुआ।

इसके अलावा, किमी के बहुआयामी लीनियर, वीएल, ऑडियो तकनीकी क्षेत्र में, उन्होंने गैर-पारंपरिक ट्रांसफॉर्मर संरचना के लिए रेखीय ध्यान के नवीनतम विकास का सक्रिय रूप से अन्वेषण किया और किमी के दृश्य और ऑडियो बहुआयामी तकनीक रिपोर्ट के इंजीनियरिंग लागूकरण का नेतृत्व किया, जिससे निचले स्तर पर बहुआयामी सूचना प्रवाह के एकीकरण के समय दक्षता की समस्या का कुशलतापूर्वक समाधान हुआ।

लिउ शाओवेई:

लिउ शाओवेई क्लीयर होम यूनिवर्सिटी के शीर्ष कंप्यूटर सिस्टम्स लैब, MADSys लैब के मुख्य सदस्य हैं, और साथ ही मून ऑफ द डार्क के कोर इन्फ्रास्ट्रक्चर (Infra) टीम के नेतृत्वकर्ता विशेषज्ञ भी हैं।

जब आप आश्चर्यचकित होते हैं कि किमी के पास ट्रिलियन पैरामीटर हैं, लेकिन API मूल्य बहुत कम है, तो इसके पीछे उसकी टीम द्वारा समर्पित "अत्यधिक मात्रात्मक कला" है। वह लंबे समय से ट्रिलियन-स्तरीय बड़े मॉडल के अत्यधिक कम लागत वाले निष्पादन, मूल मात्रात्मक और विशाल वितरित कंप्यूटिंग टोपोलॉजी डिज़ाइन में गहराई से लगा हुआ है।

ग्लोबल के सबसे एडवांस्ड AI ओपन सोर्स कम्युनिटी Reddit LocalLLaMA पर, उन्होंने Kimi के ऑफिशियल एक्सपर्ट के रूप में, बाहरी टेक जगत में बड़ी चर्चा पैदा करने वाली तकनीकी विश्लेषण लंबी लेख “Kimi infra team: Quantization is not a compromise, it's the next paradigm” प्रकाशित किया। यह लंबा लेख Kimi K2 और K2.5 के नीचे के, अत्यंत उन्नत Native INT4 नेटिव क्वांटाइजेशन फॉर्मेट को गहराई से प्रकट करता है।

वह MoBA (मिश्रित ब्लॉक ध्यान तंत्र) के मुख्य सह-लेखक हैं और महत्वपूर्ण ओपन-सोर्स प्रोजेक्ट Moonlight और इसके नीचे के Muon ऑप्टिमाइज़र के वितरित आर्किटेक्चर विकास में गहराई से शामिल रहे हैं, जिसमें मैट्रिक्स ऑर्थोगोनलाइज़ेशन के माध्यम से वितरित प्रशिक्षण में ट्रिलियन स्तर के मॉडल की कम्प्यूटेशनल लागत को भारी मात्रा में कम किया गया है।

वह क्रांतिकारी ओपन सोर्स प्रोजेक्ट KTransformers के प्रमुख संस्थापक और कोड मेंटेनर में से एक हैं, जिन्होंने हेटरोजेनियस क्लस्टर में ट्रिलियन MoE मॉडल के हाइब्रिड इन्फरेंस के लिए कैलकुलेशन बैरियर को सफलतापूर्वक दूर किया है।

चेन गुआनडुओ:

चेन गुआनडुओ मून के अंधेरे पक्ष के इंफ्रा टीम के प्रमुख शोधकर्ता हैं। उनमें "सिस्टम + एल्गोरिथम" के क्रॉस-डिसिप्लिनरी रिसर्च और डेवलपमेंट की अत्यधिक क्षमता है, और उनके शोध क्षेत्र बड़े मॉडल इंफ्रास्ट्रक्चर, कुशल ध्यान तंत्र आर्किटेक्चर, बड़े मॉडल फाइन-ट्यूनिंग को तेज करना और बड़े पैमाने पर स्टोरेज और रिट्रीवल अनुकूलन पर केंद्रित हैं।

उन्होंने अपनी स्नातक और स्नातकोत्तर दोनों ही फुडान विश्वविद्यालय के कंप्यूटर विज्ञान विभाग से पूरी कीं, जहाँ उन्होंने वितरित प्रणालियों और निचले स्तर की बुनियादी संरचना के क्षेत्र में मजबूत पेशेवर आधार बनाया। इसके बाद, उन्होंने नान्यांग प्रौद्योगिकी विश्वविद्यालय और हांगकांग विज्ञान और प्रौद्योगिकी विश्वविद्यालय में अध्ययन किया, जहाँ उन्होंने क्रमशः उच्च प्रदर्शन की गणना और बड़े मॉडल बुनियादी ढांचे के क्षेत्र में प्रसिद्ध शोधकर्ता युआन बिनहांग और लुओ सियानचियांग के मार्गदर्शन में अग्रणी शैक्षणिक दृष्टिकोण और अनुसंधान अनुभव प्राप्त किया।

महीने के अंधेरे में शामिल होने से पहले, उन्होंने शीर्ष इंटरनेट कंपनियों के नीचले कोर डिपार्टमेंट में गहरी निहितार्थ स्थापित की। उन्होंने क्रमशः बाइटडांस डेटाबेस सिस्टम रिसर्च टीम और मेन्गटुआन इंफ्रास्ट्रक्चर टीम में रिसर्च इंटर्न के रूप में काम किया और औद्योगिक स्तर के उच्च समानांतर, विशाल वितरित प्रणालियों के विकास और आर्किटेक्चर अनुकूलन में गहराई से भाग लिया।

इस अवधि के दौरान, उन्होंने एक कोर लेखक के रूप में दो महत्वपूर्ण परिणाम प्रस्तुत किए। निचले स्तर के स्टोरेज पर, उन्होंने "Oasis" विकसित और प्रकाशित किया, जिसमें एक आदर्श असंबंधित विभाजन शिक्षा सीमा फिल्टर प्रस्तावित किया गया, जो बड़े पैमाने पर सीमा प्रश्नों के दौरान निचले डेटाबेस के इंडेक्स बॉटलनेक को सीधे हल करता है;

एप्लिकेशन लेयर पर लागू करते समय, उन्होंने "जनरेट और ऑर्डर" विधि के माध्यम से बड़े मॉडल की मानवीय जटिल इच्छाओं को SQL डेटाबेस क्वेरी में परिवर्तित करने (Text-to-SQL) की सटीकता में भारी वृद्धि की।

चेन गुआनडुओ ने 2025 मार्च में मून ऑफ द डार्क साइड में शामिल हो गए। इन्फ्रा टीम के एक प्रमुख सदस्य के रूप में, वे न केवल मून ऑफ द डार्क साइड के प्रमुख बड़े मॉडल किमी K2 और किमी K2.5 के मुख्य सह-लेखक हैं, बल्कि बड़े मॉडल फाइन-ट्यूनिंग के त्वरण, कुशल ध्यान आर्किटेक्चर, और यहां तक कि अंतिम नेटवर्क आर्किटेक्चर पुनर्निर्माण जैसे क्षेत्रों में एक घने प्रौद्योगिकीय क्रांति का योगदान दिया है।

बड़े मॉडल के फाइन-ट्यूनिंग के लिए ग्राफिक्स मेमोरी की अधिक खपत को हल करने के लिए, चेन गुआनडुओ ने "Ce-lora" शीर्षक से एक शोध पत्र प्रकाशित किया, जिसमें एक कैलकुलेशन-कुशल LoRA फाइन-ट्यूनिंग विधि प्रस्तुत की गई। यह तकनीक बड़े मॉडल के पैरामीटर्स के फाइन-ट्यूनिंग के दौरान ग्राफिक्स मेमोरी के उपयोग और कैलकुलेशन ओवरहेड को कम करके, इन्फ्रा स्तर पर प्रशिक्षण थ्रूपुट को सीधे बढ़ाती है, जिसे बड़े मॉडल फाइन-ट्यूनिंग की "ग्राफिक्स मेमोरी लाइटनिंग" कहा जा सकता है।

लंबे टेक्स्ट की गणना की जटिलता के वर्गीय विस्फोट की समस्या के सामने, उन्होंने कोड जगत में बड़ी चर्चा पैदा करने वाली "Kimi Linear" आर्किटेक्चर के विकास और प्रकाशन में योगदान दिया। यह एक अत्यंत व्यक्तिपूर्ण और कुशल रैखिक ध्यान आर्किटेक्चर है, जो मॉडल की शक्तिशाली प्रतिनिधित्व क्षमता को बनाए रखते हुए, लंबे टेक्स्ट की गणना की जटिलता को भारी रूप से कम करता है, KV Cache (कुंजी-मूल्य कैश) के उपयोग को अधिकतम 75% तक कम करता है, और एक मिलियन टेक्स्ट लंबाई पर 6 गुना डिकोडिंग थ्रूपुट प्राप्त करता है, जो Kimi की लंबे टेक्स्ट तकनीकी बाधाओं पर सतत गहराई से शोध का कठोर आधार है।

He is also one of the co-authors of Attention Residuals.

सबसे निचले स्तर के स्टोरेज फिल्टर, कैलकुलेशन-कुशल फाइन-ट्यूनिंग एल्गोरिदम से लेकर विप्लवकारी नेक्स्ट-जेन Transformer नेटवर्क आर्किटेक्चर तक, चेन गुआनडुओ का करियर पथ वर्तमान में बड़े मॉडल के "केवल पैरामीटर को कूदने" से "अत्यधिक कैलकुलेशन दक्षता और इंजीनियरिंग लागूकरण की ओर" की उद्योग-प्रणाली के साथ पूरी तरह से मेल खाता है।

Closing Statement

K3 के रिसर्च और डेवलपमेंट टीम ने हमेशा निर्ममता और रहस्यमयता के साथ काम किया है, और डेटा की समीक्षा के दौरान, हमें सभी सदस्यों की विस्तृत भूमिकाओं और पूर्ण जीवनी को एक-एक करके स्पष्ट करने में कठिनाई हुई। लेकिन इस भारी सूची के माध्यम से, उत्तर स्पष्ट हो गए हैं: क्यों मून ऑफ डार्कनेस? क्यों वे प्रति व्यक्ति 70 करोड़ के अतिरिक्त मूल्यांकन को संभाल पाए?

ये 30 वर्ष से कम उम्र के युवा, वास्तविक रूप से कैलकुलेशन इकोनॉमिक्स को समझने वाले सिस्टम आर्किटेक्ट हैं। शीर्ष कॉन्फ्रेंस में सर्वश्रेष्ठ पेपर जीतने वाले स्टोरेज स्केड्यूलिंग से लेकर अटेंशन मैकेनिज़म के नींव के नवीनीकरण तक, उन्होंने "लंबा, तेज़, बचत" की इंजीनियरिंग दक्षता को अधिकतम सीमा तक पहुँचाया है।

यही पूर्ण स्टैक की ऊपरी एल्गोरिदम से लेकर निचले हार्डवेयर तक की एकीकृत क्षमता, मून ऑफ डार्कनेस को "कैलकुलेशन पावर होमोजेनिजेशन" के श्राप को तोड़ने की मुख्य बाधा प्रदान करती है।

एक और दिलचस्प बात यह है कि पूरी सूची के अंत में, किमी K3 भी पूरे रिसर्च और डेवलपमेंट टीम का एक महत्वपूर्ण सदस्य बन गया। निर्माता और निर्मित वस्तुएँ अब एक ही सूची पर साथ खड़ी हो गई हैं, चीनी बड़े मॉडल का “स्वर्ण युग” इतना तेज़ी से आ चुका है।

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।