संगठित और संकलित: शेनचाओ टेकफ्लो

अतिथि: जॉर्डन और मैक्स, सेमीएनालिसिस विश्लेषक
होस्ट: जॉर्डन (SemiAnalysis आंतरिक चर्चा)
पॉडकास्ट स्रोत: SemiAnalysis
मूल शीर्षक: [आपातकालीन एपिसोड] मूनशॉट का किमी K3 आ गया है! चीन के पास एक फ्रंटियर मॉडल है
Broadcast Date: July 18, 2026
Key Points Summary
Moonshot (मूनशॉट) ने Kimi K3 लॉन्च किया है, जो कई समग्र benchmark पर Google और Meta को पीछे छोड़कर दुनिया का तीसरा सर्वश्रेष्ठ मॉडल बन गया है, जो Anthropic के Fable और OpenAI के Soul 5.6 के बाद आता है। SemiAnalysis के दो विश्लेषक Jordan और Max ने एक आपातकालीन प्रोग्राम में इस लॉन्च के अर्थ को समझाया: 2.8T पैरामीटर वाला मॉडल Sonnet के समान मूल्य (3/15 प्रति मिलियन टोकन) पर सेवा प्रदान करता है, और यदि यह अग्रणी बंद मॉडल के स्केल के समान है, तो Anthropic का 10/50 का मुनाफा mindboggling स्तर का हो सकता है।
जॉर्डन से अधिक तीव्र निर्णय: अग्रणी अंतर संकुचित हो रहा है, जिसे वह अमेरिकी सरकार द्वारा Anthropic/OpenAI को सबसे शक्तिशाली मॉडल जारी करने पर प्रतिबंध लगाने के कारण बताते हैं, जिससे पीछे रहने वालों को कालांतर मिला। ओपन सोर्स वास्तव में पीछे नहीं छूट पाया। इसी बीच, पश्चिमी ओपन सोर्स पूरी तरह से खाली है, कोई भी अमेरिकी कंपनी का ओपन सोर्स मॉडल चीन के पांचवें सर्वश्रेष्ठ मॉडल के साथ प्रतिस्पर्धा नहीं कर पा रहा है। मॉडल प्रतिस्पर्धा अब हार्नेस (उपकरणों का उपयोग) और भू-राजनीतिक प्रतिस्पर्धा में बदल रही है।
精彩观点摘要
Kimi K3 की स्थिति के बारे में
- यदि आप सभी प्रमुख बेंचमार्क के समग्र रैंकिंग को देखते हैं, तो आज एक बहुत स्पष्ट टॉप तीन है: Fable, Soul 5.6 और Kimi K3। वे हमेशा दूसरों से ऊपर हैं, जिसमें DeepSeek, Google, Meta और xAI भी शामिल हैं।
- Google को बहुत शर्म आनी चाहिए। 2025 के नवंबर और दिसंबर में, सभी को लगता था कि AI ट्राइप्लेट Google, Anthropic और OpenAI हैं। आज कुछ 'पुराने लोगों' से बात करते हैं, वे अभी भी ऐसा मानते हैं, लेकिन स्पष्ट रूप से ऐसा नहीं है।
- यह दुनिया का दूसरा सबसे अच्छा मॉडल हो सकता है, क्योंकि हर बार जब मैं Fable का उपयोग किसी गंभीर काम के लिए करता हूँ, तो मुझे अस्वीकार कर दिया जाता है और Opus पर भेज दिया जाता है। हालाँकि मुझे यकीन नहीं है कि यह Opus से बेहतर है, लेकिन कम से कम मुझे अस्वीकार नहीं किया जाता।
फ्रंटियर मॉडल के मुनाफे के बारे में
- If Kimi is unlikely to be selling K3 at 3/15 at a loss, then Fable, with comparable scale, charging 10/50, should completely alleviate concerns that AI labs are unprofitable businesses. Selling tokens at API prices might even be more profitable than SaaS.
- K2.7 से K3 तक की कीमत में तीन गुना से अधिक की वृद्धि हुई, 0.95/4 से बढ़कर 3/15 हो गई। लेकिन मुझे नहीं लगता कि उनके पास अभी भी कई कीमत बढ़ाने का स्थान है, क्योंकि कई कार्यों के लिए GLM या MiniMax M3 पर्याप्त हैं।
अमेरिकी सरकार और अंतर के बारे में
- I believe this gap has narrowed squarely due to the U.S. government restricting Anthropic, which prevented us from accessing these companies' truly strongest models. They are artificially catching up.
- हम केवल तभी उस अग्रणी बुद्धिमत्ता तक पहुँच सकते हैं जब उसे अनुमति दी जाए। यह आगे के चौथे, पाँचवें, छठे और सातवें स्थान पर रहने वाले खिलाड़ियों के लिए वास्तव में एक अवसर है।
关于西方开源真空
- मुझे आश्चर्य होता है कि पूरे बाजार इतना अक्षम है, और हमारे पास अभी तक कोई अमेरिकी कंपनी नहीं है जो चीन की पांचवीं सबसे अच्छी कंपनी के कम से कम बराबर हो सके।
- Even if the government does not ban Chinese open-source models, ordinary American corporations are unwilling to feed their proprietary data into Chinese open-source models. Even if you load weights in an air-gapped data center and the CCP cannot see your data, executives won't buy it.
हैरनेस के बारे में
- किमी K3 का परीक्षण करने से मुझे पहली बार ओपन कोड, हर्मीस और पाई को गंभीरता से देखने का मौका मिला। हार्नेस पूरी तरह से उत्पाद का हिस्सा है।
- कुछ सरल चीजें मुझे इस मॉडल को उसके बजाय चुनने के लिए प्रेरित करती हैं: क्या इसे रिमोट SSH सर्वर पर इंस्टॉल किया जा सकता है? शॉर्टकट्स उपयोग में आसान हैं? इन हार्नेस के विवरण वास्तव में मुझे यह तय करने में प्रभावित करते हैं कि मैं टोकन कहाँ भेजूँ, यानी बजट कहाँ भेजूँ।
"अभी बहुत जल्दी है" के बारे में
- मैं पिछले हफ्ते ICML गया था, और पिछले हफ्ते AI Engineer कॉन्फ्रेंस पर था। यह एक औपचारिक AI कॉन्फ्रेंस थी, जहाँ 80% से अधिक लोगों को SemiAnalysis के बारे में कभी पता नहीं था। आप कहते हैं कि आप AI उद्योग में काम करते हैं, लेकिन SemiAnalysis नहीं पढ़ा? हम अभी बहुत जल्दी हैं।
क्या किमी K3 दुनिया का तीसरा सर्वश्रेष्ठ मॉडल है?
जॉर्डन: त्वरित टिप्पणी, किमी K3 क्या अब विश्व का तीसरा सर्वश्रेष्ठ मॉडल है?
मैक्स: उत्तर स्पष्ट रूप से "हाँ" है। सभी बेंचमार्क की आलोचना करते हैं, और बेंचमार्क में वास्तव में समस्याएँ हैं, लेकिन अगर आप सभी प्रमुख बेंचमार्क के समग्र रैंकिंग को देखें, तो उनका संकेत हमेशा सही रहा है। आज एक स्पष्ट टॉप तीन है: Fable, Soul 5.6 और Kimi K3, जो DeepSeek जैसे open source प्लेयर्स के साथ-साथ Google, Meta और xAI की तुलना में हमेशा अधिक ऊँचे हैं। यह मोंथ ऑफ़ डार्कनेस की टीम के लिए अत्यंत अद्भुत उपलब्धि है।
Google को बहुत अपमानजनक महसूस होना चाहिए। 2025 के नवंबर और दिसंबर में, सभी को लगता था कि AI ट्राइप्लेट Google, Anthropic और OpenAI हैं। आज कुछ "पुराने लोगों" से बात करते हैं, वे अभी भी ऐसा मानते हैं, लेकिन स्पष्ट रूप से ऐसा नहीं है।
Overall, I still feel it’s not as good as Fable and Soul 5.6. It’s a bit funny that they explicitly said so in their own model release blog. Maybe it’s old-fashioned Chinese modesty, or maybe they don’t want to attract scrutiny from the U.S. government, especially since the release of Fable 5.6 also had some delays. But regardless, it’s very impressive.
जॉर्डन: उन्होंने ब्लॉग के "सीमाएँ" अनुभाग में लिखा है: "हालाँकि K3 समग्र रूप से एक अत्यंत प्रतिस्पर्धी मॉडल है, लेकिन उपयोगकर्ता अनुभव में Fable 5 और GPT 5.6 के साथ स्पष्ट अंतर है।" मेरा व्यक्तिगत उपयोग अनुभव यह है कि यह वास्तव में अच्छा है, लेकिन यह बहुत धीमा है, जो बहुत परेशान करता है। इसने मुझे पहली बार open source के harness को आजमाने के लिए प्रेरित किया। सच कहूँ तो, मुझे लगता है कि मैं harness के बारे में मॉडल की तुलना में अधिक सीख रहा हूँ, क्योंकि ये सभी मॉडल मेरे वर्तमान में किए जा रहे बुनियादी कार्यों को पूरा करने के लिए पर्याप्त अच्छे हैं, और मुझे ऐसे कोई जटिल कार्य नहीं मिल पा रहे हैं जिन्हें यह पूरा नहीं कर सकता।
यह मेरे लिए शायद दुनिया का दूसरा सबसे अच्छा मॉडल है, क्योंकि हर बार जब मैं Fable का उपयोग गंभीर काम के लिए करता हूँ, तो मुझे अस्वीकार कर दिया जाता है और Opus पर भेज दिया जाता है। हालाँकि, मुझे यकीन नहीं है कि यह Opus से बेहतर है, लेकिन अस्वीकार न होना ही कम परेशानी वाला है। हालाँकि, API कुंजी के साथ प्रयोग के आधार पर भुगतान करने पर मुझे कभी अस्वीकार नहीं किया जाता; केवल web console या deep research के उपयोग पर ही मुझे सीमा पार करने का सामना करना पड़ता है। स्पष्ट है कि इस मॉडल की मांग को पूरा करने के लिए उनके पास पर्याप्त GPU नहीं है। पहले इस समस्या का समाधान ओपन सोर्स स्ट्रेटेजी के माध्यम से किया जाता था, जिसमें वजन जारी करके दूसरों को सर्व करने के लिए छोड़ दिया जाता था। लेकिन इस बार अभी तक वजन जारी नहीं किए गए हैं, और उन्होंने कहा है कि 10 दिनों में ही जारी किए जाएंगे।
क्यों 10 दिन तक वजन को ओपन सोर्स करने में देरी की गई?
जॉर्डन: आपको लगता है कि इस देरी की रणनीति क्या है?
मैक्स: स्पष्ट कर दूँ कि यह सब मेरा केवल अनुमान है। एक बड़ा कारण यह हो सकता है कि उन्हें vLLM और SGLang जैसे इन्फरेंस इंजन टीमों को पर्याप्त समय देना है, ताकि यह मॉडल उच्च प्रदर्शन के साथ सर्व किया जा सके। अगर आज ही वेट्स जारी कर दिए जाएँ, तो सभी इसे सर्व करेंगे, लेकिन केवल 20 टोकन/सेकंड की गति से, जो उनकी ब्रांड अपनाने के लिए बहुत खराब होगा। अभी उनके पास बहुत सारी पीआर और अपनाये जाने का एक उत्तम अवसर है, लेकिन अगर प्रदर्शन की समस्या के कारण इसे जल्दी ही सीमित कर दिया जाए, तो इसकी गति कमजोर हो सकती है।
एक अन्य संभावना यह है कि वे Together AI, Fireworks, Nebius, Groq जैसी इन्फरेंस सर्विस प्रोवाइडर्स के साथ लाइसेंसिंग समझौते पर बात कर रहे हैं, ताकि वे GB300 जैसे नवीनतम चिप्स का उपयोग करके अतिरिक्त क्षमता प्रदान कर सकें। ये दोनों ही कारण लगभग 10 दिन की देरी का मुख्य कारण हैं।
एडवांस्ड मॉडल का लाभ
जॉर्डन: मॉडल आर्किटेक्चर पर चर्चा करते हैं। यह 2.8T पैरामीटर है, जिसे B200 में फिट नहीं किया जा सकता; आपको एकल 8-कार्ड HGX सर्वर पर इसे सर्व करने के लिए B300, GB300 या AMD MI355X की आवश्यकता होगी। बेशक, आप क्रॉस-नोड पाइपलाइन पैरललिज़म कर सकते हैं, लेकिन इससे प्रदर्शन में भारी कमी आएगी। इसलिए, केवल नवीनतम चिप रखने वाले ही इस मॉडल को सर्व कर सकते हैं।
आपके द्वारा अभी जिस बारे में बात की गई, Google के बारे में, यह मॉडल 2.8T पैरामीटर पर अग्रणी प्रतिस्पर्धात्मकता हासिल कर चुका है, जो हमें बंद स्रोत अग्रणी मॉडल के आकार के बारे में कुछ संकेत देता है। अगर वे इसकी तुलना 10T पैरामीटर मॉडल से कर रहे हैं, तो यह और भी शर्मनाक होगा। हमें यह मानना होगा कि यह Soul, Fable के समान स्तर पर है।
मैक्स: हाँ, आप सही कह रहे हैं। मैं अभी भी Anthropic अनुसंधान टीम की क्षमता और सूक्ष्मता पर विश्वास करता हूँ। अगर ट्विटर पर कोई कह रहा है कि वर्तमान बंद स्रोत मॉडल में 10T पैरामीटर हैं, तो अगर यह सच है, तो भाई, तुम्हें सामान पैक कर लेना चाहिए, निवेदन के कल शेयर 50% गिर जाएंगे, और सब कुछ समाप्त हो जाएगा।
मुझे काफी आश्वास्त है कि किमी K3 वर्तमान अग्रणी बंद स्रोत मॉडल से काफी छोटा नहीं होगा, यहां तक कि थोड़ा बड़ा भी हो सकता है। अगर यह सच है, तो यह SemiAnalysis पर हमारे द्वारा हमेशा जोर देकर कहे जाने वाले एक बिंदु की पुष्टि करता है: इन बंद स्रोत प्रयोगशालाओं का मुनाफा निश्चित रूप से mindboggling स्तर का है। अगर किमी 3/15 की कीमत पर K3 को सर्व करके नुकसान पर नहीं चल रहा है, जैसा Sonnet की कीमत है; और Fable का आकार लगभग समान है, लेकिन 10/50 शुल्क लेता है, तो AI प्रयोगशालाओं के अलाभकारी होने के बारे में सभी चिंताएं पूरी तरह से दूर हो जानी चाहिए। API मूल्य पर token बेचना, आज के लिए, SaaS से भी अधिक मुनाफेदायक हो सकता है।
जॉर्डन: कोई कर्मचारी लागत नहीं, केवल GPU। पिछली कीमतों की तुलना में कैसा है? आपने 3/15 कहा, लेकिन पिछले मूनशॉट की सीधी कीमत 0.95/4 थी, इसलिए K2.7 से K3 तक कीमत में तीन गुना से अधिक की वृद्धि हुई। उनके पास अभी भी कितनी कीमत बढ़ाने की संभावना है?
मैक्स: मुझे नहीं लगता कि उनके पास इसे आगे बढ़ाने के लिए कोई बहुत ज्यादा स्थान है। यहां तक कि 3/15 के स्तर पर भी कई लोग इसे बहुत महंगा महसूस करेंगे। उनके कार्यों के लिए GLM या MiniMax M3 पर्याप्त हैं। यहां एक दिलचस्प विभाजन है: हम जैसे SemiAnalysis, जो Dylan के token खर्च करने से परवाह नहीं करते, Fable का उपयोग लगभग सब कुछ करने के लिए जारी रखेंगे; जबकि अत्यधिक लागत संवेदनशील, जैसे Tesla, Uber, जो हफ्ते में केवल $200 token का उपयोग करते हैं, GLM की कीमत परत पर जाएंगे। तो, वास्तव में Kimi K3 पर स्विच करने वाले उपयोगकर्ता कौन होंगे? संभवतः एक समूह होगा जो ओपन सोर्स को दार्शनिक रूप से पसंद करता है और नए मॉडल का समर्थन करना चाहता है। क्या बड़ी कंपनियां वास्तव में इस मॉडल को अपनाएंगी, मुझे आश्चर्य होगा अगर जवाब 'नहीं' हो।
नया आर्किटेक्चर और अगला कदम
जॉर्डन: यह एक पूरी तरह से नया आर्किटेक्चर है। 2.8T पैरामीटर, जिसमें Kimi का डेल्टा अटेंशन, पोटेंशियल रेजिडुअल्स, स्टेबल लेटेंट शामिल हैं, जो मूल रूप से पिछले मॉडल का लगभग दोगुना आकार है। पिछले K2.5 में, हमने देखा कि Cursor ने इसे continued pre-training और MRL के आधार पर composer के रूप में उपयोग किया, और फिर 2.5, 2.6, 2.6.7 आदि checkpoint जारी किए। यह एक नया base model है, लेकिन इसका उपयोग पहले से ही काफी पूर्ण है, और मूल मॉडल में सामान्य रूप से देखे जाने वाले कच्चे किनारे नहीं हैं। अगला कदम क्या है? 3.1 कब आएगा? कीमत में बदलाव होगा? क्या K3 पर आधारित composer होगा?
मैक्स: K3 के आधार पर कोम्पोजर ऐप नहीं होगा, कर्सर के लोगों ने अपना मॉडल शून्य से प्रशिक्षित करने का फैसला कर लिया है। K3.1, K3.2 जैसे संस्करणों के बारे में, अगले एक-दो महीनों में दो या तीन अपडेट आ सकते हैं, जो कि पोस्ट-ट्रेनिंग जारी रखेंगे। मुझे लगता है कि कीमतें अपरिवर्तित रहेंगी, क्योंकि वे अगले दो-तीन महीनों में नए हार्डवेयर पर नहीं चल पाएंगे, और निष्पादन क्षमता में कोई वृद्धि नहीं होगी जिससे कीमत कम हो सके। शायद कुछ अत्यधिक कुशल कर्नल इंजीनियर 3T पैरामीटर मॉडल की लागत को DeepSeek V4 के स्तर तक कम कर सकते हैं, लेकिन मुझे संदेह है कि 3T पैरामीटर मॉडल इसे कर सकता है। वर्तमान में GLM और MiniMax की कीमतें संभवतः 1T से 1.5T मॉडल के सेवा के लिए सीमा हैं।
क्या ओपन सोर्स, प्राइवेट सोर्स को पीछे छोड़ देगा?
मैक्स: अधिक दिलचस्प सवाल यह है कि ओपन सोर्स और क्लोज्ड सोर्स के बीच का अंतर क्या आगे भी संकुचित होगा, और क्या ओपन सोर्स वास्तव में अग्रणी स्तर की समानता प्राप्त कर सकता है। अगर ऐसा होता है, तो हमारे पूरे उद्योग पर इसका विशाल प्रभाव पड़ेगा। आपका क्या मत है?
जॉर्डन: मेरा मानना है कि अंतर अब संकुचित हो गया है, और इसका कारण पूरी तरह से अमेरिकी सरकार द्वारा Anthropic पर प्रतिबंध लगाना है, जिसके कारण हमें इन कंपनियों के वास्तविक सबसे शक्तिशाली मॉडल नहीं मिल पा रहे हैं। वे कृत्रिम रूप से पीछे छूट गए हैं।
हम Mythos और Fable की तुलना कर सकते हैं। Mythos का मैं उपयोग नहीं कर सकता, Fable के लिए मुझे अक्सर बहुत मेहनत करनी पड़ती है। 5.6 Soul, हमारा आंतरिक निर्णय है कि यह OpenAI द्वारा प्रशिक्षित सबसे बड़ा मॉडल नहीं है, यह 4.5 से छोटा है। उनके पास एक बड़ा मॉडल है। परिणामस्वरूप, हम केवल तभी इसका प्रयोग कर सकते हैं जब सरकार द्वारा अग्रणी बुद्धिमत्ता के उपयोग की अनुमति दी जाए।
यह चौथे, पांचवें, छठे और सातवें स्थान पर रहने वाले खिलाड़ियों के लिए वास्तव में एक अवसर है, जहां वे किसी सीमा के भीतर सब कुछ खोल सकते हैं और उपयोगकर्ता हिस्सेदारी पर कब्जा कर सकते हैं, लेकिन वे सच्ची सीमा कभी नहीं छू पाएंगे। मुझे लगता है कि सीमा इस गर्मियों के अंत में एक बड़ा कदम आगे बढ़ सकती है, या फिर राजनीतिक मोड़ थोड़ा बदल सकता है। या हम शायद कोडिंग के बाहर के मोडल्स को ढूंढना शुरू कर दें, जिससे वे वास्तव में उन क्षेत्रों का पता लगा सकें।
इसके साथ ही Thinking Machines के Inkling के प्रकाशन का उल्लेख कर दें, मुझे मूल ऑडियो इनपुट बहुत दिलचस्प लगा, यह भविष्य का संकेत है।
मैक्स: इंकलिंग के बारे में, पश्चिम में वास्तव में एक अच्छा ओपन सोर्स मॉडल की बहुत बड़ी कमी है। बाजार अभी भी इतना अक्षम है कि हमारे पास अमेरिका में ऐसी कोई कंपनी नहीं है जो कम से कम चीन के पांचवें सर्वश्रेष्ठ मॉडल के बराबर हो सके, यह मुझे आश्चर्यचकित करता है। एक ओर, अमेरिकी सरकार द्वारा चीनी ओपन सोर्स मॉडल पर पूर्ण प्रतिबंध लगाना केवल समय का मुद्दा है। दूसरी ओर, भले ही प्रतिबंध न हो, सामान्य अमेरिकी बड़ी कंपनियाँ अपने स्वामित्व वाले डेटा को चीनी ओपन सोर्स मॉडल में नहीं डालना चाहती हैं। भले ही आप एक एयर-गैप डेटासेंटर में वजन लोड करते हैं, और सीसीपी आपका डेटा नहीं देख सकता, तब भी प्रबंधन इसे स्वीकार नहीं करेगा। कई कंपनियाँ टोकन बजट पर ध्यान देती हैं, और केवल पश्चिमी मॉडल या चीनी-अलग मॉडल ही चलाना पसंद करती हैं। इंकलिंग हमारे पास अभी उपलब्ध सबसे अच्छा पश्चिमी OSS है, लेकिन ओपन सोर्स के सामने के स्तर से काफी पीछे है, यह मुझे हैरान करता है।
जॉर्डन: पहले नीट्रॉन था, अब इंकलिंग है। मुझे लगता है कि इंकलिंग के पास दो अवसर हैं: एक, उन्हें अधिकांश चीनी ओपन-सोर्स से बेहतर होना होगा ताकि वे प्रवेश कर सकें। दो, उन्हें फ्रंटियर लैब के सेकेंडरी और थर्ड-लेवल मॉडल्स, सोनेट से भी बेहतर होना होगा, क्योंकि आप Bedrock या Foundry का उपयोग करके फ्रंटियर के करीब स्मार्टनेस प्राप्त कर सकते हैं और बंद स्रोत सेकेंडरी मॉडल्स के साथ पैसे बचा सकते हैं। मुझे हमेशा से समझ में नहीं आया कि पश्चिमी ओपन-सोर्स का "लोगों को पैसे बचाने" का दृष्टिकोण क्यों है। मॉडल को Fireworks, Together, Base10 जैसे इकोसिस्टम में आगे बढ़ाना निश्चित रूप से अच्छी बात है, लेकिन बाजार का बड़ा हिस्सा सरकारी स्तर पर है।
चीनी घरेलू त्वरक के लिए बनाया गया
जॉर्डन: एक और बात जो बताई जा सकती है, K3 ब्लॉग में SFT चरण में क्वांटाइजेशन किए जाने का उल्लेख है, जहाँ मूल रूप से MXFP4 और MXFP8 का उपयोग वजन और एक्टिवेशन के लिए किया जाता है, और आधिकारिक रूप से "ब्रॉड हार्डवेयर कंपैटिबिलिटी" कहा जाता है। क्या आपको लगता है कि Moonshot किसी अन्य हार्डवेयर के बारे में भी चिंतित है?
मैक्स: मेरे पास 11 चीनी एक्सेलरेटर्स की सूची है, आपको अधिक जानकारी के लिए SemiAnalysis एक्सेलरेटर मॉडल की सदस्यता लेनी चाहिए। हुआवेई टेंसेन, बैइडु कुनलुन, सैनवुजी, मोएर टेम्स, विभिन्न चिप्स पेपर में दिखाई देते हैं और कोड में भी देखे जाते हैं। घरेलू एक्सेलरेटर्स पर फ्रंट-एंड मॉडल चलाना चीन की राष्ट्रीय प्राथमिकता है। यदि हम 2025 के अंत तक कहते रहे कि Google एक फ्रंट-एंड लैब है, तो अब हमें Moonshot को भी फ्रंट-एंड लैब कहना चाहिए।
जॉर्डन: एक अनुचित बात कहूं, मेरे पिता चीन में बिजनेस ट्रिप पर हैं, और वे कह रहे हैं कि होटल सब भरे हुए हैं, क्योंकि शी जिनपिंग उस क्षेत्र में AI को चीन की प्राथमिकता के रूप में घोषित करने के लिए आ रहे हैं। आपने जो कहा, उसमें से बहुत कुछ सही है।
हार्नेस ही उत्पाद है
जॉर्डन: मैं इन मॉडल्स का उपयोग करते समय सबसे बड़ी बात यह है कि, पहली बात, निरपेक्ष अग्रणी मॉडल और max thinking mode का उपयोग करने और मीडियम एफर्ट का उपयोग करने के बीच का अंतर हमेशा अधिक कठिन होता जा रहा है। दैनिक कार्यों में मुझे ऐसा कोई काम नहीं मिल रहा है जिसे ये मॉडल्स हल नहीं कर सकते। मेरी डिफ़ॉल्ट क्रिया यह है कि मैं सबसे बड़ा, सबसे कठिन मोड चालू कर देता हूँ, क्योंकि मुझे डाइलन के बजट की परवाह नहीं है।
लेकिन एक ऐसा पहलू है जहाँ हैरन स्वयं उत्पाद का हिस्सा है। किमी K3 को टेस्ट करने से मुझे पहली बार ओपन कोड, हरमेस और पाई को गंभीरता से देखने का मौका मिला। हैरन पूरी तरह से उत्पाद का हिस्सा है। कुछ साधारण विवरण मुझे इस मॉडल को दूसरे के बजाय चुनने के लिए प्रेरित करते हैं: क्या इसे रिमोट SSH सर्वर पर इंस्टॉल किया जा सकता है? शॉर्टकट उपयोग में आसान हैं? क्या मैं पिछले कमांड्स को संपादित कर सकता हूँ? ये हैरन में छोटे-छोटे विवरण वास्तव में मुझे यह तय करने में प्रभावित करते हैं कि मैं टोकन कहाँ भेजूँ, यानी बजट कहाँ भेजूँ।
मैक्स: बहुत से लोग टोकन बजट के बारे में बात करते हैं, लेकिन आपके कार्य प्रवाह के वर्णन से लगता है कि भले ही GLM मेरे कार्यों को संभाल सकता है, मैं फिर भी Fable के लिए max intelligence का उपयोग करना पसंद करता हूँ, क्योंकि ROI इसके लायक है। बेंचमार्क्स कहते हैं कि कई कार्य GLM पर स्थानांतरित किए जा सकते हैं, लेकिन आप अभी भी Anthropic या OpenAI के मॉडल पर रहना पसंद करते हैं।
जॉर्डन: लगभग हाँ। लेकिन मैं कई Slack बॉट्स का उपयोग करता हूँ, और मुझे नहीं पता कि पीछे कौन सा मॉडल चल रहा है। उदाहरण के लिए, Perplexity का Slack एकीकरण, अगर यह K3, GLM, Sonnet की ओर रूटिंग करना शुरू कर दे, तो मुझे वास्तव में कोई फर्क नहीं पड़ता। पहले उपयोग को देखकर ही पता चला कि OpenAI मॉडल कितना हिस्सा ले रहे हैं, क्योंकि यह इसका अपना निर्णय था। इस हिस्से का औचित्य harness द्वारा निर्धारित होता है।
मैक्स: यह वास्तव में आउटकम-आधारित मूल्य निर्धारण का एक अवसर है। यदि कोई प्रयोगशाला आउटकम-आधारित मूल्य निर्धारण करती है, तो वह 95% से अधिक की शुद्ध लाभ कमा सकती है, क्योंकि आप जिन कार्यों के लिए स्थिर मूल्य देने को तैयार हैं, उन्हें आज बस छोटी राशि में ही पूरा किया जा सकता है।
जॉर्डन: दूसरी बात, मुझे नहीं लगता कि इन प्रयोगशालाओं के पास कोई नया विचार नहीं बचा है। वे आश्चर्यजनक मॉडल ट्रेन करते रह सकते हैं, जो कोडिंग साइड के RSI को हल करते हैं, लेकिन हमें उन्हें जारी नहीं करते, अपनी "स्थायी निचली वर्ग" को बनाए रखते हैं। वे डिस्टिलेशन जारी रख सकते हैं, हमें थोड़ा-थोड़ा देकर, और वीडियो जनरेशन, ऑडियो टू ऑडियो, डीप रिसर्च जैसे अन्य उपयोगों की खोज जारी रख सकते हैं, जो कोडिंग से काफी अलग हैं। रोबोटिक्स और वर्ल्ड मॉडल्स एक सरल दिशा है—अगर Anthropic अपना लक्ष्य ज्ञान-आधारित कार्य से शारीरिक कार्य पर स्थानांतरित कर दे? मुझे यकीन नहीं है कि वे पूरी दुनिया की सबसे महान प्रौद्योगिकी का उपयोग करके सतत, अच्छा ROI वाला व्यवसाय नहीं बना सकते।
हम अभी बहुत जल्दी हैं
मैक्स: यहां तक कि इन बातों को छोड़ दें, मैं रोजाना इन मॉडल्स का बहुत अधिक उपयोग करता हूं, मेरे सॉफ्टवेयर इंजीनियर दोस्त इनका मुझसे दस गुना कम उपयोग करते हैं और दस गुना कम खर्च करते हैं। Fable का उपयोग करने वाला व्यक्ति Sonnet का उपयोग करने वाले व्यक्ति के बराबर उपयोग करता है, लेकिन Fable का उपयोग करने वाला व्यक्ति दस गुना अधिक पैसा खर्च करता है, 90% की सीमा के साथ, जो व्यवसाय का बड़ा हिस्सा संभालता है। जब ये लोग बड़े मॉडल्स का अधिक उपयोग करना शुरू करेंगे, तो मांग केवल बढ़ेगी, मॉडल को बेहतर बनाने की भी आवश्यकता नहीं है। फिर मुझे अपने ऐसे पड़ोसियों से बात करनी होगी जो प्रौद्योगिकी से परे हैं, मैं उनमें 0.1% या 0.01% हूं, संभवतः 1000 गुना की वृद्धि का स्थान है। Masa-san (मसा) के "स्वर्ण हंस सूचकांक वक्र" पर वापस आते हैं।
जॉर्डन: उनका कहना कि "अभी बहुत जल्दी है" पूरी तरह सही है, और इसीलिए मुझे लगता है कि Kimi K3 Anthropic और OpenAI के शुद्ध नया ARR नहीं रोकेगा। भले ही आज Fable और 5.6 का उपयोग करने वालों में से कुछ लोग अनिवार्य रूप से Kimi K3 पर स्विच हो जाएँ, ये लोग उन लोगों से पूरी तरह ढक जाएँगे जो अभी तक इस तकनीक का परीक्षण नहीं किया है। वे लोग हर दिन नए, उच्च ROI वाले उपयोग के मामलों की खोज कर रहे हैं, और वे अभी भी इन नए स्थितियों को अनलॉक करने के लिए 5.6 Soul या Fable 5 का ही उपयोग करेंगे। आप ARR की वृद्धि की गति में मंदी नहीं देखेंगे।
मैक्स: आप सोचिए कि अभी भी कितने लोग इस पॉडकास्ट को सब्सक्राइब नहीं किए हैं, और SemiAnalysis को फॉलो नहीं किए हैं। मैंने पिछले हफ्ते ICML में भाग लिया, और पिछले हफ्ते AI Engineer कॉन्फ्रेंस में, जो वास्तव में AI कॉन्फ्रेंस है, 80% से अधिक लोगों ने कभी SemiAnalysis के बारे में नहीं सुना है। आप कहते हैं कि आप AI उद्योग में काम करते हैं, लेकिन आपने SemiAnalysis तक नहीं पढ़ा? हम अभी बहुत जल्दी हैं।
जॉर्डन: यह तुम्हारे लिए एक ईगो चेक है, मैक्स, शांत हो जाओ।
