Sinara ng Moonshot AI ang Kimi K3 sa loob ng 48 oras dahil sa sobrang dami ng mga hiling mula sa mga user, na lumampas sa inaasahan, at kinailangan nilang i-pause ang pag-subscribe ng mga bagong user, na nagresulta sa “circuit breaker” sa computing power. Ang kabuuang sukat ng parameter ng K3 ay 2.8 trilyon, at gumagamit ito ng KDA hybrid linear attention mechanism na nagbaba sa kompleksidad ng pagkalkula sa attention layer mula sa square na antas patungo sa linear, na nagpapababa ng KV cache hanggang 75%, at nagpapataas ng decoding throughput ng 6 beses sa 1 milyong context length. Ang arkitekturang ito ay itinuturing na isang pagsasagawa ng “Law of Tao” sa larangan ng AI, na nagtataguyod ng pagtaas sa performance sa pamamagitan ng systemic architectural innovation. Sa mga pagsusuri ng global AI models, nakakuha ang K3 ng kabuuang marka na 57 at nasa ikatlong pwesto, na sumusunod lamang sa Claude Fable 5 at GPT-5.6. Sa merkado ng kapital, noong araw ng paglabas ng K3, bumaba ang halaga ng NVIDIA ng humigit-kumulang $111.1 bilyon, at tumaas ang halaga ng Moonshot AI mula sa $4.3 bilyon hanggang $31.5 bilyon sa loob ng anim na buwan.May-akda ng artikulo, pinagkukunan: 36氪
May sariling “Law of Tao” si Kimi.
Ang K3 ay naging sobrang pop, ngunit kinailangan ng Kimi na ipaalam ang paghinto.
Sa gabi ng July 19, inilabas ng team ni Kimi ng Moonshot ang isang pahayag na dahil sa malaking pagtaas ng bilang ng mga hiling mula sa mga user sa loob ng 48 oras pagkatapos ng paglunsad ng Kimi K3, at dahil sa kakulangan sa computing resources, ipinagpapatigil ang pagbukas ng bagong pagsubaybay para kay Kimi, at pinaprioritize ang limitadong computing resources para sa mga umiiral na subscriber.
Ang membership system ay na-divide sa mga pangunahing benepisyo ng Kimi at mga benepisyo ng Code upang ma-allocate nang tama ang mga yaman. Ayon sa susunod na pormal na pagsagot, hindi binago ng Kimi ang membership system, kundi nagbalik-balik lamang sa用户体验 sa ilalim ng limitadong computing power.
K3 ay nagsagawa ng "circuit breaker" sa computing power, kaya kailangan nating tanggihan ang mga bagong user at mag-focus sa paglilingkod sa mga umiiral na user.
Ang "Law of Tao" ni Kimi
Sa kasalukuyan, lahat ng mga tagapaglikha ng model ay nagpapalaki ng kanilang bilang ng mga user sa pamamagitan ng libreng serbisyo, pagbaba ng presyo, at iba pang mga paraan na nagbibigay ng mabuting halaga. Sa kabilang banda, ang reverse na pagkilos ni Kimi ay tila “Versailles” lamang.
Ngunit mas malakas ang model capability, mas mahaba ang konteksto, at mas madalas ang paggamit ng user, mas mataas ang pagkawala ng computing power para sa inference. Sa sitwasyon na “ang dami ng K3 requests ay malapit na sa limitasyon ng umiiral na computing cluster”, kinaharap din ni Kimi ang parehong problema tulad ng “DouBao”: mas maraming C-end users, mas maliit ang kontribusyon sa kita, ngunit hindi kayang harapin ng GPU.
Bilang ang unang 3-trilyong parameter MoE model ni Moonshot, ang kabuuang laki ng mga parameter ng K3 ay umabot sa 2.8 trilyon. Ayon sa karaniwang pag-unawa, ang bawat paglabas ng modelo na ito ay nagdudulot ng eksponensyal na paggamit ng computing power. Gayunpaman, sa ilalim ng suporta ng kaniyang natatanging core architecture, natutupad nito ang epekto ng “Law of Tao” na ipinakilala ng Huawei sa larangan ng chip.
Ang arkitekturang ito ay itinuturing din bilang isang super engine na nagpapatupad ng tatlong mahahalagang teknolohiya: KDA (Kimi Delta Attention) hybrid linear attention, attention residuals, at high-sparsity MoE, na pinapalakas ang efisiyensiya ng bawat yunit ng computing power sa pagpapabuti ng model performance.
Matagal nang nakasalalay ang industriya ng chip sa Batas ni Moore, na nagpapalakas ng performance sa pamamagitan ng pagpapaliit ng laki ng transistor. Ngunit nang malapit na ang advanced process sa mga pisikal na limitasyon at tumataas ang gastos, ang simpleng pagpapalakas ng hardware ay naging pader na.
Ang "Batas Tao" na ipinakilala ng Huawei sa taong ito ay lumalabas sa tradisyonal na pag-iisip ng "pagsususunod ng espasyo" at lumilipat sa "pagsususunod ng oras": sa pamamagitan ng logical folding, 3D stacking, at full-chain architecture optimization, pinapababa ang latency ng signal transmission at binabawasan ang redundant data movement, upang makamit ang pagtaas ng efficiency na katumbas ng advanced process sa matatag na process.
Ang kanyang pangunahang pamamaraan ay: sa pamamagitan ng sistemang arkitekturang pagbabago upang makamit ang pagtaas ng performance sa ilalim ng mga limitasyon sa hardware o gastos.
Sa palagay ko, ang KDA hybrid linear attention mechanism na ginagamit ng K3 ay ang pagsasagawa ng "Law of Tao" sa larangan ng AI.
Dapat mong malaman na ang Transformer architecture ay pinakamaraming gumagamit ng computing power sa attention mechanism. Ang standard attention ay tumataas nang quadratic sa haba ng sequence, at sa mga task na may million-level context, ang karamihan sa computing power ay ginagamit para panatilihin ang attention matrix ng mahabang sequence. Ang KDA mechanism ay bawas ang computational complexity ng karamihan sa attention layers mula sa quadratic patungo sa linear.
Batay sa teknikal na ulat na inilabas ng Moonshot sa nakaraan, ang paggamit ng mixed ratio ng KDA at MLA sa experimental model ay nagresulta sa pinakamataas na pagbawas ng 75% sa paggamit ng KV cache, at ang decoding throughput sa 1 milyong context length ay tumataas ng 6 beses. Kasama ang attention residual at high-sparsity MoE technology, ang training efficiency ay tumataas ng halos 25%, na may dagdag na gastos na mas mababa sa 2%.
Ito ay isang pagrerepaso ng “model production efficiency”. Kung ang pangunahing Transformer approach sa Silicon Valley ay isang gasoline-powered car na “nagpapalakas sa pamamagitan ng lakas,” ang KDA ay mas katulad ng isang hybrid engine na naglalayong makamit ang pinakamataas na thermal efficiency.
Ang ulat ng SemiAnalysis ay nagpapakita na ang KDA ay nagpapabilis ng pag-iisip ng 300%, habang nananatiling malapit sa performance ng Transformer sa pagtratado ng mahabang konteksto. Ibig sabihin nito, sa parehong halaga ng computing power, ang K3 ay makakapaglabas ng higit pang epektibong智能化.
Ang mga puna mula sa developer community ay nagpapakita na ang K3 ay may malaking pagkakataon sa mga mahabang proseso ng Agent at code generation, at may kakayahang makipagkumpetensya sa mga pangunahing modelo sa buong mundo.
Sa pangkabuuang pagtingin, sumusunod pa rin ang K3 sa Scaling Law, ngunit hinuhukay nito ang mga walang kahalagahang algorithmic waste. Habang ang mga kumpanya ng AI sa Silicon Valley ay patuloy na nagtatipon ng mga chip at nagdadagdag ng computing power, nagawa ng Kimi ang pagbalanse sa performance at efficiency sa pamamagitan ng pagrereporma sa algorithmic pipeline at pagpapaliit ng computing redundancy, at naglikha ng daan na nagmamaximize ng “smart output per watt.”
Nakapagtaka ito sa mga obserbador at investor mula sa Wall Street, na muli pang nagtatanong kung makakakuha ba ng katumbas na bawat milyar dolyar na pagsasakatuparan sa AI ng Silicon Valley, at kung ang pangunahing pagiging lider ng Amerika sa AI ay nabawasan na.
Samantala, ang mga enterprise user at developer ay nagsisimulang mag-alaala sa gastos ng paggamit ng AI. Ang ilang developer ay nagsisimula nang gamitin ang serbisyo ng “Model Routing”, na awtomatikong pumipili ng pinakamababang gastos at pinakamataas na efisiyensiya sa AI model batay sa iba’t ibang gawain, kabilang dito ang mga Chinese model tulad ng Kimi.
Yang Zhilin jumps high
Tingnan nang muli, ang pagbaba ng computing power ng Kimi ay isang side effect ng teknikal na tagumpay: ang pagpapabuti ng efisiyensiya ng modelo ay nagbawas sa gastos bawat paggamit, ngunit nagpalakas naman sa kabuuang demand.
Mahalagang banggitin na noong Hulyo 11, ipinahayag ni Tang Jie, ang tagapagtatag ng Zhipu, ang “Touch High摸高计划”, at direktang sinabi na “Hindi makarating sa tuktok ay pagkabigo”, at malinaw na isinampa na sa loob ng dalawang taon ay hindi sila hahanapin ang maagang pagkakaroon ng kita mula sa mga aplikasyon, kundi isasakop ang kanilang mga yaman sa paglutas ng apat na pangunahing direksyon ng AGI, at plano nilang magtipon ng pondo upang ilaan ng mga yamang nasa bilyon-bilyon para sa pagbuo ng teknolohiya ng mekanikal na interpretability.
Kung sasabihin mo, ang “pagtaas” ng Zhipu ay ang kanilang huling pagtatangka pagkatapos ng listing. Nais nilang pagsikapan ang hangganan ng teknolohiya upang palakasin ang kuwento ng “unang kompanya sa mundo na naglalabas ng malaking modelo” at mapabawasan ang totoong pagkabalisa.
Nakikita ko rin ang pagtaas ng Kimi sa tatlong dimensyon sa desisyon ni Yang Zhi Lin:
Una, ang pagtaas ng computing power ay nagpapalit sa pag-iisip tungkol sa traffic patungo sa pag-iisip tungkol sa halaga. Ayon sa publikong impormasyon, ang bahagi ng API business ng Kimi ay lumampas na sa 70%, na naiiba nang malaki sa dating modelo ng subscription sa C-end. Ang pagpapanatili ng mga umiiral na user at pagtanggi sa mga bagong kliyente ay tunay na nagpapahintulot na ilipat ang limitadong computing power patungo sa mga mataas na halagang escenario, upang maiwasan ang pagkakalat ng C-end traffic na maaaring magpapababa sa quota ng B-end business na naging pangunahing source ng kita.
Ang gastos ay malinaw rin. Halimbawa, ang pagpapatupad ng “pagpaprioritize sa mga umiiral na user” ay hindi malinaw—alinsunod sa anong mga kahilingan ang unang isasagawa at alinsunod sa anong mga kahilingan ang mababawasan ang prioridad. Kung mali ang pagtrato, maaaring mabawasan ang tiwala ng user.
Sa matagalang panahon, upang makamit ang pagbabago mula sa isang teknikal na bituin patungo sa isang matatag na kumpanya sa AI, kailangan ng Kimi na palakasin ang mga imprastruktura tulad ng flexible compute pool,分级响应机制, at dynamic scheduling capability.
Ikalawa, ang pagtukoy ng presyo ay umabot sa pinakamataas, at ang Kimi ay nagpapasa sa isang stress test mula sa murang buffet patungo sa paghahati-hati ng halaga. Ang “paghihiwalay ng pangunahing karapatan ng Kimi at ang karapatan sa Code” na nabanggit sa pahayag ay isang pansamantalang pagpaplano upang tugunan ang kakulangan sa computing power, ngunit maaari rin itong magpalit ng simula ng pagbabago sa kanyang sistema ng pagtukoy ng presyo.
Noong nakaraan, kahit ano ang ginagawa ng user—nagsusulat ng code, nag-aaral, o nag-uusap—ay nagbabayad ng parehong bayad at gumagamit ng parehong computing power. Kapag tumataas ang porsyento ng mga Code user na nagdadala ng malaking computing power, ang ganitong modelo ay magdudulot ng structural mismatch.
Ginagamit ni Kimi ang pagkakataong ito upang hatiin ang mga benepisyo ng miyembro at muli pang bigyan ng presyo batay sa paggamit: ang mga mahinang gumagamit ay nakikinabang sa mga pangunahing serbisyo, habang ang mga intensibong gumagamit ay nagbabayad ng premium para sa mga mataas na halagang kakayahan.
Ito ay isang pagtatangka na makipag-competensya para sa pagtukoy ng presyo ng modelong produkto sa pamamagitan ng paghahati-hati ng mga user batay sa kanilang halaga. Kasalukuyan, ang kaukulang bayarin ng K3 ay umabot sa $2.3 bawat milyong Token, na mas mababa kaysa sa mga pangunahing modelong dayo, ngunit nagsasakop na ng pinakamataas na presyo para sa mga lokal na modelong Pilipino.
Maaaring gustong tapusin ni Kimi ang mas mura na modelo at iparating ang isang pag-unawa: ang mga high-performance model ay may kakayahang magtakda ng presyo. Susunod, ang kompetisyon sa malalaking model ay magsisilbi mula sa “paghahambing ng mga parameter” patungo sa “paghahambing ng imprastruktura” at “paghahambing ng pagkakalagay ng presyo.”
Ang hakbang na ito, mas mahirap kaysa umabot sa tuktok ng listahan, at mas malapit sa kalikasan ng negosyo.
Ikatlo, ang pagtaas ng katayuan, ang paglipat ng papel ni Kimi mula sa geopolitical variable patungo sa anchor ng pagpapresyo.
Agad na nakakuha ng pansin sa buong mundo ang K3 pagkatapos ng paglabas. Sa pinakabagong “Intelligence Index” na inilabas ng independiyenteng evaluator ng AI na Artificial Analysis, nakamit nito ang komprehensibong marka na 57, at nasa ikatlong posisyon sa buong mundo, na sumusunod sa Claude Fable 5 (60 puntos) at GPT-5.6 Sol (59 puntos), at hihigit sa Claude Opus 4.8 (56 puntos).
Ang tagumpay na ito ay nagpabagsak din sa pangkalahatang paniniwala sa industriya na ang open-source ay nasa likod ng closed-source ng isang henerasyon.
Sambil iyon, ang impluwensya ng K3 ay nagsagabal sa larangan ng teknolohiya. Ang isang amerikanong institusyon sa pag-invest sa teknolohiya ay itinuturing ito bilang “turning point” sa pag-unlad ng AI, na naniniwala na ang mga high-quality open-source model ay nagpapabilis sa pagkalat ng kakayahan; sinabi ng isang propesor sa Computer Science ng University of California, Berkeley na ang K3 ay nagpapaliit sa pagkakaiba sa pagitan ng mga open-source model ng China at mga advanced model ng Amerika sa 2 hanggang 3 buwan.
Kapital na reaksyon ng merkado ay parehong malakas: sa unang araw ng pagtatrabaho ng K3, nawala ang halos $111.1 bilyon ang market value ng NVIDIA; direktang tinawag ng mga estratehista ng JPMorgan sa kanilang ulat ito bilang “DeepSeek 2.0”.
Ang acceleration na ito ang nagbabago sa lohika ng pagtatakda ng presyo.
Dagdag pa, ang ARR (annualized revenue) ng Moon Shadow ay nakaabot na sa halos $300 milyon hanggang Hunyo, ang paglago sa dayuhan ay 400%, at sa pagtaas ng presyo ng 60%, tumataas pa rin ang kita—ang tatlong set ng datos na ito ay nagpapakita na ang modelo ni Kimi na “open-source + efficiency” ay maaaring iskalin at magkakaroon ng kita.
Dagdag pa sa paglalabas ng balita, Moonshot ay humihingi ng paglalathala sa Hong Kong sa pinakamabilis na anim na buwan, at ang pagpapahalaga nito ay tumalon mula sa $4.3 bilyon patungo sa $31.5 bilyon sa loob ng anim na buwan, isang pagtaas na higit sa 7 beses.
Ang lahat ng ito ay isang pagkilala ng mga kapital na merkado sa isang non-Silicon Valley na landas. Habang nagbabalot sila sa mga SOTA na may functional unit economic model, ipinapakita nito na mayroon na si Kimi ng sariling valuation logic at hindi na kailangang i-compare sa OpenAI o Anthropic upang patunayan ang kanyang halaga.

Dark Side of the Moon, credit: network sources
Ngunit malayo pa ang K3 mula sa AGI. Halimbawa, sa performance score, bagaman mas mababa lang ng 3 puntos ang K3 kaysa sa Fable 5, nananatili pa ring malaking pagkakaiba ang likod nito.
Bukod dito, kilala rin ni Kimi sa teknikal na ulat ang dalawang kakulangan sa deployment: una, ang K3 ay nagpapanatili ng buong kasaysayan ng pag-iisip (thinking history) sa pagtuturo, at kung ang tagagamit ay hindi tama na isasauli ang nakaraang proseso ng pag-iisip, o kung nagbabago sa ibang modelo patungo sa K3 sa loob ng isang sesyon, bababa ang kalidad ng output;
Ang pangalawa ay ang K3 ay “masyadong aktibo” kapag ang gawain ay malinaw, at mas naghahangad na gumawa ng desisyon para sa user. Ang “pagsasagawa nang sarili” na ito sa mga proseso ng inhenyeriya na nangangailangan ng eksaktong pagpapatupad ay madaling magdulot ng serye ng mga pagkakamali.
Isang madaling nakakalimutan ngunit napakahalagang problema: hallucination. Espesyal na binanggit ng Artificial Analysis na tumataas ang hallucination rate ng K3 kumpara sa nakaraang bersyon, K2.6.
Sa ilang paraan, ang kagandahan at mga lihim na banta ng K3 ay isang pagkakawatak-watak ng pangkabuuang kakulangan sa suplay at demand ng computing power, at isang kolektibong pagsubok sa industriya ng AI sa China na pinapagod ng mga presyur sa pagkakabukod ng computing power, hindi pa nakakumpleto ang komersyalisasyon, at sobrang mataas na mga inaasahan ng mga user.
Bawat pag-overload at bawat “fuse” ng mga vendor ng AI ay isang hadlang na dapat lalampasan ng Chinese AI sa pagpapataas nito. Sigurado na ang isang bagong siklo ng kompetisyon ay nagsimula na, at ang malalaking modelo ay magsisilip mula sa pagpapalakas ng kakayahan patungo sa pagpapalakas ng computing power.
Sino ang makakabuo ng kahusayan sa algoritmo, paghahanda ng computing power, at iba pang imprastruktura, siya ang makakalaban sa huli at makakadefinir ng mga pamantayan sa pagkabuhay ng mga susunod na henerasyon ng AI company.
Mga sanggunian:
Letter Board, "K3 Launch 48 Hours"
Jin Duan, “Sala lang si Kimi”
Nakuha mula sa WeChat public account na "Tang Chen Tongxue", may-akda: Tang Chen, inaprubahan ng 36Kr.
