Pelancaran Kimi K3 memicu 'Pemutus Litar' kerana permintaan melebihi jangkaan

iconMetaEra
Kongsi
AI summary iconRingkasan
Peningkatan permintaan terhadap Kimi K3 dari Moonshot AI memicu 'circuit breaker' dalam masa 48 jam, memaksa pasukan menghentikan pendaftaran pengguna baru. Model dengan 2.8 trilion parameter ini menggunakan mekanisme perhatian linear hibrida KDA, mengurangkan KV cache sebanyak 75% dan meningkatkan throughput enam kali ganda pada panjang konteks 1 juta. Kimi K3 mendapat skor 57 daripada 60 dalam ujian AI global, menempati tempat ketiga di belakang Claude Fable 5 dan GPT-5.6. Pelancaran ini menyebabkan penurunan kapitalisasi pasaran NVIDIA sebanyak $111 bilion dan meningkatkan penilaian Moonshot kepada $31.5 bilion dalam enam bulan. Altcoin yang perlu diawasi mungkin mendapat manfaat apabila indeks takut dan serakah bereaksi terhadap perubahan pasaran yang digerakkan oleh AI.
Permukaan bulan yang gelap, Kimi K3, menghentikan pendaftaran pengguna baru dalam masa 48 jam selepas pelancaran kerana permintaan pengguna melebihi jangkaan, terpaksa menjalankan "pemutusan kuasa" secara halaman. Jumlah parameter K3 mencapai 2.8 trilion, menggunakan mekanisme perhatian linear campuran KDA, yang mengurangkan kerumitan pengiraan lapisan perhatian dari kuasa dua kepada linear, mengurangkan cache KV sehingga 75%, dan meningkatkan throughput dekod 6 kali ganda pada panjang konteks 1 juta. Arsitektur ini dianggap sebagai praktik "Hukum Tao" dalam bidang AI, mencapai lompatan prestasi melalui inovasi arsitektur sistemik. K3 mendapat skor komprehensif 57 dalam penilaian model AI global, menempati tempat ketiga, hanya di belakang Claude Fable 5 dan GPT-5.6. Di pasaran modal, pada hari pelancaran K3, kapitalisasi pasaran NVIDIA merosot sebanyak kira-kira 111.1 bilion dolar AS, sementara valuasi Permukaan Bulan yang Gelap meningkat dari 4.3 bilion dolar AS menjadi 31.5 bilion dolar AS dalam tempoh enam bulan.

Penulis artikel, sumber: 36氪

Kimi juga mempunyai "Hukum Taos" sendiri.

K3 menjadi sangat popular, tetapi Kimi terpaksa menekan butang jeda.

Pada tengah malam 19 Julai, pasukan Kimi dari Moon Shadow mengumumkan bahawa kerana permintaan pengguna melampaui anggaran dalam masa 48 jam selepas pelancaran Kimi K3, dan disebabkan kekurangan sumber komputasi, pendaftaran pengguna baru untuk Kimi telah dihentikan sementara, dengan sumber komputasi yang terhad diberikan keutamaan kepada pengguna yang sudah berlanggan.

Sistem ahli dipisahkan menjadi hak utama Kimi dan hak Code untuk menganjurkan sumber daya dengan tepat. Daripada respons rasmi yang akan datang, Kimi tidak membuat penyesuaian terhadap sistem ahli, tetapi hanya menyeimbangkan semula pengalaman pengguna di bawah kapasiti pengiraan yang terhad.

K3 menyala hingga memicu "penghentian" pengiraan, hanya boleh menolak pelanggan baharu dan fokus pada perkhidmatan kepada pelanggan lama.

"Undang-undang Tao" Kimi

Saat ini, semua pembuat model sedang berlomba-lomba memperbesar skala pengguna dengan cara seperti percuma, penurunan harga, dan strategi nilai baik. Berbanding dengan itu, tindakan Kimi yang sebaliknya kelihatan agak “Vanderbilt”.

Namun, semakin kuat kemampuan model, semakin panjang konteks, dan semakin kerap pengguna memanggilnya, semakin tinggi penggunaan daya pengiraan inferensi. Dalam keadaan “jumlah permintaan K3 mendekati had kapasiti kluster pengiraan semasa”, Kimi juga menghadapi masalah seperti “DouBao”: semakin ramai pengguna C-end, sumbangan terhadap pendapatan tidak jelas, tetapi GPU tidak mampu menanggungnya.

Sebagai model MoE pertama Moonshot dengan parameter sebanyak 3 triliun, jumlah parameter keseluruhan K3 mencapai 2,8 triliun. Menurut pemahaman biasa, model berskala sebesar ini akan menghabiskan daya komputasi secara eksponensial setiap kali menghasilkan output. Namun, dengan sokongan arsitektur inti uniknya, ia mencapai efek hukum Tao yang dicadangkan oleh Huawei di bidang chip.

Arsitektur ini juga dianggap sebagai enjin super yang melaksanakan tiga teknologi utama: KDA (Kimi Delta Attention) hybrid linear attention, attention residuals, dan MoE dengan kepadatan tinggi, mendorong kecekapan setiap unit pengiraan kepada keberkesanan model hingga maksimum.

Selama ini, industri cip bergantung pada Hukum Moore, meningkatkan prestasi dengan memperkecil saiz transistor. Namun, apabila proses canggih mendekati had fizikal dan kos melonjak, model pertumbuhan semata-mata menambah peranti keras juga memasuki jalan buntu.

"Huawei tahun ini mengusulkan 'Hukum Tao', melangkah keluar dari pendekatan tradisional 'pemampatan ruang' dan beralih ke 'pemampatan masa': melalui pelipatan logik, penimbunan tiga dimensi, dan pengoptimuman arsitektur laluan penuh, ia memampatkan latensi transmisi isyarat dan mengurangkan pengangkutan data yang berlebihan, mencapai peningkatan kecekapan tenaga yang setara dengan proses canggih pada proses yang sudah matang."

Metodologi utamanya ialah: mencapai lompatan prestasi melalui inovasi arkaitektur peringkat sistem di bawah sekatan peranti keras atau kos.

Menurut saya, mekanisme perhatian linear hibrida KDA yang digunakan oleh K3 merupakan praktik hukum Tao dalam bidang AI.

Perlu diketahui bahawa arsitektur Transformer paling memakan sumber pengiraan pada mekanisme perhatian. Perhatian standard meningkat secara kuadratik mengikut panjang urutan, dan dalam tugas konteks berjuta-juta, sebahagian besar sumber pengiraan digunakan untuk mengekalkan matriks perhatian urutan panjang. Mekanisme KDA mengurangkan kerumitan pengiraan kebanyakan lapisan perhatian dari kuadratik kepada linear.

Berdasarkan laporan teknikal yang dikeluarkan oleh Moonshot sebelum ini, dengan menggunakan nisbah campuran KDA dan MLA pada model eksperimen, penggunaan cache KV berkurang sehingga 75%, dan throughput dekod untuk panjang konteks 1 juta meningkat hingga 6 kali ganda. Dengan menggabungkan teknologi residual perhatian dan MoE dengan kejarangan tinggi, kecekapan latihan meningkat sekitar 25%, dengan kos tambahan kurang daripada 2%.

Ini adalah reka semula bagi “kecekapan penghasilan model”. Jika jalan Transformer yang dominan di Silicon Valley adalah kereta bahan bakar yang mengandalkan kuasa besar untuk mencapai keajaiban, KDA lebih menyerupai enjin hibrid yang mengejar kecekapan terma maksimum.

Laporan SemiAnalysis menunjukkan bahawa KDA meningkatkan kelajuan inferens sebanyak 300%, sambil mempertahankan prestasi yang hampir setara dengan Transformer dalam pemprosesan konteks panjang. Ini bermakna di bawah pengeluaran kuasa komputasi yang sama, K3 dapat menghasilkan lebih banyak kecerdasan yang berkesan.

Ulasan ujian dari komuniti pembangun menunjukkan bahawa K3 berprestasi cemerlang dalam tugas Agent jangka panjang dan penghasilan kod, serta memiliki keupayaan untuk bersaing dengan model terkemuka antarabangsa.

Pada dasarnya, K3 masih mengikuti Hukum Penskalaan, tetapi memotong pemborosan algoritma yang kasar. Sementara perusahaan AI di Silicon Valley terus menimbun chip dan menambah kekuatan komputasi, Kimi mencapai keseimbangan antara kinerja dan efisiensi dengan merekonstruksi rantai algoritma dan menyederhanakan redundansi komputasi, dalam kondisi kekuatan komputasi yang terbatas, serta menempuh jalan yang memaksimalkan "output kecerdasan per watt".

Ini mengejutkan para pengamat dan pelabur Wall Street, yang sekali lagi mempertanyakan sama ada pelaburan berbilion dolar AS dalam AI di Silicon Valley akan memberikan pulangan yang sepadan, dan sama ada keunggulan AS dalam AI telah dilemahkan, sebagaimana mereka sebelumnya mempertanyakan DeepSeek.

Sementara itu, pengguna perusahaan dan pembangun juga mulai memperhatikan kos penggunaan AI. Sebahagian pembangun telah menggunakan perkhidmatan "Pemilihan Model" (Model Routing) untuk secara automatik memilih model AI yang paling rendah kos dan paling cekap mengikut tugas, termasuk model China seperti Kimi.

Yang Zhi Lin melompat tinggi

Melihat kembali, kegagalan daya komputasi Kimi adalah efek samping kejayaan teknikal: peningkatan kecekapan model mengurangkan kos penggunaan sekali ganti, tetapi malah merangsang lonjakan permintaan keseluruhan.

Perlu ditekankan bahawa pada 11 Julai, pendiri Zhipu, Tang Jie, mengumumkan "Rancangan Touch High", dengan tegas menyatakan "Jika tidak mencapai puncak, ia adalah kegagalan", dan dengan jelas menyatakan bahawa dalam dua tahun ke depan, mereka tidak akan mengejar pendapatan jangka pendek daripada aplikasi, tetapi akan mengalokasikan sumber untuk menyelesaikan empat arah utama AGI, serta merancang untuk mengumpulkan dana dan mengalokasikan sumber berukuran miliaran untuk menerobos teknologi kebolehterangansan mekanikal.

Jika dikatakan bahawa "mencapai ketinggian" oleh Zhipu adalah pertempuran hidup atau mati selepas pencatatan sahamnya, ia berharap untuk memperkuat naratif "syarikat model besar pertama di dunia" dengan mengejar batas teknologi, serta meredakan kebimbangan sebenar.

Saya juga melihat Kimi mencapai “lompatan tinggi” dalam tiga dimensi dalam keputusan Yang ZhiLin:

Pertama, tingkatkan kekuatan pengiraan, beralih dari pemikiran trafik kepada pemikiran nilai. Maklumat awam menunjukkan bahawa perniagaan API Kimi telah melepasi 70%, yang sangat berbeza daripada model langganan C-end sebelum ini. Menjaga pengguna lama dan menolak pelanggan baharu sebenarnya mengalihkan kekuatan pengiraan yang terhad kepada skenario bernilai tinggi, mengelakkan trafik C-end yang meluas mengambil bahagian kuota perniagaan B-end yang telah menjadi sumber pendapatan utama.

Harganya juga jelas. Sebagai contoh, kriteria pelaksanaan “mengutamakan pengguna sedia ada” tidak telus; permintaan mana yang diprioritaskan dan mana yang diturunkan tahapnya, jika ditangani dengan salah, akan melemahkan kepercayaan pengguna.

Dalam jangka panjang, Kimi mesti memperkuat infrastruktur seperti kolam kekuatan komputasi yang fleksibel, mekanisme respons bertingkat, dan kemampuan penjadualan dinamik untuk berubah daripada seorang bintang teknologi kepada syarikat AI dewasa.

Kedua, penghargaaan meningkat, Kimi sedang menjalani ujian tekanan dari makanan自助 murah kepada penghargaaan berstrata. "Pemisahan hak utama Kimi dan hak Code" yang disebut dalam pengumuman tersebut adalah tindakan sementara untuk mengatasi kekurangan kuasa pengiraan, tetapi juga mungkin menandakan permulaan penstrukturan semula sistem penghargaaannya.

Dahulu, sama ada pengguna menulis kod, mencari maklumat, atau bercakap santai, mereka membayar caj yang sama dan menghabiskan tenaga pengiraan yang sama. Apabila peratusan pengguna Code yang menghabiskan tenaga pengiraan tinggi meningkat, model ini pasti menyebabkan ketidakseimbangan struktur.

Kimi menggunakan peluang ini untuk membahagikan hak ahli dan semula menentukan harga berdasarkan skenario penggunaan: pengguna ringan menikmati perkhidmatan asas, manakala pengguna berat membayar premium untuk kemampuan bernilai tinggi.

Ini adalah usaha untuk merebut kuasa penetapan harga produk model melalui pengelompokan pengguna berdasarkan nilai. Saat ini, kadar caj K3 telah mencapai $2.3 per juta Token, walaupun lebih rendah daripada model terkemuka luar negara, ia telah mencatatkan rekod tertinggi baru untuk model tempatan.

Mungkin Kimi juga ingin meninggalkan model berharga rendah, dan menyampaikan pemahaman kepada luar: model berprestasi tinggi memiliki kemampuan penetapan harga. Seterusnya, persaingan model besar akan berpindah dari “bertanding dalam parameter” kepada “bertanding dalam infrastruktur” dan “bertanding dalam penetapan harga kos”.

Langkah ini lebih sukar daripada mendaki ke puncak senarai, dan lebih dekat kepada esensi perniagaan.

Ketiga, peningkatan status, Kimi berpindah dari variabel geopolitik menjadi titik rujukan penetapan harga.

K3 selepas dilancarkan segera menarik perhatian global. Dalam indeks kecerdasan terkini yang dikeluarkan oleh agensi penilaian model AI bebas, Artificial Analysis, skor kompositnya mencapai 57, menempati kedudukan ketiga global, di belakang Claude Fable 5 (60) dan GPT-5.6 Sol (59), serta mengungguli Claude Opus 4.8 (56).

Pencapaian ini juga secara tidak sengaja memecahkan konsensus industri bahawa "sumber terbuka tertinggal separuh generasi daripada sumber tertutup".

Sementara itu, pengaruh K3 telah meluas di luar kalangan teknologi. Institusi pelaburan teknologi Amerika menganggapnya sebagai "titik balik" dalam perkembangan AI, percaya bahawa model open-source berkualiti tinggi sedang mempercepat penyebaran kemampuan; seorang profesor ilmu komputer dari Universiti California, Berkeley, menyatakan bahawa K3 telah mengurangkan jurang antara model open-source China dan model canggih Amerika kepada hanya 2 hingga 3 bulan.

Tindakan pasaran modal juga begitu tajam; pada hari pertama perdagangan K3, kapitalisasi pasaran NVIDIA merosot sebanyak kira-kira US$111.1 bilion dalam sehari; analis JPMorgan dalam laporan mereka secara langsung menyebutnya sebagai "DeepSeek 2.0".

Akselerasi ini lah yang mengubah logik penentuan harga.

Selain itu, ARR (pendapatan tahunan) Bulan Gelap telah mendekati US$300 juta pada Jun, dengan kadar pertumbuhan luar negara sebanyak 400%, dan pendapatan justru meningkat selepas kenaikan harga 60%. Gabungan tiga set data ini menunjukkan bahawa model "sumber terbuka + kecekapan" Kimi boleh diubah menjadi pendapatan berskala.

Dengan pengumuman bahawa Moonshot sedang mencari untuk disenaraikan di Hong Kong dalam tempoh paling cepat enam bulan, nilai pasarnya meningkat dari US$4.3 bilion menjadi US$31.5 bilion dalam tempoh enam bulan, meningkat lebih daripada tujuh kali ganda.

Ini semua merupakan pengesahan oleh pasaran modal terhadap jalan alternatif bukan utama di Silicon Valley. Ketika mereka mempertaruhkan pada “SOTA yang mampu menjalankan model ekonomi unit yang berfungsi”, ini juga menunjukkan bahawa Kimi memiliki logik penilaian sendiri, dan tidak lagi perlu membandingkan dirinya dengan OpenAI atau Anthropic untuk membuktikan nilainya.

Sisi gelap bulan, sumber gambar: data rangkaian

Namun, K3 masih jauh dari AGI. Sebagai contoh, dalam ujian prestasi, walaupun K3 hanya 3 mata lebih rendah daripada Fable 5, perbezaan di belakangnya masih besar.

Selain itu, Kimi juga mengakui dua kelemahan pada peringkat pelaksanaan dalam laporan teknikal: pertama, K3 menyimpan sejarah pemikiran yang lengkap semasa latihan; jika pihak yang memanggil tidak menghantar semula proses penalaran sebelumnya dengan betul, atau beralih daripada model lain ke K3 dalam sesi, kualiti output akan menurun secara ketara;

Kedua, K3 akan menjadi "terlalu proaktif" apabila tugas tidak jelas, lebih cenderung membuat keputusan untuk pengguna. "Tindakan sendiri" ini dalam proses kejuruteraan yang memerlukan pelaksanaan tepat, mudah memicu rantaian kesilapan.

Masih ada satu isu yang mudah diabaikan tetapi sangat penting: halusinasi. Artificial Analysis secara khusus menunjukkan bahawa kadar halusinasi K3 meningkat berbanding generasi sebelumnya, K2.6.

Dalam beberapa segi, kilau dan kebimbangan K3 merupakan cerminan ketidakseimbangan permintaan dan penawaran kuasa pengiraan seluruh industri, serta kesakitan kolektif industri AI China di bawah tekanan berat berupa keterbatasan kuasa pengiraan, komersialisasi yang belum lengkap, dan harapan pengguna yang terlalu tinggi.

Setiap kali overloading dan setiap kali “melting down” oleh pengeluar AI ini, merupakan rintangan yang perlu dilalui oleh AI China dalam usaha mencapai ketinggian baru. Yang pasti, satu kitaran persaingan baharu telah bermula, di mana model besar akan berpindah dari persaingan kemampuan kepada persaingan kekuatan pengiraan.

Siapa yang mampu membina keunggulan dalam algoritma, simpanan kuasa pengiraan, dan infrastruktur lain, hanya mereka yang akan berjaya akhirnya dan menentukan piawaian kehidupan bagi syarikat AI generasi seterusnya.

Rujukan:

Papan Huruf, "K3 Diumumkan Selama 48 Jam"

Jin Duan, Semuanya Salah Kimi

Artikel ini berasal daripada akaun微信公众号 "Tang Chen Tong Xue", penulis: Tang Chen, diterbitkan dengan kebenaran 36Kr.

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.