月之暗面 Kimi K3 在發布後 48 小時內,因用戶請求量遠超預期而暫停新用戶訂閱,被迫進行算力「熔斷」。K3 的總參數規模達 2.8 萬億,採用 KDA 混合線性注意力機制,將注意力層的計算複雜度從平方級降至線性,KV 緩存最多減少 75%,在 100 萬上下文長度下解碼吞吐量提升 6 倍。該架構被視為 AI 領域「韜定律」的實踐,透過系統級架構創新實現性能躍升。K3 在全球 AI 模型評測中綜合得分 57 分,位列第 3 名,僅次於 Claude Fable 5 和 GPT-5.6。在資本市場上,K3 發布當日英偉達市值蒸發約 1111 億美元,月之暗面估值在半年內從 43 億美元飆升至 315 億美元。文章作者、來源:36氪
Kimi 也有自己的「韜定律」。
K3 爆火,Kimi 卻不得不按下暫停鍵。
於7月19日深夜,月之暗面Kimi團隊發佈公告,因Kimi K3上線48小時內用戶請求量大幅超出預估,由於算力資源緊張,暫停開放Kimi新用戶訂閱,將有限算力優先保障現有訂閱用戶。
會員體系隨之拆分為 Kimi 主權益與 Code 權益,以精準分配資源。從稍後的官方回應看,Kimi 沒有對會員體系進行調整,只是在有限算力下對用戶體驗的重新平衡。
K3 火到觸發算力「熔斷」,只能婉拒新客,專注服務老用戶。
Kimi 的「韜定律」
目前,各大模型廠商都在拼命擴大用戶規模,透過免費、降價等高性價比手段吸引新用戶。相比之下,Kimi 的反向操作顯得略為「凡爾賽」。
但模型能力越強、上下文越長、用戶調用越頻繁,對推理算力的消耗也越高。在「K3請求量逼近現有算力集群的承載極限」的情況下,Kimi 也遭遇到「豆包」式的煩惱:C 端用戶越多,對收入的貢獻不明顯,但 GPU 抗不住了。
作為月之暗面首款三萬億參數級 MoE 模型,K3 的總參數規模達到 2.8 萬億。按常規理解,此規模的模型每次輸出都會消耗指數級的算力。但在其獨特核心架構的支持下,達到了華為在晶片領域提出的「韜定律」效果。
這個架構也被視為一臺超級引擎,落地了三項關鍵技術:KDA(Kimi Delta Attention)混合線性注意力、注意力殘差(Attention Residuals)和高稀疏度 MoE,把每一分算力轉化為模型效果的效率推到極致。
長期以來,晶片行業依賴摩爾定律,透過縮小電晶體尺寸來提升性能。但當先進製程逼近物理極限、成本急劇上升,單純堆疊硬體的增長模式也步入瓶頸。
Huawei this year proposed the "Tao Law," moving beyond the traditional approach of "spatial miniaturization" toward "temporal miniaturization": by implementing logical folding, 3D stacking, and end-to-end architecture optimization, it reduces signal transmission latency and minimizes redundant data movement, achieving energy efficiency gains comparable to advanced processes on mature nodes.
其核心方法論是:在硬體受限或成本約束下,通過系統級架構創新實現性能躍升。
In my opinion, the KDA hybrid linear attention mechanism adopted by K3 is a practical application of the "Tao Law" in the field of AI.
要知道,Transformer 架構在注意力機制上最耗算力。標準注意力隨序列長度呈平方級增長,在百萬級上下文任務中,大部分算力消耗在維持長序列的注意力矩陣上。KDA 機制將大部分注意力層的計算複雜度從平方級降至線性。
根據月之暗面此前發布的技術報告,在實驗模型上採用 KDA 與 MLA 混合比例,KV 緩存佔用最高削減 75%,在 100 萬上下文長度下的解碼吞吐量提升至原來的 6 倍。配合注意力殘差與高稀疏度 MoE 技術,訓練效率提升約 25%,額外成本不到 2%。
這是對「模型生產效率」的重構。如果說硅谷主流的 Transformer 路線是「大力出奇蹟」的燃油車,KDA 則更像追求「熱效率極致」的混合動力引擎。
SemiAnalysis 的報告指出,KDA 將推理速度提升 300%,同時在長上下文處理上保持接近 Transformer 的性能。這意味著在同等算力投入下,K3 能產出更多有效智能。
開發者社區的實測反饋顯示,K3 在長流程 Agent 任務和代碼生成方面表現出色,具備與國際頂級模型競爭的實力。
從根本上說,K3 依然遵循 Scaling Law(縮放定律),但將刀鋒對準了粗獷的算法浪費。當矽谷的 AI 企業仍在不斷囤積晶片、堆疊算力時,Kimi 透過重構算法鏈路、精簡計算冗餘,在有限算力的條件下,實現了性能與效率的平衡,走出一條「每瓦特智能產出比」最大化的路徑。
這讓華爾街觀察人士和投資者感到意外,他們像驚訝於 DeepSeek 一樣,再度質疑硅谷對人工智能數千億美元的投資是否能獲得相應回報,美國在人工智能領域的領先優勢是否被削弱。
同時,企業用戶和開發者也開始關注 AI 使用成本。部分開發者已開始使用「模型路由」(Model Routing)服務,根據不同任務自動選擇成本最低、效率最高的 AI 模型,其中當然包括 Kimi 在內的中國模型。
楊植麟摸高
回過頭來看,Kimi 算力被擊穿是技術成功的副作用:模型效率的提升降低了單次使用成本,反而刺激了需求總量的暴漲。
值得一提的是,7月11日,智譜創始人唐傑宣布「Touch High 摸高計劃」,直言「不登頂,就是失敗」,並明確表示未來兩年不追求短期應用變現,而是集中資源攻堅 AGI 的四大核心方向,並擬募集資金,計劃投入百億級資源突破機械可解釋性技術。
如果說,智譜「摸高」是上市後的背水一戰,其希望透過衝擊技術的天花板,來鞏固「全球大模型第一股」的故事,並緩解真實的焦慮。
我也在楊植麟的決策中,看到 Kimi 在三個維度的「摸高」:
一是提升算力,從流量思維轉向價值思維。公開資訊顯示,Kimi 的 API 業務占比已突破 70%,與此前依賴 C 端訂閱模式大不相同。保留老用戶、拒絕新客戶,實質上是將有限算力傾斜至高價值場景,避免泛 C 端流量擠佔已成為收入支柱的 B 端業務配額。
其代價也顯而易見。例如「優先保障存量用戶」的執行標準不透明,哪些請求被優先響應、哪些被降級處理,一旦處理失策,都會稀釋用戶信任。
In the long term, Kimi must solidify its infrastructure—including elastic computing pools, tiered response mechanisms, and dynamic scheduling capabilities—to transition from a technological star to a mature leading AI enterprise.
二是定價摸高,Kimi 正在進行從廉價自助餐到價值分層的壓力測試。公告中提及的「拆分 Kimi 主權益與 Code 權益」,既是應對算力短缺的短期調配,也可能預示著其定價體系重構的開端。
過去,不論用戶是寫代碼、查資料還是閒聊,都支付相同的費用並消耗相同的算力。當高算力消耗的 Code 用戶比例上升時,這種模式必然導致結構性錯配。
Kimi 借此機會對會員權益進行拆分,也是根據使用場景重新定價:輕度用戶享受基礎服務,重度用戶為高價值功能支付溢價。
這是透過價值用戶分層,試圖爭奪模型產品的定價權。目前,K3 的收費標準已達到每百萬 Token 2.3 美元,雖低於海外頂尖模型,但已創下國產模型新高。
或許,Kimi 也想告別廉價模式,對外傳遞一個認知:高性能模型具備定價能力。接下來,大模型的競爭也將從「拼參數」轉向「拼基礎設施」、「拼成本定價」。
這一步,比登上排行榜更難,也更接近商業本質。
Third, status elevation: Kimi's transformation from a geopolitical variable to a pricing anchor.
K3 發布後迅速引發全球關注。在獨立 AI 模型評測機構 Artificial Analysis 發布的最新「智能指數(Intelligence Index)」中,其綜合得分達到 57 分,位列全球第 3 名,僅次於 Claude Fable 5(60 分)和 GPT-5.6 Sol(59 分),領先 Claude Opus 4.8(56 分)。
This achievement also conveniently shattered the industry consensus that open source lags behind closed source by half a generation.
同時,K3 的影響力已溢出技術圈。美國科技投資機構將其視為 AI 發展的「拐點」,認為高質量開源模型正加速能力擴散;加州大學伯克利分校計算機科學教授聲稱,K3 將中國開源模型與美國先進模型的差距,拉小至 2 到 3 個月。
資本市場的反應同樣劇烈,K3 發布的首個交易日,英偉達單日市值蒸發約 1111 億美元;摩根大通策略師在報告中直接稱之為 “DeepSeek 2.0”。
This acceleration is what changes the pricing logic.
此外,月之暗面 ARR(年化收入)至 6 月已接近 3 億美元,海外增速達 400%,漲價 60% 後收入反而增加,這三組數據疊加,表明 Kimi 的「開源+效率」模式可規模化變現。
加上有消息披露,月之暗面正在尋求最快六個月內在香港上市,估值在半年內從43億美元飆升至315億美元,漲幅超7倍。
這些都是資本市場在為一條非矽谷主流路線的「確權」。它們為「能跑通單位經濟模型的 SOTA」下注時,也說明 Kimi 擁有了獨立的估值邏輯,不再需要對標 OpenAI 或 Anthropic 來證明自己值多少錢。

月之暗面 圖源:網路資料
但 K3 距離 AGI 還有很長的路要走。例如跑分,雖然 K3 只比 Fable 5 低了 3 分,但背後仍是不小的差距。
此外,Kimi 在技術報告中還承認了兩個部署層面的缺陷:一是 K3 在訓練中保留了完整的思考歷史(thinking history),如果調用方沒有正確地將之前的推理過程傳回,或在會話中從其他模型切換至 K3,輸出品質就會明顯下降;
二是 K3 在任務模糊時會「過度主動」,更傾向於替用戶做決定。這種「自作主張」在需要精確執行的工程流程裡,容易觸發連鎖錯誤。
還有一個容易被忽視但極其重要的問題:幻覺。Artificial Analysis 在評測中特別指出,K3 的幻覺率反而比上一代 K2.6 上升了。
在某種程度上,K3 的光鮮與隱憂,是全行業算力供需失衡的縮影,也是中國 AI 產業在算力卡脖子、商業化未閉環、用戶預期過高等重壓下的集體陣痛。
這些 AI 廠商的每一次過載、每一次「熔斷」,都是中國 AI「摸高」需要邁過去的坎兒。可以確定的是,一個新的競爭週期已經開啟,大模型將從拼能力跨越到拼算力。
誰能在演算法、算力儲備等基礎設施上建立優勢,誰才能笑到最後,並定義下一代AI公司的生存標準。
參考資料:
字母榜,《K3 發布 48 小時》
錦緞,《都怪Kimi》
本文來自微信公眾號「唐辰同學」,作者:唐辰,36氪經授權發布。
