Kimi K3 排名全球第三大 AI 模型,挑戰 Anthropic 和 OpenAI

iconTechFlow
分享
AI summary icon精華摘要
Moonshot 的 Kimi K3 全球排名第三,落後於 Anthropic 的 Fable 和 OpenAI 的 Soul 5.6。該模型擁有 2.8 兆參數,每百萬個標記的成本為 3/15,與 Sonnet 的定價相當。鏈上數據顯示其廣泛採用,而恐懼與貪婪指數則反映市場信心持續上升。分析師指出,Kimi K3 的表現可能提升 AI 實驗室的利潤,超越 SaaS 模型。美國出口限制可能正在縮小中國與美國模型之間的差距。

整理 & 編譯:深潮 TechFlow

嘉賓:Jordan 和 Max,SemiAnalysis 分析師

主持人:Jordan(SemiAnalysis 內部對話)

播客源:SemiAnalysis

原标题:[緊急特輯] Moonshot 的 Kimi K3 已登場!中國擁有了前沿模型

播出日期:2026 年 7 月 18 日

重點摘要

Moonshot(月之暗面)發布 Kimi K3,在多個綜合 benchmark 上超越 Google 和 Meta,成為世界第三好模型,僅次於 Anthropic 的 Fable 和 OpenAI 的 Soul 5.6。SemiAnalysis 的兩位分析師 Jordan 和 Max 在緊急節目中拆解了這次發布的含義:2.8T 參數的模型以和 Sonnet 同等定價(3/15 per million tokens)提供服務,如果它和前沿閉源模型規模相當,那 Anthropic 收 10/50 的利潤率就可能是 mindboggling 級別。

更尖銳的判斷來自 Jordan:前沿差距縮小,他歸因於美國政府限制 Anthropic/OpenAI 發布最強模型,人為給了追趕者時間窗口。開源並沒有真正追上來。與此同時,西方開源完全真空,沒有一家美國公司的開源模型能趕上中國第五好的。模型競爭正在變成 harness(使用工具)和地緣政治的競爭。

精彩觀點摘要

關於 Kimi K3 的定位

  • 如果你看所有主要 benchmark 的綜合排名,今天有一個非常清晰的 top three:Fable、Soul 5.6 和 Kimi K3。它們始終高於其他所有人,包括 DeepSeek,也包括 Google、Meta 和 xAI。
  • Google 應該感到非常尷尬。就在 2025 年 11 月、12 月,所有人都還認為 AI 三巨頭是 Google、Anthropic 和 OpenAI。今天跟一些「老古董」聊,他們還這麼認為,但顯然已經不是了。
  • 它可能是世界第二好的模型,因為每次我用 Fable 做點正經事都被拒絕,被打回 Opus。雖然不確定它比 Opus 好不好,但至少不會被拒。

關於前沿模型利潤率

  • If Kimi is unlikely to be selling K3 at 3/15 at a loss, then Fable, with a similar scale, charging 10/50, should completely alleviate concerns that AI labs are unprofitable businesses. Selling tokens at API pricing may even be more profitable than SaaS.
  • K2.7 到 K3 價格漲了 3 倍多,從 0.95/4 涨到 3/15。但我不覺得他們還有多少提價空間,因為很多任務用 GLM 或 MiniMax M3 就夠了。

關於美國政府與差距

  • 我相信這個差距之所以縮小,squarely 歸功於美國政府限制 Anthropic,導致我們拿不到這些公司真正最強的模型。他們是人為追上來的。
  • 我們只能在前沿智能被允許的情況下才能接觸它。這對後面第四、五、六、七名的玩家其實是一個機會。

关于西方开源真空

  • 整個市場還這麼低效,我們竟然沒有一家美國公司能至少趕上中國第五好的,這讓我震驚。
  • Even if the government does not ban Chinese open-source models, ordinary American enterprises are unwilling to feed their proprietary data into Chinese open-source models. Even if you load weights in an air-gapped data center and the CCP cannot see your data, executives still won’t buy it.

關於 Harness

  • 測試 Kimi K3 讓我第一次認真審視 Open Code、Hermes 和 Pi。Harness 完全還是產品的一部分。
  • 一些簡單的東西就能讓我選擇這個模型而不是那個:能不能安裝在遠程 SSH 伺服器上?快捷鍵好不好用?這些 harness 裡的細節實際上影響我把 token 傳送到哪裡,也就是把預算傳送到哪裡。

關於「還太早」

  • 我上週去了 ICML,前一週去了 AI Engineer 大會。這是名義上的 AI 大會,80% 以上的人從沒聽過 SemiAnalysis。你自稱在 AI 行業工作,但連 SemiAnalysis 都沒讀過?我們還太早了。

Kimi K3 是世界第三好模型嗎

Jordan: 快速熱評,Kimi K3 現在是世界第 3 好模型嗎?

Max:答案是明確的「是」。大家都喜歡吐槽 benchmark,benchmark 確實有問題,但如果你把所有主要 benchmark 的綜合排名拿出來看,它們的指向一直是对的。今天有一個非常清晰的 top three:Fable、Soul 5.6 和 Kimi K3,始終高於其他所有人,包括 DeepSeek 等 open source 玩家,也非常明顯地高於 Google、Meta 和 xAI。這對月之暗面的團隊來說是極其了不起的成就。

Google 應該感到非常尷尬。就在 2025 年 11 月、12 月,所有人都還認為 AI 三巨頭是 Google、Anthropic 和 OpenAI。今天跟一些"老古董"聊,他們還這麼認為,但顯然已經不是了。

總體來說,我還是覺得它不如 Fable 和 Soul 5.6。有點好笑的是,他們在自己的模型發布博客中也明確這麼說了。也許是老派的中國式謙虛,也許是不想招來美國政府審查,畢竟 Fable 5.6 的發布當時也有些延遲。但不管怎樣,非常令人印象深刻。

Jordan:他們在部落格的 limitations 章節中寫道:「儘管 K3 整體上是一個有高度競爭力的模型,但在用戶體驗上仍存在與 Fable 5 和 GPT 5.6 之間的明顯差距。」我的個人使用體驗是,它確實不錯,但真的很慢,這點很煩。它讓我第一次有動力去嘗試 open source 的 harness。說實在的,我感覺自己學到更多關於 harness 的東西,而不是關於模型的,因為所有這些模型都足夠好,能完成我目前做的基礎工作,我很難找到它做不到的複雜任務。

這對我來說可能是世界第二好的模型,因為每次我用 Fable 做正經事都被拒絕,被打回 Opus。雖然不確定它是否比 Opus 更好,但至少不被拒絕這件事本身就不那麼煩人。不過,使用 API 密鑰按量付費時就不會被拒,只有在使用 web console 或 deep research 時才會撞上限額。他們明顯沒有足夠的 GPU 來滿足這個模型帶來的需求。以前這個問題是透過開源策略解決的,釋出權重讓別人去 serve。但這次還沒有釋出權重,他們說 10 天後才放。

為何推遲 10 天才開源權重

Jordan: 你認為這個延遲的策略是什麼?

Max:說清楚,這都是我的純猜測。一個主要原因是他們需要給 vLLM 和 SGLang 這些推理引擎團隊足夠的時間,以確保能高效地部署這個模型。如果今天就把權重釋出,所有人都在部署,但只給你 20 tokens/秒,這對他們的品牌聲譽會非常不利。他們現在有一個絕佳的機會獲得大量 PR 和廣泛採用,但如果一發布就被性能拖累,反而會削弱勢頭。

另一種可能性是他們正在與 Together AI、Fireworks、Nebius、Groq 等推理服務廠商談判授權合作,讓這些廠商使用 GB300 等最新晶片來提供增量容量。這兩點大概就是推遲 10 天的主要原因。

前沿模型的暴利

Jordan: 請談談模型架構。它有 2.8T 參數,無法放入 B200,你需要 B300、GB300 或 AMD MI355X 才能在單台 8 卡 HGX 伺服器上提供服務。當然你可以進行跨節點的 pipeline parallelism,但這會嚴重影響效能。因此,只有擁有最新晶片的人才能提供這個模型的服務。

回到你剛才說 Google 的話題,這個模型在 2.8T 參數下就達到了前沿競爭力,這其實給了我們一些關於閉源前沿模型有多大的線索。如果他們是用 10T 參數模型來和這個比,那就更丟人了。我們得假設它和 Soul、Fable 在同一個量級。

Max: 對,你說得對。我仍然相信 Anthropic 研究團隊的能力和敏銳度。如果 Twitter 上有人說當前閉源模型有 10T 參數之類的,如果那是真的,老兄該收拾行李了,英偉達股價明天就該跌 50%,一切就結束了。

我比較確信 Kimi K3 不會比當前領先的閉源模型小多少,甚至可能稍大一點。如果這是真的,這進一步印證了我們在 SemiAnalysis 一直強調的一個觀點:這些閉源實驗室的利潤率絕對是 mindboggling 級別。如果 Kimi 大概率不是在虧本以 3/15 的價格提供 K3,這和 Sonnet 定價一樣;而 Fable 規模差不多,卻收 10/50,那就該徹底打消人們對 AI 實驗室不賺錢的擔憂。賣 token 按 API 價格算,可能比 SaaS 還賺錢,就今天來說。

Jordan: 沒有員工成本,只有 GPU。那與之前的定價相比呢?你說 3/15,但上一版 Moonshot 的直接定價是 0.95/4,所以從 K2.7 到 K3 價格漲了 3 倍多。他們還有多少提價空間?

Max:我不覺得他們還有多少空間往上推。就算在 3/15 這個價位,也會有不少人覺得太貴。他們的任務用 GLM 或 MiniMax M3 就夠了。這裡有一個有趣的分叉:像我們 SemiAnalysis 這種不在乎燒 Dylan 的 token 的,會繼續用 Fable 做幾乎所有事;而極度成本敏感的,比如 Tesla、Uber 這種一週只用 $200 token 的,會走 GLM 定價層。那真正會切換到 Kimi K3 的用戶是誰?可能就是一群哲學上熱愛 open source、想支持新模型的人。大企業會不會真採用這個模型,我不會意外答案是否定的。

新架構與下一步

Jordan: 這是全新架構。2.8T 參數,具備 Kimi 的 delta attention、potential residuals、stable latent,基本上是之前模型的放大版,大約兩倍大。之前 K2.5 我們看到 Cursor 用它做 composer,基於 continued pre-training 和 MRL,然後推出了 2.5、2.6、2.6.7 等 checkpoint。這是新 base model,但使用起來已相當完整,未出現原始模型常見的粗糙邊緣。下一步呢?3.1 什麼時候出?定價會變嗎?會有基於 K3 的 composer 嗎?

Max: 基於 K3 的 composer 應該不會有,Cursor 那幫人已經決定從零訓練自己的模型了。至於 K3.1、K3.2 這些,估計接下來一兩個月會出兩到三個更新,就是繼續 post-training。定價我猜會維持不變,因為他們在未來兩三個月內不可能跑在新硬體上,沒有 throughput 提升來降價。也許有特別牛的 kernel 工程師能把 cost 壓到 DeepSeek V4 的水平,但 3T 參數模型做到這點我比較懷疑。當前 GLM 和 MiniMax 的定價可能已經是 1T 到 1.5T 模型能 serve 的極限了。

開源會追上閉源嗎

Max: 更有意思的问题是 open source 和 closed source 的差距會不會繼續縮小,開源能不能真正達到前沿水平的 parity。這如果發生,對我們整個行業影響巨大。你怎麼看?

Jordan: 我的觀點是,差距現在縮小了,原因 squarely 在於美國政府限制 Anthropic,導致我們無法取得這些公司真正最強的模型。他們是被人為追上來的。

我們可以看到 Mythos 和 Fable 的對比。Mythos 我用不了,Fable 我得好好求才能偶爾用上。5.6 Soul,我們內部判斷它不是 OpenAI 訓練過的最大模型,沒有 4.5 那麼大。他們手裡有一個更大的。結果是,我們只能在前沿智能被政府允許的情況下才能接觸它。

這對後面的第四、五、六、七名玩家其實是一個機會,可以在某個上限之內放開一切,開始搶奪用戶份額,但永遠摸不到真正的 frontier。我覺得前沿有可能在今夏末再往前邁一大步,也有可能政治風向再變一點。也有可能我們開始找到編碼以外的模態,讓他們真正去探索那些領域。

順帶提一下 Thinking Machines 的 Inkling 發布,原生音頻輸入我覺得非常有趣,是未來的信號。

Max:關於 Inkling,西方確實非常非常非常缺乏一個不爛的 open source 模型。市場如此低效,我們竟然沒有任何一家美國公司能至少追上中國第五好的模型,這讓我震驚。一方面,美國政府全面禁止中國開源模型可能只是時間問題。另一方面,即使不禁,普通美國大型企業也不願將專有數據喂給中國開源模型。即使你在氣隙數據中心載入權重,CCP 看不到你的數據,高管也不會買賬。許多企業在乎 token 預算,又只願意運行西方模型或非中國模型。Inkling 是我們目前能拿到的最好的西方 OSS,但離開源前沿仍遠,這讓我震驚。

Jordan: 之前是 Neotron,現在是 Inkling。我覺得 Inkling 的策略有兩個機會:一,他們必須比大多數中國開源更好,才能入局。二,他們還得比前沿實驗室的二級、三級模型好,比 Sonnet 好,因為你可以用 Bedrock 或 Foundry 拿到接近前沿的智能,用閉源二級模型省錢。我一直不太理解西方開源「幫人省錢」這個角度。把模型推進 Fireworks、Together、Base10 這些生態確實是好事,但市場大頭是政府層面的。

為中國國產加速器而生

Jordan: 另一個值得說的,K3 博客裡提到 SFT 階段做了量化,原生用 MXFP4 和 MXFP8 做權重和激活,官方說法是 "broad hardware compatibility"。你覺得 Moonshot 還在乎什麼其他硬體?

Max:我有一份包含 11 種中國加速器的清單,你應該訂閱 SemiAnalysis 加速器模型以了解更多。華為昇騰、百度昆侖、寒武紀、摩爾線程,各種晶片都在論文中出現,也在代碼中看到。將前沿模型運行在國產加速器上,這已是中國的國家優先事項。如果我們在 2025 年底還說 Google 是前沿實驗室,那現在也得把 Moonshot 稱為前沿實驗室了。

Jordan: 說個題外話,我爸爸正在中國出差,他說住的酒店全滿了,因為習近平馬上要到那個區域發表關於 AI 是中國頭號優先級的演講。你說的很多是對的。

Harness 才是產品本身

Jordan: 在使用這些模型的過程中,我最大的感悟是,第一,越來越難區分使用絕對前沿模型加上 max thinking mode 與使用 medium effort 之間的差別。在日常任務中,我真的找不到這些模型解決不了的事。我的默認行為就是開啟最大、最難的模式,因為我不在乎 Dylan 的預算。

但有一個層面是,Harness 本身就是產品的一部分。測試 Kimi K3 讓我第一次認真審視 Open Code、Hermes 和 Pi。Harness 完全還是產品的一部分。一些簡單的細節就能讓我選擇這個模型而不是那個:能不能安裝在遠程 SSH 伺服器上?快捷鍵好不好用?能不能編輯之前的命令?這些 Harness 裡的小細節實際上影響我把 token 傳送到哪裡,也就是把預算送到哪裡。

Max: 很多人談 token 預算,但從你的工作流描述來看,就算我讓 GLM 能搞定的任務,也樂意路由給 Fable 用 max intelligence,因為 ROI 還是值這個價的。benchmarks 說很多任務能遷到 GLM,但你還是樂意留在 Anthropic 或 OpenAI 的模型上。

Jordan: 基本上是的。但我使用很多 Slack bot,背後運行什麼模型我並不知道。例如 Perplexity 的 Slack 集成,如果它開始路由到 K3、路由到 GLM、路由到 Sonnet,我其實不在意。之前查看用量時才發現 OpenAI 模型佔了多少,因為這是它自己做出的決策。那部分的合理化是由 harness 來決定的。

Max: 這反而是 outcome-based pricing 的一個切入點。某個實驗室如果做 outcome-based pricing,可能能拿到 95% 以上毛利,因為你願意付 stable pricing 的那些任務,今天其實零頭就能搞定。

Jordan:第二點,我不覺得這些實驗室已經沒想法可做了。他們可以繼續訓練令人驚嘆的模型,去打編碼側的 RSI,但不釋放給我們,維持他們的“永久底層階級”。他們可以繼續蒸餾,給我們嘗一點,同時繼續探索其他用途,比如視頻生成、音頻到音頻、deep research,這些和編碼不太像。機器人學和世界模型就是一個簡單方向,如果 Anthropic 把目標從知識工作轉到體力勞動上呢?說他們沒法用全世界最偉大的技術建一個可持續的好 ROI 生意,我不信。

我們還太早

Max:即使不談這些,我每天用這些模型的頻率非常高,我那些從事軟體工程師的朋友用得比我少十倍、花費也少十倍。使用 Fable 的人和使用 Sonnet 的人使用頻率一樣,但使用 Fable 的人花費是十倍,90% 毛利,支撐了大部分的業務。一旦這些人開始使用更大模型、使用更頻繁,需求只會更大,模型甚至不需要變得更好。然後我還得去跟不懂科技的鄰居聊天,在他們當中我肯定是 0.1% 甚至 0.01%,可能還有 1000 倍的增長空間。回到 Masa-san(孫正義)的「金鵝指數曲線」。

Jordan:她說的「還太早」完全正確,這也正是我認為 Kimi K3 不會讓 Anthropic 和 OpenAI 的淨新增 ARR 放緩的原因。即使今天使用 Fable 和 5.6 的人中有一部分無法說服地轉向 Kimi K3,這部分人也會被那些尚未認真嘗試這項技術的人完全淹沒。那些人每天都在發現新的高 ROI 使用案例,他們仍會默認使用 5.6 Soul 或 Fable 5 來解鎖這些新場景。你不會看到 ARR 增速放緩。

Max: 你想想還有多少人沒訂閱這個播客、沒關注 SemiAnalysis。我上週去了 ICML,前一週去了 AI Engineer 大會,這名義上是 AI 大會,80% 以上的人從沒聽過 SemiAnalysis。你自稱在 AI 行業工作,但連 SemiAnalysis 都沒讀過?我們還太早了。

Jordan: 這算是給你自己一個 ego check,Max,冷靜一下。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露