雖然國產AI大模型的調用量已領先美國九週,但在高強度編程場景下,實際成本遠高於GPT Codex套裝。智譜2025年虧損超過30億元,Kimi等套裝配額受限且高峰時段限流。主因是中國算力基礎設施不足(數據中心449個 vs 美國5427個),導致無法推出類似Codex的高性價比套裝。當前開發者需在性能、價格、穩定性三個維度間權衡,國產模型僅在部分性能指標上接近國際頂級模型,整體仍面臨叫好不叫座的困境。文章作者、來源:最話FunTalk
過去一個月,矽谷AI界頻出大招,GPT-5.6、fable5、Grok-4.5 紛紛亮相。
一時間,國內開發者、程式員群體紛紛沸騰,各種關於 GPT-5.6 等前沿模型的討論、評測此起彼伏。
儘管這個月也有 Kimi-K3 這樣的新銳國產模型問世,但總的來看,國產大模型當前在一線開發者群體中,始終處於一種「叫好不叫座」的狀態。

根據最新數據,在使用量方面:OpenRouter 6月22日至28日的數據顯示,中國模型週調用量達20.39萬億Token,美國模型為4.25萬億,前者已連續九週領先。
但與之形成對比的是,國內AI六小龍在營收方面的表現卻不盡如人意:公開財報顯示,智譜2025年營收7.24億元,虧損卻達到了30億元以上;MiniMax為7900萬美元(約5.7億元);月之暗面等其餘四家尚未披露完整年營收。
Even top-tier companies still have revenues at the hundreds of millions level.
相比之下,作為 AI 頭部企業的 Anthropic,其 ARR 已達到約 600 億—700 億美元,主要驅動力為 B2B API 及 AI Coding 場景。
這不禁引出了一個尖銳的問題:
為何號稱「便宜」、「調用量大」的國產模型,至今仍叫好不叫座,在 AI Coding 等高價值場景上,仍難以與國外頂尖模型正面抗衡?
最近,筆者在與多個一線開發者深入探討此問題後,發現了一個很反直覺的事實:
國產大模型,在某種程度上其實非常「貴」。
也正是這樣的「貴」,讓某些在性能上有所突破的國產模型,難以真正展現自己的閃光之處。
01 “低價” 的幻覺
提到國產大模型,很多人想到的都是 DeepSeek、Kimi 這樣的代表,而與之關聯最緊密的標籤之一,就是低價、便宜;
如果僅從 Token 單價來看,國產模型與 GPT-5.6、fable5 等頂尖模型相比,確實有著不小的優勢,以 GLM-5.2 與 DeepSeek V4 為例:GLM-5.2 每百萬 Token 輸入/輸出為 1.4/4.4 美元,DeepSeek-V4-Pro 為 0.435/0.87 美元;GPT-5.6 Sol 為 5/30 美元,Claude Fable 5 則為 10/50 美元。
但實際上,這種「低價」的印象,是圈外人長期的誤區。
尤其在高強度的程式設計場景下,國產大模型的單價不但沒有優勢,甚至反而比有套裝方案的 GPT、Claude 貴出好幾倍。
李光(化名)是AI領域的一位科研工作者,由於工作需要,每天都要在AI Coding的場景下消耗幾十億Token,在這樣的消耗量下,如果使用國產大模型,例如GLM-5.2,整體的成本就會變得非常恐怖。

李光晒出的 Token 賬單
於當天對話中,李光消耗的 Token 已接近 40 億,若他使用的是 GLM-5.2,成本大致為:(8639 萬普通輸入 × 1.4 美元 + 33.80 億快取輸入 × 0.26 美元 + 1906 萬輸出及推理 × 4.4 美元)約為 1084 美元,按 1 美元兌 7.2 元人民幣估算,約合人民幣 7800 元。
而讓李光如此放手燒 Token 的原因,就是因為他開了 GPT 的 CodeX 套餐,
這裡簡單解釋一下 CodeX 套餐的具體形式:簡單來說,這是為編程場景推出的套餐;嚴格來說,它並非真正無限量,而是將 Codex 納入 ChatGPT 訂閱:Plus 為 20 美元/月,Pro 從 100 美元/月起,配額約為 Plus 的 5 倍或 20 倍;達到上限後可購買 Credits 繼續使用。
同樣地,Anthropic 的 Claude Code 也有一套類似的套餐,具體形式為:Claude Pro 為 20 美元/月,Max 5x 和 Max 20x 分別為 100、200 美元/月;Claude 網頁端與 Claude Code 共享每 5 小時及每周配額,觸頂後可按 API 價格續用。
在這樣的套餐兜底下,巨大的 Token 成本反而被抹平了。
對於國內的開發者來說,在高強度 AI Coding 場景下,每天消耗幾十億、上百億 Token,是一個很普遍的常態。
小劉也是 AI 編程的重度開發者,他在 Codex 上實際一週的花費是 300 元人民幣,這還是在沒有公司報銷的情況下。
但即使是這樣的成本,與國產模型相比,依然顯得「便宜」了很多,因為同樣 300 元,根本買不來 GLM 5.2 等數量的 token。

小劉的 Token 賬單
在中國開發者看來,GPT 的 Codex 套餐是目前能買到的最便宜的 token,比智譜、Kimi 便宜好幾倍,這可能違反直覺,但事實就是國產模型在高強度的 Coding 場景下,性價比完全無法與之相比。
這裡需要說明的是:Codex 並非真正意義上的不限量套餐,如果按最高檔 200 美元計算,一週大約有 20 億額度。
但由於部分開發者會透過「中轉站」等手段使用模型,某些模型的實際成本會比官方渠道低很多,這就導致有時能以更低的價格買到更多 Token,於是才有了 300 塊能買 120 億 Token 的現象。
實際上,國產模型在定價方面並非沒有推出過類似的套餐,但如果細究起來,此類套餐在限額方面與 Codex 相比,存在很大的限制。
02 國產定價之痛
國產大模型在定價方面的現狀,可以用一句話來形容:
你以為你進的是自助餐的場子,但最後發現,商家還是按斤計費。
例如,在套餐方面,國內的 Kimi、GLM-5.2:Kimi Code 分為 49、99、199、699 元四檔,配額每週刷新;GLM Coding Plan 的 Lite、Pro、Max 每 5 小時分別約 80、400、1600 次 Prompt,每週約 400、2000、8000 次,且 GLM-5.2 高峰期按 3 倍扣額。
以阿里的 Qoder 為例,根據筆者一位從事 B 端客戶運維的朋友阿迷(化名)介紹:「Qoder 曾經是國內最好用的 AI IDE,可惜它自己的新定價,把優勢搞沒了。」
在套餐方面:Qoder CN 個人 Pro、Pro+ 分別為 59、169 元/月,包含 2000、6000 Credits;Teams 與 VPC 版分別為 99、199 元/席位·月,均包含 3000 Credits,後者從 50 席起售。
“今年他們合併靈碼調了定價後,就我知道的,至少都有二三十家放棄續費了。”阿迷後來介紹道。
根據阿迷的測試,Qoder 企業版 199 的套餐,按他的使用方式,3 天就用完了,如果按重度開發者的使用方式,估計一天就用完了。
同樣地,在套餐方面,令國內用戶感到五味陳雜的,還有 GLM-5.2。
根據開發者小薇的說法:「GLM-5.2 的套餐約等於沒有,就算有套餐,高峰期仍然限流,並且還存在『背刺』用戶的現象。」
根據36氪的報導:GLM-5.2 的套餐,之前比演唱會門票還難搶,每天早上 10 點鐘準時刷新,能不能買到全憑手速。
2026年1月,智譜發佈公告,因算力緊張,將每日可售數量直接削減至原量的20%,每天早上10點釋出部分配額,幾分鐘內即售罄。
歸根結底,國產模型在套餐和價格上的「吝嗇」,本質上是由算力不足所導致的窘境。
根據2025年中國信通院、工信部的數據,中國現有的數據中心為449個,而美國則為5427個;在總算力方面,中國為1053 EFLOPS,而美國則為2400。
但這裡的關鍵在於:美國那 2,400 EFLOPS 中,高端 GPU 的佔比極高;中國的算力中,大量是華為昇騰、寒武紀等國產晶片,單卡性能與 H100 仍有代差。
為應對日益增長的算力需求,自2026年3月起,智譜、阿里雲、騰訊雲、百度在Token價格上集體調漲,漲幅介於5%至460%不等。
To be frank, the “low price” and “price war” of domestic models have long become a thing of the past.
不是國產模型不想搞 buffet,是因為算過賬:以現在的算力成本和虧損狀態,搞包月等於拿固定月費去賭用戶不會刷爆,而按照國內開發者、程式設計師動輒一天燒幾十億、甚至上百億 Token 的用法,這樣的商業模式,很快會被擊穿成本線。
而 OpenAI 和 Anthropic 的程式設計方案,主打高淨值企業客戶——Cursor、GitHub Copilot 這類大客戶每年能為 Anthropic 帶來 14 億美元的收入。
在高算力的加持下,這套商業模式本質是用「固定月費」換「長期鎖客」,客戶質量高,ARPU 也相對較高,攤得平成本。
相比之下,國內雖然有阿里這樣的雲巨頭,但問題是:阿里雲 FY2026 調整後 EBITA Margin 僅為 7.5%,雲智能集團雖然收入增長迅速,但利潤並不豐厚。
此外,傳統雲廠商敢於銷售「無限量雲伺服器」,是因為用戶並非24小時滿負載。一台ECS的實際CPU利用率可能僅為10%,雲廠商可以將一台物理機超售給十位用戶。
但大模型推理不同:每生成一個 token,就必須實實在在消耗一次 GPU 計算資源。如果用戶 24 小時持續不斷地使用,雲廠商的 HBM 显存、GPU 核心和電費都是剛性支出,完全沒有超售空間。
03 模型的「黃金三角」
除了價格因素外,對國內開發者而言,選擇 Codex、Claude Code 的原因,無疑是其強大的編程性能。
然而,在性能方面,國產模型也並非像某些刻板印象中所想的那樣。
在與多位開發者交談後,筆者發現一個較為普遍的觀點是:國產大模型,尤其是 GLM-5.2 等最新模型,已經可以承擔一些輔助性、次要的任務,例如進行測試和修復 bug。
但在較為複雜、長時間的異步任務上,國產模型目前與 GPT、Claude 等頂尖模型仍有較大差距。
開發者小張,今年3月曾使用一次國產模型進行編程,對比 GLM、Qwen 和 GPT 完成同一任務,僅有 GPT 成功完成,且符合頁面要求,那是一個多級、多列內容比對與結果生成的項目。
而另一位開發者小薇則表示,根據她的體驗,Kimi 2.7 和 豆包 2.1 Pro 的性能也尚可,但整體來說還是弱一檔(屬於第二梯隊),但總體而言也超過 Claude Sonnet 4.6 了。
目前,開發者群體中的普遍共識是:GLM-5.2 是第一個達到 Opus 級別的國產模型。
它在執行真實、複雜、長時間的非同步任務中,是可用且佔有一席之地的。
儘管在許多維度上,例如世界知識方面,其與真正的 Opus 模型仍有較大差距,但這不妨礙它成為國產模型的新高度。
但現實是:這剛剛嶄露頭角的少數「尖子生」,卻被與性能無關的其他因素拖累了。
具體來說,此類因素包括快取效率不佳、高峰時段仍會限流等,導致開發者的實際體驗非常糟糕。
這就引出了當下模型對比中的另一個維度:穩定性。
在一線開發者、程式員的體驗中,模型的選擇,早已不是簡單的性能對比,而是——
Performance–Price–Stability: The Golden Triangle.
在這三個維度中,國產模型僅勉強獲得了第一維度的部分指標。
近期,國內的 Kimi 發布了其最新的旗艦模型 K3:這是一款擁有 2.8 萬億參數、原生多模態和 100 萬 Token 上下文的開放權重旗艦模型,主攻長程編程、知識工作與深度推理。

在眾多評測中,其在 Artificial Analysis 上的智力指數為 57 分、位列全球第三;Arena 前端編程榜以 1679 分登頂,甚至有傳言稱,其性能已經能比肩 Claude Fable 5。
然而,在耀眼的分數與排名背後,開發者最關心的,仍是一個詞:性價比。
在 K3 發布後,許多開發者表示,目前 Kimi 仍然昂貴,與 Codex 相比缺乏性價比,且配額不足;單看 API 價格,K3 也談不上「白菜價」:每百萬 Token 的緩存/輸入/輸出分別為 2/20/100 元;GPT-5.6 Sol 為 0.5/5/30 美元,K3 雖低於 Sol,卻明顯高於 GPT-5.6 Luna 的 0.1/1/6 美元。
且在使用 K3 的過程中,開發者表示還出現了 API 斷連,甚至斷了一上午的情況。
就目前的情況來看,國內開發者並非不願意為國產模型付費,而是國產模型因算力緊張、成本高昂,目前無法開設像 Codex 那樣具有性價比的套餐,只能開設看似自助餐、實則限量的「大眾點評套餐」(類似智譜的 Coding Plan)。
而套餐體驗不穩定、性價比模糊,導致用戶使用過後難以留存。這本質上,是在目前算力底座成本高昂的情況下,用戶的理性選擇。
以上這些,並非我們要長他人志氣、滅自己威風,只是想提示一種風險。
目前,國產模型在追趕 GPT、Claude 的過程中,非常喜歡強調性能,但國產大模型從研發到應用,需要攀登的,遠不止性能這一座高山。
我們需要的是等待,等到國產算力基座大規模量產了,在技術、價格、穩定性方面,形成合力了,我們的產品就能撐起用戶的期待。
