智谱在 100,000 個國產晶片上推出 GLM-5.3-Flash 模型,與 NVIDIA 競爭

iconMetaEra
分享
AI summary icon精華摘要
智谱 AI 已推出 GLM-5.3-Flash 模型,現已部署於超過 100,000 個國產晶片的叢集中。該模型前身為 Ox Alpha,在 AA 智能指數上取得 57 分,效率與 token 成本與 NVIDIA GPU 相當,定價低於主要競爭對手,並為 GLM-5 系列中首款原生多模態模型。鏈上數據顯示,市場對 AI 基礎設施的興趣持續上升,鏈上分析強調趨勢正轉向成本效益更高的國產解決方案。
智譜發布最新模型 GLM-5.3-Flash,該模型此前以匿名形式 Ox Alpha 在測試平台免費開放,5 天內流量超過 50 萬億 token。模型調用超過 10 萬張國產晶片叢集進行推理服務,硬體效率及單 token 成本已與英偉達 GPU 相當。性能方面,該模型在 AA 綜合智能指數中得分 57,與 Claude Opus 4.8 持平。定價上,每百萬 token 輸入 0.8 元、輸出 2.8 元,遠低於競爭對手。架構採用稀疏與線性注意力混合設計,是 GLM-5 系列首個原生多模態模型。在國內 AI 模型集體漲價的背景下,智譜以低價策略搶佔市場。

文章作者、來源:晚點LatePost

8月26日,智譜正式確認:此前在開發者社區引發熱議的匿名模型 Ox Alpha(中文社區稱「牛來」),即為其最新發布的 GLM-5.3-Flash。模型代號靈感源自國內近期熱映電影《牛來》。

該模型在正式發佈前,以匿名形式於 OpenRouter 和 OpenCode 上免費開放測試,5 天內流量累計超過 50 萬億 token,刷新了兩個平台的流量增長紀錄,當前使用量已超過 DeepSeek 的兩倍以上。但真正引發市場關注的,是智譜隨後披露的一個細節:這些流量,全部由國產晶片承載。

智譜在官方技術文檔中表示,調用超過 10 萬張國產晶片叢集用於該模型推理服務,“硬體效率及單 token 成本已經達到了與主流英偉達 GPU 相當的水平”。

半導體研究機構 SemiAnalysis 隨即在 X 平台發文評論:「所有流量均由國產晶片承載,硬體效率與單 token 成本已可與英偉達 GPU 相媲美。繼 Jalapeño(OpenAI 自研推理晶片)昨日宣布之後,CUDA 护城河再度受到考驗。」

100,000 張國產卡:從測試到生產,智譜在技術文檔中描述了這套國產晶片叢集的部署細節。

單張晶片的主要瓶頸在於記憶體容量與頻寬,支援長達 100 萬 token 的上下文長度尤其困難。為此,智譜在 SGLang 基礎上構建了專用推理引擎,採用 W8A8 量化、INT8/FP8/BF16 混合快取量化,以及節點內張量平行等技術,並引入生產級 Encode–Prefill–Decode(EPD)分離式架構,將多模態編碼、prompt 預填充和逐 token 解碼拆分為可獨立調度的工作池。

ZhiPu 表示,與同一硬體上的初始基線相比,端到端服務性能提升了 3 倍。

據《晚點LatePost》了解,這批晶片的供應商或來自華為、摩爾線程與海光。智譜官方對此未予置評,技術文檔中也未明確具體晶片型號。

SemiAnalysis 在評論中特別指出,此前有觀點認為只有頂級前沿實驗室才具備每日 100 萬億 token 的算力規模,「而這裡每日 100 萬億 token 的免費流量,全部跑在國產晶片上。」

模型本身:對標 DeepSeek,定價為 Claude Opus 的 1/40。GLM-5.3-Flash 的總參數規模為 320B,激活參數為 18B,參數量約為上一代旗艦 GLM-5.3 的 40%,與 DeepSeek V4 Flash 幾乎持平。

在性能方面,智譜官方評測顯示,GLM-5.3-Flash 在 Artificial Analysis Intelligence Index(AA 綜合智能指數)中取得 57 分,超越上一代旗艦 GLM-5.2,與 Anthropic 的 Claude Opus 4.8 持平,亦高於 DeepSeek 旗艦模型 V4 Pro 正式版的 53 分。

在定價方面,GLM-5.3-Flash 的每百萬 token 輸入為 0.8 元,輸出為 2.8 元,快取命中價格為 0.23 元,為 GLM-5.3 的十分之一。上線前兩週享半價優惠。

智譜表示,GLM-5.3-Flash 的定價為 GLM-5.3 的 1/10,在限時折扣期間為 GLM-5.3 的 1/20,為 Claude Opus 4.8 的 1/40。

與調整後的 DeepSeek V4 Flash 相比(谷時輸入 1.5 元、輸出 4.5 元),GLM-5.3-Flash 在絕大多數常規調用場景下更便宜。

架構創新:激活參數和層數幾乎減半 GLM-5.3-Flash 採用了與 GLM-5.3 完全不同的架構設計,這也是其能夠以更低的成本實現更高性能的核心原因。

與 GLM-4.5 相比,GLM-5.3-Flash 的總參數量相近(355B 與 320B),但激活參數量從 32B 降至 18B,層數從 92 層減至 45 層,幾乎減少一半。

智譜表示,GLM-5.3-Flash 是首個採用稀疏注意力與線性注意力混合架構的開源前沿模型。與 GLM-5.3 相比,其注意力計算量與 KV 緩存大小分別降低了 3.01 倍和 4.44 倍。

此外,該模型是 GLM-5 系列首個原生多模態模型,支援圖像和影片輸入,也是智譜自戰略聚焦 coding 以來首次推出具備多模態能力的新模型。

在漲價潮中低價突破:GLM-5.3-Flash 的發布,發生在中國 AI 模型市場一輪集體漲價之後。

Kimi K3 的輸出價格高達每百萬 token 100 元,超過前代 K2.6 的三倍以上;智譜在上半年調價後,輸出價格也達到 28 元;DeepSeek V4 Pro 從 6 元漲至 13.5 元,高峰時段為 27 元;DeepSeek V4 Flash 的輸出價格從 2 元漲至 4.5 元,高峰時段為 9 元。

價格上漲的直接後果是需求外溢。《晚點LatePost》指出,DeepSeek V4 Flash 提價後,在 OpenCode 平台上的調用量下滑了一半,這部分需求成為國產模型廠商新的增長空間。

GLM-5.3-Flash 的定價策略,正是瞄準了這一缺口。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露