中國的 Z.ai(前稱智譜 AI)於 8 月 26 日發布了 GLM-5.3-Flash,成為 GLM-5 系列中首款原生多模態模型。此次發佈不僅因模型本身而引人注目:它完全運行於國產 AI 加速器上,有力證明了中國硬體能夠處理大規模運算負載。
時機至關重要。美國的出口管制限制了中國買家獲取 NVIDIA 最先進晶片的途徑,迫使 Z.ai 等公司圍繞現有資源進行開發。
模型實際上所做的事
GLM-5.3-Flash 採用結合稀疏注意力與線性注意力的混合架構,此設計顯著降低計算需求。該模型總共擁有 320 億個參數,但每個詞元僅激活 18 億個,意味著它能在不每次推論時承擔全部計算成本的情況下,調用龐大的知識庫。
上下文視窗為 100 萬個 token,使其成為任何開放模型中最長的之一。原生支援影像和影片輸入,使其從架構層面就真正實現多模態,而非後期附加的功能。
在 DeepSWE v1.1 編碼基準測試中,GLM-5.3-Flash 得分為 63.4,而其前身 GLM-5.2 得分為 46.2。該模型在人工分析智能指數上也獲得了 57 分。
定價具有競爭力。API 訪問費用為每百萬輸入代幣 $0.15,每百萬輸出代幣 $0.50,緩存的輸入則為 $0.03。Z.ai 將此成本描述為某些競爭對手的大約十分之一。
中國晶片正在實際運作
Z.ai 在國內製造的 AI 加速器叢集上部署了 GLM-5.3-Flash,隨後構建了自訂的服務堆疊,並應用針對該硬體量身定制的量化技術。結果相比更通用的部署方式,端到端性能提升了三倍。
該模型以開放權重形式發佈,採用 MIT 許可證,可在 Hugging Face 和 ModelScope 上以 FP8 和 BF16 格式獲取。MIT 許可證是最寬鬆的許可證之一:開發者和公司可以無限制地商業使用、修改和分發這些權重。
