ZhipuAI 在兩週內完成 100,000 台國內 AI 加速器的部署

iconMetaEra
分享
AI summary icon精華摘要
根據 AI + 加密貨幣新聞,智譜AI 在短短兩週內,於超過 100,000 台國內 AI 加速器叢集上部署了其 GLM-5.3-Flash 推理系統。該系統的端到端吞吐量提升了 3.2 倍,由 AI 驅動的 Infra Agent 處理原本由資深工程師執行的優化任務。鏈上新聞強調了 AI 快速整合至基礎設施,展現自動化如何重塑技術工作流程。此部署反映了中國 AI + 加密貨幣領域日益增長的動能。
兩週時間,10 萬顆國產 AI 加速器,一個開始優化自己的模型。

文章作者:APPSO

文章來源:華爾街見聞

就在剛剛,智譜 GLM 首席科學家唐傑在 X 平台分享了一項關於 GLM-5.3-Flash 推理系統優化的研究。

他透露,從 GLM-5.3-Flash 首次在國產 AI 加速器上運行,到完成全部生產流量承載,僅用了兩週時間。在這個過程中,系統端到端吞吐能力提升了 3.2 倍。

讓唐傑印象最深刻的是,完成大量優化工作的不僅僅是基礎設施工程師,還有一個由 GLM-5.3 驅動的 Infra Agent。

「一個幫助優化服務自身的模型。」唐傑這樣描述這一變化。

在他看來,這意味著 AI 開始參與優化承載自身運行的系統。雖然距離真正意義上的遞歸自我改進(Recursive Self-Improvement,RSI)仍然很遠,但一種早期形態已經出現。

智譜團隊也提到,過去一年裡,他們觀察到 GLM 的角色正在發生變化。

最初,團隊探索 GLM 在代碼理解和網絡安全領域的能力,希望讓模型協助分析複雜代碼中的漏洞。但隨著模型能力提升,GLM 開始參與構建 AI 系統本身。

團隊表示,他們曾觀察到模型完成了一些過去需要資深基礎設施工程師團隊花費數週才能完成的任務,而這些工作又會直接影響下一代模型的訓練和部署方式。

兩週完成國產算力集群部署

將一個大模型從新硬體上的首次運行,推進到能夠穩定承載生產請求的推理服務,需要大量系統工程工作。

GLM-5.3-Flash 此次部署運行在超過 10 萬顆國產 AI 加速器組成的叢集上。智譜團隊表示,這是一次此前缺少成熟經驗參考的大規模部署。

團隊需要解決多個問題,包括國產晶片顯存容量和互聯頻寬限制、新模型架構適配、100 萬 token 長上下文支援,以及多模態請求處理等。與此同時,國產 AI 加速器的軟體生態仍處於發展階段,部分 Kernel 支援不足,許多資料也需要工程團隊自行探索。

Tang Jie 表示,在這些限制條件下,GLM-5.3 驅動的 Infra Agent 參與了推理系統優化過程,幫助分析性能瓶頸、提出優化方案,並完成部分程式碼修改。

整個優化過程並非簡單地增加計算資源,而是在算力、記憶體、通信和調度之間尋找新的平衡。

智譜團隊採用了一系列優化方案。例如,透過 ReplaySSM 以計算換取記憶體空間,透過節點內張量平行降低顯存壓力,透過 INT8、FP8、BF16 混合精度快取提高容量利用率,同時引入 Encode-Prefill-Decode(EPD)分離式架構,讓不同推理階段能夠更靈活地調度。

最終,GLM-5.3-Flash 的端到端服務性能相比初始版本提升約 3 倍,硬體利用率和單 token 成本達到接近主流 NVIDIA GPU 平台的水平。

部署完成後,GLM-5.3-Flash 進入真實使用環境測試。智譜團隊介紹,該模型曾以匿名模型名 Ox-Alpha 運行於 OpenCode 和 OpenRouter 平台,一週內成為兩個平台使用量最高的模型之一,六天處理超過 62 萬億 token。

不過,這次實驗真正的變化,並不只是讓 AI 寫代碼,而是讓 AI 能夠理解複雜系統為何出現性能變化。

例如,當系統回饋「吞吐量下降 20%」時,它只能說明某處出現異常,卻無法直接告訴 Agent 哪一層出了問題、當前假設是否錯誤,以及下一步應該驗證什麼。

對於資深工程師來說,此類判斷依賴長期經驗。工程師知道何時查看執行時間線、何時運行微基準測試,以及應比較哪個模組的輸出。

智譜團隊希望將這種工程經驗轉化為 AI 可調用的回饋機制,並稱之為「dense feedback」。

這套機制的核心,是讓 Agent 獲得更接近工程判斷過程的資訊。

當模型需要確認計算是否正確時,它可以獲得對應的正確性反饋;當模型需要分析性能下降原因時,它可以查看系統運行過程中的時間消耗;當模型嘗試新的優化方案時,它可以通過實驗判斷該方案是否適用於當前場景。

智譜團隊認為,真正有效的回饋需要滿足幾個條件:它必須足夠接近具體問題、能夠快速獲得,同時能透過客觀實驗驗證。否則,大量的日誌和指標反而可能讓 Agent 難以判斷下一步行動方向。

模型優化系統,系統服務模型

在 dense feedback 的幫助下,Infra Agent 開始參與定位推理系統中的隱藏問題。

在 KDA 的上下文並行路徑中,Agent 發現了一個影響長上下文計算精度的問題。

由於不同上下文分片之間需要不斷合併狀態矩陣,TF32 計算產生的捨入誤差會隨著序列長度增加不斷累積,最終導致計算結果偏差。

Agent 透過比較不同執行路徑的結果,將問題定位至狀態傳播與合併過程中的精度處理。相關修復已合併至 Flash Linear Attention 專案 PR #1180。

另一個問題出現在 KV 轉帳與 DeepEP 調度之間。

在測試過程中,Agent 發現 KV 轉帳沒有與 DeepEP 派遣形成有效重疊,導致部分場景下傳輸開銷超過 30%。

隨後,Agent 沿著 Python 與 C++ 調用鏈繼續分析,發現節點內路徑沒有及時釋放 Python GIL,使傳輸任務無法及時推進。

完成修改後,KV 轉帳帶來的額外開銷從超過 30% 降低到 1% 以下。

此外,Agent 還優化了一個 Decode Kernel。

它發現,由於 Kernel 切分方式的問題,同一組歸一化計算被重複執行了 4 次。通過重新組織計算結構以減少重複計算,該 Kernel 最終獲得 1.71 倍的效能提升。

此優化思路源自 Agent 對 SGLang、Flash Linear Attention 和 DeepGEMM 等專案現有 Kernel 的學習,將這些代碼中的優化經驗提煉為「optimization skeleton」,並結合當前系統回饋判斷其適用性。

過去,類似的優化經驗主要依賴工程師個人的積累。

而在這一過程中,Agent 開始能夠從既有程式碼中學習優化方法,再通過實驗驗證這些方法是否適合新的硬體和模型環境。

Tang Jie 表示,人類工程師仍然負責設定目標、搭建反饋環境,以及審核高風險修改。

但工程師的角色正在變化,從直接解決每一個問題的人,逐漸轉向設計反饋系統的人。

智譜團隊認為,建立在真實基礎設施任務上的可驗證反饋環境,也可能成為訓練下一代模型的重要基礎。每一次 Agent 完成工程任務,都可能成為下一代模型學習的數據。

Currently, the case of GLM-5.3-Flash is still distant from true recursive self-improvement. However, Tang Jie believes that a minimal loop has already emerged.

模型優化系統,而系統服務模型。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露