DeepSeek 剛剛推出了一款能夠處理百萬個 token 上下文的模型,其激活的參數數量甚至少於兩年前發布的一些開源模型。於 9 月 10 日推出的 V4.1-Flash,代表這家中國 AI 初創公司最新試圖重寫大型語言模型的經濟模式。
該模型將 5520 億個參數打包至混合專家(MoE)架構中,但僅在輸入任務中啟用約 80 億個參數,在輸出中啟用 160 億個參數。結果是,該模型的表現遠超其實際運算資源所暗示的水平。
使其運作的架構
V4.1-Flash 引入了 DeepSeek 所稱的非對稱因果編碼器-解碼器架構,透過為各任務優化的不同路徑處理輸入並生成輸出,而非透過單一管道運行所有內容。
上下文視窗可延伸至 100 萬個 token。支援此龐大上下文的 KV 快取約消耗每個 token 890 個位元組,僅為前一代 V4-Flash 模型所需量的四分之一。
這種快取減少的影響比表面上聽起來更重要。KV 快取是決定模型能同時服務多少用戶以及對話能持續多長的記憶體瓶頸。將其減少 75% 意味著運營商可以在相同硬體上服務大約四倍的用戶,或在不升級 GPU 集群的情況下處理長達四倍的上下文。
在基準測試中,DeepSeek 声稱 V4.1-Flash 的表現優於公司自身的 V4-Pro 模型,並直接與 GPT-5.6 和 Kimi K3 競爭。公司已開始將 V4-Pro 的請求導向新模型,更新後的定價將於 9 月 14 日生效。
開放權重,開放策略
DeepSeek 已在 Hugging Face 上以 MIT 授權釋出該模型的權重。此新模型可透過 DeepSeek 的 API,以端點「deepseek-flash」存取。開放權重與 API 存取的結合,創造了雙軌採用路徑:希望在自身基礎設施上執行推論的開發者可下載並本地部署,而偏好託管服務的使用者則可呼叫 DeepSeek 新定價層級的 API。
首次公開發行的影響與競爭定位
V4.1-Flash 的發佈時機並非偶然。DeepSeek 預計將在上海證券交易所科創板上市,而展現持續的技術動能,正是讓路演簡報更具說服力的關鍵。
V4.1-Flash 內建的多模態理解功能,涵蓋視覺與文字資料,縮小了包括 OpenAI 和開發 Kimi K3 的 Moonshot AI 在內的競爭對手的差異化空間。
