根據動察 Beating 監測,DeepSeek 聯合北京大學發布了投機採樣加速框架 DSpark 的技術報告,並開源了全棧程式碼庫 DeepSpec。目前 DSpark 已部署於 DeepSeek-V4 的線上業務。在保證輸出無損的前提下,DSpark 將 Flash 版單用戶生成速度提升 60% 至 85%,Pro 版速度提升 57% 至 78%。DSpark 的表現超越了原有的單 Token 多分支預測(MTP-1)基線,在嚴格時延約束下顯著提升了系統整體吞吐量。 此前,多 Token 投機採樣難以在線上生產環境落地。自迴歸草稿模型生成速度過慢,而並行草稿模型因各位置獨立預測,導致長序列後半段的接受率極低。若在高併發下盲目驗證多 Token 草稿,大模型會浪費大量算力驗證注定被拒絕的錯誤詞彙,導致系統整體吞吐量嚴重崩潰,因此業界在線上多限於單 Token 預測(MTP-1)。 DSpark 克服了高併發下的吞吐退化瓶頸。DSpark 首先採用 DFlash 並行主幹網路生成隱藏狀態,再追加極其輕量的馬爾可夫頭。馬爾可夫頭透過查表與一次矩陣乘法,以極低成本串行注入相鄰詞的關聯。同時,系統整合了置信度預測頭與後驗校準演算法。為完美兼容生產環境的零開銷排程並防止未來資訊洩漏,排程器採用非同步機制,利用兩步前的歷史預測動態決定候選詞裁剪長度,徹底防止大模型在高負載下驗證高風險的尾部錯誤。 除了 DSpark,DeepSeek 此次開源的 DeepSpec 程式碼庫內建支援 Qwen3 與 Gemma 等開源大模型。DeepSpec 提供了從下載提示詞、重建大模型快取、訓練草稿模型到基準評估的完整 Python 工具鏈。開發者可直接利用開源腳本,在本地為不同開源大模型客製化並部署專屬加速模組。
DeepSeek 開源 DeepSpec 框架,將 V4 模型速度提升高達 85%
MarsBit分享
DeepSeek 已開源 DeepSpec 框架並推出 DSpark 加速系統,將 DeepSeek-V4 的速度提升高達 85%。該框架在無損品質的情況下,將 Flash 和 Pro 版本提升 60%-78%。DSpark 使用 DFlash 和輕量級馬可夫頭來降低拒絕率並提升吞吐量。DeepSpec 支援 Qwen3 和 Gemma,提供完整的 Python 工具鏈以進行本地部署。此更新帶來新的代幣上線,並為開發者和交易者標誌著一項關鍵的代幣發行新聞事件。
來源:顯示原文
免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。
虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款和風險披露 。