NVIDIA 發布 AI 推理指南,由中國團隊領先實現 6 倍無損加速

icon MarsBit
分享
AI summary icon精華摘要
NVIDIA 於 9 月 2 日發布了一份 AI 推理指南,展示了六種加速方法。中國團隊主導了關鍵創新,如猜測解碼和 DFlash,後者提供 6 倍無損加速。恐懼與貪婪指數仍處於高位,值得關注的山寨幣逐漸受到關注。硬體限制(如 GPU 瓦片大小)影響模型設計。DeepSeek-V3 的 MTP 方法及其他技術被強調為高效方案。該指南詳細說明了每種方法的成本與使用情境。

最近,NVIDIA 發布了一篇官方的大模型推理指南,結果翻著翻著,竟讓人看成了一本華人團隊的論文合集。

事情是這樣的。

9月2日,英偉達技術博客上線了一篇長文《用投機解碼做AI模型協同設計》。

文章的核心是一張選型表,將目前最主流的6種推理加速方案一字排開,連訓練成本、適用場景都給你扒得乾乾淨淨。

DeepSeek

它的意義在於,這是晶片霸主極為罕見地以官方姿態,將「模型應如何貼合硬體物理極限進行設計」寫成了規範。

而當他們環顧四周,尋找能在矽片極限上跳舞的最優解時,列入指南的核心方案,幾乎全是由華人團隊主導的。

這早已超出了普通算法綜述的範疇。這張表到底洩露了什麼天機?咱們一行一行拆。

幾乎純賺的買賣:投機解碼在做什麼

要理解這張表,得先弄明白「投機解碼」是個什麼局。

大模型吐字時,是一字一蹦的。每吐出一個詞,數百GB的參數就得在顯存裡完整跑一圈。其實大部分時間,算力都在等著記憶體搬數據。

「投機解碼」的解法,十分簡單粗暴——

先找一個輕量級的小模型做前置預測,一口氣先猜 7 個字;然後大模型一次性對這 7 個字做驗證。

驗證7個字和自己寫1個字的耗時差不多,畢竟權重反正都要搬一遍。

猜對的直接收下,猜錯的就從斷點處重來。因為大模型只接受它自己本來就會寫的字,所以最終輸出連個標點都不用變。這就是所謂的「無損加速」。

DeepSeek

在這個遊戲裡,所有的算力壓榨,都圍繞著一個核心的數學期望公式展開:

Speedup = 𝔼[L] × TtargetTdraft + Tverify

分子為收益 𝔼[L],代表預期接受長度(大模型每輪平均能選中幾個字)。

分母是你付出的額外代價,小模型做預測的時間(Tdraft)加上大模型最終驗證的時間(Tverify)。

想讓加速比(Speedup)狂飆,無非兩條路:要么拉高分子(猜得更準),要么極致壓縮分母(猜得更快)。

踩著同行的肩膀,推出第四代進化

沿著英偉達這張表從上往下看,你會看到一條清晰的廝殺主線。

第一行是最古老的「外置草稿模型」,得單獨訓一個小模型當助手。

NVIDIA 直接亮出了天價賬單:從頭訓練需消耗 1T 到 10T 的 token,代價非常高昂。

不過它之所以還留在表上,是因為英偉達給它安排了一個特定的歸宿——他們花了 200 億美元收編的 Groq 芯片(LPU)。

最後一行則是無需訓練的 n-gram 查表法,靠從上文裡硬搜重複片段直接抄,只適合大段複製貼上的死板場景。

真正代表技術演進的,是中間的這四行。

DeepSeek

第二行:EAGLE-3。

由北大李宇輝、滑鐵盧大學張洪陽等人組成的團隊。

從 ICML、EMNLP 一路殺到 NeurIPS,三年連發三代,把「逐字往下猜」這條串行老路做到了物理上限。

它曾是這個領域的絕對霸主,但在英偉達的新表裡,它被擠到了「參考位」,理由極短:接受長度已經被後浪超越。

第三行:MTP(Multi-Token Prediction)

雖然這個思路是 Meta 在 2024 年首創,但真正將其打造成大模型推理標準的,是 DeepSeek -V3。

NVIDIA 對其評價極高——GPU 上大模型的最佳選擇。核心在於,這種方案必須在預訓練階段就與主模型一起訓練。

第四行:DFlash。拿下6倍無損加速的狠角色。

三位作者 Jian Chen、Yesheng Liang、Zhijian Liu。它徹底摒棄了 EAGLE 和 MTP 那種「一個字接一個字猜」的串行打法,轉而借鑒擴散模型,一次前向計算,直接將 7 個 Token 的預測序列一次性生成出來,把分母(耗時)壓縮到了極致。

順帶一提,指導老師 Zhijian Liu 是 UCSD 助理教授,但他同時也是英偉達研究院的研究科學家。

第五行:DSpark。由 DeepSeek 和北京大學混編的24人團隊操刀。

DFlash 的並行架構雖然快速,但有一個致命弱點:越往後猜測越不準確。為了強行提升分子(接受長度),DSpark 在並行底座上外掛了一個極輕量的串行模組。

實測數據非常直觀:接受長度比 EAGLE-3 拔高近 30%,比 DFlash 拔高 18%。在 DeepSeek 在 V4 的線上生產環境中,速度比 MTP 快了 60% 到 85%。

硬體常數,反向鎖死模型架構

這四代技術能將算力榨乾到這種地步,靠的不只是算法上的巧思。

很多人以為草稿一次猜得越多越賺,但這完全无视了矽片的物理規則。

當注意力機制佔據解碼時間的大頭時,大模型驗證階段需要處理的 Token 總數是 1+D(1 個真實輸入 + D 個草稿預測)。

為了將這部分數據輸入 GPU,硬體會在底層將 Query 頭和 KV 頭進行分組,每組的注意力核分塊大小必須嚴格受限於 GPU 物理矩陣的邊界(Tile Size,當前架構通常為 128)。

這就得到了底層對齊公式:G × (1 + D) ≤ 128

稍作推導,便得出了英偉達指南中的終極常數準則:

D = 128G − 1

其中,G 是注意力分組數(Query 頭和 KV 頭的比例)。

這意味著,你的模型在設計之初如何對注意力進行分組,就直接決定了草稿需要猜幾個字,才能剛好將 GPU 的分塊嚴絲合縫地填滿。

如果 G=8,草稿剛好猜 15 個;如果 G=32,只能猜 3 個。硬體跨不過邊界,哪怕最後一個 Tile 你只用了半塊,算力照樣按整塊扣費。

過去,投機解碼是模型訓練完成後,工程團隊再想辦法加上的加速套件。但現在,底層的物理法則告訴你:一個硬體矩陣的常數,直接反推到了模型架構的設計參數上。

在我們的印象中,很少有晶片廠商會如此將底層硬體的約束方程寫入大模型的設計圖紙中。

尾聲

模型運行效率的競賽重心,徹底變了。

單純堆砌龐大參數的時代正在翻篇,如今真正的勝負手,取決於誰更懂腳下那塊矽片的物理極限。

在這個由晶片巨頭反向定規矩的新賽場上,華人團隊已經悄然成為了破局的默认答案。

像英偉達這樣的算力霸主,自然不會挑剔貨架上擺的是哪家算法。

但這套榨乾矽片極限的最優解究竟出自誰手,白紙黑字,印得清清楚楚。

本文來自微信公眾號「新智元」,作者:ASI啟示錄

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露