最近、NVIDIAが公式な大規模モデル推論ガイドを発表したが、見ているうちに、まるで華人チームの論文集のようになってしまった。
このような状況です。
9月2日、NVIDIAの技術ブログに、長文「Speculation as a Code: Collaborative Design of AI Models」が掲載されました。
本文の核心は、現在最も主流な6つの推論加速手法を一覧表にまとめ、訓練コストや適用シーンまで明確に示したものです。

その重要性は、チップの霸者が、非常に珍しく公式な姿勢で「モデルをハードウェアの物理的限界に沿って設計する方法」を規範としてまとめた点にある。
そして、彼らがシリコンチップの限界で踊る最適解を探している際、ガイドラインに掲載された主要なソリューションのほとんどは、中華系チームが主導している。
これは通常のアルゴリズムのレビューをはるかに超えています。この表は一体何を漏らしているのでしょうか?1行ずつ分解してみましょう。
ほぼ純利益の取引:投机解码は今何をしているのか
この表を理解するには、「投機デコード」とは何なのかをまず理解する必要があります。
大規模モデルは、単語を一つずつ出力します。一つの単語を出力するたびに、数百GBのパラメータがGPUメモリ内で完全にループします。実際には、ほとんどの時間が、メモリからデータを転送するのを待つことに費やされています。
「投機解码」の解法は、非常に単純かつ直截的です——
軽量の小さなモデルで事前予測を行い、一度に7文字を推測する。その後、大規模モデルがその7文字を一括で検証する。
7文字を検証するのと自分で1文字を書くのにはほぼ同じ時間がかかる。結局、重みはすべて一度移動しなければならないのだから。
正解した場合はそのまま受け取ってください。不正解の場合はブレークポイントからやり直してください。大規模モデルは元々自分が書く文字しか受け入れないため、最終出力では句読点さえ変更する必要はありません。これがいわゆる「損失なしの高速化」です。

このゲームでは、すべての計算能力の搾取が、一つの核心的な数学的期待値の式を中心に展開されています:
Speedup = 𝔼[L] × TtargetTdraft + Tverify
分子は収益𝔼[L]であり、期待される受信長さ(大規模モデルが1ラウンドあたり平均してどのくらいの文字を正しく選ぶか)を表す。
分母は、あなたが支払う追加コスト、すなわち小モデルによる予測時間(Tdraft)と大モデルによる最終検証時間(Tverify)の合計です。
スピードアップを爆上げしたいなら、道は二つしかない:分子を引き上げる(より正確に予測する)か、分母を極限まで圧縮する(より速く予測する)。
競合の肩を借りて、第4世代の進化を遂げる
ニンテンドーのこの表を上から下へとたどると、明確な競争の軸が見えてくる。
最初の行は最も古い「外部ドラフトモデル」であり、アシスタントとして別途小さなモデルを訓練する必要があります。
NVIDIAは直接、高額な請求書を提示しました:最初からトレーニングするには1Tから10Tのトークンを消費し、コストが非常に高いです。
しかし、それがまだリストに残っているのは、NVIDIAがそのために特定の帰結を用意しているからです——彼らはGroqチップ(LPU)を200億ドルで買収しました。
最後の行は、トレーニング不要のn-gramテーブル検索法で、前文から繰り返しの断片を直接検索してコピーするのみであり、大規模なコピー&ペーストに適した機械的なシナリオに限定される。
技術の進化を真正に表しているのは、真ん中のこの4行です。

第二行:EAGLE-3。
北大のYuhui Li、ウィンザー大学のHongyang Zhangらのチームによる。
ICML、EMNLPからNeurIPSまで駆け抜け、3年で3世代を連続発表し、「一字ずつ下に推測する」という並列処理の古い道を物理的限界まで押し上げた。
それはかつてこの分野の絶対的な霸者だったが、NVIDIAの新しいランキングでは、「参照位置」に追いやられた。その理由は極めて簡潔だ:受信長さは後続の勢力に越えられた。
三行目:MTP(マルチトークン予測)。
アイデアはMetaが2024年に初めて導入したが、それを大規模モデル推論の標準にまで押し上げたのは DeepSeek -V3。
NVIDIAはその評価を非常に高く評価しています——GPU上で大規模モデルを実行するための最適な選択肢。核心は、このソリューションが事前学習段階からメインモデルと一体となって学習されることにあります。
4行目:DFlash。6倍損なし加速を手に入れた強者。
著者三人:Jian Chen、Yesheng Liang、Zhijian Liu。これは、EAGLEやMTPが採用する「一字ずつ推測する」逐次的手法を完全に廃止し、拡散モデルを参考にして、一度の前方計算で7つのトークンの予測シーケンスを一括生成し、分母(所要時間)を極限まで圧縮する。
ちなみに、指導教員の劉志堅はUCSDの助教授であり、同時にNVIDIAリサーチの研究科学者でもあります。
五行目:DSpark。DeepSeekと北京大学が共同で構成する24人のチームが手がけました。
DFlashの並列アーキテクチャは高速だが、致命的な欠点がある:後になるほど推測の精度が低下する。DSparkは、並列基盤の上に極めて軽量な直列モジュールを追加し、分子(受容長さ)を強制的に引き上げた。
実測データは非常に直観的です:受信長さはEAGLE-3より約30%向上し、DFlashより18%向上しています。在 DeepSeek V4のオンライン本番環境では、MTPよりも速度が60%から85%向上しました。
ハードウェア定数、逆ロックモデルアーキテクチャ
この四世代の技術が、計算能力をこのように最大限に引き出すことができるのは、アルゴリズム上の工夫だけではなく、その他の要因によるものです。
多くの人が、 Draft で一度に多くのものを当てるほど儲かると考えていますが、これはシリコンチップの物理法則を完全に無視しています。
注意メカニズムがデコード時間の大部分を占める場合、大規模モデルの検証段階で処理されるトークンの総数は1+D(1つの実際の入力 + D個のドラフト予測)です。
このデータをGPUに供給するため、ハードウェアは底层でQueryヘッドとKVヘッドをグループ化し、各グループのアテンションカーネルのブロックサイズは、GPUの物理行列の境界(Tile Size、現在のアーキテクチャでは通常128)に厳密に制限されます。
これで底层の整列式が得られました:G × (1 + D) ≤ 128
少し推論すると、NVIDIAガイドの最終定数規則が導き出される:
D = 128G − 1
ここで、Gは注意グループ数(QueryヘッドとKVヘッドの比率)です。
これは、モデルの設計時に注意をどのようにグループ化したかが、GPUのブロックをぴったり埋めるために草稿がどのくらいの文字数を推測すべきかを直接決定することを意味する。
G=8の場合、ちょうど15回推測できます。G=32の場合、3回しか推測できません。ハードウェアは境界を越えることができず、最後のTileを半分しか使用しなくても、計算リソースは全体として課金されます。
以前、投机デコードはモデルの学習が完了してから、エンジニアリングチームが後から追加するアクセラレーションパッケージだった。しかし現在、基礎的な物理法則が示すのは、ハードウェア行列の定数が直接モデルアーキテクチャの設計パラメータに逆算されるということである。
私たちの印象では、チップメーカーがこのような形で、底層ハードウェアの制約方程式を大規模モデルの設計図に組み込むことはめったにありません。
エピローグ
モデルの実行効率の競争の中心が、完全に変わった。
巨大なパラメータを単に積み重ねる時代は終わりを告げ、今や真の勝負所は、足下のシリコンチップの物理的限界をどれだけ理解しているかにかかっている。
このチップ大手がルールを逆転させた新しい競技場で、華人チームはすでに破局のデフォルトな答えとなっている。
算力の霸者であるNVIDIAは、棚に並ぶアルゴリズムがどの会社のものかを気にしないのは当然です。
しかし、このシリコンウェハーの限界を最大限に引き出す最適解は誰の手によるものか、白紙黒字で明確に記されている。
本文は微信公众号「新智元」より、著者:ASI启示録
