AIチップの競争格局は深く変化している。OpenAIはLLM推論に特化したJalapeñoチップを発表し、NVIDIAはGPUとGroq LPUを組み合わせてハイブリッド計算を実現し、Googleはトレーニングと推論をそれぞれTPU 8tとTPU 8iという2種類のチップに分離した。この3つのアプローチは、トレーニングと推論がハードウェアリソースに異なる要求をもたらすことを反映している。トレーニングは行列計算と大規模な接続に重点を置くのに対し、推論はより高いHBM帯域幅、より大きなSRAM、より短いネットワークパスを必要とする。この2つのワークロードに対するチップ設計の差が広がる中、FLOPSはもはや唯一の評価基準ではなく、トークンコストがAIハードウェア競争の新たな指標となっている。記事執筆者、出典:雷峰網
トークンコストが大規模モデルのハードウェア競争の新たな指標となる
具身知能が煙のたつ厨房に進出
百万のトラフィックにおけるボットのバイト記
前Covariant AI副社長の舟谱数は、LPUの役割をVera Rubinの低遅延デコード領域の不足を補うものと要約した。

Groq のチップ設計もほぼこれに焦点を当てています。1セットのLPXラックには256個のLPUが搭載され、合計で128 GBのSRAMしかありません。これはGPUラック内のHBMと容量面で比較できないほど小さいですが、集約されたSRAMの帯域幅は40 PB/sに達します。
この設計では「近さ」が重視されています。HBMは多くのモデル状態を格納できますが、計算ユニットから遠いです。一方、SRAMは高価で容量を拡大しにくいですが、データがチップ内にあり、非常に高い帯域幅と低いアクセス遅延を提供できます。

Decode 一歩一歩の計算は限られており、頻繁にデータを取得するため、データをALUに近づけることで、次のトークンの待ち時間に直接的なメリットが現れます。
Groqはさらに動的ハードウェア制御を削減しました。LPUは決定論的実行アーキテクチャであり、命令スケジューリングは主にソフトウェアによって事前に完了します。各チップはプロセッサとルーターの両方の役割を同時に担い、コンパイラは計算リソースとネットワークリソースを一緒にスケジュールし、従来のハードウェアフロー制御や仮想チャネルといったメカニズムさえ省略しています。

代償も明確です:このアーキテクチャはGPUほど汎用性がなく、オンチップSRAMには大規模モデルの完全な状態を収めきれません。そのためNVIDIAはGroq 3にモデル全体を独立して実行させず、より複雑なハイブリッドシステムを構築しました。

PrefillはGPUで実行され、大部分のDecodeはLPUで行う。Decode内のAttentionは再びGPUに戻る。GPUとLPUはそれぞれ独自のKV Cacheを維持し、主にdraft Tokensをやり取りし、micro-batchを用いて計算と通信をオーバーラップさせる。LPUは同期ドメインであるのに対し、GPUと外部KV Cacheは非同期システムであるため、NVIDIAはFPGAを両者の非同期ブリッジとして追加している。
この構造は、AIチップの役割分担がどの程度進んでいるかをよく示しています。訓練チップと推論チップの区別を超えて、1回のデコード内でも異なる部分を異なるアーキテクチャで実行できるようになっています。
しかし、NVIDIAが提示したデータは、この路線の限界も示している:ビジネスが全体のスループットのみを追求し、高い遅延を受け入れられる場合、Rubin GPUは依然として効率的である。単一ユーザーあたりのトークン速度要件が高まると、LPXの優位性が徐々に発揮され、LPUをさらに増やした場合、全体のスループット効率も低下する。

したがって、Groq 3の登場は、GPUが推論において淘汰されることを意味するものではありません。これは別のことを示しています:同じGPUでは、高スループットと極低遅延の両方を同時に実現することが難しいため、それぞれのハードウェアが得意とする領域で分担させることで、システム全体の性能曲線をより効果的に広げることができるのです。
Googleはこの切り口をより上位のレベルに置きました。

トレーニングと推論には、異なる2つのチップレシピを使用します。
GoogleはTPU 8世代でTPU 8tとTPU 8iの両方を同時に開発しました。tはトレーニング向けで、iは推論向けです。この分類の背後にあるロジックは、チップのメモリ構成に直接反映されています。
ホットチップスの現場展示中、TPU 8t は 6 組の HBM を使用し、TPU 8i は逆に 8 組を使用しています。Google の説明によると、推論では単位計算あたりより多くの HBM が必要であり、さらに SRAM の割合も高める必要があるため、8i はより多くのリソースを SRAM、メモリ容量、および帯域幅に割り当てています。

この差異は深く考える価値があります。AIチップが行列演算能力だけを競っているのであれば、推論用チップがこれほど多くのチップ面積やパッケージリソースをメモリに割く理由はありません。TPU 8iがこのような設計であることは、Googleが見ているボトルネックがデータ供給に移っていることを示しています。
トレーニング時、大きなバッチは重みの読み込みコストを多数のトークンに分散できるが、デコード中は毎回生成されるトークンが少ない一方で、重みとKVキャッシュは依然として頻繁にアクセスされる。したがって、単位FLOPSあたりに必要なHBM帯域幅は、この二つのタスクでは異なる。
Google はこの差異をネットワークトポロジーにも適用しました。過去、TPU では 3D Torus が一般的で、大規模クラスタにおける全体のスループットを重視していました。TPU 8i は BoardFly をサポートし、ネットワークパスが短くなります。BoardFly のパスの上限は 7 hops であり、3D Torus は 16 hops に達します。

トレーニングでは、数回の追加ネットワークホップの後にも大きな行列計算が残るため、通信時間は摊薄されます。デコードでは各ステップの計算ウィンドウが短く、数ホップのネットワーク遅延がトークン間隔に直接影響しやすくなります。
MoEはこの問題をさらに顕著にしています。MoEは、トークンが一部のエキスパートのみを活性化できるため、計算量的には効率的ですが、ルーターはトークンを異なるエキスパートに送信します。これらのエキスパートが異なるチップに分散している場合、計算は減少しますが、All-to-All通信は増加します。

したがって、TPU 8i は Collective Acceleration Engine を追加し、一部の collective 操作をネットワークインターフェースに近い I/O Die 上で処理します。データはまず Compute Die に移動し、HBM を通して操作を行う必要がなく、チップ内部のデータ移動の一部を省略できます。
訓練版TPU 8tのリソース割り当ては、明らかに反対側に傾いています。訓練には大量のFLOPSが必要であり、パラメータと勾配を同期するための巨大なScale-Upドメインも必要です。TPU 8tのSuperpodは9600個のチップまで拡張でき、約2 PBの共有HBMと121 EFLOPS FP4の集計計算能力を備えており、GoogleはこれにVirgoネットワークを導入して、より広範囲の訓練を専用のアーキテクチャとして構築しています。

Googleは現場で、ダークシリコンという実際のチップ設計の問題にも言及しました。
チップの面積と電力予算は限られている。同じチップにトレーニングに必要な大量の行列計算リソースと、推論に必要なより多くのSRAM、HBM、低遅延ネットワークを同時に搭載すると、ある特定のワークロードが実行されている間、常に一部の回路が長時間闲置する。

両方のタスクに異なるリソース比率が必要であるため、直接2つのチップを作成した方がより明確である。
FLOPSからトークン経済へ
三条のルートを一緒にすると、違いがはっきりします。
OpenAIはJalapeñoを制作し、チップをLLM推論の層に特化させながら、PrefillとDecodeを同種のハードウェア上で柔軟にスケジューリングする。NVIDIAはさらに下層に分割し、GPUとGroq LPUが推論の異なるステージを分担する。Googleは上層に切り分け、トレーニングと推論を直接2つのTPUとして実現する。
これらのルートの背後には、神秘的な新しい計算原理があるわけではなく、リソースの比率が変わっているだけです。トレーニングでは、高バッチサイズでデータ移動コストを分散できるため、より多くのトランジスタを行列計算と大規模な接続に割り当てます。低遅延推論では、多くの時間がデータ待機に費やされるため、より高いHBM帯域幅、より大きなSRAM、より優れたKVキャッシュの局所性、およびより短いネットワークパスが必要です。
两类负载所需的「芯片配方」差距越来越大,用一颗通用芯片同时兼顾两者,效率损失自然会越来越明显。
これが、今回のハードウェア競争における核心的な数値が変化している理由です。FLOPS は依然として重要ですが、その横には Tokens/s/user、TBT、TTFT、Tokens/kW、HBM バンド幅、およびネットワーク遅延が登場しています。
それは実際には同じことを説明しています:計算能力はすでにそこに置かれているため、システムがデータを継続的に投入し、生成されたトークンをできるだけ早く出力できるかどうかです。
OpenAI、NVIDIA、Google が現在選択している境界線はまだ異なり、今後さらに変化するのは、この境界線をどこに引くかである可能性が高い。
トレーニングと推論は分離でき、Prefill と Decode も分離可能で、Decode 内の Attention とその他の計算もさらに分割できます。分割を細かくすれば、個々の処理効率を向上させやすくなりますが、リソーススケジューリング、KV Cache の移動、およびハードウェア間通信はより複雑になります。
したがって、次の段階でのAIチップ競争の課題は、より強力なチップを製造することだけではなくなったかもしれない。
より難しいのは、どのタスクを専用のチップで実行する価値があり、どのタスクを同じハードウェア内で継続して実行すれば、システム全体のトークンコストが低くなるかを決定することである。
