作者:小餅
AMDがTaalasを買収:推論チップがモデルの重みをシリコンに刻み込む
8月6日、AMDはトロントの半導体企業Taalasを買収すると発表したが、取引金額は公表されていない。2023年に設立され、これまでに資金調達2億1900万ドルを達成したこのスタートアップは、やや異常なことを実現した:AIモデルの重みを直接チップの金属層に焼き込み、1つのモデル専用のチップを製造した。
GPUは、モデルパラメータを高帯域幅メモリ(HBM)に保存し、推論時にデータを計算ユニットの内外に繰り返し転送します。この「転送」プロセスは、多くの電力と時間を消費し、業界では「メモリウォール」と呼ばれています。Taalasのアプローチは、この転送を完全に廃止し、重みをチップのトランジスタに固定化することで、記憶と計算を一体化させることです。
代償として、このチップは1つのモデルしか実行できませんが、その代わりに速度とエネルギー効率が桁違いに向上します。
17000トークン/秒とは何を意味しますか?
Taalasの技術検証チップHC1は、TSMCの6nmプロセスを採用し、チップ面積は815平方ミリメートル、トランジスタ数は530億個で、内蔵モデルはMetaのLlama 3.1 8Bです。
HC1のベンチマークデータ:単一ユーザーあたり約17,000トークン/秒。対照的に、Nvidia H200は同じモデルで約230トークン/秒、H100は約150トークン/秒です。速度は73倍で、消費電力は後者の1/10です。
より直感的な経済的計算:Taalasが報告する推論コストは、100万トークンあたり約0.75セント(Llama 8B)ですが、GPUソリューションは20〜49セントの範囲です。HC1カード1枚の消費電力は250Wで、標準的な空冷ラックに10枚のカードを設置すると、必要な電力は12〜15kWのみで、液体冷却は不要です。一方、GPUラックの電力消費は通常120〜600kWに及びます。
フォーブスのアナリスト、カール・フロイントは2月の評価で、「最速の推論プラットフォーム(Cerebras ワーフレサイズエンジン)より10倍速く、GPUより2桁速い」と評価した。
ただし、いくつか重要な制約があります。HC1はTaalasが独自開発した3ビットデータ形式と6ビットパラメータを使用しており、量子化が非常に激しく、複雑な推論タスクでは品質の損失が明確に存在します。17,000トークン/秒という数値は、1K入力/1K出力のベンダー基準テストからのものであり、実際の本番環境でのパフォーマンスを反映していません。また、Llama 3.1 8Bは2024年半ばにリリースされたモデルであり、8Bパラメータの量子化版ですらラズベリーパイ5で動作可能です。HC1はアーキテクチャの可能性を示したものであり、成熟した製品としての競争力ではありません。
モデルの世代交代はどうすればよいですか?
モデルをチップに焼き込む際、最も直感的な疑問は:モデルが更新されたら、チップは無効になるのか?
Taalasの回答は、廃止されないということです。従来のASIC設計サイクルは2年以上かかりますが、Taalasは自動化された設計プロセスを開発し、チップの上位層のわずかな金属マスクを変更するだけで、新しいモデルを新しいチップにコンパイルでき、サイクルは約8週間です。同社はコストモデルに、4年間のライフサイクル内で3回のチップ更新費用を組み込んでいます。
この回答は一部の不安を解消できますが、完全には取り除けません。
GPUの柔軟性は、同じカードで今日Llamaを実行し、明日Claudeを実行し、明後日未発表の新しいモデルを実行できることにあります。Taalasのチップはこれができません。顧客が複数のモデルを同時に必要とする場合(これは本番環境で非常に一般的です)、各モデルに異なるチップを用意する必要があり、在庫管理と運用の複雑さが増します。
HC2は開発中であり、目標は約200億パラメータ規模のモデルで、4ビット浮動小数点を使用して精度を向上させます。Taalasは当初、2026年末までに最先端モデルのサポートを実現する予定でした。
AMDの買収により、Instinct GPU製品ラインとHeliosラックシステムのシナジーが実現し、顧客はGPUで柔軟なワークロードを処理し、Taalasチップで安定した高頻度の単一モデル推論を実行できます。
推論チップの軍備競争
AMDがTaalasを買収したことは、過去8か月間の推論チップ買収ラッシュの最新の一件である。
2025年12月、NvidiaはGroqを200億ドルで買収し、SRAMベースの低遅延推論アーキテクチャを獲得した。
2026年5月、Cerebrasは約5600億ドルの時価総額でIPOを実施し、2020年のSnowflake以来最大のテクノロジーIPOとなった。
6月、Etchedは2年以上の隠遁期を終え、TSMCのN4Pプロセスで世界初のTransformer専用チップの試作に成功し、10億ドルを超える顧客契約を獲得したと発表した。IntelはSambaNovaとの買収意向書に署名したとの報道があり、QualcommはTenstorrentと接触している。
これらの取引は同じ判断を示しています:推論がAIコンピューティング支出の主戦場となっていることです。
業界予測によると、2026年には推論がAI計算支出の3分の2を占め、2030年までに専用推論ASICが推論市場の45%を獲得する可能性がある。NvidiaのGPUは依然としてトレーニング分野を支配しているが、推論分野では、その汎用アーキテクチャがさまざまな方向からの専用チップの挑戦に直面している。
Taalasはこのスペクトルの最も極端な位置にあります:「一類モデル」の汎用性すら放棄し、直接「一つのモデル」専用のチップを制作しています。
GroqはSRAMを用いてHBMを代替し、メモリーボトルネックを回避し、Cerebrasはウェハレベルの面積を用いて力技で突破し、EtchedはTransformerアーキテクチャにのみ最適化し、Taalasの賭けはさらに大胆だ:AIモデルが通信プロトコルのように最終的に少数の標準に収束すると信じている。モデルが毎月更新されなくなるとき、最も人気のある数つのモデルごとに専用チップを製造することが経済的に合理的になる。
モデルが「凝固」すると予想する
AMDの上級副社長であるVamsi Boppanaは、公告で、この買収の目的は顧客に「あらゆるAIワークロードに最適な計算ソリューションを提供すること」であると述べました。これは競争戦略として、GPUが柔軟性を担い、Taalasチップが極限の効率を実現し、顧客が必要に応じて組み合わせることを意味します。
この組み合わせの論理が成り立つかどうかは、AIモデルの更新サイクルが遅くなるかどうかという核心的な仮定にかかっている。
大規模モデルが数ヶ月ごとにアーキテクチャレベルの更新を継続するなら、重みをシリコンに焼き付けるアプローチは、流砂にコンクリートを注ぐようなもので、チップの回収が終わる前にモデルは既に陳腐化してしまう。しかし、モデルの能力が収束し、トップモデルが1〜2年間安定してサービスを提供することが普通になるなら、Taalas型の専用チップは、通信業界のベースバンドチップのように、狂騒的な実験から当然の選択肢へと変わるだろう。
過去12か月を振り返ると、モデル更新のペースに微妙な変化が見られます。Llamaシリーズは3.1から3.2、そして4への間隔が長くなっている一方、GPTは4から4o、そして5へのアーキテクチャの変更幅が縮小しています。新たなモデルの多くは、既存のアーキテクチャを基にディストリレーション、量子化、ファインチューニングを行っており、ベースモデルのイテレーションは鈍化しています。
このトレンドが継続すれば、Taalasは的中した。
Twitter:https://twitter.com/BitpushNewsCN
比推 TG コミュニティ:https://t.me/BitPushCommunity
比推のTGサブスクライブ: https://t.me/bitpush
