動的監視 Beating の監視によると、過去2年間、大規模モデルの推論最適化は常にKVキャッシュに焦点を当ててきました。これは、モデルがコンテキストを読み終わった後に残る中間計算結果であり、コンテキストが長くなるほどVRAMと帯域幅を多く消費します。DeepSeek-V2はMLAを活用し、DeepSeek 67Bと比較してKVキャッシュを93.3%削減しました。Kimi Linearはさらに完全なMLAと比較して最大75%の削減を実現しています。すべての取り組みは、長コンテキストをより安価にすることを目指しています。しかし、これらのソリューションには一つの壁があります。キャッシュは通常、同じモデル内でのみ再利用可能です。Agentが小規模モデルから大規模モデルに切り替えると、ターゲットモデルは前の数万、あるいは数十万トークンを再計算しなければなりません。モデルルーティングが頻繁になるほど、この重複計算は無視できなくなります。NVIDIAの最新論文は、この壁を壊し始めています。研究チームは、同じファミリーでKV構造が一致する異なるサイズのモデル間で、キャッシュに明確な線形関係が存在することを発見しました。500セグメント、各セグメント1024トークンのテキストで1回キャリブレーションを行うだけで、あるモデルで計算されたKVキャッシュを別のモデルに転送して継続利用するためのマッピングを導出できます。Qwen3-14Bから32Bに切り替える場合、32Kコンテキストの再計算には約7秒かかりますが、キャッシュの変換には約0.28秒しかかかりません。これは約25倍の高速化です。つまり、今後は小規模モデルに「読み」を担当させ、長コンテキストをKVキャッシュに変換し、より強力な能力が必要なときにそのキャッシュを大規模モデルに渡して、「考え」て生成を直接開始させることが可能になります。これにより、モデルルーティングの計算リソースをさらに節約できます。現在、シンプルなタスクを小規模モデルで処理することで節約できるのは主に生成コストですが、大規模モデルに切り替えた際には、長コンテキストは依然として大規模モデルで再計算されるのが一般的です。もし跨モデルKVキャッシュが成熟すれば、このprefill段階さえ小規模モデルに任せることができます。Agentは安価なモデルでコンテキストを長期的に維持し、難題に遭遇したときだけ大規模モデルを呼び起こすことが可能になり、毎回「セーブデータ」からやり直す必要がなくなります。
NVIDIA、AIの効率を向上させるためにクロスモデルKVキャッシュの再利用を可能に
MarsBit共有
NVIDIAは、同じファミリー内のモデル間でKVキャッシュを再利用する技術を導入し、AIの効率を向上させました。この手法は、構造が類似したモデル間でKVキャッシュのクロスチェーンマッピングを可能にし、14Bモデルから32Bモデルへコンテキストを移行する際に25倍の速度向上を実現します。これにより、小さなモデルが初期タスクを処理し、複雑なタスクには大きなモデルが対応することでコストを削減できる可能性があります。このアプローチは、モデル間の相互作用を簡素化することで、クロスチェーンブリッジの支援にも貢献する可能性があります。
出典:原文を表示
免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。
デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。