より小さく、同時により良くするとは、基本的な物理学に反しているように聞こえる。しかし、エディンバラ大学の研究者たちがNVIDIAと協力して、大規模言語モデルでこれを実現した。彼らの手法は「ダイナミック・メモリ・スパーシフィケーション(DMS)」と呼ばれ、AIインフラの重要な部分を8倍圧縮しながら、難易度の高いベンチマークでのスコアを向上させている。
AIモデルが、メモリのわずか一部で同等、あるいはそれ以上の性能を発揮できるならば、現在は処理が不可能なウェアラブルデバイス、スマートホームハードウェア、エッジデバイスなどに、本格的な推論機能を展開する道が開ける。
DMSが実際にどのように機能するか
このブレークスルーを理解するには、キー・バリュー(KV)キャッシュについて知る必要があります。AIモデルが問題を推論する際、中間結果をこのキャッシュに保存します。これは、モデルが自身の思考プロセスを追跡できる作業メモリに相当します。推論の連鎖が長く複雑になるほど、このキャッシュは大きくなり、より多くの計算リソースを必要とします。
DMSはこのプロセスにメスを入れます。キャッシュにすべてのトークンを保持するのではなく、最も重要なトークンのみを選択的に保持し、残りは削除します。その結果、KVキャッシュは元のサイズの1/8に圧縮されます。ノイズを除去することで、モデルは同じ計算リソース内でより深く、より複雑な推論パスを探索できるようになります。
ベンチマーク結果
AIME 24、数学オリンピック予選試験において、DMSを使用して圧縮されたモデルは、非圧縮モデルよりも平均で12点高い得点を記録しました。
GPQA Diamond(物理学、化学、生物学の大学院レベルの問題から構築されたベンチマーク)において、DMS圧縮モデルは平均で8ポイント以上高いスコアを記録しました。
LiveCode Benchでは、実践的なプログラミング能力をテストし、同じ数量のKVキャッシュデータを読み取る際に、圧縮モデルはフルキャッシュ版よりも10ポイント高い得点を獲得しました。
主任研究員のエドアルド・ポンティ氏は、二重の利点を簡単に要約した。
モデルはより速く推論でき、品質は同じです。
固定された時間枠内で、DMSを使用したLLMはより多くの推論の経路を探索し、より強力な結論に到達できます。
より長いトレンド、加速中
AI分野は2010年代半ばから、知識蒸留、プリニング、量子化などの手法が、小さなモデルが特定のタスクで大きなモデルと競合できることを示し始めたため、モデルの効率性を追求してきました。DMSがこの流れに加えたのは、モデルの訓練時ではなく、実際に使用される際の推論時のメモリに焦点を当てたことです。推論メモリを8倍圧縮することで、すべてのデプロイメントの実行コストが劇的に低下します。
この研究はNeurIPS会議で発表され、「Inference-Time Hyper-Scaling with KV Cache Compression」と題された論文で詳細が説明されています。評価はLlamaおよびQwenモデルを用いて実施されました。
