エディンバラ大学の研究者がAIモデルを8倍圧縮し、ベンチマークスコアを向上

iconCryptoBriefing
共有
AI summary icon概要
エディンバラのAI・暗号通貨ニュース:エディンバラ大学とNVIDIAの研究者たちは、AIモデルを8倍圧縮しつつベンチマークスコアを向上させる「Dynamic Memory Sparsification(DMS)」という手法を開発しました。この技術は、最も重要なトークンのみを保持することでキー・バリュー(KV)キャッシュを縮小し、モデルの推論速度を向上させます。AIME 24、GPQA Diamond、LiveCode Benchにおいて、DMSモデルはフルサイズモデルをそれぞれ12ポイント、8ポイント、10ポイント上回りました。オンチェーンのニュースは、現実世界でのパフォーマンス向上を伴うAIの進歩を引き続き強調しています。

より小さく、同時により良くするとは、基本的な物理学に反しているように聞こえる。しかし、エディンバラ大学の研究者たちがNVIDIAと協力して、大規模言語モデルでこれを実現した。彼らの手法は「ダイナミック・メモリ・スパーシフィケーション(DMS)」と呼ばれ、AIインフラの重要な部分を8倍圧縮しながら、難易度の高いベンチマークでのスコアを向上させている。

AIモデルが、メモリのわずか一部で同等、あるいはそれ以上の性能を発揮できるならば、現在は処理が不可能なウェアラブルデバイス、スマートホームハードウェア、エッジデバイスなどに、本格的な推論機能を展開する道が開ける。

DMSが実際にどのように機能するか

このブレークスルーを理解するには、キー・バリュー(KV)キャッシュについて知る必要があります。AIモデルが問題を推論する際、中間結果をこのキャッシュに保存します。これは、モデルが自身の思考プロセスを追跡できる作業メモリに相当します。推論の連鎖が長く複雑になるほど、このキャッシュは大きくなり、より多くの計算リソースを必要とします。

DMSはこのプロセスにメスを入れます。キャッシュにすべてのトークンを保持するのではなく、最も重要なトークンのみを選択的に保持し、残りは削除します。その結果、KVキャッシュは元のサイズの1/8に圧縮されます。ノイズを除去することで、モデルは同じ計算リソース内でより深く、より複雑な推論パスを探索できるようになります。

広告

ベンチマーク結果

AIME 24、数学オリンピック予選試験において、DMSを使用して圧縮されたモデルは、非圧縮モデルよりも平均で12点高い得点を記録しました。

GPQA Diamond(物理学、化学、生物学の大学院レベルの問題から構築されたベンチマーク)において、DMS圧縮モデルは平均で8ポイント以上高いスコアを記録しました。

LiveCode Benchでは、実践的なプログラミング能力をテストし、同じ数量のKVキャッシュデータを読み取る際に、圧縮モデルはフルキャッシュ版よりも10ポイント高い得点を獲得しました。

主任研究員のエドアルド・ポンティ氏は、二重の利点を簡単に要約した。

モデルはより速く推論でき、品質は同じです。

固定された時間枠内で、DMSを使用したLLMはより多くの推論の経路を探索し、より強力な結論に到達できます。

より長いトレンド、加速中

AI分野は2010年代半ばから、知識蒸留、プリニング、量子化などの手法が、小さなモデルが特定のタスクで大きなモデルと競合できることを示し始めたため、モデルの効率性を追求してきました。DMSがこの流れに加えたのは、モデルの訓練時ではなく、実際に使用される際の推論時のメモリに焦点を当てたことです。推論メモリを8倍圧縮することで、すべてのデプロイメントの実行コストが劇的に低下します。

この研究はNeurIPS会議で発表され、「Inference-Time Hyper-Scaling with KV Cache Compression」と題された論文で詳細が説明されています。評価はLlamaおよびQwenモデルを用いて実施されました。

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。