同時讓東西變小且更好,聽起來似乎違背了基本的物理法則。但愛丁堡大學的研究人員與 NVIDIA 合作,已在大型語言模型上實現了這一目標。他們的技術稱為動態記憶稀疏化(Dynamic Memory Sparsification,DMS),將 AI 基礎設施中的一個關鍵部分壓縮了 8 倍,同時讓模型在困難的基準測試中得分更高。
如果 AI 模型只需一小部分記憶體就能運行得同樣好,甚至更好,那麼就為在目前無法處理這些模型的設備上部署強大的推理能力打開了大門,包括可穿戴設備、智能家居硬體和邊緣設備。
DMS 如何實際運作
要理解這項突破,您需要了解鍵值(KV)快取。當 AI 模型推理問題時,它會將中間結果儲存在此快取中,這相當於一個工作記憶,讓模型能夠追蹤自己的思考過程。推理鏈越長、越複雜,該快取就越大,所需的計算資源也越多。
DMS 對這一過程進行了精細處理。它並非保留快取中的所有代幣,而是有選擇地僅保留最重要的代幣,並捨棄其餘部分。結果是,KV 快取被壓縮至原始大小的八分之一。通過清除雜訊,模型能在相同的計算預算內探索更深入、更複雜的推理路徑。
基準結果
在 AIME 24 數學奧林匹克資格考試中,使用 DMS 壓縮的模型平均比未壓縮的模型高出 12 分。
在 GPQA Diamond 基準上,該基準由物理、化學和生物學的研究生級科學問題構建,經 DMS 壓縮的模型平均分數高出 8 分以上。
在測試實用程式設計能力的 LiveCode Bench 上,壓縮模型在讀取相同數量的 KV 快取資料時,比其完整快取版本高出 10 分。
主導研究員 Edoardo Ponti 博士簡單總結了雙重好處。
模型可以更快地進行推理,但品質相同。
在固定的時間窗口內,使用 DMS 的 LLM 可以探索更多的推理路徑,並得出更強有力的結論。
一個更長的趨勢,正在加速
自2010年代中期以來,人工智能領域一直致力於提升模型效率,當時知識蒸餾、剪枝和量化等技術已證明較小的模型在特定任務上能與較大的模型競爭。DMS 在此基礎上進一步聚焦於推理時的記憶體,即模型實際使用時所消耗的資源,而非訓練時。將推理記憶體壓縮8倍,意味著每一個部署的運行成本都將大幅降低。
該研究於 NeurIPS 會議上發表,並詳細刊登於題為 “Inference-Time Hyper-Scaling with KV Cache Compression” 的論文中。評估使用了 Llama 和 Qwen 模型進行。
