Зробити щось меншим і одночасно кращим — здається порушенням основ фізики. Але дослідники з Університету Единбурга, працюючи з NVIDIA, зуміли це зробити з великими мовними моделями. Їхня техніка, яка називається Dynamic Memory Sparsification (DMS), стискає критичний компонент інфраструктури ШІ в 8 разів, водночас підвищуючи результати моделей на складних тестах.
Якщо моделі ШІ зможуть працювати так само добре або краще, використовуючи лише частину пам’яті, це відкриє двері для впровадження серйозних здатностей до міркувань на пристроях, які зараз не можуть їх обробляти, включаючи носимі пристрої, розумне домашнє обладнання та крайові пристрої.
Як працює DMS
Щоб зрозуміти прорив, вам потрібно знати про кеш ключ-значення (KV). Коли модель ШІ розмірковує над проблемою, вона зберігає проміжні результати у цьому кеші — суттєво, робочій пам’яті, яка дозволяє моделі відстежувати власний процес міркувань. Чим довша й складніша ланцюжок міркувань, тим більшим стає цей кеш і тим більше обчислювальних ресурсів він вимагає.
DMS застосовує скальпель до цього процесу. Замість збереження всіх токенів у кеші, він обирає тільки найважливіші та видаляє решту. Результатом є стиснення KV-кешу до восьмої частини його початкового розміру. Видаляючи шум, моделі можуть досліджувати глибші та складніші логічні шляхи в межах того ж обчислювального бюджету.
Результати еталонного тестування
На AIME 24, кваліфікаційному іспиті з математичної олімпіади, стиснені моделі, що використовують DMS, показали середній результат на 12 балів вищий, ніж їхні некомпресовані аналоги.
На GPQA Diamond — наборі даних, створеному зі завдань зі старшої наукової програми з фізики, хімії та біології — моделі зі стисненням DMS показали середній результат на 8 балів вищий.
На LiveCode Bench, який тестує практичні програмні здібності, стиснені моделі набрали 10 балів більше, ніж їхні повні кеш-еквіваленти, при читанні тієї самої суми даних KV-кешу.
Головний дослідник доктор Едоардо Понті коротко описав подвійну перевагу.
Моделі можуть міркувати швидше, але з тією ж якістю.
У межах фіксованого часових вікна LLM, що використовує DMS, може дослідити більше ланцюжків міркувань і прийти до більш сильних висновків.
Довготривалий тренд, що прискорюється
Галузь ШІ вже з середини 2010-х років прагне до ефективності моделей, коли такі методи, як дистиляція знань, обрізання та квантування, почали доводити, що менші моделі можуть конкурувати з більшими у конкретних завданнях. Те, що DMS додає до цієї лінії, — це зосередження на пам’яті під час висновку, ресурсах, які споживаються не під час навчання моделі, а під час її реального використання. Зменшення пам’яті під час висновку в 8 разів означає, що кожне розгортання стає значно дешевшим у підтримці.
Дослідження було представлено на конференції NeurIPS і детально описано в статті під назвою «Inference-Time Hyper-Scaling with KV Cache Compression». Оцінки проводилися за допомогою моделей Llama та Qwen.
