Дослідники з Единбурга стиснули моделі ШІ в 8 разів, одночасно підвищивши результати на тестах

iconCryptoBriefing
Поділитися
AI summary iconКороткий зміст
Новини з Единбурга щодо ШІ та криптовалют: Дослідники з Університету Единбурга та NVIDIA розробили Dynamic Memory Sparsification (DMS) — метод, який стискає моделі ШІ в 8 разів, одночасно покращуючи результати на тестах. Техніка зменшує кеш ключ-значення (KV), зберігаючи лише найважливіші токени, що дозволяє моделям швидше міркувати. На AIME 24, GPQA Diamond та LiveCode Bench моделі DMS перевершили повнорозмірні версії на 12, 8 та 10 балів відповідно. Новини на ланцюзі продовжують підкреслювати досягнення у сфері ШІ з реальними перевагами в продуктивності.

Зробити щось меншим і одночасно кращим — здається порушенням основ фізики. Але дослідники з Університету Единбурга, працюючи з NVIDIA, зуміли це зробити з великими мовними моделями. Їхня техніка, яка називається Dynamic Memory Sparsification (DMS), стискає критичний компонент інфраструктури ШІ в 8 разів, водночас підвищуючи результати моделей на складних тестах.

Якщо моделі ШІ зможуть працювати так само добре або краще, використовуючи лише частину пам’яті, це відкриє двері для впровадження серйозних здатностей до міркувань на пристроях, які зараз не можуть їх обробляти, включаючи носимі пристрої, розумне домашнє обладнання та крайові пристрої.

Як працює DMS

Щоб зрозуміти прорив, вам потрібно знати про кеш ключ-значення (KV). Коли модель ШІ розмірковує над проблемою, вона зберігає проміжні результати у цьому кеші — суттєво, робочій пам’яті, яка дозволяє моделі відстежувати власний процес міркувань. Чим довша й складніша ланцюжок міркувань, тим більшим стає цей кеш і тим більше обчислювальних ресурсів він вимагає.

DMS застосовує скальпель до цього процесу. Замість збереження всіх токенів у кеші, він обирає тільки найважливіші та видаляє решту. Результатом є стиснення KV-кешу до восьмої частини його початкового розміру. Видаляючи шум, моделі можуть досліджувати глибші та складніші логічні шляхи в межах того ж обчислювального бюджету.

Реклама

Результати еталонного тестування

На AIME 24, кваліфікаційному іспиті з математичної олімпіади, стиснені моделі, що використовують DMS, показали середній результат на 12 балів вищий, ніж їхні некомпресовані аналоги.

На GPQA Diamond — наборі даних, створеному зі завдань зі старшої наукової програми з фізики, хімії та біології — моделі зі стисненням DMS показали середній результат на 8 балів вищий.

На LiveCode Bench, який тестує практичні програмні здібності, стиснені моделі набрали 10 балів більше, ніж їхні повні кеш-еквіваленти, при читанні тієї самої суми даних KV-кешу.

Головний дослідник доктор Едоардо Понті коротко описав подвійну перевагу.

Моделі можуть міркувати швидше, але з тією ж якістю.

У межах фіксованого часових вікна LLM, що використовує DMS, може дослідити більше ланцюжків міркувань і прийти до більш сильних висновків.

Довготривалий тренд, що прискорюється

Галузь ШІ вже з середини 2010-х років прагне до ефективності моделей, коли такі методи, як дистиляція знань, обрізання та квантування, почали доводити, що менші моделі можуть конкурувати з більшими у конкретних завданнях. Те, що DMS додає до цієї лінії, — це зосередження на пам’яті під час висновку, ресурсах, які споживаються не під час навчання моделі, а під час її реального використання. Зменшення пам’яті під час висновку в 8 разів означає, що кожне розгортання стає значно дешевшим у підтримці.

Дослідження було представлено на конференції NeurIPS і детально описано в статті під назвою «Inference-Time Hyper-Scaling with KV Cache Compression». Оцінки проводилися за допомогою моделей Llama та Qwen.

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.