Исследователи из Эдинбурга сжали модели ИИ в 8 раз, одновременно повысив результаты на тестах

iconCryptoBriefing
Поделиться
AI summary iconСводка
Эдинбург: ИИ и крипто-новости: Исследователи из Эдинбургского университета и NVIDIA разработали Dynamic Memory Sparsification (DMS) — метод, позволяющий сжимать модели ИИ в 8 раз при улучшении результатов на тестах. Техника сокращает ключевое-значение (KV) кэш, сохраняя только наиболее важные токены, что позволяет моделям быстрее проводить рассуждения. На AIME 24, GPQA Diamond и LiveCode Bench модели DMS превзошли полноразмерные версии на 12, 8 и 10 баллов. Новости в блокчейне продолжают подчеркивать достижения в области ИИ с реальными преимуществами в производительности.

Сделать что-то одновременно меньше и лучше звучит как нарушение основ физики. Но исследователи из Эдинбургского университета, сотрудничавшие с NVIDIA, добились этого с помощью больших языковых моделей. Их метод, называемый динамической разреженной памятью (DMS), сжимает критически важную часть инфраструктуры ИИ в 8 раз, одновременно повышая результаты моделей на сложных тестах.

Если модели ИИ смогут работать так же хорошо или лучше, используя лишь долю памяти, это откроет возможности для внедрения мощных возможностей логического вывода на устройствах, которые сейчас не справляются с ними, включая носимые устройства, оборудование для умного дома и краевые устройства.

Как на самом деле работает DMS

Чтобы понять прорыв, вам нужно знать о ключ-значение (KV) кэше. Когда ИИ-модель решает задачу, она сохраняет промежуточные результаты в этом кэше — своеобразной оперативной памяти, позволяющей модели отслеживать собственный ход мыслей. Чем длиннее и сложнее цепочка рассуждений, тем больше становится этот кэш и тем больше вычислительных ресурсов он требует.

DMS применяет скальпель к этому процессу: вместо того чтобы сохранять все токены в кэше, он избирательно сохраняет только наиболее значимые и отбрасывает остальные. В результате KV-кэш сжимается до одной восьмой от первоначального размера. Устраняя шум, модели могут исследовать более глубокие и сложные пути рассуждений в рамках того же вычислительного бюджета.

Реклама

Результаты эталонного тестирования

На экзамене AIME 24, квалификационном этапе математической олимпиады, сжатые модели с использованием DMS показали средний результат на 12 баллов выше, чем их несжатые аналоги.

На GPQA Diamond — наборе данных, созданном на основе задач уровня аспирантуры по физике, химии и биологии — модели с сжатием DMS показали средний результат выше на более чем 8 баллов.

На LiveCode Bench, тестирующем практические навыки программирования, сжатые модели показали на 10 баллов выше, чем их полные версии кэша, при чтении того же объема данных кэша KV.

Ведущий исследователь доктор Эдоардо Понти кратко обобщил двойную выгоду.

Модели могут рассуждать быстрее, но с той же качеством.

В пределах фиксированного временного окна LLM, использующий DMS, может исследовать больше цепочек рассуждений и прийти к более сильным выводам.

Более длительный тренд, ускоряющийся

Сфера ИИ стремится к повышению эффективности моделей с середины 2010-х годов, когда такие методы, как дистилляция знаний, обрезка и квантование, продемонстрировали, что меньшие модели могут конкурировать с более крупными в конкретных задачах. То, что добавляет DMS в эту линию развития, — это фокус на памяти во время вывода, ресурсах, потребляемых не при обучении модели, а при её реальном использовании. Сжатие памяти во время вывода в 8 раз означает, что каждое развертывание становится значительно дешевле в эксплуатации.

Исследование было представлено на конференции NeurIPS и подробно описано в статье под названием «Inference-Time Hyper-Scaling with KV Cache Compression». Оценки проводились с использованием моделей Llama и Qwen.

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.