Pesquisadores de Edimburgo comprimem modelos de IA em 8x enquanto aumentam os resultados dos benchmarks

iconCryptoBriefing
Compartilhar
AI summary iconResumo
Notícias de Edinburgh AI e criptomoeda: Pesquisadores da Universidade de Edinburgh e da NVIDIA desenvolveram a Esparsificação Dinâmica de Memória (DMS), um método que comprime modelos de IA em 8x enquanto melhora os resultados em benchmarks. A técnica reduz o cache chave-valor (KV) mantendo apenas os tokens mais importantes, permitindo que os modelos raciocinem mais rapidamente. No AIME 24, GPQA Diamond e LiveCode Bench, os modelos DMS superaram as versões completas em 12, 8 e 10 pontos. As notícias on-chain continuam destacando avanços em IA com ganhos reais de desempenho.

Tornar algo menor e melhor ao mesmo tempo parece uma violação da física básica. Mas pesquisadores da Universidade de Edimburgo, em parceria com a NVIDIA, conseguiram realizar isso com modelos de linguagem de grande porte. Sua técnica, chamada Dynamic Memory Sparsification (DMS), comprime um componente crítico da infraestrutura de IA em 8x, enquanto, de alguma forma, faz os modelos obterem pontuações mais altas em benchmarks difíceis.

Se modelos de IA puderem funcionar tão bem ou melhor com uma fração da memória, abre-se a porta para implantar capacidades de raciocínio sério em dispositivos que atualmente não conseguem lidar com elas, incluindo wearables, hardware de casa inteligente e dispositivos de borda.

Como o DMS realmente funciona

Para entender a inovação, você precisa conhecer o cache chave-valor (KV). Quando um modelo de IA raciocina sobre um problema, ele armazena resultados intermediários nesse cache, essencialmente uma memória de trabalho que permite ao modelo acompanhar seu próprio processo de pensamento. Quanto mais longa e complexa for a cadeia de raciocínio, maior o cache se torna e mais recursos computacionais ele exige.

O DMS atua como um bisturi nesse processo. Em vez de manter todos os tokens no cache, ele retém seletivamente apenas os mais importantes e descarta os demais. O resultado é um cache KV comprimido para um oitavo do tamanho original. Ao eliminar o ruído, os modelos conseguem explorar caminhos de raciocínio mais profundos e complexos dentro do mesmo orçamento computacional.

Anúncio

Os resultados do benchmark

No AIME 24, um exame qualificatório para a olimpíada de matemática, modelos comprimidos usando DMS obtiveram uma média de 12 pontos mais altos do que suas contrapartes não comprimidas.

No GPQA Diamond, um benchmark construído a partir de problemas científicos de nível de pós-graduação em física, química e biologia, os modelos comprimidos pelo DMS obtiveram pontuações em média mais de 8 pontos superiores.

No LiveCode Bench, que testa a habilidade de programação prática, modelos comprimidos obtiveram 10 pontos a mais em relação aos seus equivalentes com cache completo ao ler a mesma quantia de dados de cache KV.

O pesquisador principal, Dr. Edoardo Ponti, resumiu simplesmente o duplo benefício.

Os modelos podem raciocinar mais rápido, mas com a mesma qualidade.

Dentro de uma janela de tempo fixa, um LLM que utiliza DMS pode explorar mais linhas de raciocínio e chegar a conclusões mais fortes.

Uma tendência mais longa, acelerando

O campo de IA tem buscado eficiência de modelo desde meados dos anos 2010, quando técnicas como distilação de conhecimento, poda e quantização começaram a demonstrar que modelos menores podem competir com modelos maiores em tarefas específicas. O que o DMS adiciona a essa linhagem é um foco na memória durante a inferência, os recursos consumidos não quando o modelo está sendo treinado, mas quando ele está sendo realmente utilizado. Compactar a memória de inferência em 8x significa que cada implantação se torna drasticamente mais barata para executar.

A pesquisa foi apresentada na conferência NeurIPS e detalhada em um artigo intitulado “Inference-Time Hyper-Scaling with KV Cache Compression”. As avaliações foram realizadas usando os modelos Llama e Qwen.

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.