Des chercheurs d'Édimbourg compressent les modèles d'IA jusqu'à 8 fois tout en améliorant les scores de référence

iconCryptoBriefing
Partager
AI summary iconRésumé
Actualités AI et crypto d’Édimbourg : Des chercheurs de l’Université d’Édimbourg et de NVIDIA ont développé Dynamic Memory Sparsification (DMS), une méthode qui compresse les modèles d’IA jusqu’à 8 fois tout en améliorant les scores de référence. La technique réduit le cache clé-valeur (KV) en conservant uniquement les jetons les plus importants, permettant aux modèles de raisonner plus rapidement. Sur AIME 24, GPQA Diamond et LiveCode Bench, les modèles DMS ont surpassé les versions complètes de 12, 8 et 10 points. Les actualités sur chaîne continuent de mettre en avant les progrès de l’IA avec des gains de performance concrets.

Rendre quelque chose plus petit et meilleur en même temps semble violer les lois fondamentales de la physique. Mais des chercheurs de l’Université d’Édimbourg, en collaboration avec NVIDIA, y sont parvenus avec les modèles de langage à grande échelle. Leur technique, appelée Dynamic Memory Sparsification (DMS), compresse un élément critique de l’infrastructure d’intelligence artificielle jusqu’à 8 fois tout en faisant augmenter les performances des modèles sur des benchmarks difficiles.

Si les modèles d'IA peuvent fonctionner aussi bien, voire mieux, avec une fraction de la mémoire, cela ouvre la porte au déploiement de capacités de raisonnement avancées sur des appareils qui ne les prennent pas actuellement en charge, notamment les dispositifs portables, les équipements de maison intelligente et les appareils edge.

Comment DMS fonctionne réellement

Pour comprendre cette percée, vous devez connaître le cache clé-valeur (KV). Lorsqu'un modèle d'IA raisonne sur un problème, il stocke les résultats intermédiaires dans ce cache, qui agit comme une mémoire de travail permettant au modèle de suivre son propre processus de réflexion. Plus la chaîne de raisonnement est longue et complexe, plus ce cache grossit et plus il exige de ressources computationnelles.

DMS applique un scalpel à ce processus. Au lieu de conserver tous les jetons dans le cache, il conserve sélectivement uniquement ceux qui sont les plus importants et élimine les autres. Le résultat est un cache KV réduit à un huitième de sa taille d'origine. En éliminant le bruit, les modèles peuvent explorer des voies de raisonnement plus profondes et plus complexes dans le même budget computationnel.

Publicité

Les résultats de référence

Sur AIME 24, un examen de sélection pour les olympiades de mathématiques, les modèles compressés utilisant DMS ont obtenu en moyenne 12 points de plus que leurs homologues non compressés.

Sur GPQA Diamond, un benchmark construit à partir de problèmes scientifiques de niveau master en physique, chimie et biologie, les modèles compressés par DMS ont obtenu des scores en moyenne supérieurs de plus de 8 points.

Sur LiveCode Bench, qui évalue les compétences de programmation pratiques, les modèles compressés ont obtenu 10 points de plus que leurs équivalents avec cache complet tout en lisant le même montant de données de cache KV.

Le chercheur principal, Dr. Edoardo Ponti, a résumé simplement le double avantage.

Les modèles peuvent raisonner plus rapidement tout en conservant la même qualité.

Dans une fenêtre temporelle fixe, un LLM utilisant DMS peut explorer plus de pistes de raisonnement et parvenir à des conclusions plus solides.

Une tendance plus longue, en accélération

Le domaine de l'IA poursuit l'efficacité des modèles depuis le milieu des années 2010, lorsque des techniques comme la distillation de connaissance, le pruning et la quantization ont démontré que des modèles plus petits pouvaient rivaliser avec des modèles plus grands sur des tâches spécifiques. Ce que DMS apporte à cette lignée, c'est une attention portée à la mémoire lors de l'inférence, les ressources consommées non pas lors de l'entraînement du modèle, mais lors de son utilisation réelle. Réduire la mémoire d'inférence de 8 fois signifie que chaque déploiement devient considérablement moins coûteux à exécuter.

La recherche a été présentée à la conférence NeurIPS et détaillée dans un article intitulé « Inference-Time Hyper-Scaling with KV Cache Compression ». Les évaluations ont été réalisées à l'aide des modèles Llama et Qwen.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.