L'article de Google DeepMind révèle que la méthode de récirculation améliore les performances des transformeurs

iconCryptoBriefing
Partager
AI summary iconRésumé
Google DeepMind a publié un nouvel article présentant une méthode appelée « recirculation » pour améliorer les modèles transformer. Cette technique renvoie les activations des couches plus profondes vers les couches antérieures pendant l'inférence, augmentant les performances sans reformation. Les rapports sur les nouvelles chaines indiquent que la méthode a réduit la perplexité de 23 % et amélioré la précision du raisonnement de 21 % sur le benchmark GSM8K. Toutefois, elle augmente les coûts initiaux de traitement. Les médias crypto soulignent le potentiel de gains d'efficacité de l'IA dans les applications blockchain.

Google DeepMind vient de publier un article qui pourrait modifier discrètement la façon dont les modèles linguistiques traitent le texte. La technique, appelée « recirculation », prend les activations des couches plus profondes d’un transformer et les mélange à nouveau aux couches plus superficielles pendant l’inférence. L’article, co-écrit avec des chercheurs de l’Université du Texas à Austin, démontre que cette connexion récurrente légère procure des gains de performance qui rivalisent, et dans certains cas surpassent, un fine-tuning complet. Aucun re-entraînement requis. Aucune chirurgie majeure de l’architecture.

Ce que la recirculation fait réellement

La récirculation brise le flux unidirectionnel du traitement des transformeurs. Une fraction des activations calculées dans les couches plus profondes du modèle est réintroduite dans les couches plus superficielles pendant la génération des jetons. Le modèle obtient ainsi une deuxième passe pour comprendre ses propres représentations internes, ce qui lui permet d'affiner ce que l'article appelle ses « états de croyance » sur plusieurs étapes.

La distinction clé par rapport aux approches existantes comme le prompting en chaîne de pensée ou les architectures transformateurs en boucle est que la recirculation ne nécessite pas de jetons de raisonnement supplémentaires ni une profondeur architecturale accrue. Il s'agit d'une modification additionnelle au fonctionnement de l'inférence, et non d'une refonte du modèle lui-même.

Publicité

Les chiffres sont difficiles à ignorer

L'équipe DeepMind a testé la récirculation sur la famille de modèles Gemma3, incluant les variantes de 1B, 4B et 12B paramètres. La récirculation de base a permis une réduction d'environ 8,5 % de la perplexité sur neuf jeux de données de modélisation linguistique, avec une latence nulle ajoutée pendant la génération.

La recirculation adaptative a été poussée plus loin, réalisant une réduction moyenne de 23 % de la perplexité sur les mêmes neuf jeux de données. À titre de comparaison, le fine-tuning complet n’a obtenu qu’une réduction de 21,6 %. Sur les tâches de raisonnement, le benchmark GSM8K a enregistré une augmentation relative de 21 % de la précision avec la recirculation adaptative.

Il y a un compromis. Le traitement de préremplissage, la phase où le modèle analyse la requête initiale, devient séquentiel sous recirculation, augmentant le coût initial de traitement d'une requête.

Pourquoi la communauté IA prête attention

L'article, répertorié sous arXiv:2608.17981, a déjà été reproduit indépendamment. Les implémentations sur GitHub ont confirmé les gains sur des modèles en dehors de la famille Gemma, notamment Llama 3.2 1B. Les discussions se sont répandues au sein des communautés de recherche sur X et sur les plateformes médiatiques technologiques chinoises.

La récirculation fonctionne au niveau d'activation, en dessous de la surface de génération de jetons, ce qui la rend complémentaire plutôt que concurrente par rapport aux techniques d'invite comme le raisonnement en chaîne de pensée, qui consomment des jetons de sortie et ajoutent de la latence.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.