Google DeepMind vient de publier un article qui pourrait modifier discrètement la façon dont les modèles linguistiques traitent le texte. La technique, appelée « recirculation », prend les activations des couches plus profondes d’un transformer et les mélange à nouveau aux couches plus superficielles pendant l’inférence. L’article, co-écrit avec des chercheurs de l’Université du Texas à Austin, démontre que cette connexion récurrente légère procure des gains de performance qui rivalisent, et dans certains cas surpassent, un fine-tuning complet. Aucun re-entraînement requis. Aucune chirurgie majeure de l’architecture.
Ce que la recirculation fait réellement
La récirculation brise le flux unidirectionnel du traitement des transformeurs. Une fraction des activations calculées dans les couches plus profondes du modèle est réintroduite dans les couches plus superficielles pendant la génération des jetons. Le modèle obtient ainsi une deuxième passe pour comprendre ses propres représentations internes, ce qui lui permet d'affiner ce que l'article appelle ses « états de croyance » sur plusieurs étapes.
La distinction clé par rapport aux approches existantes comme le prompting en chaîne de pensée ou les architectures transformateurs en boucle est que la recirculation ne nécessite pas de jetons de raisonnement supplémentaires ni une profondeur architecturale accrue. Il s'agit d'une modification additionnelle au fonctionnement de l'inférence, et non d'une refonte du modèle lui-même.
Les chiffres sont difficiles à ignorer
L'équipe DeepMind a testé la récirculation sur la famille de modèles Gemma3, incluant les variantes de 1B, 4B et 12B paramètres. La récirculation de base a permis une réduction d'environ 8,5 % de la perplexité sur neuf jeux de données de modélisation linguistique, avec une latence nulle ajoutée pendant la génération.
La recirculation adaptative a été poussée plus loin, réalisant une réduction moyenne de 23 % de la perplexité sur les mêmes neuf jeux de données. À titre de comparaison, le fine-tuning complet n’a obtenu qu’une réduction de 21,6 %. Sur les tâches de raisonnement, le benchmark GSM8K a enregistré une augmentation relative de 21 % de la précision avec la recirculation adaptative.
Il y a un compromis. Le traitement de préremplissage, la phase où le modèle analyse la requête initiale, devient séquentiel sous recirculation, augmentant le coût initial de traitement d'une requête.
Pourquoi la communauté IA prête attention
L'article, répertorié sous arXiv:2608.17981, a déjà été reproduit indépendamment. Les implémentations sur GitHub ont confirmé les gains sur des modèles en dehors de la famille Gemma, notamment Llama 3.2 1B. Les discussions se sont répandues au sein des communautés de recherche sur X et sur les plateformes médiatiques technologiques chinoises.
La récirculation fonctionne au niveau d'activation, en dessous de la surface de génération de jetons, ce qui la rend complémentaire plutôt que concurrente par rapport aux techniques d'invite comme le raisonnement en chaîne de pensée, qui consomment des jetons de sortie et ajoutent de la latence.
