Des têtes de récupération multimodale identifiées dans les modèles vision-langage à long contexte

icon MarsBit
Partager
AI summary iconRésumé
Un nouvel article EMNLP 2026 intitulé « Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models » révèle comment les modèles utilisent l'analyse sur chaîne pour localiser des preuves pertinentes dans des documents longs. L'étude identifie des « multimodal retrieval heads » (MMRetHeads) qui aident les modèles à se concentrer sur un contenu textuel ou visuel spécifique. Ces têtes ont été testées sur six modèles, notamment Qwen3-VL et Gemma3, avec une baisse de performance observée lorsqu'elles sont désactivées, confirmant leur rôle dans la récupération de preuves. Des données sur chaîne ont été utilisées pour valider les résultats.

Avec le développement de l'IA Bureau et des agents de documents, les grands modèles commencent à traiter directement des documents longs et complexes tels que les états financiers, les contrats et les rapports de recherche.

Mais pouvoir recevoir un document complet ne signifie pas pouvoir utiliser correctement les informations qu'il contient.

Face à des centaines de pages de texte, d'images, de tableaux et de graphiques, la première question que le modèle doit se poser est : où se trouvent les preuves véritablement pertinentes pour la question actuelle ?

L'article accepté pour EMNLP 2026, « Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models », étudie ce processus à l'intérieur du modèle.

Modèle visuel linguistique à long contexte

De « qui peut contenir » à « qui peut être trouvé »

Les modèles visuels et linguistiques à long contexte peuvent recevoir simultanément un grand volume de texte et d'images, mais la réponse finale dépend généralement d'une très petite partie de ces informations. Les preuves pertinentes peuvent être un passage de texte, ou bien cachées dans un tableau, une image ou une zone spécifique de la mise en page.

La question à laquelle l'équipe de recherche s'intéresse est la suivante : lorsque les preuves sont déjà présentes dans l'entrée, existe-t-il un ensemble de têtes d'attention au sein du modèle chargées d'orienter la question vers le texte ou le contenu visuel pertinent ?

L'équipe a désigné ces têtes d'attention identifiées comme des têtes de recherche multimodale (MMRetHeads).

Comment identifier la tête de recherche multimodale ?

Inspired by QRHead, the research team proposed the MMRetHeads detection method.

Plus précisément, cette méthode analyse l'attention question-vers-évidence de chaque tête d'attention, c'est-à-dire l'attention des jetons de question vers les régions d'évidence annotées. Si l'évidence est textuelle, elle correspond aux jetons textuels ; si l'évidence se trouve dans une image, elle correspond aux jetons visuels. Plus l'attention dirigée vers l'évidence est forte, plus le score de recherche de cette tête d'attention est élevé.

Modèle visuel linguistique à long contexte

Étude couvrant six modèles visuels linguistiques à long contexte, notamment Qwen3-VL et Gemma3, incluant des tâches telles que la recherche textuelle, la recherche d'images, la recherche de texte rendu et la recherche d'images identiques, avec des longueurs de contexte de 8K, 16K, 32K, 64K et 128K.

L'analyse a également révélé que la recherche de texte et d'images partagent une partie des têtes d'attention, mais des longueurs de contexte et des formes de preuve différentes déclenchent des têtes d'attention distinctes.

Do these attention heads really affect the model's responses?

L'attention portée aux preuves ne montre que l'existence d'une corrélation entre les deux. Pour vérifier si le modèle dépend réellement de ces têtes, l'équipe de recherche a masqué les têtes d'attention à haut score, puis a comparé les résultats à ceux obtenus en masquant un nombre équivalent de têtes d'attention aléatoires.

Dans les tâches de recherche textuelle et d'image, le masquage de la tête de recherche entraîne une baisse significative des performances du modèle selon la longueur du contexte et la position de la preuve ; l'effet du masquage aléatoire est beaucoup plus faible.

La même différence se manifeste également dans les questions-réponses sur des documents longs plus réalistes :

  • MMLongBench-Doc : 48,2 → 5,7
  • SlideVQA : 71,2 → 8,9

Après masquage aléatoire, les deux tâches conservent respectivement 32,2 et 52,6 points. La baisse causée par le masquage des têtes de recherche est nettement plus importante, ce qui indique que ces têtes ne se contentent pas d’orienter l’attention vers les preuves, mais exercent également un effet causal sur l’accès du modèle aux preuves.

Des résultats similaires ont été observés dans les tâches d'inférence multimodale. Après avoir masqué la tête de recherche, le modèle peut parfois répondre « informations insuffisantes » même si le graphique est toujours présent dans l'entrée, ou bien lire des contenus erronés ou générer des justifications inexistantes.

Modèle visuel linguistique à long contexte

Du mécanisme interne à la recherche de documents

L'équipe de recherche a ensuite utilisé les signaux d'attention de ces têtes pour la recherche de documents multimodaux.

Étant donné une question, MMRetHeads calcule un score de pertinence pour les pages ou zones de mise en page candidates, puis classe les candidats en fonction de ce score. La recherche au niveau de la page cherche des pages entières contenant des preuves, tandis que la recherche au niveau de la mise en page localise plus précisément les blocs de texte, tableaux, images ou graphiques sur la page. Ce processus ne nécessite aucun entraînement supplémentaire du récupérateur.

Sur MMDocIR, le Recall@1 au niveau de la page pour Qwen3-VL-8B atteint 64,7, soit une amélioration de 7,7 points de pourcentage par rapport à la meilleure base de référence signalée ; le Recall@1 au niveau du layout atteint 39,0, soit une amélioration de 6,3 points de pourcentage par rapport à la meilleure base de référence signalée.

Modèle visuel linguistique à long contexte

Lien vers l'article : https://arxiv.org/abs/2605.27243

Cet article provient du compte WeChat « Quantum Bit », auteur : l'équipe MMRetHeads

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.