Avec le développement de l'IA Bureau et des agents de documents, les grands modèles commencent à traiter directement des documents longs et complexes tels que les états financiers, les contrats et les rapports de recherche.
Mais pouvoir recevoir un document complet ne signifie pas pouvoir utiliser correctement les informations qu'il contient.
Face à des centaines de pages de texte, d'images, de tableaux et de graphiques, la première question que le modèle doit se poser est : où se trouvent les preuves véritablement pertinentes pour la question actuelle ?
L'article accepté pour EMNLP 2026, « Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models », étudie ce processus à l'intérieur du modèle.

De « qui peut contenir » à « qui peut être trouvé »
Les modèles visuels et linguistiques à long contexte peuvent recevoir simultanément un grand volume de texte et d'images, mais la réponse finale dépend généralement d'une très petite partie de ces informations. Les preuves pertinentes peuvent être un passage de texte, ou bien cachées dans un tableau, une image ou une zone spécifique de la mise en page.
La question à laquelle l'équipe de recherche s'intéresse est la suivante : lorsque les preuves sont déjà présentes dans l'entrée, existe-t-il un ensemble de têtes d'attention au sein du modèle chargées d'orienter la question vers le texte ou le contenu visuel pertinent ?
L'équipe a désigné ces têtes d'attention identifiées comme des têtes de recherche multimodale (MMRetHeads).
Comment identifier la tête de recherche multimodale ?
Inspired by QRHead, the research team proposed the MMRetHeads detection method.
Plus précisément, cette méthode analyse l'attention question-vers-évidence de chaque tête d'attention, c'est-à-dire l'attention des jetons de question vers les régions d'évidence annotées. Si l'évidence est textuelle, elle correspond aux jetons textuels ; si l'évidence se trouve dans une image, elle correspond aux jetons visuels. Plus l'attention dirigée vers l'évidence est forte, plus le score de recherche de cette tête d'attention est élevé.

△
Étude couvrant six modèles visuels linguistiques à long contexte, notamment Qwen3-VL et Gemma3, incluant des tâches telles que la recherche textuelle, la recherche d'images, la recherche de texte rendu et la recherche d'images identiques, avec des longueurs de contexte de 8K, 16K, 32K, 64K et 128K.
L'analyse a également révélé que la recherche de texte et d'images partagent une partie des têtes d'attention, mais des longueurs de contexte et des formes de preuve différentes déclenchent des têtes d'attention distinctes.
Do these attention heads really affect the model's responses?
L'attention portée aux preuves ne montre que l'existence d'une corrélation entre les deux. Pour vérifier si le modèle dépend réellement de ces têtes, l'équipe de recherche a masqué les têtes d'attention à haut score, puis a comparé les résultats à ceux obtenus en masquant un nombre équivalent de têtes d'attention aléatoires.
Dans les tâches de recherche textuelle et d'image, le masquage de la tête de recherche entraîne une baisse significative des performances du modèle selon la longueur du contexte et la position de la preuve ; l'effet du masquage aléatoire est beaucoup plus faible.
La même différence se manifeste également dans les questions-réponses sur des documents longs plus réalistes :
- MMLongBench-Doc : 48,2 → 5,7
- SlideVQA : 71,2 → 8,9
Après masquage aléatoire, les deux tâches conservent respectivement 32,2 et 52,6 points. La baisse causée par le masquage des têtes de recherche est nettement plus importante, ce qui indique que ces têtes ne se contentent pas d’orienter l’attention vers les preuves, mais exercent également un effet causal sur l’accès du modèle aux preuves.
Des résultats similaires ont été observés dans les tâches d'inférence multimodale. Après avoir masqué la tête de recherche, le modèle peut parfois répondre « informations insuffisantes » même si le graphique est toujours présent dans l'entrée, ou bien lire des contenus erronés ou générer des justifications inexistantes.

△
Du mécanisme interne à la recherche de documents
L'équipe de recherche a ensuite utilisé les signaux d'attention de ces têtes pour la recherche de documents multimodaux.
Étant donné une question, MMRetHeads calcule un score de pertinence pour les pages ou zones de mise en page candidates, puis classe les candidats en fonction de ce score. La recherche au niveau de la page cherche des pages entières contenant des preuves, tandis que la recherche au niveau de la mise en page localise plus précisément les blocs de texte, tableaux, images ou graphiques sur la page. Ce processus ne nécessite aucun entraînement supplémentaire du récupérateur.
Sur MMDocIR, le Recall@1 au niveau de la page pour Qwen3-VL-8B atteint 64,7, soit une amélioration de 7,7 points de pourcentage par rapport à la meilleure base de référence signalée ; le Recall@1 au niveau du layout atteint 39,0, soit une amélioration de 6,3 points de pourcentage par rapport à la meilleure base de référence signalée.

△
Lien vers l'article : https://arxiv.org/abs/2605.27243
Cet article provient du compte WeChat « Quantum Bit », auteur : l'équipe MMRetHeads
