Com o desenvolvimento do Office AI e dos agentes de documentos, os grandes modelos agora processam diretamente materiais extensos, como demonstrações financeiras, contratos e relatórios de pesquisa.
Mas ser capaz de receber um documento completo não equivale a ser capaz de usar corretamente as informações contidas nele.
Diante de centenas de páginas de texto, imagens, tabelas e gráficos, a primeira pergunta que o modelo precisa responder é: onde estão as evidências realmente relevantes para a questão atual?
O novo artigo aceito no EMNLP 2026, “Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models”, investiga esse processo internamente ao modelo.

De "cabe" para "encontra"
Modelos visuais de linguagem com contexto longo podem receber simultaneamente grande quantidade de texto e imagens, mas a resposta final geralmente depende apenas de uma pequena parte dessas informações. A evidência relevante pode ser um trecho de texto, ou pode estar escondida em tabelas, imagens ou em alguma área específica do layout.
A questão que a equipe de pesquisa está investigando é: quando a evidência já está presente na entrada, existe um conjunto de cabeças de atenção internas ao modelo responsáveis por direcionar a pergunta para o texto ou conteúdo visual relevante?
A equipe denominou essas cabeças de atenção identificadas como cabeças de recuperação multimodal (MMRetHeads).
Como identificar o cabeçalho de busca multimodal?
Inspired by QRHead, the research team proposed the MMRetHeads detection method.
Especificamente, o método analisa a atenção de questão para evidência de cada cabeça de atenção, ou seja, a atenção dos tokens de questão direcionados às regiões de evidência anotadas. Se a evidência for texto, corresponde aos tokens de texto; se a evidência estiver em uma imagem, corresponde aos tokens visuais. Quanto mais forte for a atenção direcionada à evidência, maior será a pontuação de recuperação dessa cabeça de atenção.

△
Cobertura de pesquisa nos modelos visuais de linguagem de longo contexto Qwen3-VL, Gemma3 e outros quatro, incluindo tarefas como recuperação de texto, recuperação de imagem, recuperação de texto renderizado e recuperação de imagens idênticas, com testes em comprimentos de contexto de 8K, 16K, 32K, 64K e 128K.
A análise também descobriu que a busca de texto e imagem compartilham parte das cabeças de atenção, mas diferentes comprimentos de contexto e formas de evidência ativam cabeças de atenção distintas.
Do these attention heads really affect the model's responses?
A atenção voltada para as evidências apenas indica uma associação entre os dois. Para verificar se o modelo realmente depende dessas cabeças, a equipe de pesquisa bloqueou as cabeças de atenção com pontuações mais altas e comparou os resultados com aqueles obtidos ao bloquear o mesmo número de cabeças de atenção aleatórias.
Na tarefa de busca de texto e imagem, o desempenho do modelo diminui significativamente após ocultar a cabeça de busca, em diferentes comprimentos de contexto e posições de evidência; o impacto causado por ocultação aleatória é muito menor.
A mesma diferença também aparece em perguntas e respostas em documentos longos mais realistas:
- MMLongBench-Doc: 48,2→5,7
- SlideVQA: 71,2→8,9
Após o bloqueio aleatório, as duas tarefas ainda mantiveram pontuações de 32,2 e 52,6, respectivamente. A queda causada pelo bloqueio das cabeças de busca foi significativamente maior, indicando que essas cabeças não apenas direcionam a atenção para perto das evidências, mas também têm um papel causal na acessibilidade das evidências pelo modelo.
Resultados semelhantes também foram observados em tarefas de raciocínio multimodal. Após o bloqueio da cabeça de busca, o modelo às vezes responde “informação insuficiente” mesmo quando o gráfico ainda está presente na entrada, ou pode ler conteúdo incorreto ou gerar justificativas inexistente.

△
Do mecanismo interno à recuperação de documentos
A equipe de pesquisa utilizou adicionalmente os sinais de evidência dessas cabeças de atenção para busca de documentos multimodais.
Dado um problema, o MMRetHeads calcula pontuações de relevância para páginas ou áreas de layout candidatas e classifica as opções com base nisso. A busca em nível de página procura páginas inteiras que contenham evidências, enquanto a busca em nível de layout localiza ainda mais blocos de texto, tabelas, imagens ou gráficos dentro da página. Todo o processo não requer treinamento adicional do recuperador.
No MMDocIR, o Qwen3-VL-8B atinge Recall@1 em nível de página de 64,7, um aumento de 7,7 pontos percentuais em relação à melhor linha de base relatada; o Recall@1 em nível de layout atinge 39,0, um aumento de 6,3 pontos percentuais em relação à melhor linha de base relatada.

△
Link do artigo: https://arxiv.org/abs/2605.27243
Este artigo é do número de assinantes do WeChat "Quantum Bit", autor: equipe MMRetHeads
