Recuperação multimodal identificada em modelos de visão e linguagem com contexto longo

icon MarsBit
Compartilhar
AI summary iconResumo
Um novo artigo da EMNLP 2026 intitulado 'Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models' revela como os modelos utilizam análise on-chain para localizar evidências relevantes em documentos longos. O estudo identifica 'multimodal retrieval heads' (MMRetHeads) que ajudam os modelos a se concentrar em conteúdo textual ou visual específico. Esses heads foram testados em seis modelos, incluindo Qwen3-VL e Gemma3, com quedas de desempenho observadas quando desativados, confirmando seu papel na recuperação de evidências. Dados on-chain foram utilizados para validar os resultados.

Com o desenvolvimento do Office AI e dos agentes de documentos, os grandes modelos agora processam diretamente materiais extensos, como demonstrações financeiras, contratos e relatórios de pesquisa.

Mas ser capaz de receber um documento completo não equivale a ser capaz de usar corretamente as informações contidas nele.

Diante de centenas de páginas de texto, imagens, tabelas e gráficos, a primeira pergunta que o modelo precisa responder é: onde estão as evidências realmente relevantes para a questão atual?

O novo artigo aceito no EMNLP 2026, “Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models”, investiga esse processo internamente ao modelo.

Modelo de linguagem visual com contexto longo

De "cabe" para "encontra"

Modelos visuais de linguagem com contexto longo podem receber simultaneamente grande quantidade de texto e imagens, mas a resposta final geralmente depende apenas de uma pequena parte dessas informações. A evidência relevante pode ser um trecho de texto, ou pode estar escondida em tabelas, imagens ou em alguma área específica do layout.

A questão que a equipe de pesquisa está investigando é: quando a evidência já está presente na entrada, existe um conjunto de cabeças de atenção internas ao modelo responsáveis por direcionar a pergunta para o texto ou conteúdo visual relevante?

A equipe denominou essas cabeças de atenção identificadas como cabeças de recuperação multimodal (MMRetHeads).

Como identificar o cabeçalho de busca multimodal?

Inspired by QRHead, the research team proposed the MMRetHeads detection method.

Especificamente, o método analisa a atenção de questão para evidência de cada cabeça de atenção, ou seja, a atenção dos tokens de questão direcionados às regiões de evidência anotadas. Se a evidência for texto, corresponde aos tokens de texto; se a evidência estiver em uma imagem, corresponde aos tokens visuais. Quanto mais forte for a atenção direcionada à evidência, maior será a pontuação de recuperação dessa cabeça de atenção.

Modelo de linguagem visual com contexto longo

Cobertura de pesquisa nos modelos visuais de linguagem de longo contexto Qwen3-VL, Gemma3 e outros quatro, incluindo tarefas como recuperação de texto, recuperação de imagem, recuperação de texto renderizado e recuperação de imagens idênticas, com testes em comprimentos de contexto de 8K, 16K, 32K, 64K e 128K.

A análise também descobriu que a busca de texto e imagem compartilham parte das cabeças de atenção, mas diferentes comprimentos de contexto e formas de evidência ativam cabeças de atenção distintas.

Do these attention heads really affect the model's responses?

A atenção voltada para as evidências apenas indica uma associação entre os dois. Para verificar se o modelo realmente depende dessas cabeças, a equipe de pesquisa bloqueou as cabeças de atenção com pontuações mais altas e comparou os resultados com aqueles obtidos ao bloquear o mesmo número de cabeças de atenção aleatórias.

Na tarefa de busca de texto e imagem, o desempenho do modelo diminui significativamente após ocultar a cabeça de busca, em diferentes comprimentos de contexto e posições de evidência; o impacto causado por ocultação aleatória é muito menor.

A mesma diferença também aparece em perguntas e respostas em documentos longos mais realistas:

  • MMLongBench-Doc: 48,2→5,7
  • SlideVQA: 71,2→8,9

Após o bloqueio aleatório, as duas tarefas ainda mantiveram pontuações de 32,2 e 52,6, respectivamente. A queda causada pelo bloqueio das cabeças de busca foi significativamente maior, indicando que essas cabeças não apenas direcionam a atenção para perto das evidências, mas também têm um papel causal na acessibilidade das evidências pelo modelo.

Resultados semelhantes também foram observados em tarefas de raciocínio multimodal. Após o bloqueio da cabeça de busca, o modelo às vezes responde “informação insuficiente” mesmo quando o gráfico ainda está presente na entrada, ou pode ler conteúdo incorreto ou gerar justificativas inexistente.

Modelo de linguagem visual com contexto longo

Do mecanismo interno à recuperação de documentos

A equipe de pesquisa utilizou adicionalmente os sinais de evidência dessas cabeças de atenção para busca de documentos multimodais.

Dado um problema, o MMRetHeads calcula pontuações de relevância para páginas ou áreas de layout candidatas e classifica as opções com base nisso. A busca em nível de página procura páginas inteiras que contenham evidências, enquanto a busca em nível de layout localiza ainda mais blocos de texto, tabelas, imagens ou gráficos dentro da página. Todo o processo não requer treinamento adicional do recuperador.

No MMDocIR, o Qwen3-VL-8B atinge Recall@1 em nível de página de 64,7, um aumento de 7,7 pontos percentuais em relação à melhor linha de base relatada; o Recall@1 em nível de layout atinge 39,0, um aumento de 6,3 pontos percentuais em relação à melhor linha de base relatada.

Modelo de linguagem visual com contexto longo

Link do artigo: https://arxiv.org/abs/2605.27243

Este artigo é do número de assinantes do WeChat "Quantum Bit", autor: equipe MMRetHeads

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.