Con el desarrollo de Office AI y agentes de documentos, los grandes modelos ahora procesan directamente materiales extensos como estados financieros, contratos e informes de investigación.
Pero poder recibir un documento completo no equivale a poder utilizar correctamente la información que contiene.
Ante cientos de páginas de texto, imágenes, tablas y gráficos, lo primero que el modelo debe responder es: ¿dónde están realmente las pruebas relevantes para la pregunta actual?
El nuevo artículo aceptado en EMNLP 2026, “Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models”, estudia este proceso desde el interior del modelo.

De "cabe" a "encuentras"
Los modelos de lenguaje visual con contexto largo pueden recibir simultáneamente una gran cantidad de texto e imágenes, pero la respuesta final generalmente depende solo de una pequeña parte de la información. La evidencia relevante puede ser un fragmento de texto, o puede estar oculta en tablas, imágenes o en alguna región específica del diseño.
La pregunta que el equipo de investigación está analizando es: cuando la evidencia ya está presente en la entrada, ¿existe un conjunto de cabezas de atención internas al modelo que se encarguen de dirigir la pregunta hacia el texto o contenido visual relevante?
El equipo denomina a estos cabezales de atención identificados como cabezales de recuperación multimodal (MMRetHeads).
¿Cómo identificar el encabezado de búsqueda multimodal?
Inspired by QRHead, the research team proposed the MMRetHeads detection method.
Específicamente, este método analiza la atención de pregunta a evidencia de cada cabeza de atención, es decir, la atención de los tokens de pregunta hacia las regiones de evidencia anotadas. Si la evidencia es texto, corresponde a tokens de texto; si la evidencia se encuentra en una imagen, corresponde a tokens visuales. Cuanto más fuerte sea la atención hacia la evidencia, mayor será la puntuación de recuperación de esa cabeza de atención.

△
Se cubre la investigación de seis modelos de lenguaje visual de contexto largo, incluyendo Qwen3-VL y Gemma3, con tareas como recuperación de texto, recuperación de imágenes, recuperación de texto renderizado y recuperación de imágenes idénticas, y se prueban longitudes de contexto de 8K, 16K, 32K, 64K y 128K.
El análisis también reveló que la recuperación de texto e imágenes comparte algunos cabezales de atención, pero diferentes longitudes de contexto y formas de evidencia activan distintos cabezales de atención.
Do these attention heads really affect the model's responses?
La atención dirigida a las pruebas solo indica una asociación entre ambos. Para verificar si el modelo realmente depende de estas cabezas, el equipo de investigación bloqueó las cabezas de atención con puntuaciones más altas y comparó los resultados con los obtenidos al bloquear la misma cantidad de cabezas de atención aleatorias.
En tareas de búsqueda de texto e imágenes, el rendimiento del modelo disminuye significativamente cuando se bloquea la cabeza de búsqueda, en diferentes longitudes de contexto y posiciones de evidencia; el impacto causado por el bloqueo aleatorio es mucho menor.
La misma diferencia también aparece en preguntas y respuestas de documentos largos más realistas:
- MMLongBench-Doc: 48.2→5.7
- SlideVQA: 71.2→8.9
Después del enmascaramiento aleatorio, las dos tareas aún conservaron puntajes de 32.2 y 52.6, respectivamente. La caída causada por el enmascaramiento de las cabezas de recuperación fue significativamente mayor, lo que indica que estas cabezas no solo dirigen la atención cerca de las pruebas, sino que también tienen un efecto causal en el acceso del modelo a las pruebas.
Resultados similares también se observan en tareas de razonamiento multimodal. Después de ocultar la cabeza de recuperación, el modelo a veces responde con “información insuficiente” incluso cuando el gráfico aún está presente en la entrada, o puede leer contenido incorrecto o generar justificaciones inexistentes.

△
Desde el mecanismo interno hasta la recuperación de documentos
El equipo de investigación utilizó además las señales de evidencia de estos cabezales de atención para la recuperación de documentos multimodales.
Dado un problema, MMRetHeads calcula una puntuación de relevancia para las páginas o áreas de diseño candidatas y ordena las opciones en función de ello. La recuperación a nivel de página busca páginas completas que contengan evidencia, mientras que la recuperación a nivel de diseño localiza aún más bloques de texto, tablas, imágenes o gráficos dentro de la página. Todo el proceso no requiere entrenamiento adicional del recuperador.
En MMDocIR, Qwen3-VL-8B alcanza un Recall@1 a nivel de página de 64.7, un aumento de 7.7 puntos porcentuales respecto a la mejor línea base reportada; el Recall@1 a nivel de diseño alcanza 39.0, un aumento de 6.3 puntos porcentuales respecto a la mejor línea base reportada.

△
Enlace al artículo: https://arxiv.org/abs/2605.27243
Este artículo proviene del canal de WeChat "Quantum Bit", autor: equipo MMRetHeads
