Se identificaron cabezas de recuperación multimodal en modelos de visión-lenguaje con contexto largo

icon MarsBit
Compartir
AI summary iconResumen
Un nuevo artículo de EMNLP 2026 titulado '¿Pueden los cabezales de recuperación ver imágenes? Cabezales de recuperación multimodal en modelos de visión-lenguaje con contexto largo' revela cómo los modelos utilizan análisis en cadena para localizar evidencia relevante en documentos extensos. El estudio identifica 'cabezales de recuperación multimodal' (MMRetHeads) que ayudan a los modelos a enfocarse en contenido textual o visual específico. Estos cabezales se probaron en seis modelos, incluyendo Qwen3-VL y Gemma3, observándose caídas en el rendimiento cuando se desactivaron, lo que confirma su papel en la recuperación de evidencia. Se utilizó datos en cadena para validar los hallazgos.

Con el desarrollo de Office AI y agentes de documentos, los grandes modelos ahora procesan directamente materiales extensos como estados financieros, contratos e informes de investigación.

Pero poder recibir un documento completo no equivale a poder utilizar correctamente la información que contiene.

Ante cientos de páginas de texto, imágenes, tablas y gráficos, lo primero que el modelo debe responder es: ¿dónde están realmente las pruebas relevantes para la pregunta actual?

El nuevo artículo aceptado en EMNLP 2026, “Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models”, estudia este proceso desde el interior del modelo.

Modelo de lenguaje visual con contexto largo

De "cabe" a "encuentras"

Los modelos de lenguaje visual con contexto largo pueden recibir simultáneamente una gran cantidad de texto e imágenes, pero la respuesta final generalmente depende solo de una pequeña parte de la información. La evidencia relevante puede ser un fragmento de texto, o puede estar oculta en tablas, imágenes o en alguna región específica del diseño.

La pregunta que el equipo de investigación está analizando es: cuando la evidencia ya está presente en la entrada, ¿existe un conjunto de cabezas de atención internas al modelo que se encarguen de dirigir la pregunta hacia el texto o contenido visual relevante?

El equipo denomina a estos cabezales de atención identificados como cabezales de recuperación multimodal (MMRetHeads).

¿Cómo identificar el encabezado de búsqueda multimodal?

Inspired by QRHead, the research team proposed the MMRetHeads detection method.

Específicamente, este método analiza la atención de pregunta a evidencia de cada cabeza de atención, es decir, la atención de los tokens de pregunta hacia las regiones de evidencia anotadas. Si la evidencia es texto, corresponde a tokens de texto; si la evidencia se encuentra en una imagen, corresponde a tokens visuales. Cuanto más fuerte sea la atención hacia la evidencia, mayor será la puntuación de recuperación de esa cabeza de atención.

Modelo de lenguaje visual con contexto largo

Se cubre la investigación de seis modelos de lenguaje visual de contexto largo, incluyendo Qwen3-VL y Gemma3, con tareas como recuperación de texto, recuperación de imágenes, recuperación de texto renderizado y recuperación de imágenes idénticas, y se prueban longitudes de contexto de 8K, 16K, 32K, 64K y 128K.

El análisis también reveló que la recuperación de texto e imágenes comparte algunos cabezales de atención, pero diferentes longitudes de contexto y formas de evidencia activan distintos cabezales de atención.

Do these attention heads really affect the model's responses?

La atención dirigida a las pruebas solo indica una asociación entre ambos. Para verificar si el modelo realmente depende de estas cabezas, el equipo de investigación bloqueó las cabezas de atención con puntuaciones más altas y comparó los resultados con los obtenidos al bloquear la misma cantidad de cabezas de atención aleatorias.

En tareas de búsqueda de texto e imágenes, el rendimiento del modelo disminuye significativamente cuando se bloquea la cabeza de búsqueda, en diferentes longitudes de contexto y posiciones de evidencia; el impacto causado por el bloqueo aleatorio es mucho menor.

La misma diferencia también aparece en preguntas y respuestas de documentos largos más realistas:

  • MMLongBench-Doc: 48.2→5.7
  • SlideVQA: 71.2→8.9

Después del enmascaramiento aleatorio, las dos tareas aún conservaron puntajes de 32.2 y 52.6, respectivamente. La caída causada por el enmascaramiento de las cabezas de recuperación fue significativamente mayor, lo que indica que estas cabezas no solo dirigen la atención cerca de las pruebas, sino que también tienen un efecto causal en el acceso del modelo a las pruebas.

Resultados similares también se observan en tareas de razonamiento multimodal. Después de ocultar la cabeza de recuperación, el modelo a veces responde con “información insuficiente” incluso cuando el gráfico aún está presente en la entrada, o puede leer contenido incorrecto o generar justificaciones inexistentes.

Modelo de lenguaje visual con contexto largo

Desde el mecanismo interno hasta la recuperación de documentos

El equipo de investigación utilizó además las señales de evidencia de estos cabezales de atención para la recuperación de documentos multimodales.

Dado un problema, MMRetHeads calcula una puntuación de relevancia para las páginas o áreas de diseño candidatas y ordena las opciones en función de ello. La recuperación a nivel de página busca páginas completas que contengan evidencia, mientras que la recuperación a nivel de diseño localiza aún más bloques de texto, tablas, imágenes o gráficos dentro de la página. Todo el proceso no requiere entrenamiento adicional del recuperador.

En MMDocIR, Qwen3-VL-8B alcanza un Recall@1 a nivel de página de 64.7, un aumento de 7.7 puntos porcentuales respecto a la mejor línea base reportada; el Recall@1 a nivel de diseño alcanza 39.0, un aumento de 6.3 puntos porcentuales respecto a la mejor línea base reportada.

Modelo de lenguaje visual con contexto largo

Enlace al artículo: https://arxiv.org/abs/2605.27243

Este artículo proviene del canal de WeChat "Quantum Bit", autor: equipo MMRetHeads

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.