Выявлены мультимодальные поисковые головки в визуально-языковых моделях с длинным контекстом

icon MarsBit
Поделиться
AI summary iconСводка
Новая статья EMNLP 2026 под названием «Могут ли головки извлечения видеть изображения? Мультимодальные головки извлечения в языково-визуальных моделях с длинным контекстом» раскрывает, как модели используют анализ в цепочке для поиска релевантных доказательств в длинных документах. В исследовании выявлены «мультимодальные головки извлечения» (MMRetHeads), которые помогают моделям сосредотачиваться на конкретном текстовом или визуальном содержании. Эти головки были протестированы на шести моделях, включая Qwen3-VL и Gemma3, и при их отключении наблюдалось снижение производительности, что подтверждает их роль в извлечении доказательств. Для проверки выводов использовались данные в цепочке.

С развитием Office AI и документных агентов крупные модели начинают напрямую обрабатывать длинные текстовые и графические материалы, такие как финансовые отчеты, контракты и исследовательские отчеты.

Но возможность получить полный документ не означает умения правильно использовать содержащуюся в нем информацию.

面对上百页的文字、图片、表格和图表,模型首先要回答的是:与当前问题真正相关的证据,究竟在哪里?

Новая статья, принятая на EMNLP 2026, «Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models», исследует этот процесс изнутри модели.

Визуально-языковая модель с длинным контекстом

От «вмещается» к «находится»

Модели визуального языка с длинным контекстом могут одновременно принимать большое количество текста и изображений, но окончательный ответ обычно зависит лишь от небольшой части этой информации. Соответствующие доказательства могут быть представлены в виде текста, а также могут скрываться в таблицах, изображениях или определенных областях макета.

Вопрос, на который ориентируется исследовательская группа: существуют ли внутри модели наборы внимательных голов, ответственные за направление вопроса на соответствующий текстовый или визуальный контент, когда доказательства уже присутствуют во входных данных?

Команда назвала выявленные такие головы внимания мультимодальными головами поиска (MMRetHeads).

Как распознать мультимодальный поисковый заголовок?

Вдохновленные QRHead, исследовательская команда предложила метод обнаружения MMRetHeads.

В частности, метод анализирует внимание от вопроса к доказательству для каждого внимательного головы, то есть внимание, которое токены вопроса направляют на области доказательств. Если доказательство представляет собой текст, оно соответствует текстовым токенам; если доказательство находится на изображении, оно соответствует визуальным токенам. Чем сильнее внимание, направленное на доказательства, тем выше оценка поиска для данной внимательной головы.

Визуально-языковая модель с длинным контекстом

Исследование охватывает шесть длинноконтекстных визуально-языковых моделей, включая Qwen3-VL и Gemma3, с задачами, такими как текстовый поиск, поиск изображений, поиск текста на изображениях и поиск одинаковых изображений, а также тестирование контекстных длин 8K, 16K, 32K, 64K и 128K.

Анализ также показал, что текстовый и образный поиск делят часть голов внимания, но различные длины контекста и формы доказательств задействуют разные головы внимания.

Do these attention heads really affect the model's responses?

Обращение внимания на доказательства лишь указывает на наличие связи между ними. Для проверки, действительно ли модель зависит от этих заголовков, исследовательская группа заблокировала заголовки с высокими оценками и сравнила результаты с блокировкой того же количества случайных заголовков внимания.

В задачах поиска по тексту и изображениям производительность модели значительно снижается при маскировании поискового заголовка при различных длинах контекста и положениях доказательств; влияние случайного маскирования значительно меньше.

Такая же разница наблюдается и в более реалистичных вопросах и ответах на длинные документы:

  • MMLongBench-Doc: 48,2→5,7
  • SlideVQA: 71,2→8,9

После случайного маскирования обе задачи сохранили соответственно 32,2 и 52,6 балла. Снижение, вызванное маскированием головок поиска, было значительно больше, что указывает на то, что эти головки не просто сосредотачивают внимание на доказательствах, но также играют причинную роль в доступе модели к доказательствам.

Аналогичные результаты наблюдаются и в много Modalных задачах рассуждения. После маскирования головы поиска модель иногда отвечает «недостаточно информации», даже если график все еще присутствует во входных данных, или может прочитать неверную информацию и сгенерировать несуществующие аргументы.

Визуально-языковая модель с длинным контекстом

От внутренних механизмов до поиска документов

Исследовательская команда далее использовала сигналы внимания из этих голов для мультимодального поиска документов.

Для заданного вопроса MMRetHeads вычисляет оценку релевантности для кандидатских страниц или областей макета и сортирует кандидатов на основе этих оценок. Поиск на уровне страницы ищет целые страницы, содержащие доказательства, а поиск на уровне макета дополнительно локализует текстовые блоки, таблицы, изображения или диаграммы на странице. Этот процесс не требует дополнительного обучения ретривера.

На MMDocIR Recall@1 на уровне страницы для Qwen3-VL-8B достиг 64,7, что на 7,7 процентных пункта выше, чем у лучшей из задокументированных базовых моделей; Recall@1 на уровне макета достиг 39,0, что на 6,3 процентных пункта выше, чем у лучшей из задокументированных базовых моделей.

Визуально-языковая модель с длинным контекстом

Ссылка на статью: https://arxiv.org/abs/2605.27243

Эта статья взята из официального аккаунта WeChat «Quantum Bit», автор: команда MMRetHeads

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.