С развитием Office AI и документных агентов крупные модели начинают напрямую обрабатывать длинные текстовые и графические материалы, такие как финансовые отчеты, контракты и исследовательские отчеты.
Но возможность получить полный документ не означает умения правильно использовать содержащуюся в нем информацию.
面对上百页的文字、图片、表格和图表,模型首先要回答的是:与当前问题真正相关的证据,究竟在哪里?
Новая статья, принятая на EMNLP 2026, «Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models», исследует этот процесс изнутри модели.

От «вмещается» к «находится»
Модели визуального языка с длинным контекстом могут одновременно принимать большое количество текста и изображений, но окончательный ответ обычно зависит лишь от небольшой части этой информации. Соответствующие доказательства могут быть представлены в виде текста, а также могут скрываться в таблицах, изображениях или определенных областях макета.
Вопрос, на который ориентируется исследовательская группа: существуют ли внутри модели наборы внимательных голов, ответственные за направление вопроса на соответствующий текстовый или визуальный контент, когда доказательства уже присутствуют во входных данных?
Команда назвала выявленные такие головы внимания мультимодальными головами поиска (MMRetHeads).
Как распознать мультимодальный поисковый заголовок?
Вдохновленные QRHead, исследовательская команда предложила метод обнаружения MMRetHeads.
В частности, метод анализирует внимание от вопроса к доказательству для каждого внимательного головы, то есть внимание, которое токены вопроса направляют на области доказательств. Если доказательство представляет собой текст, оно соответствует текстовым токенам; если доказательство находится на изображении, оно соответствует визуальным токенам. Чем сильнее внимание, направленное на доказательства, тем выше оценка поиска для данной внимательной головы.

△
Исследование охватывает шесть длинноконтекстных визуально-языковых моделей, включая Qwen3-VL и Gemma3, с задачами, такими как текстовый поиск, поиск изображений, поиск текста на изображениях и поиск одинаковых изображений, а также тестирование контекстных длин 8K, 16K, 32K, 64K и 128K.
Анализ также показал, что текстовый и образный поиск делят часть голов внимания, но различные длины контекста и формы доказательств задействуют разные головы внимания.
Do these attention heads really affect the model's responses?
Обращение внимания на доказательства лишь указывает на наличие связи между ними. Для проверки, действительно ли модель зависит от этих заголовков, исследовательская группа заблокировала заголовки с высокими оценками и сравнила результаты с блокировкой того же количества случайных заголовков внимания.
В задачах поиска по тексту и изображениям производительность модели значительно снижается при маскировании поискового заголовка при различных длинах контекста и положениях доказательств; влияние случайного маскирования значительно меньше.
Такая же разница наблюдается и в более реалистичных вопросах и ответах на длинные документы:
- MMLongBench-Doc: 48,2→5,7
- SlideVQA: 71,2→8,9
После случайного маскирования обе задачи сохранили соответственно 32,2 и 52,6 балла. Снижение, вызванное маскированием головок поиска, было значительно больше, что указывает на то, что эти головки не просто сосредотачивают внимание на доказательствах, но также играют причинную роль в доступе модели к доказательствам.
Аналогичные результаты наблюдаются и в много Modalных задачах рассуждения. После маскирования головы поиска модель иногда отвечает «недостаточно информации», даже если график все еще присутствует во входных данных, или может прочитать неверную информацию и сгенерировать несуществующие аргументы.

△
От внутренних механизмов до поиска документов
Исследовательская команда далее использовала сигналы внимания из этих голов для мультимодального поиска документов.
Для заданного вопроса MMRetHeads вычисляет оценку релевантности для кандидатских страниц или областей макета и сортирует кандидатов на основе этих оценок. Поиск на уровне страницы ищет целые страницы, содержащие доказательства, а поиск на уровне макета дополнительно локализует текстовые блоки, таблицы, изображения или диаграммы на странице. Этот процесс не требует дополнительного обучения ретривера.
На MMDocIR Recall@1 на уровне страницы для Qwen3-VL-8B достиг 64,7, что на 7,7 процентных пункта выше, чем у лучшей из задокументированных базовых моделей; Recall@1 на уровне макета достиг 39,0, что на 6,3 процентных пункта выше, чем у лучшей из задокументированных базовых моделей.

△
Ссылка на статью: https://arxiv.org/abs/2605.27243
Эта статья взята из официального аккаунта WeChat «Quantum Bit», автор: команда MMRetHeads
