З розвитком Office AI та документних агентів великі моделі починають безпосередньо обробляти довгі текстово-графічні матеріали, такі як фінансові звіти, контракти та дослідницькі звіти.
Але здатність отримати повний документ не означає здатності правильно використовувати інформацію з нього.
Стикаючись з сотнями сторінок тексту, зображень, таблиць і діаграм, модель спочатку має відповісти: де саме знаходяться докази, що справді стосуються поточного запиту?
Нова стаття, прийнята на EMNLP 2026, «Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models», досліджує цей процес зсередини моделі.

Від «поміщається» до «знаходиться»
Візуальні мовні моделі з довгим контекстом можуть одночасно приймати велику кількість тексту та зображень, але остаточна відповідь зазвичай залежить лише від невеликої частини інформації. Відповідні докази можуть бути текстовим фрагментом або прихованими в таблицях, зображеннях або певних областях макету.
Проблема, яку досліджує команда дослідників: чи існує в моделі група увагових голов, які спрямовують запитання на відповідний текстовий або візуальний контент, коли докази вже присутні у вхідних даних?
Команда назвала виявлені голови уваги цього типу багатомодальними головами пошуку (MMRetHeads).
Як ідентифікувати багатомодальний пошуковий заголовок?
Натхнені QRHead, дослідницька команда запропонувала метод виявлення MMRetHeads.
Зокрема, цей метод аналізує увагу від запитання до доказів для кожного голови уваги, тобто увагу, що спрямована від токенів запитання до областей доказів. Якщо докази є текстом, вони відповідають текстовим токенам; якщо докази розташовані на зображенні, вони відповідають візуальним токенам. Чим сильніша увага, спрямована на докази, тим вищий рейтинг пошуку для цього голови уваги.

△
Дослідження охоплює 6 довгих контекстних візуальних мовних моделей, зокрема Qwen3-VL та Gemma3, і включає завдання, такі як пошук тексту, пошук зображень, пошук відтвореного тексту та пошук однакових зображень, а також тестування довжин контексту 8K, 16K, 32K, 64K і 128K.
Аналіз також виявив, що текстовий та іміджевий пошук ділять частину увагових голов, але різні довжини контексту та форми доказів викликають різні увагові голови.
Чи впливають ці увагові голови на відповіді моделі?
Звернення уваги на докази лише свідчить про існування зв’язку між ними. Щоб перевірити, чи справді модель залежить від цих заголовків, дослідницька команда заблокувала заголовки з високими балами, а потім порівняла результати зі зблокованими випадковими заголовками у такій самій кількості.
У завданнях пошуку за текстом і зображеннями після блокування головки пошуку значно знижується продуктивність моделі при різних довжинах контексту та розташуванні доказів; вплив випадкового блокування значно менший.
Така ж різниця спостерігається і в більш реальних довгих документах з питаннями та відповідями:
- MMLongBench-Doc: 48,2→5,7
- SlideVQA: 71,2→8,9
Після випадкового блокування обидві завдання зберегли відповідно 32,2 та 52,6 бала. Зниження, спричинене блокуванням головок пошуку, є значно більшим, що свідчить про те, що ці головки не просто зосереджують увагу на доказах, але й мають причинно-наслідковий вплив на доступ моделі до доказів.
Подібні результати спостерігаються і у багатомодальних завданнях міркувань. Після блокування голови пошуку модель іноді відповідає «недостатньо інформації», навіть якщо діаграма все ще присутня у вхідних даних, або ж може прочитати неправильний вміст або згенерувати неіснуючі аргументи.

△
Від внутрішніх механізмів до пошуку документів
Дослідницька команда далі використала сигнали уваги з цих голов для багатомодального пошуку документів.
За заданим запитом MMRetHeads обчислює бали релевантності для кандидатів на сторінки або області макету та сортує кандидати за цими балами. Пошук на рівні сторінки шукає цілі сторінки, що містять докази, а пошук на рівні макету додатково локалізує текстові блоки, таблиці, зображення або діаграми на сторінці. Цей процес не вимагає додаткового навчання ретрівера.
На MMDocIR Recall@1 на рівні сторінки для Qwen3-VL-8B досягає 64,7, що на 7,7 процентних пункту вище, ніж у найкращої відомої базової моделі; Recall@1 на рівні макету досягає 39,0, що на 6,3 процентних пункту вище, ніж у найкращої відомої базової моделі.

△
Посилання на статтю: https://arxiv.org/abs/2605.27243
Цей матеріал зі сторінки WeChat «Quantum Bit», автор: команда MMRetHeads
