Виявлено мультимодальні пошукові голови в моделях зору-мови з довгим контекстом

icon MarsBit
Поділитися
AI summary iconКороткий зміст
Нова стаття EMNLP 2026 під назвою «Чи можуть головки пошуку бачити зображення? Багатомодальні головки пошуку в моделях зору-мови з довгим контекстом» розкриває, як моделі використовують аналіз у ланцюгу для пошуку відповідних доказів у довгих документах. Дослідження виявило «багатомодальні головки пошуку» (MMRetHeads), які допомагають моделям зосереджуватися на певному текстовому або візуальному вмісті. Ці головки були протестовані на шести моделях, включаючи Qwen3-VL і Gemma3, і було зафіксовано зниження продуктивності при їх вимкненні, що підтверджує їхню роль у пошуку доказів. Для підтвердження результатів використовувалися дані у ланцюгу.

З розвитком Office AI та документних агентів великі моделі починають безпосередньо обробляти довгі текстово-графічні матеріали, такі як фінансові звіти, контракти та дослідницькі звіти.

Але здатність отримати повний документ не означає здатності правильно використовувати інформацію з нього.

Стикаючись з сотнями сторінок тексту, зображень, таблиць і діаграм, модель спочатку має відповісти: де саме знаходяться докази, що справді стосуються поточного запиту?

Нова стаття, прийнята на EMNLP 2026, «Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models», досліджує цей процес зсередини моделі.

Візуальна мовна модель з довгим контекстом

Від «поміщається» до «знаходиться»

Візуальні мовні моделі з довгим контекстом можуть одночасно приймати велику кількість тексту та зображень, але остаточна відповідь зазвичай залежить лише від невеликої частини інформації. Відповідні докази можуть бути текстовим фрагментом або прихованими в таблицях, зображеннях або певних областях макету.

Проблема, яку досліджує команда дослідників: чи існує в моделі група увагових голов, які спрямовують запитання на відповідний текстовий або візуальний контент, коли докази вже присутні у вхідних даних?

Команда назвала виявлені голови уваги цього типу багатомодальними головами пошуку (MMRetHeads).

Як ідентифікувати багатомодальний пошуковий заголовок?

Натхнені QRHead, дослідницька команда запропонувала метод виявлення MMRetHeads.

Зокрема, цей метод аналізує увагу від запитання до доказів для кожного голови уваги, тобто увагу, що спрямована від токенів запитання до областей доказів. Якщо докази є текстом, вони відповідають текстовим токенам; якщо докази розташовані на зображенні, вони відповідають візуальним токенам. Чим сильніша увага, спрямована на докази, тим вищий рейтинг пошуку для цього голови уваги.

Візуальна мовна модель з довгим контекстом

Дослідження охоплює 6 довгих контекстних візуальних мовних моделей, зокрема Qwen3-VL та Gemma3, і включає завдання, такі як пошук тексту, пошук зображень, пошук відтвореного тексту та пошук однакових зображень, а також тестування довжин контексту 8K, 16K, 32K, 64K і 128K.

Аналіз також виявив, що текстовий та іміджевий пошук ділять частину увагових голов, але різні довжини контексту та форми доказів викликають різні увагові голови.

Чи впливають ці увагові голови на відповіді моделі?

Звернення уваги на докази лише свідчить про існування зв’язку між ними. Щоб перевірити, чи справді модель залежить від цих заголовків, дослідницька команда заблокувала заголовки з високими балами, а потім порівняла результати зі зблокованими випадковими заголовками у такій самій кількості.

У завданнях пошуку за текстом і зображеннями після блокування головки пошуку значно знижується продуктивність моделі при різних довжинах контексту та розташуванні доказів; вплив випадкового блокування значно менший.

Така ж різниця спостерігається і в більш реальних довгих документах з питаннями та відповідями:

  • MMLongBench-Doc: 48,2→5,7
  • SlideVQA: 71,2→8,9

Після випадкового блокування обидві завдання зберегли відповідно 32,2 та 52,6 бала. Зниження, спричинене блокуванням головок пошуку, є значно більшим, що свідчить про те, що ці головки не просто зосереджують увагу на доказах, але й мають причинно-наслідковий вплив на доступ моделі до доказів.

Подібні результати спостерігаються і у багатомодальних завданнях міркувань. Після блокування голови пошуку модель іноді відповідає «недостатньо інформації», навіть якщо діаграма все ще присутня у вхідних даних, або ж може прочитати неправильний вміст або згенерувати неіснуючі аргументи.

Візуальна мовна модель з довгим контекстом

Від внутрішніх механізмів до пошуку документів

Дослідницька команда далі використала сигнали уваги з цих голов для багатомодального пошуку документів.

За заданим запитом MMRetHeads обчислює бали релевантності для кандидатів на сторінки або області макету та сортує кандидати за цими балами. Пошук на рівні сторінки шукає цілі сторінки, що містять докази, а пошук на рівні макету додатково локалізує текстові блоки, таблиці, зображення або діаграми на сторінці. Цей процес не вимагає додаткового навчання ретрівера.

На MMDocIR Recall@1 на рівні сторінки для Qwen3-VL-8B досягає 64,7, що на 7,7 процентних пункту вище, ніж у найкращої відомої базової моделі; Recall@1 на рівні макету досягає 39,0, що на 6,3 процентних пункту вище, ніж у найкращої відомої базової моделі.

Візуальна мовна модель з довгим контекстом

Посилання на статтю: https://arxiv.org/abs/2605.27243

Цей матеріал зі сторінки WeChat «Quantum Bit», автор: команда MMRetHeads

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.