Natukoy ang Multimodal Retrieval Heads sa mga Vision-Language Model na may Mahabang Konteksto

icon MarsBit
I-share
AI summary iconSummary
Ang isang bagong papel sa EMNLP 2026 na may pamagat na 'Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models' ay naglalantad kung paano ginagamit ng mga modelo ang on-chain analysis upang makahanap ng mga kaugnay na ebidensya sa mahahabang dokumento. Ang pag-aaral ay nakakilala sa 'multimodal retrieval heads' (MMRetHeads) na tumutulong sa mga modelo na mag-focus sa partikular na teksto o visual na nilalaman. Tinesting ang mga head na ito sa anim na modelo, kabilang ang Qwen3-VL at Gemma3, at nakita ang pagbaba sa performance kapag pinagpapalit, na nagpapatotoo sa kanilang papel sa paghahanap ng ebidensya. Ginamit ang on-chain data upang patunayan ang mga natuklasan.

Dahil sa pag-unlad ng Office AI at mga dokumentong agent, ang mga malalaking modelo ay nagsisimula na direktang prosesuhin ang mga mahabang materyales na may teksto at larawan tulad ng financial reports, mga kontrata, at mga研究报告.

Ngunit ang kakayahan na tumanggap ng buong dokumento ay hindi katumbas ng kakayahan na gamitin nang tama ang impormasyon dito.

Sa harap ng mga dosenang pahina ng teksto, larawan, talahanayan at mga grapiko, ang unang tanong na dapat sagutin ng modelo ay: Saan talaga ang ebidensya na may kinalaman sa kasalukuyang tanong?

Ang bagong papel na tinanggap sa EMNLP 2026, “Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models”, ay tumatalakay sa prosesong ito mula sa loob ng modelo.

Long-context visual language model

Mula sa “Kakayanin” patungo sa “Makakita”

Ang mga modelo na visual-wika na may mahabang konteksto ay maaaring tumanggap ng malaking halaga ng teksto at larawan, ngunit ang huling sagot ay karaniwang nakasalalay sa isang maliit na bahagi lamang ng impormasyon. Ang kaugnay na ebidensya ay maaaring isang talata, o maaaring nakatago sa isang talahanayan, larawan, o isang partikular na lugar ng layout.

Ang tanong na pinag-aaralan ng team ng pananaliksik ay: Kapag ang ebidensya ay nasa input na, mayroon bang isang grupo ng attention heads sa loob ng modelo na responsable sa pagtuturo sa tanong patungo sa kaugnay na teksto o visual na nilalaman?

Tinatawag ng team ang mga head na ito na napansin bilang multimodal retrieval heads (MMRetHeads).

Paano matutukoy ang multimodal retrieval head?

Na-inspire sa QRHead, ang team ng pag-aaral ay nagmungkahi ng paraan ng pagdetect na MMRetHeads.

Sa partikular, ang paraan na ito ay nag-aanalisa ang bawat attention head na question-to-evidence attention, o ang pagtutok ng question token sa mga rehiyon ng ebidensya. Kung ang ebidensya ay teksto, ito ay tumutugma sa text token; kung ang ebidensya ay nasa larawan, ito ay tumutugma sa visual token. Mas malakas ang pagtutok sa ebidensya, mas mataas ang retrieval score ng attention head na iyon.

Long-context visual language model

Sinakop ang pag-aaral ang 6 na mahabang kontekstong visual-language model tulad ng Qwen3-VL at Gemma3, kasama ang mga gawain tulad ng text retrieval, image retrieval, rendered text retrieval, at same-image retrieval, at sinubukan ang mga haba ng konteksto na 8K, 16K, 32K, 64K, at 128K.

Natuklasan din ng pagsusuri na ang text at image retrieval ay nagbabahagi ng ilang attention heads, ngunit iba’t ibang haba ng konteksto at anyo ng ebidensya ay gumagamit ng iba’t ibang attention heads.

Do these attention heads really affect the model's responses?

Ang pagtutok sa mga ebidensya ay nagpapakita lamang ng ugnayan sa pagitan ng dalawa. Upang subukan kung talagang nakasalalay ang modelo sa mga head na ito, sinilip ng pangkat ng mga mananaliksik ang mga head na may mataas na skor, at kinompara ang resulta sa pag-silip sa parehong bilang ng random na attention heads.

Sa mga gawain ng paghahanap sa teksto at larawan, ang pagpapalabas ng search head ay nagdulot ng malaking pagbaba sa performance ng modelo sa iba’t ibang haba ng konteksto at posisyon ng ebidensya; ang epekto ng random masking naman ay mas maliit.

Ang parehong pagkakaiba ay lumalabas din sa mas totoong mga tanong at sagot sa mahabang dokumento:

  • MMLongBench-Doc: 48.2→5.7
  • SlideVQA: 71.2→8.9

Pagkatapos ng random na pag-shield, nanatili ang dalawang gawain sa 32.2 at 52.6 puntos. Mas malaki ang pagbaba dahil sa pag-shield ng retrieval heads, na nagpapakita na ang mga head na ito ay hindi lamang nag-aalok ng atensyon sa paligid ng ebidensya, kundi may causal na epekto rin sa pag-access ng modelo sa ebidensya.

Sa mga gawain ng multimodal reasoning, nakikita rin ang katulad na resulta. Pagkatapos ma-block ang retrieval head, minsan ay sumasagot ang modelo ng “hindi sapat ang impormasyon” kahit na nananatili pa ang mga chart sa input, o maaari ring basahin ang maling nilalaman o lumikha ng mga batayan na hindi umiiral.

Long-context visual language model

Mula sa internal mechanism hanggang sa paghahanap ng dokumento

Ginamit ng panel ng mga siyentipiko ang mga signal na ebidensya mula sa mga head ng atensyon para sa multi-modal na paghahanap ng dokumento.

Sa ibinigay na tanong, ang MMRetHeads ay kalkulahin ang score ng kinalalabasan para sa mga kandidatong pahina o rehiyon ng layout, at ayusin ang mga kandidato batay dito. Ang page-level retrieval ay naghahanap ng buong pahina na naglalaman ng ebidensya, habang ang layout-level retrieval ay naglalokalisa pa sa mga bloke ng teksto, tabla, larawan, o grapiko sa loob ng pahina. Ang buong proseso ay hindi nangangailangan ng karagdagang pag-train sa retriever.

Sa MMDocIR, ang page-level Recall@1 ng Qwen3-VL-8B ay umabot sa 64.7, isang pagtaas ng 7.7 puntos kumpara sa pinakamalakas na nareport na baseline; ang layout-level Recall@1 ay umabot sa 39.0, isang pagtaas ng 6.3 puntos kumpara sa pinakamalakas na nareport na baseline.

Long-context visual language model

Link ng papel: https://arxiv.org/abs/2605.27243

Ito ay mula sa WeChat public account na "Quantum Bit", may-akda: ang tim ng MMRetHeads

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.