隨著 Office AI 和文件智能體的發展,大模型開始直接處理財報、合約、研究報告等長篇图文材料。
但能夠接收一份完整文件,並不等於能夠正確使用其中的資訊。
面對上百頁的文字、圖片、表格和圖表,模型首先要回答的是:與當前問題真正相關的證據,究竟在哪裡?
EMNLP 2026 接收的論文新作 “Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models”,從模型內部研究了這一過程。

從「裝得下」到「找得到」
長上下文視覺語言模型可同時接收大量文字和圖片,但最終答案通常僅依賴其中很小一部分資訊。相關證據可能是一段文字,也可能藏於表格、圖片或某個版面區域中。
研究團隊關注的問題是:當證據已經出現在輸入中時,模型內部是否存在一組注意力頭,負責將問題指向相關的文本或視覺內容?
團隊將識別出的這類注意力頭稱為多模態檢索頭(MMRetHeads)。
如何識別多模態檢索頭?
受 QRHead 啟發,研究團隊提出了 MMRetHeads 檢測方法。
具體來說,該方法分析每個注意力頭的 question-to-evidence 注意力,即問題 token 指向標註證據區域的注意力。若證據為文字,則對應文字 token;若證據位於圖片中,則對應視覺 token。指向證據的注意力越強,該注意力頭的檢索得分就越高。

△
研究涵蓋 Qwen3-VL、Gemma3 等 6 個長上下文視覺語言模型,包括文本檢索、圖像檢索、渲染文本檢索和相同圖像檢索等任務,並測試 8K、16K、32K、64K 和 128K 上下文長度。
分析還發現,文本和圖像檢索會共享部分注意力頭,但不同的上下文長度和證據形式也會調用不同的注意力頭。
Do these attention heads really affect the model’s responses?
注意力指向證據,僅能說明兩者存在關聯。為檢驗模型是否真正依賴這些注意力頭,研究團隊屏蔽了得分最高的檢索注意力頭,並與屏蔽相同數量隨機注意力頭的結果進行比較。
在文字和圖片檢索任務中,屏蔽檢索頭後,模型在不同上下文長度和證據位置下的表現顯著下降;隨機屏蔽造成的影響則小得多。
同樣的差異也出現在更真實的長文檔問答中:
- MMLongBench-Doc:48.2→5.7
- SlideVQA:71.2 → 8.9
隨機屏蔽後,兩項任務仍分別保留 32.2 和 52.6 分。由屏蔽檢索頭所導致的下降幅度明顯更大,表明這些頭不僅僅是將注意力集中在證據附近,還對模型訪問證據具有因果作用。
在多模態推理任務中也能觀察到類似結果。檢索頭被屏蔽後,模型有時會在圖表仍然存在於輸入中的情況下回答「資訊不足」,也可能讀取錯誤內容或生成不存在的依據。

△
從內部機制到文檔檢索
研究團隊進一步將這些注意力頭中的證據信號用於多模態文檔檢索。
給定一個問題,MMRetHeads 會為候選頁面或版面區域計算相關性分數,並據此對候選項進行排序。頁面級檢索尋找包含證據的整頁,版面級檢索則進一步定位頁面中的文字塊、表格、圖片或圖表。整個過程無需額外訓練檢索器。
On MMDocIR, Qwen3-VL-8B achieves a page-level Recall@1 of 64.7, an improvement of 7.7 percentage points over the strongest reported baseline; and a layout-level Recall@1 of 39.0, an improvement of 6.3 percentage points over the strongest reported baseline.

△
論文連結:https://arxiv.org/abs/2605.27243
本文來自微信公眾號「量子位」,作者:MMRetHeads 團隊
