Office AI ve belge ajanlarının gelişmesiyle büyük modeller, gelir tabloları, sözleşmeler, araştırma raporları gibi uzun metinli görsel materyalleri doğrudan işlemeye başlıyor.
Bir belgenin tamamını alabilmek, bilgileri doğru şekilde kullanabilmek anlamına gelmez.
Yüzlerce sayfa metin, resim, tablo ve grafikle karşılaşıldığında, modelin ilk cevaplaması gereken şey şu: Mevcut soruyla gerçekten ilgili kanıtlar nerede?
EMNLP 2026'e kabul edilen yeni makale "Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models", bu süreci modelin içinden incelemektedir.

"Yerleşebilir"den "Bulunabilir"e
Uzun bağlamlı görsel-dil modelleri, büyük miktarda metin ve resmi aynı anda alabilir, ancak nihai cevap genellikle bu bilgilerin çok küçük bir kısmına dayanır. İlgili kanıt bir metin parçası olabilir ya da tablolar, resimler veya belirli bir sayfa bölgesi içinde saklı olabilir.
Araştırma ekibinin odaklandığı soru şudur: Kanıt zaten girdide mevcutken, modelin içindedir ve soruyu ilgili metinsel veya görsel içeriklere yönlendiren bir dikkat kafası grubu bulunur mu?
Takım, bu tür dikkat başlıklarını çoklu modlu arama başlıkları (MMRetHeads) olarak adlandırıyor.
Multimodal retrieval head nasıl tanımlanır?
QRHead'ten ilham alarak araştırma ekibi MMRetHeads tespit yöntemini önerdi.
Özellikle, bu yöntem, her dikkat kafasının soru-to-kanıt dikkatini analiz eder, yani soru token'larının etiketlenmiş kanıt bölgelerine yönelik dikkatini. Kanıt metinse, metin token'larına karşılık gelir; kanıt resimdeyse, görsel token'lara karşılık gelir. Kanıta yönelik dikkat ne kadar güçlüyse, o dikkat kafasının arama puanı o kadar yüksektir.

△
Qwen3-VL, Gemma3 dahil olmak üzere altı uzun bağlamlı görsel-dil modeli incelenmiş, metin arama, görsel arama, işlenen metin arama ve aynı görsel arama görevleri dahil olmak üzere 8K, 16K, 32K, 64K ve 128K bağlam uzunlukları test edilmiştir.
Analiz ayrıca, metin ve görüntü aramanın bazı dikkat başlıklarını paylaştığını, ancak farklı bağlam uzunlukları ve kanıt formlarının farklı dikkat başlıklarını çağırdığını ortaya koydu.
Bu dikkat başlıkları gerçekten modelin cevaplarını etkiliyor mu?
Dikkatin kanıta yöneltilmesi, yalnızca ikisi arasındaki bir ilişki olduğunu gösterir. Modelin gerçekten bu başlıklara mı bağlı olduğunu test etmek için araştırma ekibi, yüksek puan alan arama başlıklarını engelledi ve aynı sayıda rastgele dikkat başlığını engelleme sonucuyla karşılaştırdı.
Metin ve görsel arama görevlerinde, arama başlığı engellendikten sonra model, farklı bağlam uzunluklarında ve kanıt konumlarında önemli ölçüde daha kötü performans gösteriyor; rastgele engelleme ise çok daha az etki yapıyor.
Aynı fark, daha gerçekçi uzun belge soru-cevaplarında da ortaya çıkar:
- MMLongBench-Doc: 48,2→5,7
- SlideVQA: 71,2→8,9
Rastgele engelleme sonrası, iki görev sırasıyla 32,2 ve 52,6 puan korundu. Arama başlıklarının engellenmesinden kaynaklanan düşüş çok daha belirgin olup, bu başlıkların sadece kanıta yakın odaklanmadığını, aynı zamanda modelin kanıta erişimine neden olduğunu göstermektedir.
Çok modlu çıkarım görevlerinde benzer sonuçlar gözlemlenmiştir. Arama başlığı engellendikten sonra, model girdide grafikler hâlâ mevcutken bazen "yeterli bilgi yok" cevabını verebilir veya yanlış içerikleri okuyabilir ya da var olmayan dayanaklar üretebilir.

△
İç mekanizmadan belge aramaya
Araştırma ekibi, bu dikkat başlıklarındaki kanıt sinyallerini çoklu modlu belge aramasında kullanmaya devam etti.
Verilen bir soru için MMRetHeads, aday sayfalar veya düzen alanları için ilgilik puanları hesaplar ve bu puanlara göre adayları sıralar. Sayfa düzeyi arama, kanıtı içeren tam sayfaları bulur; düzen düzeyi arama ise sayfa içindeki metin bloklarını, tabloları, resimleri veya grafikleri daha da hassas bir şekilde konumlandırır. Bu süreç, arama aracının ek eğitimine gerek duymaz.
MMDocIR üzerinde, Qwen3-VL-8B'nin sayfa düzeyindeki Recall@1 değeri 64,7'ye ulaşıp, en güçlü raporlanmış temel modele göre 7,7 puan arttı; düzen düzeyindeki Recall@1 değeri ise 39,0'a ulaşıp, en güçlü raporlanmış temel modele göre 6,3 puan arttı.

△
Makale bağlantısı: https://arxiv.org/abs/2605.27243
Bu yazı, WeChat hesabından "Quantum Bits" tarafından yazılmıştır, yazar: MMRetHeads ekibi
