Uzun Bağlamlı Görsel-Dil Modellerinde Çoklu Modality Alım Başlıkları Belirlendi

icon MarsBit
Paylaş
AI summary iconÖzet
Başlığı 'Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models' olan EMNLP 2026 makalesi, modellerin uzun belgelerde ilgili kanıtları bulmak için zincir üzerindeki analizleri nasıl kullandığını ortaya koyuyor. Çalışma, modellerin belirli metin veya görsel içeriklere odaklanmalarına yardımcı olan 'çoklu modalli retrieval başlıkları' (MMRetHeads) tanımlıyor. Bu başlıklar, Qwen3-VL ve Gemma3 dahil altı model üzerinde test edildi ve devre dışı bırakıldığında performans düşüşleri gözlemlendi, bu da onların kanıt retrievaldeki rolünü doğruladı. Bulgular, zincir üzerindeki verilerle doğrulandı.

Office AI ve belge ajanlarının gelişmesiyle büyük modeller, gelir tabloları, sözleşmeler, araştırma raporları gibi uzun metinli görsel materyalleri doğrudan işlemeye başlıyor.

Bir belgenin tamamını alabilmek, bilgileri doğru şekilde kullanabilmek anlamına gelmez.

Yüzlerce sayfa metin, resim, tablo ve grafikle karşılaşıldığında, modelin ilk cevaplaması gereken şey şu: Mevcut soruyla gerçekten ilgili kanıtlar nerede?

EMNLP 2026'e kabul edilen yeni makale "Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models", bu süreci modelin içinden incelemektedir.

Uzun bağlamlı görsel dil modeli

"Yerleşebilir"den "Bulunabilir"e

Uzun bağlamlı görsel-dil modelleri, büyük miktarda metin ve resmi aynı anda alabilir, ancak nihai cevap genellikle bu bilgilerin çok küçük bir kısmına dayanır. İlgili kanıt bir metin parçası olabilir ya da tablolar, resimler veya belirli bir sayfa bölgesi içinde saklı olabilir.

Araştırma ekibinin odaklandığı soru şudur: Kanıt zaten girdide mevcutken, modelin içindedir ve soruyu ilgili metinsel veya görsel içeriklere yönlendiren bir dikkat kafası grubu bulunur mu?

Takım, bu tür dikkat başlıklarını çoklu modlu arama başlıkları (MMRetHeads) olarak adlandırıyor.

Multimodal retrieval head nasıl tanımlanır?

QRHead'ten ilham alarak araştırma ekibi MMRetHeads tespit yöntemini önerdi.

Özellikle, bu yöntem, her dikkat kafasının soru-to-kanıt dikkatini analiz eder, yani soru token'larının etiketlenmiş kanıt bölgelerine yönelik dikkatini. Kanıt metinse, metin token'larına karşılık gelir; kanıt resimdeyse, görsel token'lara karşılık gelir. Kanıta yönelik dikkat ne kadar güçlüyse, o dikkat kafasının arama puanı o kadar yüksektir.

Uzun bağlamlı görsel dil modeli

Qwen3-VL, Gemma3 dahil olmak üzere altı uzun bağlamlı görsel-dil modeli incelenmiş, metin arama, görsel arama, işlenen metin arama ve aynı görsel arama görevleri dahil olmak üzere 8K, 16K, 32K, 64K ve 128K bağlam uzunlukları test edilmiştir.

Analiz ayrıca, metin ve görüntü aramanın bazı dikkat başlıklarını paylaştığını, ancak farklı bağlam uzunlukları ve kanıt formlarının farklı dikkat başlıklarını çağırdığını ortaya koydu.

Bu dikkat başlıkları gerçekten modelin cevaplarını etkiliyor mu?

Dikkatin kanıta yöneltilmesi, yalnızca ikisi arasındaki bir ilişki olduğunu gösterir. Modelin gerçekten bu başlıklara mı bağlı olduğunu test etmek için araştırma ekibi, yüksek puan alan arama başlıklarını engelledi ve aynı sayıda rastgele dikkat başlığını engelleme sonucuyla karşılaştırdı.

Metin ve görsel arama görevlerinde, arama başlığı engellendikten sonra model, farklı bağlam uzunluklarında ve kanıt konumlarında önemli ölçüde daha kötü performans gösteriyor; rastgele engelleme ise çok daha az etki yapıyor.

Aynı fark, daha gerçekçi uzun belge soru-cevaplarında da ortaya çıkar:

  • MMLongBench-Doc: 48,2→5,7
  • SlideVQA: 71,2→8,9

Rastgele engelleme sonrası, iki görev sırasıyla 32,2 ve 52,6 puan korundu. Arama başlıklarının engellenmesinden kaynaklanan düşüş çok daha belirgin olup, bu başlıkların sadece kanıta yakın odaklanmadığını, aynı zamanda modelin kanıta erişimine neden olduğunu göstermektedir.

Çok modlu çıkarım görevlerinde benzer sonuçlar gözlemlenmiştir. Arama başlığı engellendikten sonra, model girdide grafikler hâlâ mevcutken bazen "yeterli bilgi yok" cevabını verebilir veya yanlış içerikleri okuyabilir ya da var olmayan dayanaklar üretebilir.

Uzun bağlamlı görsel dil modeli

İç mekanizmadan belge aramaya

Araştırma ekibi, bu dikkat başlıklarındaki kanıt sinyallerini çoklu modlu belge aramasında kullanmaya devam etti.

Verilen bir soru için MMRetHeads, aday sayfalar veya düzen alanları için ilgilik puanları hesaplar ve bu puanlara göre adayları sıralar. Sayfa düzeyi arama, kanıtı içeren tam sayfaları bulur; düzen düzeyi arama ise sayfa içindeki metin bloklarını, tabloları, resimleri veya grafikleri daha da hassas bir şekilde konumlandırır. Bu süreç, arama aracının ek eğitimine gerek duymaz.

MMDocIR üzerinde, Qwen3-VL-8B'nin sayfa düzeyindeki Recall@1 değeri 64,7'ye ulaşıp, en güçlü raporlanmış temel modele göre 7,7 puan arttı; düzen düzeyindeki Recall@1 değeri ise 39,0'a ulaşıp, en güçlü raporlanmış temel modele göre 6,3 puan arttı.

Uzun bağlamlı görsel dil modeli

Makale bağlantısı: https://arxiv.org/abs/2605.27243

Bu yazı, WeChat hesabından "Quantum Bits" tarafından yazılmıştır, yazar: MMRetHeads ekibi

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.