Seiring dengan perkembangan Office AI dan agen dokumen, model besar mulai secara langsung memproses bahan panjang berupa laporan keuangan, kontrak, dan laporan penelitian.
Namun, mampu menerima seluruh dokumen tidak sama dengan mampu menggunakan informasi di dalamnya dengan benar.
Menghadapi ratusan halaman teks, gambar, tabel, dan grafik, pertanyaan pertama yang harus dijawab model adalah: bukti yang benar-benar relevan dengan pertanyaan saat ini berada di mana?
Karya baru yang diterima EMNLP 2026, "Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models", mempelajari proses ini dari dalam model.

Dari "Bisa Muat" ke "Bisa Ditemukan"
Model visual-language konteks panjang dapat menerima sejumlah besar teks dan gambar secara bersamaan, tetapi jawaban akhir biasanya hanya bergantung pada sebagian kecil informasi saja. Bukti yang relevan bisa berupa sepotong teks, atau tersembunyi di dalam tabel, gambar, atau area tata letak tertentu.
Masalah yang menjadi fokus tim peneliti adalah: ketika bukti sudah muncul dalam input, apakah ada sekelompok head perhatian di dalam model yang bertanggung jawab untuk mengarahkan pertanyaan ke teks atau konten visual yang relevan?
Tim menyebut kepala perhatian semacam ini sebagai multimodal retrieval heads (MMRetHeads).
Bagaimana cara mengenali multimodal retrieval head?
Terinspirasi oleh QRHead, tim peneliti mengusulkan metode deteksi MMRetHeads.
Secara khusus, metode ini menganalisis perhatian question-to-evidence pada setiap head perhatian, yaitu perhatian yang diarahkan dari token pertanyaan ke area bukti yang ditandai. Jika bukti berupa teks, maka sesuai dengan token teks; jika bukti berada dalam gambar, maka sesuai dengan token visual. Semakin kuat perhatian yang diarahkan ke bukti, semakin tinggi skor pencarian head perhatian tersebut.

△
Mencakup penelitian terhadap 6 model visual bahasa konteks panjang, termasuk Qwen3-VL dan Gemma3, dengan tugas seperti pencarian teks, pencarian gambar, pencarian teks render, dan pencarian gambar yang sama, serta menguji panjang konteks 8K, 16K, 32K, 64K, dan 128K.
Analisis juga menemukan bahwa pencarian teks dan gambar berbagi sebagian kepala perhatian, tetapi panjang konteks dan bentuk bukti yang berbeda akan memanggil kepala perhatian yang berbeda.
Apakah kepala perhatian ini benar-benar memengaruhi jawaban model?
Fokus pada bukti hanya menunjukkan adanya korelasi antara keduanya. Untuk menguji apakah model benar-benar bergantung pada kepala-kepala ini, tim peneliti memblokir kepala pencarian dengan skor tinggi, lalu membandingkannya dengan hasil dari memblokir jumlah kepala perhatian acak yang sama.
Dalam tugas pencarian teks dan gambar, kinerja model menurun signifikan setelah kepala pencarian di屏蔽; dampak dari屏蔽 acak jauh lebih kecil.
Perbedaan yang sama juga muncul dalam pertanyaan dan jawaban dokumen panjang yang lebih realistis:
- MMLongBench-Doc: 48,2→5,7
- SlideVQA: 71,2→8,9
Setelah penyamaran acak, kedua tugas masih masing-masing mempertahankan skor 32,2 dan 52,6. Penurunan yang disebabkan oleh penyamaran kepala pencarian jauh lebih besar, menunjukkan bahwa kepala-kepala ini tidak hanya fokus pada bukti di sekitarnya, tetapi juga memiliki peran kausal dalam akses model terhadap bukti.
Hasil serupa juga dapat diamati dalam tugas inferensi multimodal. Setelah kepala pencarian dinonaktifkan, model terkadang menjawab "informasi tidak cukup" meskipun grafik masih ada dalam input, atau membaca konten yang salah serta menghasilkan dasar yang tidak ada.

△
Dari mekanisme internal hingga pencarian dokumen
Tim peneliti lebih lanjut menggunakan sinyal bukti dari kepala perhatian ini untuk pencarian dokumen multimodal.
Diberikan sebuah pertanyaan, MMRetHeads akan menghitung skor relevansi untuk halaman atau area tata letak kandidat, lalu mengurutkan kandidat berdasarkan skor tersebut. Pencarian tingkat halaman mencari halaman utuh yang berisi bukti, sedangkan pencarian tingkat tata letak lebih lanjut menentukan blok teks, tabel, gambar, atau grafik di dalam halaman. Seluruh proses ini tidak memerlukan pelatihan tambahan pada pencari.
Di MMDocIR, Recall@1 tingkat halaman untuk Qwen3-VL-8B mencapai 64,7, meningkat 7,7 poin persentase dibandingkan baseline terbaik yang dilaporkan; Recall@1 tingkat tata letak mencapai 39,0, meningkat 6,3 poin persentase dibandingkan baseline terbaik yang dilaporkan.

△
Tautan makalah: https://arxiv.org/abs/2605.27243
Artikel ini berasal dari akun WeChat "Quantum Bit", penulis: tim MMRetHeads
