Pengambilan Multimodal Berjaya Dikenal Pasti dalam Model Penglihatan-Bahasa Konteks Panjang

icon MarsBit
Kongsi
AI summary iconRingkasan
Kertas EMNLP 2026 baharu berjudul 'Bolehkah Kepala Pencarian Melihat Gambar? Kepala Pencarian Multimodal dalam Model Penglihatan-Bahasa Konteks Panjang' mengungkap bagaimana model menggunakan analisis atas rantai untuk mencari bukti yang relevan dalam dokumen panjang. Kajian ini mengenal pasti 'kepala pencarian multimodal' (MMRetHeads) yang membantu model memfokuskan perhatian pada teks atau kandungan visual tertentu. Kepala-kepala ini diuji merentas enam model, termasuk Qwen3-VL dan Gemma3, dengan penurunan prestasi diperhatikan apabila dimatikan, mengesahkan peranan mereka dalam pengambilan bukti. Data atas rantai digunakan untuk mengesahkan dapatan tersebut.

Dengan perkembangan Office AI dan agen dokumen, model besar kini mula memproses bahan panjang seperti laporan kewangan, kontrak, dan laporan penyelidikan secara langsung.

Namun, mampu menerima seluruh dokumen tidak bermakna mampu menggunakan maklumat di dalamnya dengan betul.

Menghadapi ratusan halaman teks, gambar, jadual, dan grafik, soalan pertama yang perlu dijawab oleh model ialah: di manakah bukti yang benar-benar berkaitan dengan soalan semasa?

Kertas kerja baharu yang diterima oleh EMNLP 2026, “Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models”, mengkaji proses ini dari dalam model.

Model visual bahasa konteks panjang

Dari "Bisa Muat" ke "Bisa Ditemukan"

Model bahasa visual konteks panjang boleh menerima sejumlah besar teks dan gambar secara serentak, tetapi jawapan akhir biasanya hanya bergantung pada sebahagian kecil maklumat sahaja. Bukti yang berkaitan mungkin berupa satu petikan teks, atau tersembunyi dalam jadual, gambar, atau kawasan layout tertentu.

Masalah yang menjadi perhatian pasukan penyelidikan ialah: apakah terdapat sekumpulan kepala perhatian di dalam model yang bertanggungjawab untuk mengarahkan soalan kepada kandungan teks atau visual yang relevan apabila bukti sudah muncul dalam input?

Pasukan tersebut menamakan kepala perhatian semacam ini sebagai Multi-modal Retrieval Heads (MMRetHeads).

Bagaimana untuk mengenal pasti kepala pencarian multimodal?

Digerakkan oleh QRHead, pasukan penyelidik mengusulkan kaedah pengesanan MMRetHeads.

Secara khusus, kaedah ini menganalisis perhatian question-to-evidence pada setiap head perhatian, iaitu perhatian yang diarahkan dari token soalan ke kawasan bukti yang ditandai. Jika bukti berupa teks, ia sepadan dengan token teks; jika bukti terletak dalam gambar, ia sepadan dengan token visual. Semakin kuat perhatian yang diarahkan ke bukti, semakin tinggi skor pencarian head perhatian tersebut.

Model visual bahasa konteks panjang

Mencakup penyelidikan terhadap 6 model visual bahasa konteks panjang seperti Qwen3-VL dan Gemma3, termasuk tugas pencarian teks, pencarian gambar, pencarian teks yang dirender, dan pencarian gambar yang sama, serta menguji panjang konteks 8K, 16K, 32K, 64K, dan 128K.

Analisis juga menemukan bahawa pencarian teks dan gambar akan berkongsi sebahagian kepala perhatian, tetapi panjang konteks dan bentuk bukti yang berbeza juga akan memanggil kepala perhatian yang berbeza.

Do these attention heads really affect the model's responses?

Perhatian terhadap bukti hanya menunjukkan adanya hubungan antara keduanya. Untuk menguji sama ada model benar-benar bergantung pada kepala-kepala ini, pasukan penyelidik menghalang kepala pencarian berpoin tinggi, kemudian membandingkannya dengan hasil menghalang jumlah kepala perhatian rawak yang sama.

Dalam tugas pencarian teks dan gambar, selepas menutup kepala pencarian, prestasi model menurun secara ketara di bawah panjang konteks dan kedudukan bukti yang berbeza; kesan penutupan rawak jauh lebih kecil.

Perbezaan yang sama juga muncul dalam soal jawab dokumen panjang yang lebih realistik:

  • MMLongBench-Doc: 48.2→5.7
  • SlideVQA: 71.2→8.9

Selepas penyekatan rawak, kedua-dua tugas masih masing-masing mengekalkan skor 32.2 dan 52.6. Penurunan yang disebabkan oleh penyekatan kepala pencarian jelas lebih besar, menunjukkan bahawa kepala-kepala ini bukan sahaja memfokuskan perhatian di sekitar bukti, tetapi juga mempunyai kesan sebab-akibat terhadap akses model kepada bukti.

Hasil serupa juga dapat diperhatikan dalam tugas penalaran multimodal. Selepas kepala pencarian ditutup, model kadang-kadang menjawab “maklumat tidak mencukupi” walaupun grafik masih wujud dalam input, atau membaca maklumat yang salah serta menghasilkan rujukan yang tidak wujud.

Model visual bahasa konteks panjang

Dari mekanisme dalaman hingga pencarian dokumen

Pasukan penyelidik seterusnya menggunakan isyarat bukti dalam kepala perhatian ini untuk pencarian dokumen multimodal.

Diberikan satu soalan, MMRetHeads akan mengira skor relevansi untuk halaman atau kawasan layout calon, kemudian mengurutkan calon-calon berdasarkan skor tersebut. Pencarian per halaman mencari halaman penuh yang mengandungi bukti, manakala pencarian per layout pula mengesan lebih lanjut blok teks, jadual, gambar, atau grafik di dalam halaman tersebut. Proses keseluruhan tidak memerlukan latihan tambahan pada pencari.

Di MMDocIR, Recall@1 per halaman untuk Qwen3-VL-8B mencapai 64.7, meningkat 7.7 peratus berbanding garis dasar terbaik yang dilaporkan; Recall@1 per tata letak mencapai 39.0, meningkat 6.3 peratus berbanding garis dasar terbaik yang dilaporkan.

Model visual bahasa konteks panjang

Pautan kertas: https://arxiv.org/abs/2605.27243

Artikel ini berasal daripada akaun微信公众号 "Quantum Bit", penulis: pasukan MMRetHeads

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.