ऑफिस AI और दस्तावेज़ एजेंट्स के विकास के साथ, बड़े मॉडल अब फाइनेंशियल रिपोर्ट्स, अनुबंध, अनुसंधान रिपोर्ट्स जैसी लंबी टेक्स्ट और इमेज सामग्री को सीधे प्रोसेस करने लगे हैं।
लेकिन पूरा दस्तावेज प्राप्त करने की क्षमता का अर्थ है कि आप उसमें दी गई जानकारी का सही ढंग से उपयोग कर सकते हैं।
सैकड़ों पृष्ठों के पाठ, चित्र, तालिकाओं और चार्ट के सामने, मॉडल को पहले यह जवाब देना होगा: वर्तमान प्रश्न के संबंध में वास्तविक साक्ष्य कहाँ हैं?
EMNLP 2026 के स्वीकृत पेपर "Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models" इस प्रक्रिया का मॉडल के अंदर से अध्ययन करता है।

"समायोजित करने योग्य" से "खोजने योग्य"
लंबे संदर्भ वाले दृश्य-भाषा मॉडल एक साथ कई पाठ और चित्रों को स्वीकार कर सकते हैं, लेकिन अंतिम उत्तर अक्सर केवल उनमें से बहुत कम जानकारी पर निर्भर करता है। संबंधित साक्ष्य एक पाठ हो सकता है, या यह तालिका, चित्र या किसी लेआउट क्षेत्र में छिपा हो सकता है।
अनुसंधान टीम द्वारा ध्यान दिया जा रहा प्रश्न यह है: जब साक्ष्य पहले से ही इनपुट में मौजूद हो, तो क्या मॉडल के अंदर एक सेट एटेंशन हेड्स मौजूद होते हैं जो प्रश्न को संबंधित पाठ या दृश्य सामग्री की ओर इशारा करते हैं?
टीम ने इन ध्यान शीर्षों को बहुआयामी खोज शीर्ष (MMRetHeads) के रूप में नामित किया।
मल्टीमॉडल रिट्रीवल हेड की पहचान कैसे करें?
QRHead के प्रेरणा से, अनुसंधान टीम ने MMRetHeads डिटेक्शन विधि प्रस्तावित की।
विशेष रूप से, यह विधि प्रत्येक ध्यान शीर्ष के प्रश्न-से-साक्ष्य ध्यान का विश्लेषण करती है, जो प्रश्न टोकन से चिह्नित साक्ष्य क्षेत्र की ओर ध्यान को दर्शाता है। यदि साक्ष्य पाठ है, तो यह पाठ टोकन से मेल खाता है; यदि साक्ष्य चित्र में स्थित है, तो यह दृश्य टोकन से मेल खाता है। साक्ष्य की ओर अधिक ध्यान होने पर, उस ध्यान शीर्ष का खोज स्कोर अधिक होता है।

△
अध्ययन में Qwen3-VL, Gemma3 जैसे 6 लंबे संदर्भ विजुअल भाषा मॉडल शामिल हैं, जिनमें टेक्स्ट रिट्रीवल, इमेज रिट्रीवल, रेंडर्ड टेक्स्ट रिट्रीवल और समान इमेज रिट्रीवल जैसे कार्य शामिल हैं, और 8K, 16K, 32K, 64K और 128K संदर्भ लंबाई का परीक्षण किया गया है।
विश्लेषण ने यह भी पाया कि टेक्स्ट और इमेज रिट्रीवल एक हिस्से के ध्यान शीर्ष को साझा करते हैं, लेकिन विभिन्न संदर्भ लंबाई और साक्ष्य प्रारूप अलग-अलग ध्यान शीर्ष को सक्रिय करते हैं।
Do these attention heads really affect the model's responses?
ध्यान को साक्ष्य की ओर इशारा करना केवल दोनों के बीच संबंध को दर्शाता है। मॉडल की जांच करने के लिए कि वह वास्तव में इन हेड्स पर निर्भर करता है, अनुसंधान टीम ने उच्च स्कोर वाले रिट्रीवल हेड्स को ब्लॉक किया और फिर उसी संख्या में यादृच्छिक ध्यान हेड्स को ब्लॉक करने के परिणामों की तुलना की।
टेक्स्ट और इमेज रिट्रीवल कार्यों में, रिट्रीवल हेड को ब्लॉक करने के बाद, मॉडल का प्रदर्शन विभिन्न संदर्भ लंबाइयों और साक्ष्य स्थितियों में काफी कम हो जाता है; जबकि रैंडम ब्लॉकिंग का प्रभाव काफी कम होता है।
इसी तरह का अंतर अधिक वास्तविक लंबे दस्तावेज़ प्रश्न-उत्तर में भी दिखाई देता है:
- MMLongBench-Doc: 48.2→5.7
- SlideVQA: 71.2→8.9
रैंडम मास्किंग के बाद, दोनों कार्यों के स्कोर क्रमशः 32.2 और 52.6 बने रहे। रिट्रीवल हेड्स को मास्क करने से हुए गिरावट काफी अधिक थी, जिससे स्पष्ट होता है कि ये हेड्स केवल साक्ष्य के पास ध्यान केंद्रित नहीं करते, बल्कि मॉडल के साक्ष्य तक पहुंचने पर कारणात्मक प्रभाव डालते हैं।
बहुमोडल निष्कर्ष लेने के कार्यों में भी समान परिणाम देखे गए। जब खोज हेड को ब्लॉक कर दिया जाता है, तो मॉडल कभी-कभी इनपुट में ग्राफ़ मौजूद होने के बावजूद "जानकारी अपर्याप्त" का उत्तर दे सकता है, या फिर गलत सामग्री पढ़ सकता है या अस्तित्वहीन आधार बना सकता है।

△
आंतरिक तंत्र से दस्तावेज़ खोज तक
अनुसंधान टीम ने इन ध्यान शीर्षों में साक्ष्य संकेतों का उपयोग बहुआयामी दस्तावेज़ खोज के लिए आगे बढ़ाया।
दिए गए प्रश्न के लिए, MMRetHeads उम्मीदवार पृष्ठों या लेआउट क्षेत्रों के लिए संबंधितता स्कोर की गणना करता है और इसके आधार पर उम्मीदवारों को क्रमबद्ध करता है। पृष्ठ स्तरीय खोज उन पूर्ण पृष्ठों को ढूंढती है जिनमें साक्ष्य होता है, जबकि लेआउट स्तरीय खोज पृष्ठ के भीतर टेक्स्ट ब्लॉक, टेबल, चित्र या ग्राफ़ को और अधिक सटीकता से स्थानित करती है। पूरी प्रक्रिया में खोजकर्ता के लिए अतिरिक्त प्रशिक्षण की आवश्यकता नहीं होती।
MMDocIR पर, Qwen3-VL-8B का पेज-लेवल Recall@1 64.7 है, जो सबसे मजबूत रिपोर्ट किए गए बेसलाइन से 7.7 प्रतिशत अधिक है; लेआउट-लेवल Recall@1 39.0 है, जो सबसे मजबूत रिपोर्ट किए गए बेसलाइन से 6.3 प्रतिशत अधिक है।

△
कागजात का लिंक: https://arxiv.org/abs/2605.27243
यह लेख वेचेन ग्रुप "क्वांटम बिट" से आया है, लेखक: MMRetHeads टीम
