लंबे संदर्भ दृश्य-भाषा मॉडल में बहुआयामी रिट्रीवल हेड्स पहचाने गए

icon MarsBit
साझा करें
AI summary iconसारांश
EMNLP 2026 का एक नया पेपर, जिसका शीर्षक 'क्या रिट्रीवल हेड्स इमेजेस देख सकते हैं? लॉन्ग-कॉन्टेक्स्ट विज़ुअल-लैंग्वेज मॉडल्स में मल्टीमॉडल रिट्रीवल हेड्स' है, यह दर्शाता है कि मॉडल कैसे ऑन-चेन विश्लेषण का उपयोग करके लंबे दस्तावेज़ों में प्रासंगिक साक्ष्य का पता लगाते हैं। अध्ययन में 'मल्टीमॉडल रिट्रीवल हेड्स' (MMRetHeads) की पहचान की गई है, जो मॉडल्स को विशिष्ट पाठ या दृश्य सामग्री पर ध्यान केंद्रित करने में मदद करते हैं। इन हेड्स का परीक्षण Qwen3-VL और Gemma3 सहित छह मॉडल्स पर किया गया, और जब इन्हें अक्षम किया गया, तो प्रदर्शन में कमी देखी गई, जिससे उनकी साक्ष्य पुनः प्राप्ति में भूमिका की पुष्टि हुई। ऑन-चेन डेटा का उपयोग निष्कर्षों की पुष्टि के लिए किया गया।

ऑफिस AI और दस्तावेज़ एजेंट्स के विकास के साथ, बड़े मॉडल अब फाइनेंशियल रिपोर्ट्स, अनुबंध, अनुसंधान रिपोर्ट्स जैसी लंबी टेक्स्ट और इमेज सामग्री को सीधे प्रोसेस करने लगे हैं।

लेकिन पूरा दस्तावेज प्राप्त करने की क्षमता का अर्थ है कि आप उसमें दी गई जानकारी का सही ढंग से उपयोग कर सकते हैं।

सैकड़ों पृष्ठों के पाठ, चित्र, तालिकाओं और चार्ट के सामने, मॉडल को पहले यह जवाब देना होगा: वर्तमान प्रश्न के संबंध में वास्तविक साक्ष्य कहाँ हैं?

EMNLP 2026 के स्वीकृत पेपर "Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models" इस प्रक्रिया का मॉडल के अंदर से अध्ययन करता है।

लंबे संदर्भ विजुअल भाषा मॉडल

"समायोजित करने योग्य" से "खोजने योग्य"

लंबे संदर्भ वाले दृश्य-भाषा मॉडल एक साथ कई पाठ और चित्रों को स्वीकार कर सकते हैं, लेकिन अंतिम उत्तर अक्सर केवल उनमें से बहुत कम जानकारी पर निर्भर करता है। संबंधित साक्ष्य एक पाठ हो सकता है, या यह तालिका, चित्र या किसी लेआउट क्षेत्र में छिपा हो सकता है।

अनुसंधान टीम द्वारा ध्यान दिया जा रहा प्रश्न यह है: जब साक्ष्य पहले से ही इनपुट में मौजूद हो, तो क्या मॉडल के अंदर एक सेट एटेंशन हेड्स मौजूद होते हैं जो प्रश्न को संबंधित पाठ या दृश्य सामग्री की ओर इशारा करते हैं?

टीम ने इन ध्यान शीर्षों को बहुआयामी खोज शीर्ष (MMRetHeads) के रूप में नामित किया।

मल्टीमॉडल रिट्रीवल हेड की पहचान कैसे करें?

QRHead के प्रेरणा से, अनुसंधान टीम ने MMRetHeads डिटेक्शन विधि प्रस्तावित की।

विशेष रूप से, यह विधि प्रत्येक ध्यान शीर्ष के प्रश्न-से-साक्ष्य ध्यान का विश्लेषण करती है, जो प्रश्न टोकन से चिह्नित साक्ष्य क्षेत्र की ओर ध्यान को दर्शाता है। यदि साक्ष्य पाठ है, तो यह पाठ टोकन से मेल खाता है; यदि साक्ष्य चित्र में स्थित है, तो यह दृश्य टोकन से मेल खाता है। साक्ष्य की ओर अधिक ध्यान होने पर, उस ध्यान शीर्ष का खोज स्कोर अधिक होता है।

लंबे संदर्भ विजुअल भाषा मॉडल

अध्ययन में Qwen3-VL, Gemma3 जैसे 6 लंबे संदर्भ विजुअल भाषा मॉडल शामिल हैं, जिनमें टेक्स्ट रिट्रीवल, इमेज रिट्रीवल, रेंडर्ड टेक्स्ट रिट्रीवल और समान इमेज रिट्रीवल जैसे कार्य शामिल हैं, और 8K, 16K, 32K, 64K और 128K संदर्भ लंबाई का परीक्षण किया गया है।

विश्लेषण ने यह भी पाया कि टेक्स्ट और इमेज रिट्रीवल एक हिस्से के ध्यान शीर्ष को साझा करते हैं, लेकिन विभिन्न संदर्भ लंबाई और साक्ष्य प्रारूप अलग-अलग ध्यान शीर्ष को सक्रिय करते हैं।

Do these attention heads really affect the model's responses?

ध्यान को साक्ष्य की ओर इशारा करना केवल दोनों के बीच संबंध को दर्शाता है। मॉडल की जांच करने के लिए कि वह वास्तव में इन हेड्स पर निर्भर करता है, अनुसंधान टीम ने उच्च स्कोर वाले रिट्रीवल हेड्स को ब्लॉक किया और फिर उसी संख्या में यादृच्छिक ध्यान हेड्स को ब्लॉक करने के परिणामों की तुलना की।

टेक्स्ट और इमेज रिट्रीवल कार्यों में, रिट्रीवल हेड को ब्लॉक करने के बाद, मॉडल का प्रदर्शन विभिन्न संदर्भ लंबाइयों और साक्ष्य स्थितियों में काफी कम हो जाता है; जबकि रैंडम ब्लॉकिंग का प्रभाव काफी कम होता है।

इसी तरह का अंतर अधिक वास्तविक लंबे दस्तावेज़ प्रश्न-उत्तर में भी दिखाई देता है:

  • MMLongBench-Doc: 48.2→5.7
  • SlideVQA: 71.2→8.9

रैंडम मास्किंग के बाद, दोनों कार्यों के स्कोर क्रमशः 32.2 और 52.6 बने रहे। रिट्रीवल हेड्स को मास्क करने से हुए गिरावट काफी अधिक थी, जिससे स्पष्ट होता है कि ये हेड्स केवल साक्ष्य के पास ध्यान केंद्रित नहीं करते, बल्कि मॉडल के साक्ष्य तक पहुंचने पर कारणात्मक प्रभाव डालते हैं।

बहुमोडल निष्कर्ष लेने के कार्यों में भी समान परिणाम देखे गए। जब खोज हेड को ब्लॉक कर दिया जाता है, तो मॉडल कभी-कभी इनपुट में ग्राफ़ मौजूद होने के बावजूद "जानकारी अपर्याप्त" का उत्तर दे सकता है, या फिर गलत सामग्री पढ़ सकता है या अस्तित्वहीन आधार बना सकता है।

लंबे संदर्भ विजुअल भाषा मॉडल

आंतरिक तंत्र से दस्तावेज़ खोज तक

अनुसंधान टीम ने इन ध्यान शीर्षों में साक्ष्य संकेतों का उपयोग बहुआयामी दस्तावेज़ खोज के लिए आगे बढ़ाया।

दिए गए प्रश्न के लिए, MMRetHeads उम्मीदवार पृष्ठों या लेआउट क्षेत्रों के लिए संबंधितता स्कोर की गणना करता है और इसके आधार पर उम्मीदवारों को क्रमबद्ध करता है। पृष्ठ स्तरीय खोज उन पूर्ण पृष्ठों को ढूंढती है जिनमें साक्ष्य होता है, जबकि लेआउट स्तरीय खोज पृष्ठ के भीतर टेक्स्ट ब्लॉक, टेबल, चित्र या ग्राफ़ को और अधिक सटीकता से स्थानित करती है। पूरी प्रक्रिया में खोजकर्ता के लिए अतिरिक्त प्रशिक्षण की आवश्यकता नहीं होती।

MMDocIR पर, Qwen3-VL-8B का पेज-लेवल Recall@1 64.7 है, जो सबसे मजबूत रिपोर्ट किए गए बेसलाइन से 7.7 प्रतिशत अधिक है; लेआउट-लेवल Recall@1 39.0 है, जो सबसे मजबूत रिपोर्ट किए गए बेसलाइन से 6.3 प्रतिशत अधिक है।

लंबे संदर्भ विजुअल भाषा मॉडल

कागजात का लिंक: https://arxiv.org/abs/2605.27243

यह लेख वेचेन ग्रुप "क्वांटम बिट" से आया है, लेखक: MMRetHeads टीम

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।