مع تطور الذكاء الاصطناعي للمكتب والوكلاء المستندة إلى المستندات، بدأت النماذج الكبيرة في معالجة المواد الطويلة التي تحتوي على نصوص وصور مثل التقارير المالية والعقود وتقارير البحوث.
لكن القدرة على تلقي مستند كامل لا تعني القدرة على استخدام المعلومات فيه بشكل صحيح.
بمواجهة مئات الصفحات من النصوص والصور والجداول والرسوم البيانية، فإن السؤال الأول الذي يجب على النموذج الإجابة عنه هو: أين توجد الأدلة ذات الصلة الحقيقية بالسؤال الحالي؟
الورقة الجديدة المقبولة في EMNLP 2026 بعنوان "Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models" تدرس هذه العملية من داخل النموذج.

من "القدرة على التخزين" إلى "القدرة على العثور"
يمكن للنماذج البصرية-اللغوية ذات السياق الطويل استقبال كميات كبيرة من النصوص والصور في وقت واحد، لكن الإجابة النهائية تعتمد عادةً على جزء صغير جدًا من هذه المعلومات. قد يكون الدليل ذا صلة جزءًا من النص، أو مخفيًا في جدول أو صورة أو منطقة معينة من التصميم.
السؤال الذي تركز عليه فريق البحث هو: عندما تكون الأدلة موجودة بالفعل في المدخلات، هل هناك مجموعة من رؤوس الانتباه داخل النموذج مسؤولة عن توجيه السؤال نحو المحتوى النصي أو البصري ذي الصلة؟
يُسمّي الفريق هذه الرؤوس الانتباهية المُحدَّدة رؤوس الاسترجاع متعددة الوسائط (MMRetHeads).
كيفية التعرف على رأس الاسترجاع متعدد الوسائط؟
مستوحى من QRHead، اقترح فريق البحث أسلوب الكشف MMRetHeads.
بشكل محدد، تحلل هذه الطريقة انتباه السؤال إلى الأدلة لكل رأس انتباه، أي انتباه رموز السؤال نحو مناطق الأدلة المُعلَّمة. إذا كانت الأدلة نصية، فتتوافق مع رموز النص؛ وإذا كانت الأدلة موجودة في صورة، فتتوافق مع رموز بصرية. كلما كان الانتباه الموجه نحو الأدلة أقوى، زاد得分 الاسترجاعي لرأس الانتباه هذا.

△
تغطي الدراسة ستة نماذج بصرية-لغوية طويلة السياق، بما في ذلك Qwen3-VL وGemma3، وتشمل مهام مثل استرجاع النص، واسترجاع الصور، واسترجاع النص المُرسَم، واسترجاع الصور المتماثلة، مع اختبار أطوال سياق 8K و16K و32K و64K و128K.
كما كشف التحليل أن استرجاع النص والصورة يشتركان في جزء من رؤوس الانتباه، لكن أطوال السياق المختلفة وأشكال الأدلة تستخدم رؤوس انتباه مختلفة.
Do these attention heads really affect the model's responses?
التركيز على الأدلة يُظهر فقط وجود علاقة بين الاثنين. لاختبار ما إذا كان النموذج يعتمد حقًا على هذه الرؤوس، قام فريق البحث بحجب الرؤوس ذات الدرجات العالية، ثم قارن النتائج مع حجب نفس العدد من الرؤوس العشوائية.
في مهام استرجاع النص والصورة، ينخفض أداء النموذج بشكل ملحوظ عند إخفاء رأس الاسترجاع تحت أطوال سياقية مختلفة ومواقع أدلة مختلفة؛ بينما يكون التأثير الناتج عن الإخفاء العشوائي أقل بكثير.
يظهر نفس الفرق أيضًا في أسئلة وأجوبة المستندات الطويلة الأكثر واقعية:
- MMLongBench-Doc: 48.2→5.7
- SlideVQA: 71.2→8.9
بعد التعتيم العشوائي، حافظت المهمتان على درجات 32.2 و52.6 على التوالي. الانخفاض الناتج عن تعتيم رؤوس الاسترجاع كان أكبر بشكل ملحوظ، مما يشير إلى أن هذه الرؤوس لا تركز فقط على الأدلة القريبة، بل لها تأثير سببي على وصول النموذج إلى الأدلة.
يمكن ملاحظة نتائج مشابهة في مهام الاستدلال متعددة الوسائط. بعد إخفاء رأس الاسترجاع، قد تجيب النموذج أحيانًا بـ "المعلومات غير كافية" حتى عندما لا تزال الرسوم البيانية موجودة في المدخلات، أو قد تقرأ محتوى خاطئًا أو تولّد أسسًا غير موجودة.

△
من الآلية الداخلية إلى استرجاع المستندات
استخدم فريق البحث إشارات الانتباه هذه في استرجاع المستندات متعددة الوسائط.
بالنظر إلى سؤال معين، سيحسب MMRetHeads درجات الارتباط لصفحات أو مناطق تخطيط مرشحة، ثم يرتب الخيارات بناءً على هذه الدرجات. يبحث الاسترجاع على مستوى الصفحة عن صفحات كاملة تحتوي على الأدلة، بينما يحدد الاسترجاع على مستوى التخطيط بدقة كتل النص أو الجداول أو الصور أو المخططات داخل الصفحة. لا يتطلب هذا العملية تدريباً إضافياً للمرشح.
على MMDocIR، يصل Recall@1 على مستوى الصفحة لـ Qwen3-VL-8B إلى 64.7، بزيادة قدرها 7.7 نقطة مئوية مقارنة بأقوى أساسية مُبلغ عنها؛ ويصل Recall@1 على مستوى التخطيط إلى 39.0، بزيادة قدرها 6.3 نقطة مئوية مقارنة بأقوى أساسية مُبلغ عنها.

△
رابط الورقة البحثية: https://arxiv.org/abs/2605.27243
هذا المقال من حساب WeChat الرسمي "Quantum Bits"، الكاتب: فريق MMRetHeads
