دفتری AI اور دستاویزاتی ایجینٹس کے ترقی کے ساتھ، بڑے ماڈلز اب فنانشل رپورٹس، معاہدے، اور تحقیقی رپورٹس جیسی لمبی تصویری اور متن کی مواد کو ب без تبدیلی سے پروسیس کر رہے ہیں۔
لیکن ایک مکمل دستاویز حاصل کرنا، اس کی معلومات کا صحیح طریقے سے استعمال کرنا نہیں ہے۔
سینکڑوں صفحات کے متن، تصاویر، ٹیبلز اور گرافس کے سامنے، ماڈل کو پہلے یہ جواب دینا ہوگا کہ موجودہ سوال کے لیے حقیقی طور پر متعلقہ ثبوت کہاں ہیں؟
EMNLP 2026 میں قبول کی گئی نئی تحقیقی تحریر "کیا ریٹریول ہیڈز تصویریں دیکھ سکتے ہیں؟ لمبے سیاق و سباق ویژن-زبانی ماڈلز میں متعدد ماڈل ریٹریول ہیڈز"، اس عمل کا ماڈل کے اندر سے جائزہ لیتی ہے۔

"جس میں جگہ ہو" سے "جسے تلاش کیا جا سکے"
طویل متنی سیاق و سباق والے بصری زبانی ماڈلز ایک ساتھ بہت سارے متن اور تصاویر کو قبول کر سکتے ہیں، لیکن آخری جواب عام طور پر صرف ان میں سے بہت کم معلومات پر منحصر ہوتا ہے۔ متعلقہ ثبوت ایک متن کے طور پر ہو سکتا ہے، یا ٹیبل، تصویر یا کسی لے آؤٹ علاقے میں چھپا ہوا ہو سکتا ہے۔
تحقیقی ٹیم کا توجہ کا مرکز یہ ہے کہ جب ثبوت پہلے سے ہی ان پٹ میں موجود ہو، تو ماڈل کے اندر کیا ایک مجموعہ توجہ کے سر ہوتے ہیں جو سوال کو متعلقہ متن یا ویژول مواد کی طرف اشارہ کرتے ہیں؟
ٹیم نے ان اہمیت والے سراغوں کو متعدد ماڈل ریٹریول سراغ (MMRetHeads) کہا۔
-multimodal retrieval head کیسے پہچانیں؟
QRHead کی حوصلہ افزائی کے ساتھ، تحقیقی ٹیم نے MMRetHeads ڈیٹیکشن طریقہ پیش کیا۔
خود کو، یہ طریقہ ہر توجہ ہیڈ کے سوال سے ثبوت تک کی توجہ کا تجزیہ کرتا ہے، یعنی سوال ٹوکن جو نشان زدہ ثبوت کے علاقوں کی طرف اشارہ کرتے ہیں۔ اگر ثبوت متن ہے، تو یہ متن کے ٹوکن کے مطابق ہوتا ہے؛ اگر ثبوت تصویر میں ہے، تو یہ ویژول ٹوکن کے مطابق ہوتا ہے۔ جتنا زیادہ توجہ ثبوت کی طرف ہوگی، اتنا ہی زیادہ اس توجہ ہیڈ کا ریٹریول اسکور ہوگا۔

△
مطالعہ میں Qwen3-VL، Gemma3 سمیت 6 لمبے سیکھنے والے ویژوئل لینگویج ماڈلز کو شامل کیا گیا ہے، جن میں ٹیکسٹ ریٹریول، ایمیج ریٹریول، رینڈرڈ ٹیکسٹ ریٹریول اور ایک جیسی تصویروں کا ریٹریول جیسے کام شامل ہیں، اور 8K، 16K، 32K، 64K اور 128K سیکھنے کے طویل ماحول کا ٹیسٹ کیا گیا۔
تجزیہ سے یہ بھی پتہ چلا کہ متن اور تصویر کی تلاش کے درمیان کچھ توجہ کے سر ہوتے ہیں، لیکن مختلف سیاق و سباق کی لمبائی اور شواہد کی شکلیں مختلف توجہ کے سر استعمال کرتی ہیں۔
کیا یہ توجہ کے سر واقعی ماڈل کے جوابات کو متاثر کرتے ہیں؟
توجه کو شواہد کی طرف مبذول کیا جاتا ہے، جو صرف دونوں کے درمیان تعلق کو ظاہر کرتا ہے۔ ماڈل کی جانچ کے لیے کہ وہ حقیقت میں ان ہیڈز پر انحصار کرتا ہے یا نہیں، تحقیقی ٹیم نے اعلی اسکور والے ریٹریول ہیڈز کو بلاک کر دیا اور اس کے بعد انہیں اتنے ہی تصادفی توجہ ہیڈز کو بلاک کرنے کے نتائج کے ساتھ موازنہ کیا۔
ٹیکسٹ اور تصویر ریٹریول کے کاموں میں، ریٹریول ہیڈ کو شفٹ کرنے کے بعد، ماڈل مختلف سیاق و سباق کی لمبائیوں اور شواہد کے مقامات پر نمایاں طور پر کمزور ہو جاتا ہے؛ جبکہ تصادفی شفٹنگ کا اثر کافی کم ہوتا ہے۔
یہی فرق لمبے دستاویزات کے سوال وجواب میں بھی ظاہر ہوتا ہے:
- MMLongBench-Doc: 48.2→5.7
- SlideVQA: 71.2→8.9
تصادفی شیلڈنگ کے بعد، دونوں کاموں کے اسکورز کریب 32.2 اور 52.6 رہ گئے۔ ریٹریول ہیڈز کو شیلڈ کرنے سے ہونے والی کمی زیادہ واضح ہے، جس سے ثابت ہوتا ہے کہ یہ ہیڈز صرف شواہد کے قریب توجہ مرکوز نہیں کرتے، بلکہ ماڈل کو شواہد تک رسائی دینے میں بھی سببی کردار ادا کرتے ہیں۔
بہت سے متعدد ماڈل ریزننگ ٹاسکس میں بھی اسی قسم کے نتائج نظر آتے ہیں۔ جب ریٹریول ہیڈ کو بند کر دیا جاتا ہے، تو ماڈل کبھی کبھی یہ جواب دے دیتا ہے کہ "معلومات نہیں ہے"، جبکہ گراف اب بھی ان پٹ میں موجود ہوتا ہے، یا پھر غلط معلومات پڑھ لیتا ہے یا غیر موجودہ حوالہ جات تخلیق کر دیتا ہے۔

△
اندرونی مکینیزم سے لے کر دستاویزات کی تلاش تک
تحقیقی ٹیم نے اس کے بعد اس توجہ کے سراغوں کو متعدد ماڈل دستاویزات کی تلاش کے لیے استعمال کیا۔
دیے گئے سوال کے لیے، MMRetHeads مرکزی صفحات یا لے آؤٹ علاقوں کے لیے متعلقہ اسکورز کا حساب لگاتا ہے اور اس کے بنیاد پر امیدواروں کو ترتیب دیتا ہے۔ صفحہ سطح کی تلاش وہ صفحات تلاش کرتی ہے جن میں ثبوت موجود ہو، جبکہ لے آؤٹ سطح کی تلاش صفحے کے اندر متن کے بلاکس، جدول، تصاویر یا گرافس کو مزید درست طریقے سے定位 کرتی ہے۔ پوری پروسیجر میں تلاش کنندہ کو مزید تربیت کی ضرورت نہیں ہوتی۔
MMDocIR پر، Qwen3-VL-8B کا صفحہ سطحی Recall@1 64.7 ہے، جو سب سے طاقتور رپورٹ کیے گئے بنیادی نقطہ سے 7.7 فیصد زیادہ ہے؛ لے آؤٹ سطحی Recall@1 39.0 ہے، جو سب سے طاقتور رپورٹ کیے گئے بنیادی نقطہ سے 6.3 فیصد زیادہ ہے۔

△
کاغذ کا لنک: https://arxiv.org/abs/2605.27243
یہ مضمون ویچن گروپ "Quantum Bit" سے ہے، مصنف: MMRetHeads ٹیم
