طویل سیاق میں ویژن-زبانی ماڈلز میں متعدد ماڈل ریٹریول ہیڈز کی شناخت

icon MarsBit
بانٹیں
AI summary iconخلاصہ
ایک نئی EMNLP 2026 کی تحریر جس کا عنوان 'کیا ریٹریول ہیڈز تصویریں دیکھ سکتے ہیں؟ لمبے سیاق و سباق ویژن-زبانی ماڈلز میں ملٹی مودل ریٹریول ہیڈز' ہے، یہ ظاہر کرتی ہے کہ ماڈلز لمبے دستاویزات میں متعلقہ شواہد کو تلاش کرنے کے لیے آن-چین تجزیہ کا استعمال کرتے ہیں۔ اس مطالعہ نے 'ملٹی مودل ریٹریول ہیڈز' (MMRetHeads) کو شناخت کیا ہے جو ماڈلز کو خاص متن یا بصری مواد پر توجہ مرکوز کرنے میں مدد کرتے ہیں۔ ان ہیڈز کا آزمائش چھ ماڈلز، جن میں Qwen3-VL اور Gemma3 شامل ہیں، پر کیا گیا، اور ان کو بند کرنے پر پرفارمنس میں کمی دیکھی گئی، جس سے ان کے شواہد تلاش کرنے کے کردار کی تصدیق ہوتی ہے۔ آن-چین ڈیٹا کا استعمال نتائج کی تصدیق کے لیے کیا گیا۔

دفتری AI اور دستاویزاتی ایجینٹس کے ترقی کے ساتھ، بڑے ماڈلز اب فنانشل رپورٹس، معاہدے، اور تحقیقی رپورٹس جیسی لمبی تصویری اور متن کی مواد کو ب без تبدیلی سے پروسیس کر رہے ہیں۔

لیکن ایک مکمل دستاویز حاصل کرنا، اس کی معلومات کا صحیح طریقے سے استعمال کرنا نہیں ہے۔

سینکڑوں صفحات کے متن، تصاویر، ٹیبلز اور گرافس کے سامنے، ماڈل کو پہلے یہ جواب دینا ہوگا کہ موجودہ سوال کے لیے حقیقی طور پر متعلقہ ثبوت کہاں ہیں؟

EMNLP 2026 میں قبول کی گئی نئی تحقیقی تحریر "کیا ریٹریول ہیڈز تصویریں دیکھ سکتے ہیں؟ لمبے سیاق و سباق ویژن-زبانی ماڈلز میں متعدد ماڈل ریٹریول ہیڈز"، اس عمل کا ماڈل کے اندر سے جائزہ لیتی ہے۔

طویل سیاق و سباق والی بصری زبانی ماڈل

"جس میں جگہ ہو" سے "جسے تلاش کیا جا سکے"

طویل متنی سیاق و سباق والے بصری زبانی ماڈلز ایک ساتھ بہت سارے متن اور تصاویر کو قبول کر سکتے ہیں، لیکن آخری جواب عام طور پر صرف ان میں سے بہت کم معلومات پر منحصر ہوتا ہے۔ متعلقہ ثبوت ایک متن کے طور پر ہو سکتا ہے، یا ٹیبل، تصویر یا کسی لے آؤٹ علاقے میں چھپا ہوا ہو سکتا ہے۔

تحقیقی ٹیم کا توجہ کا مرکز یہ ہے کہ جب ثبوت پہلے سے ہی ان پٹ میں موجود ہو، تو ماڈل کے اندر کیا ایک مجموعہ توجہ کے سر ہوتے ہیں جو سوال کو متعلقہ متن یا ویژول مواد کی طرف اشارہ کرتے ہیں؟

ٹیم نے ان اہمیت والے سراغوں کو متعدد ماڈل ریٹریول سراغ (MMRetHeads) کہا۔

-multimodal retrieval head کیسے پہچانیں؟

QRHead کی حوصلہ افزائی کے ساتھ، تحقیقی ٹیم نے MMRetHeads ڈیٹیکشن طریقہ پیش کیا۔

خود کو، یہ طریقہ ہر توجہ ہیڈ کے سوال سے ثبوت تک کی توجہ کا تجزیہ کرتا ہے، یعنی سوال ٹوکن جو نشان زدہ ثبوت کے علاقوں کی طرف اشارہ کرتے ہیں۔ اگر ثبوت متن ہے، تو یہ متن کے ٹوکن کے مطابق ہوتا ہے؛ اگر ثبوت تصویر میں ہے، تو یہ ویژول ٹوکن کے مطابق ہوتا ہے۔ جتنا زیادہ توجہ ثبوت کی طرف ہوگی، اتنا ہی زیادہ اس توجہ ہیڈ کا ریٹریول اسکور ہوگا۔

طویل سیاق و سباق والی بصری زبانی ماڈل

مطالعہ میں Qwen3-VL، Gemma3 سمیت 6 لمبے سیکھنے والے ویژوئل لینگویج ماڈلز کو شامل کیا گیا ہے، جن میں ٹیکسٹ ریٹریول، ایمیج ریٹریول، رینڈرڈ ٹیکسٹ ریٹریول اور ایک جیسی تصویروں کا ریٹریول جیسے کام شامل ہیں، اور 8K، 16K، 32K، 64K اور 128K سیکھنے کے طویل ماحول کا ٹیسٹ کیا گیا۔

تجزیہ سے یہ بھی پتہ چلا کہ متن اور تصویر کی تلاش کے درمیان کچھ توجہ کے سر ہوتے ہیں، لیکن مختلف سیاق و سباق کی لمبائی اور شواہد کی شکلیں مختلف توجہ کے سر استعمال کرتی ہیں۔

کیا یہ توجہ کے سر واقعی ماڈل کے جوابات کو متاثر کرتے ہیں؟

توجه کو شواہد کی طرف مبذول کیا جاتا ہے، جو صرف دونوں کے درمیان تعلق کو ظاہر کرتا ہے۔ ماڈل کی جانچ کے لیے کہ وہ حقیقت میں ان ہیڈز پر انحصار کرتا ہے یا نہیں، تحقیقی ٹیم نے اعلی اسکور والے ریٹریول ہیڈز کو بلاک کر دیا اور اس کے بعد انہیں اتنے ہی تصادفی توجہ ہیڈز کو بلاک کرنے کے نتائج کے ساتھ موازنہ کیا۔

ٹیکسٹ اور تصویر ریٹریول کے کاموں میں، ریٹریول ہیڈ کو شفٹ کرنے کے بعد، ماڈل مختلف سیاق و سباق کی لمبائیوں اور شواہد کے مقامات پر نمایاں طور پر کمزور ہو جاتا ہے؛ جبکہ تصادفی شفٹنگ کا اثر کافی کم ہوتا ہے۔

یہی فرق لمبے دستاویزات کے سوال وجواب میں بھی ظاہر ہوتا ہے:

  • MMLongBench-Doc: 48.2→5.7
  • SlideVQA: 71.2→8.9

تصادفی شیلڈنگ کے بعد، دونوں کاموں کے اسکورز کریب 32.2 اور 52.6 رہ گئے۔ ریٹریول ہیڈز کو شیلڈ کرنے سے ہونے والی کمی زیادہ واضح ہے، جس سے ثابت ہوتا ہے کہ یہ ہیڈز صرف شواہد کے قریب توجہ مرکوز نہیں کرتے، بلکہ ماڈل کو شواہد تک رسائی دینے میں بھی سببی کردار ادا کرتے ہیں۔

بہت سے متعدد ماڈل ریزننگ ٹاسکس میں بھی اسی قسم کے نتائج نظر آتے ہیں۔ جب ریٹریول ہیڈ کو بند کر دیا جاتا ہے، تو ماڈل کبھی کبھی یہ جواب دے دیتا ہے کہ "معلومات نہیں ہے"، جبکہ گراف اب بھی ان پٹ میں موجود ہوتا ہے، یا پھر غلط معلومات پڑھ لیتا ہے یا غیر موجودہ حوالہ جات تخلیق کر دیتا ہے۔

طویل سیاق و سباق والی بصری زبانی ماڈل

اندرونی مکینیزم سے لے کر دستاویزات کی تلاش تک

تحقیقی ٹیم نے اس کے بعد اس توجہ کے سراغوں کو متعدد ماڈل دستاویزات کی تلاش کے لیے استعمال کیا۔

دیے گئے سوال کے لیے، MMRetHeads مرکزی صفحات یا لے آؤٹ علاقوں کے لیے متعلقہ اسکورز کا حساب لگاتا ہے اور اس کے بنیاد پر امیدواروں کو ترتیب دیتا ہے۔ صفحہ سطح کی تلاش وہ صفحات تلاش کرتی ہے جن میں ثبوت موجود ہو، جبکہ لے آؤٹ سطح کی تلاش صفحے کے اندر متن کے بلاکس، جدول، تصاویر یا گرافس کو مزید درست طریقے سے定位 کرتی ہے۔ پوری پروسیجر میں تلاش کنندہ کو مزید تربیت کی ضرورت نہیں ہوتی۔

MMDocIR پر، Qwen3-VL-8B کا صفحہ سطحی Recall@1 64.7 ہے، جو سب سے طاقتور رپورٹ کیے گئے بنیادی نقطہ سے 7.7 فیصد زیادہ ہے؛ لے آؤٹ سطحی Recall@1 39.0 ہے، جو سب سے طاقتور رپورٹ کیے گئے بنیادی نقطہ سے 6.3 فیصد زیادہ ہے۔

طویل سیاق و سباق والی بصری زبانی ماڈل

کاغذ کا لنک: https://arxiv.org/abs/2605.27243

یہ مضمون ویچن گروپ "Quantum Bit" سے ہے، مصنف: MMRetHeads ٹیم

اعلان دستبرداری: اس صفحہ پر معلومات تیسرے فریق سے حاصل کی گئی ہوں گی اور یہ ضروری نہیں کہ KuCoin کے خیالات یا خیالات کی عکاسی کرے۔ یہ مواد کسی بھی قسم کی نمائندگی یا وارنٹی کے بغیر صرف عام معلوماتی مقاصد کے لیے فراہم کیا گیا ہے، اور نہ ہی اسے مالی یا سرمایہ کاری کے مشورے کے طور پر سمجھا جائے گا۔ KuCoin کسی غلطی یا کوتاہی کے لیے، یا اس معلومات کے استعمال کے نتیجے میں کسی بھی نتائج کے لیے ذمہ دار نہیں ہوگا۔ ڈیجیٹل اثاثوں میں سرمایہ کاری خطرناک ہو سکتی ہے۔ براہ کرم اپنے مالی حالات کی بنیاد پر کسی پروڈکٹ کے خطرات اور اپنے خطرے کی برداشت کا بغور جائزہ لیں۔ مزید معلومات کے لیے، براہ کرم ہماری استعمال کی شرائط اور خطرے کا انکشاف دیکھیں۔