অফিস এআই এবং ডকুমেন্ট এজেন্টের উন্নয়নের সাথে সাথে, বড় মডেলগুলি এখন বার্ষিক প্রতিবেদন, চুক্তি, গবেষণা প্রতিবেদন ইত্যাদি দীর্ঘ টেক্সট এবং ইমেজ মেটিরিয়ালগুলি সরাসরি প্রক্রিয়াকরণ করছে।
একটি পুরো ডকুমেন্ট গ্রহণ করা যায়, কিন্তু সেই তথ্যগুলি সঠিকভাবে ব্যবহার করা যায় না।
শত শত পৃষ্ঠার পাঠ্য, চিত্র, টেবিল এবং গ্রাফের মধ্যে, মডেলের প্রথমেই উত্তর দিতে হবে: বর্তমান প্রশ্নের সাথে প্রকৃতপক্ষে সম্পর্কিত প্রমাণগুলি কোথায়?
EMNLP 2026-এ গৃহীত নতুন পেপার “Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models” মডেলের অভ্যন্তরে এই প্রক্রিয়াটি অধ্যয়ন করে।

"যেটা জায়গা পায়" থেকে "যেটা খুঁজে পাওয়া যায়"
দীর্ঘ প্রসঙ্গ ভিজুয়াল-ল্যাঙ্গুয়েজ মডেলগুলি একসাথে বহু টেক্সট এবং ছবি গ্রহণ করতে পারে, কিন্তু চূড়ান্ত উত্তরটি সাধারণত শুধুমাত্র সেই অত্যন্ত সীমিত তথ্যের উপর নির্ভর করে। সংশ্লিষ্ট প্রমাণগুলি একটি টেক্সট সেগমেন্ট হতে পারে, অথবা এটি টেবিল, ছবি বা কোনো লেআউট অঞ্চলের মধ্যে লুকিয়ে থাকতে পারে।
গবেষণা দলের মনোযোগ দেওয়া হচ্ছে: যখন প্রমাণ ইনপুটে প্রকাশিত হয়, তখন মডেলের ভিতরে কি কোনো সেট অ্যাটেনশন হেড রয়েছে যা প্রশ্নকে সংশ্লিষ্ট টেক্সট বা ভিজুয়াল কনটেন্টের দিকে নির্দেশ করে?
টিম এই ধরনের ধ্যান মাথাগুলিকে মাল্টিমোডাল রিট্রিভাল হেড (MMRetHeads) নামে চিহ্নিত করেছে।
মাল্টিমোডাল রিট্রিভাল হেড কীভাবে শনাক্ত করবেন?
QRHead-এর অনুপ্রেরণায়, গবেষণা দল MMRetHeads ডিটেকশন পদ্ধতি প্রস্তাব করেছে।
বিশেষভাবে, এই পদ্ধতিটি প্রতিটি মনোযোগ হেডের প্রশ্ন-থেকে-প্রমাণ মনোযোগ বিশ্লেষণ করে, অর্থাৎ প্রশ্ন টোকেনগুলি যে প্রমাণ অঞ্চলগুলির দিকে মনোযোগ দেয়। যদি প্রমাণটি পাঠ্য হয়, তবে এটি পাঠ্য টোকেনগুলির সাথে সম্পর্কিত; যদি প্রমাণটি ছবিতে থাকে, তবে এটি ভিজুয়াল টোকেনগুলির সাথে সম্পর্কিত। প্রমাণের দিকে যত বেশি মনোযোগ, সেই মনোযোগ হেডের রিট্রিভাল স্কোর তত বেশি।

△
Qwen3-VL, Gemma3 সহ 6টি দীর্ঘ কনটেক্সট ভিজুয়াল-ল্যাঙ্গুয়েজ মডেলকে কভার করা হয়েছে, যার মধ্যে টেক্সট রিট্রিভাল, ইমেজ রিট্রিভাল, রেন্ডারড টেক্সট রিট্রিভাল এবং সমান ইমেজ রিট্রিভালের মতো টাস্ক অন্তর্ভুক্ত রয়েছে, এবং 8K, 16K, 32K, 64K এবং 128K কনটেক্সট লেংথ পরীক্ষা করা হয়েছে।
বিশ্লেষণটি আরও প্রকাশ করে যে টেক্সট এবং ইমেজ রিট্রিভাল কিছু অনুসন্ধান হেড শেয়ার করে, তবে বিভিন্ন কনটেক্সট দৈর্ঘ্য এবং প্রমাণ ফর্ম্যাট বিভিন্ন অনুসন্ধান হেডকে কল করে।
এই মনোযোগ হেডগুলি কি আসলে মডেলের উত্তরকে প্রভাবিত করে?
সাক্ষ্যের দিকে মনোযোগ দেওয়া শুধুমাত্র দুটির মধ্যে সম্পর্ক থাকার কথা বোঝায়। মডেলটি সত্যিই এই হেডগুলির উপর নির্ভর করে কিনা তা পরীক্ষা করতে, গবেষক দলটি উচ্চ স্কোরযুক্ত রিট্রিভাল হেডগুলি বন্ধ করে দেয় এবং একই সংখ্যক র্যান্ডম অ্যাটেনশন হেড বন্ধ করার ফলাফলের সাথে তুলনা করে।
টেক্সট এবং ইমেজ রিট্রিভাল টাস্কে, রিট্রিভাল হেড ব্লক করার পর, মডেলটি বিভিন্ন কনটেক্সট দৈর্ঘ্য এবং প্রমাণের অবস্থানের ক্ষেত্রে উল্লেখযোগ্যভাবে দুর্বল হয়ে পড়ে; র্যান্ডম ব্লকিংয়ের প্রভাব তুলনামূলকভাবে অনেক কম।
একই পার্থক্যটি আরও বাস্তবিক দীর্ঘ দলিল প্রশ্ন-উত্তরেও দেখা যায়:
- MMLongBench-Doc: 48.2→5.7
- স্লাইডভিকিউএএ: 71.2→8.9
র্যান্ডম শাম্পিংয়ের পরে, দুটি কাজ যথাক্রমে 32.2 এবং 52.6 পায়। রিট্রিভাল হেড শাম্পিংয়ের কারণে পড়ে যাওয়া পরিষ্কারভাবে বেশি, যা নির্দেশ করে যে এই হেডগুলি শুধুমাত্র প্রমাণের কাছাকাছি মনোযোগ দেয় না, বরং মডেলের প্রমাণের প্রবেশাধিকারের জন্যও কারণগত ভূমিকা পালন করে।
মাল্টিমোডাল যুক্তিগত কাজগুলিতেও এই ধরনের ফলাফল পর্যবেক্ষণ করা যায়। রিট্রিভাল হেড বন্ধ করে দেওয়ার পরে, মডেলটি কখনও কখনও ইনপুটে গ্রাফ থাকা সত্ত্বেও "অপর্যাপ্ত তথ্য" উত্তর দেয়, বা ভুল তথ্য পড়ে বা অস্তিত্বহীন যুক্তি তৈরি করে।

△
অভ্যন্তরীণ কার্যপ্রণালী থেকে ডকুমেন্ট রিট্রিভাল
গবেষণা দল এই মনোযোগ হেডগুলিতে প্রমাণ সংকেতগুলি বহুমাধ্যম দলিল অনুসন্ধানের জন্য আরও ব্যবহার করেছে।
একটি প্রশ্ন প্রদান করে, MMRetHeads প্রার্থী পৃষ্ঠা বা লেআউট অঞ্চলের জন্য সংশ্লিষ্টতা স্কোর গণনা করে এবং প্রার্থীদের এই স্কোর অনুযায়ী সাজায়। পৃষ্ঠা-স্তরের অনুসন্ধান প্রমাণ সহ পুরো পৃষ্ঠা খুঁজে বের করে, যখন লেআউট-স্তরের অনুসন্ধান পৃষ্ঠার মধ্যে টেক্সট ব্লক, টেবিল, চিত্র বা গ্রাফগুলির অবস্থান আরও নির্দিষ্টভাবে চিহ্নিত করে। এই প্রক্রিয়ায় অতিরিক্তভাবে অনুসন্ধানকারীকে প্রশিক্ষণের প্রয়োজন হয় না।
MMDocIR-এ, Qwen3-VL-8B-এর পেজ-লেভেল Recall@1 হল 64.7, যা সর্বোচ্চ প্রতিবেদিত বেসলাইনের তুলনায় 7.7 পার্সেন্টপয়েন্ট বেশি; লেআউট-লেভেল Recall@1 হল 39.0, যা সর্বোচ্চ প্রতিবেদিত বেসলাইনের তুলনায় 6.3 পার্সেন্টপয়েন্ট বেশি।

△
পেপার লিঙ্ক: https://arxiv.org/abs/2605.27243
এই লেখাটি ওয়েইচ্যাট গিটহাব প্রোগ্রাম "Quantum Bit" থেকে এসেছে, লেখক: MMRetHeads টিম
