দীর্ঘ-সংদর্ভ দৃশ্য-ভাষা মডেলগুলিতে মাল্টিমোডাল রিট্রিভাল হেডস শনাক্ত করা হয়েছে

icon MarsBit
শেয়ার
AI summary iconসারাংশ
'Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models' শিরোনামে একটি নতুন EMNLP 2026 পেপার প্রকাশিত হয়েছে, যা মডেলগুলির দীর্ঘ দলিলে প্রাসঙ্গিক প্রমাণ খুঁজে বার করতে চেইন-ভিত্তিক বিশ্লেষণ ব্যবহারের পদ্ধতি উন্মোচন করে। এই অধ্যয়নটি 'মাল্টিমোডাল রিট্রিভাল হেডস' (MMRetHeads) চিহ্নিত করেছে, যা মডেলগুলিকে নির্দিষ্ট টেক্সট বা ভিজুয়াল কন্টেন্টের দিকে মনোনিবেশ করতে সাহায্য করে। Qwen3-VL এবং Gemma3 সহ ছয়টি মডেলের উপর এই হেডগুলির পরীক্ষা চালানো হয়েছিল, এবং বন্ধ করে দিলে পারফরম্যান্সের পতন লক্ষ্য করা হয়েছিল, যা এগুলির প্রমাণ-পুনরুদ্ধারের ভূমিকা নিশ্চিত করে। ফলাফলগুলির যাচাইয়ের জন্য চেইন-ভিত্তিক ডেটা ব্যবহার করা হয়েছিল।

অফিস এআই এবং ডকুমেন্ট এজেন্টের উন্নয়নের সাথে সাথে, বড় মডেলগুলি এখন বার্ষিক প্রতিবেদন, চুক্তি, গবেষণা প্রতিবেদন ইত্যাদি দীর্ঘ টেক্সট এবং ইমেজ মেটিরিয়ালগুলি সরাসরি প্রক্রিয়াকরণ করছে।

একটি পুরো ডকুমেন্ট গ্রহণ করা যায়, কিন্তু সেই তথ্যগুলি সঠিকভাবে ব্যবহার করা যায় না।

শত শত পৃষ্ঠার পাঠ্য, চিত্র, টেবিল এবং গ্রাফের মধ্যে, মডেলের প্রথমেই উত্তর দিতে হবে: বর্তমান প্রশ্নের সাথে প্রকৃতপক্ষে সম্পর্কিত প্রমাণগুলি কোথায়?

EMNLP 2026-এ গৃহীত নতুন পেপার “Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models” মডেলের অভ্যন্তরে এই প্রক্রিয়াটি অধ্যয়ন করে।

দীর্ঘ প্রেক্ষাপট ভিজুয়াল ভাষ্য মডেল

"যেটা জায়গা পায়" থেকে "যেটা খুঁজে পাওয়া যায়"

দীর্ঘ প্রসঙ্গ ভিজুয়াল-ল্যাঙ্গুয়েজ মডেলগুলি একসাথে বহু টেক্সট এবং ছবি গ্রহণ করতে পারে, কিন্তু চূড়ান্ত উত্তরটি সাধারণত শুধুমাত্র সেই অত্যন্ত সীমিত তথ্যের উপর নির্ভর করে। সংশ্লিষ্ট প্রমাণগুলি একটি টেক্সট সেগমেন্ট হতে পারে, অথবা এটি টেবিল, ছবি বা কোনো লেআউট অঞ্চলের মধ্যে লুকিয়ে থাকতে পারে।

গবেষণা দলের মনোযোগ দেওয়া হচ্ছে: যখন প্রমাণ ইনপুটে প্রকাশিত হয়, তখন মডেলের ভিতরে কি কোনো সেট অ্যাটেনশন হেড রয়েছে যা প্রশ্নকে সংশ্লিষ্ট টেক্সট বা ভিজুয়াল কনটেন্টের দিকে নির্দেশ করে?

টিম এই ধরনের ধ্যান মাথাগুলিকে মাল্টিমোডাল রিট্রিভাল হেড (MMRetHeads) নামে চিহ্নিত করেছে।

মাল্টিমোডাল রিট্রিভাল হেড কীভাবে শনাক্ত করবেন?

QRHead-এর অনুপ্রেরণায়, গবেষণা দল MMRetHeads ডিটেকশন পদ্ধতি প্রস্তাব করেছে।

বিশেষভাবে, এই পদ্ধতিটি প্রতিটি মনোযোগ হেডের প্রশ্ন-থেকে-প্রমাণ মনোযোগ বিশ্লেষণ করে, অর্থাৎ প্রশ্ন টোকেনগুলি যে প্রমাণ অঞ্চলগুলির দিকে মনোযোগ দেয়। যদি প্রমাণটি পাঠ্য হয়, তবে এটি পাঠ্য টোকেনগুলির সাথে সম্পর্কিত; যদি প্রমাণটি ছবিতে থাকে, তবে এটি ভিজুয়াল টোকেনগুলির সাথে সম্পর্কিত। প্রমাণের দিকে যত বেশি মনোযোগ, সেই মনোযোগ হেডের রিট্রিভাল স্কোর তত বেশি।

দীর্ঘ প্রেক্ষাপট ভিজুয়াল ভাষ্য মডেল

Qwen3-VL, Gemma3 সহ 6টি দীর্ঘ কনটেক্সট ভিজুয়াল-ল্যাঙ্গুয়েজ মডেলকে কভার করা হয়েছে, যার মধ্যে টেক্সট রিট্রিভাল, ইমেজ রিট্রিভাল, রেন্ডারড টেক্সট রিট্রিভাল এবং সমান ইমেজ রিট্রিভালের মতো টাস্ক অন্তর্ভুক্ত রয়েছে, এবং 8K, 16K, 32K, 64K এবং 128K কনটেক্সট লেংথ পরীক্ষা করা হয়েছে।

বিশ্লেষণটি আরও প্রকাশ করে যে টেক্সট এবং ইমেজ রিট্রিভাল কিছু অনুসন্ধান হেড শেয়ার করে, তবে বিভিন্ন কনটেক্সট দৈর্ঘ্য এবং প্রমাণ ফর্ম্যাট বিভিন্ন অনুসন্ধান হেডকে কল করে।

এই মনোযোগ হেডগুলি কি আসলে মডেলের উত্তরকে প্রভাবিত করে?

সাক্ষ্যের দিকে মনোযোগ দেওয়া শুধুমাত্র দুটির মধ্যে সম্পর্ক থাকার কথা বোঝায়। মডেলটি সত্যিই এই হেডগুলির উপর নির্ভর করে কিনা তা পরীক্ষা করতে, গবেষক দলটি উচ্চ স্কোরযুক্ত রিট্রিভাল হেডগুলি বন্ধ করে দেয় এবং একই সংখ্যক র‍্যান্ডম অ্যাটেনশন হেড বন্ধ করার ফলাফলের সাথে তুলনা করে।

টেক্সট এবং ইমেজ রিট্রিভাল টাস্কে, রিট্রিভাল হেড ব্লক করার পর, মডেলটি বিভিন্ন কনটেক্সট দৈর্ঘ্য এবং প্রমাণের অবস্থানের ক্ষেত্রে উল্লেখযোগ্যভাবে দুর্বল হয়ে পড়ে; র‍্যান্ডম ব্লকিংয়ের প্রভাব তুলনামূলকভাবে অনেক কম।

একই পার্থক্যটি আরও বাস্তবিক দীর্ঘ দলিল প্রশ্ন-উত্তরেও দেখা যায়:

  • MMLongBench-Doc: 48.2→5.7
  • স্লাইডভিকিউএএ: 71.2→8.9

র্যান্ডম শাম্পিংয়ের পরে, দুটি কাজ যথাক্রমে 32.2 এবং 52.6 পায়। রিট্রিভাল হেড শাম্পিংয়ের কারণে পড়ে যাওয়া পরিষ্কারভাবে বেশি, যা নির্দেশ করে যে এই হেডগুলি শুধুমাত্র প্রমাণের কাছাকাছি মনোযোগ দেয় না, বরং মডেলের প্রমাণের প্রবেশাধিকারের জন্যও কারণগত ভূমিকা পালন করে।

মাল্টিমোডাল যুক্তিগত কাজগুলিতেও এই ধরনের ফলাফল পর্যবেক্ষণ করা যায়। রিট্রিভাল হেড বন্ধ করে দেওয়ার পরে, মডেলটি কখনও কখনও ইনপুটে গ্রাফ থাকা সত্ত্বেও "অপর্যাপ্ত তথ্য" উত্তর দেয়, বা ভুল তথ্য পড়ে বা অস্তিত্বহীন যুক্তি তৈরি করে।

দীর্ঘ প্রেক্ষাপট ভিজুয়াল ভাষ্য মডেল

অভ্যন্তরীণ কার্যপ্রণালী থেকে ডকুমেন্ট রিট্রিভাল

গবেষণা দল এই মনোযোগ হেডগুলিতে প্রমাণ সংকেতগুলি বহুমাধ্যম দলিল অনুসন্ধানের জন্য আরও ব্যবহার করেছে।

একটি প্রশ্ন প্রদান করে, MMRetHeads প্রার্থী পৃষ্ঠা বা লেআউট অঞ্চলের জন্য সংশ্লিষ্টতা স্কোর গণনা করে এবং প্রার্থীদের এই স্কোর অনুযায়ী সাজায়। পৃষ্ঠা-স্তরের অনুসন্ধান প্রমাণ সহ পুরো পৃষ্ঠা খুঁজে বের করে, যখন লেআউট-স্তরের অনুসন্ধান পৃষ্ঠার মধ্যে টেক্সট ব্লক, টেবিল, চিত্র বা গ্রাফগুলির অবস্থান আরও নির্দিষ্টভাবে চিহ্নিত করে। এই প্রক্রিয়ায় অতিরিক্তভাবে অনুসন্ধানকারীকে প্রশিক্ষণের প্রয়োজন হয় না।

MMDocIR-এ, Qwen3-VL-8B-এর পেজ-লেভেল Recall@1 হল 64.7, যা সর্বোচ্চ প্রতিবেদিত বেসলাইনের তুলনায় 7.7 পার্সেন্টপয়েন্ট বেশি; লেআউট-লেভেল Recall@1 হল 39.0, যা সর্বোচ্চ প্রতিবেদিত বেসলাইনের তুলনায় 6.3 পার্সেন্টপয়েন্ট বেশি।

দীর্ঘ প্রেক্ষাপট ভিজুয়াল ভাষ্য মডেল

পেপার লিঙ্ক: https://arxiv.org/abs/2605.27243

এই লেখাটি ওয়েইচ্যাট গিটহাব প্রোগ্রাম "Quantum Bit" থেকে এসেছে, লেখক: MMRetHeads টিম

দাবিত্যাগ: এই পৃষ্ঠার তথ্য তৃতীয় পক্ষের কাছ থেকে প্রাপ্ত হতে পারে এবং অগত্যা KuCoin এর মতামত বা মতামত প্রতিফলিত করে না। এই বিষয়বস্তু শুধুমাত্র সাধারণ তথ্যগত উদ্দেশ্যে প্রদান করা হয়, কোন ধরনের প্রতিনিধিত্ব বা ওয়ারেন্টি ছাড়াই, বা এটিকে আর্থিক বা বিনিয়োগ পরামর্শ হিসাবে বোঝানো হবে না। KuCoin কোনো ত্রুটি বা বাদ পড়ার জন্য বা এই তথ্য ব্যবহারের ফলে যে কোনো ফলাফলের জন্য দায়ী থাকবে না। ডিজিটাল সম্পদে বিনিয়োগ ঝুঁকিপূর্ণ হতে পারে। আপনার নিজের আর্থিক পরিস্থিতির উপর ভিত্তি করে একটি পণ্যের ঝুঁকি এবং আপনার ঝুঁকি সহনশীলতা সাবধানে মূল্যায়ন করুন। আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের ব্যবহারের শর্তাবলী এবং ঝুঁকি প্রকাশ পড়ুন।