Với sự phát triển của Office AI và các tác giả tài liệu, các mô hình lớn bắt đầu xử lý trực tiếp các tài liệu dài như báo cáo tài chính, hợp đồng và báo cáo nghiên cứu.
Nhưng việc có thể nhận toàn bộ tài liệu không đồng nghĩa với việc có thể sử dụng đúng thông tin trong đó.
Trước hàng trăm trang văn bản, hình ảnh, bảng và biểu đồ, câu hỏi đầu tiên mà mô hình cần trả lời là: bằng chứng thực sự liên quan đến câu hỏi hiện tại nằm ở đâu?
Bài báo mới được chấp nhận tại EMNLP 2026, “Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models”, đã nghiên cứu quá trình này từ bên trong mô hình.

Từ “đựng được” đến “tìm thấy”
Các mô hình ngôn ngữ thị giác với ngữ cảnh dài có thể đồng thời tiếp nhận lượng lớn văn bản và hình ảnh, nhưng câu trả lời cuối cùng thường chỉ dựa vào một phần rất nhỏ thông tin. Bằng chứng liên quan có thể là một đoạn văn bản, hoặc ẩn trong bảng, hình ảnh hoặc một khu vực bố cục nào đó.
Vấn đề mà nhóm nghiên cứu quan tâm là: khi bằng chứng đã xuất hiện trong đầu vào, liệu có tồn tại một nhóm đầu chú ý bên trong mô hình chịu trách nhiệm định hướng câu hỏi đến nội dung văn bản hoặc hình ảnh liên quan?
Đội ngũ gọi những đầu chú ý được xác định này là các đầu truy vấn đa mô态 (MMRetHeads).
Làm thế nào để nhận diện đầu tìm kiếm đa mô hình?
Được truyền cảm hứng bởi QRHead, nhóm nghiên cứu đã đề xuất phương pháp phát hiện MMRetHeads.
Cụ thể, phương pháp này phân tích sự chú ý từ câu hỏi đến bằng chứng của mỗi đầu chú ý, tức là sự chú ý từ các token câu hỏi đến các vùng bằng chứng được ghi chú. Nếu bằng chứng là văn bản, nó tương ứng với các token văn bản; nếu bằng chứng nằm trong hình ảnh, nó tương ứng với các token thị giác. Sự chú ý hướng đến bằng chứng càng mạnh, điểm tìm kiếm của đầu chú ý đó càng cao.

△
Nghiên cứu bao phủ 6 mô hình ngôn ngữ thị giác có ngữ cảnh dài, bao gồm Qwen3-VL và Gemma3, với các nhiệm vụ như tìm kiếm văn bản, tìm kiếm hình ảnh, tìm kiếm văn bản được tạo ra và tìm kiếm hình ảnh giống nhau, đồng thời kiểm tra độ dài ngữ cảnh 8K, 16K, 32K, 64K và 128K.
Phân tích cũng cho thấy việc truy xuất văn bản và hình ảnh sẽ chia sẻ một phần các đầu chú ý, nhưng các độ dài ngữ cảnh và dạng bằng chứng khác nhau sẽ kích hoạt các đầu chú ý khác nhau.
Do những đầu chú ý này thực sự ảnh hưởng đến câu trả lời của mô hình không?
Việc chú ý đến bằng chứng chỉ cho thấy sự liên quan giữa hai yếu tố. Để kiểm tra xem mô hình có thực sự phụ thuộc vào các đầu này hay không, nhóm nghiên cứu đã che các đầu truy vấn có điểm cao, sau đó so sánh với kết quả khi che cùng số lượng đầu chú ý ngẫu nhiên.
Trong các nhiệm vụ tìm kiếm văn bản và hình ảnh, sau khi che đầu tìm kiếm, hiệu suất của mô hình giảm đáng kể ở các độ dài ngữ cảnh và vị trí bằng chứng khác nhau; tác động do che ngẫu nhiên gây ra thì nhỏ hơn nhiều.
Sự khác biệt tương tự cũng xuất hiện trong các câu hỏi và trả lời tài liệu dài thực tế hơn:
- MMLongBench-Doc: 48,2→5,7
- SlideVQA: 71,2→8,9
Sau khi che ngẫu nhiên, hai nhiệm vụ vẫn lần lượt giữ được 32,2 và 52,6 điểm. Sự sụt giảm do che đầu truy vấn rõ ràng lớn hơn, cho thấy những đầu này không chỉ tập trung sự chú ý vào bằng chứng gần đó, mà còn có tác nhân nhân quả đối với khả năng truy cập bằng chứng của mô hình.
Các kết quả tương tự cũng được quan sát thấy trong các nhiệm vụ suy luận đa mô态. Sau khi đầu truy vấn bị che, mô hình đôi khi trả lời “thông tin không đủ” ngay cả khi biểu đồ vẫn còn trong đầu vào, hoặc đọc sai nội dung và tạo ra các cơ sở không tồn tại.

△
Từ cơ chế nội bộ đến truy xuất tài liệu
Nhóm nghiên cứu tiếp tục sử dụng các tín hiệu chứng cứ từ các đầu chú ý này để truy vấn tài liệu đa phương tiện.
Với một câu hỏi được đưa ra, MMRetHeads sẽ tính toán điểm liên quan cho các trang hoặc khu vực bố cục ứng cử, sau đó sắp xếp các ứng cử viên dựa trên điểm số này. Việc tìm kiếm ở cấp độ trang nhằm tìm các trang đầy đủ chứa bằng chứng, trong khi tìm kiếm ở cấp độ bố cục sẽ xác định chính xác hơn các khối văn bản, bảng, hình ảnh hoặc biểu đồ trên trang. Toàn bộ quy trình không yêu cầu huấn luyện thêm bộ tìm kiếm.
Trên MMDocIR, Recall@1 ở cấp độ trang của Qwen3-VL-8B đạt 64,7, tăng 7,7 điểm phần trăm so với cơ sở tham chiếu mạnh nhất đã được báo cáo; Recall@1 ở cấp độ bố cục đạt 39,0, tăng 6,3 điểm phần trăm so với cơ sở tham chiếu mạnh nhất đã được báo cáo.

△
Liên kết bài báo: https://arxiv.org/abs/2605.27243
Bài viết này đến từ tài khoản chính thức WeChat "Quantum Bit", tác giả: Đội ngũ MMRetHeads
