Các đầu truy xuất đa mô态 đã được xác định trong các mô hình thị giác-ngôn ngữ ngữ cảnh dài

icon MarsBit
Chia sẻ
AI summary iconTóm tắt
Một bài báo EMNLP 2026 mới có tựa đề "Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models" tiết lộ cách các mô hình sử dụng phân tích trên chuỗi để tìm kiếm bằng chứng liên quan trong các tài liệu dài. Nghiên cứu xác định các "multimodal retrieval heads" (MMRetHeads) giúp mô hình tập trung vào nội dung văn bản hoặc hình ảnh cụ thể. Các đầu này đã được kiểm tra trên sáu mô hình, bao gồm Qwen3-VL và Gemma3, với sự suy giảm hiệu suất được quan sát khi bị vô hiệu hóa, xác nhận vai trò của chúng trong việc truy xuất bằng chứng. Dữ liệu trên chuỗi đã được sử dụng để xác thực các phát hiện.

Với sự phát triển của Office AI và các tác giả tài liệu, các mô hình lớn bắt đầu xử lý trực tiếp các tài liệu dài như báo cáo tài chính, hợp đồng và báo cáo nghiên cứu.

Nhưng việc có thể nhận toàn bộ tài liệu không đồng nghĩa với việc có thể sử dụng đúng thông tin trong đó.

Trước hàng trăm trang văn bản, hình ảnh, bảng và biểu đồ, câu hỏi đầu tiên mà mô hình cần trả lời là: bằng chứng thực sự liên quan đến câu hỏi hiện tại nằm ở đâu?

Bài báo mới được chấp nhận tại EMNLP 2026, “Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models”, đã nghiên cứu quá trình này từ bên trong mô hình.

Mô hình thị giác - ngôn ngữ với ngữ cảnh dài

Từ “đựng được” đến “tìm thấy”

Các mô hình ngôn ngữ thị giác với ngữ cảnh dài có thể đồng thời tiếp nhận lượng lớn văn bản và hình ảnh, nhưng câu trả lời cuối cùng thường chỉ dựa vào một phần rất nhỏ thông tin. Bằng chứng liên quan có thể là một đoạn văn bản, hoặc ẩn trong bảng, hình ảnh hoặc một khu vực bố cục nào đó.

Vấn đề mà nhóm nghiên cứu quan tâm là: khi bằng chứng đã xuất hiện trong đầu vào, liệu có tồn tại một nhóm đầu chú ý bên trong mô hình chịu trách nhiệm định hướng câu hỏi đến nội dung văn bản hoặc hình ảnh liên quan?

Đội ngũ gọi những đầu chú ý được xác định này là các đầu truy vấn đa mô态 (MMRetHeads).

Làm thế nào để nhận diện đầu tìm kiếm đa mô hình?

Được truyền cảm hứng bởi QRHead, nhóm nghiên cứu đã đề xuất phương pháp phát hiện MMRetHeads.

Cụ thể, phương pháp này phân tích sự chú ý từ câu hỏi đến bằng chứng của mỗi đầu chú ý, tức là sự chú ý từ các token câu hỏi đến các vùng bằng chứng được ghi chú. Nếu bằng chứng là văn bản, nó tương ứng với các token văn bản; nếu bằng chứng nằm trong hình ảnh, nó tương ứng với các token thị giác. Sự chú ý hướng đến bằng chứng càng mạnh, điểm tìm kiếm của đầu chú ý đó càng cao.

Mô hình thị giác - ngôn ngữ với ngữ cảnh dài

Nghiên cứu bao phủ 6 mô hình ngôn ngữ thị giác có ngữ cảnh dài, bao gồm Qwen3-VL và Gemma3, với các nhiệm vụ như tìm kiếm văn bản, tìm kiếm hình ảnh, tìm kiếm văn bản được tạo ra và tìm kiếm hình ảnh giống nhau, đồng thời kiểm tra độ dài ngữ cảnh 8K, 16K, 32K, 64K và 128K.

Phân tích cũng cho thấy việc truy xuất văn bản và hình ảnh sẽ chia sẻ một phần các đầu chú ý, nhưng các độ dài ngữ cảnh và dạng bằng chứng khác nhau sẽ kích hoạt các đầu chú ý khác nhau.

Do những đầu chú ý này thực sự ảnh hưởng đến câu trả lời của mô hình không?

Việc chú ý đến bằng chứng chỉ cho thấy sự liên quan giữa hai yếu tố. Để kiểm tra xem mô hình có thực sự phụ thuộc vào các đầu này hay không, nhóm nghiên cứu đã che các đầu truy vấn có điểm cao, sau đó so sánh với kết quả khi che cùng số lượng đầu chú ý ngẫu nhiên.

Trong các nhiệm vụ tìm kiếm văn bản và hình ảnh, sau khi che đầu tìm kiếm, hiệu suất của mô hình giảm đáng kể ở các độ dài ngữ cảnh và vị trí bằng chứng khác nhau; tác động do che ngẫu nhiên gây ra thì nhỏ hơn nhiều.

Sự khác biệt tương tự cũng xuất hiện trong các câu hỏi và trả lời tài liệu dài thực tế hơn:

  • MMLongBench-Doc: 48,2→5,7
  • SlideVQA: 71,2→8,9

Sau khi che ngẫu nhiên, hai nhiệm vụ vẫn lần lượt giữ được 32,2 và 52,6 điểm. Sự sụt giảm do che đầu truy vấn rõ ràng lớn hơn, cho thấy những đầu này không chỉ tập trung sự chú ý vào bằng chứng gần đó, mà còn có tác nhân nhân quả đối với khả năng truy cập bằng chứng của mô hình.

Các kết quả tương tự cũng được quan sát thấy trong các nhiệm vụ suy luận đa mô态. Sau khi đầu truy vấn bị che, mô hình đôi khi trả lời “thông tin không đủ” ngay cả khi biểu đồ vẫn còn trong đầu vào, hoặc đọc sai nội dung và tạo ra các cơ sở không tồn tại.

Mô hình thị giác - ngôn ngữ với ngữ cảnh dài

Từ cơ chế nội bộ đến truy xuất tài liệu

Nhóm nghiên cứu tiếp tục sử dụng các tín hiệu chứng cứ từ các đầu chú ý này để truy vấn tài liệu đa phương tiện.

Với một câu hỏi được đưa ra, MMRetHeads sẽ tính toán điểm liên quan cho các trang hoặc khu vực bố cục ứng cử, sau đó sắp xếp các ứng cử viên dựa trên điểm số này. Việc tìm kiếm ở cấp độ trang nhằm tìm các trang đầy đủ chứa bằng chứng, trong khi tìm kiếm ở cấp độ bố cục sẽ xác định chính xác hơn các khối văn bản, bảng, hình ảnh hoặc biểu đồ trên trang. Toàn bộ quy trình không yêu cầu huấn luyện thêm bộ tìm kiếm.

Trên MMDocIR, Recall@1 ở cấp độ trang của Qwen3-VL-8B đạt 64,7, tăng 7,7 điểm phần trăm so với cơ sở tham chiếu mạnh nhất đã được báo cáo; Recall@1 ở cấp độ bố cục đạt 39,0, tăng 6,3 điểm phần trăm so với cơ sở tham chiếu mạnh nhất đã được báo cáo.

Mô hình thị giác - ngôn ngữ với ngữ cảnh dài

Liên kết bài báo: https://arxiv.org/abs/2605.27243

Bài viết này đến từ tài khoản chính thức WeChat "Quantum Bit", tác giả: Đội ngũ MMRetHeads

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.