Odaily Planet Daily tin: Kimi công bố mở nguồn bộ tiêu chuẩn đánh giá khả năng nhận thức thị giác của mô hình đa phương thức lớn PerceptionBench, nhằm tách biệt khả năng nhận thức thị giác thành 10 năng lực nguyên tử để đánh giá độc lập, bao gồm các khía cạnh như mối quan hệ thị giác, đếm, thuộc tính, độ sâu và 3D, định vị, so sánh, nhận dạng tinh vi, tích hợp ngữ cảnh, OCR và nhận diện ảo giác. Bộ tiêu chuẩn này được xây dựng dựa trên các trường hợp mô hình thất bại từ 42 bộ đánh giá hiện có, bao gồm 3.000 câu hỏi đã được xác minh bởi con người, mỗi câu chỉ kiểm tra một năng lực thị giác duy nhất, không yêu cầu suy luận hay kiến thức bên ngoài.
Kết quả đánh giá cho thấy, trong số 16 mô hình đa mô hình tiên tiến nhất, không có mô hình nào đạt độ chính xác tổng thể vượt quá 60%. GPT-5.6-Sol dẫn đầu với độ chính xác 59,7%, tiếp theo là Kimi K3 (58,5%), Claude-Fable-5 (57,2%), Gemini-3.1-Pro (56,2%) và GPT-5.5 (55,8%). Báo cáo chỉ ra rằng ảo giác thị giác (Hallucination) vẫn là khả năng yếu nhất của các mô hình, và khả năng nhận thức tổng thể vẫn còn nhiều tiềm năng cải thiện đáng kể.
