Odaily Planet Daily melaporkan bahawa Kimi telah mengumumkan pelancaran PerceptionBench, satu penilaian terbuka untuk model bahasa besar multimodal, yang bertujuan untuk memecahkan kemampuan persepsi visual menjadi 10 kemampuan atomik yang dinilai secara berasingan, merangkumi dimensi seperti hubungan visual, pengiraan, atribut, kedalaman dan 3D, penentuan lokasi, perbandingan, pengenalan halus, integrasi konteks, OCR, dan pengenalan ilusi. Penilaian ini dibina berdasarkan kes gagal model daripada 42 set penilaian sedia ada, dan mengandungi 3,000 soalan yang telah disahkan secara manual, dengan setiap soalan hanya menguji satu kemampuan visual sahaja, tanpa memerlukan penaakulan atau pengetahuan luar.
Hasil penilaian menunjukkan bahawa daripada 16 model multimodal canggih, tiada model yang mencapai ketepatan keseluruhan melebihi 60%. GPT-5.6-Sol menduduki tempat pertama dengan ketepatan 59.7%, diikuti oleh Kimi K3 (58.5%), Claude-Fable-5 (57.2%), Gemini-3.1-Pro (56.2%), dan GPT-5.5 (55.8%) dalam lima besar. Laporan tersebut menunjukkan bahawa halusinasi visual (Hallucination) masih merupakan kelemahan paling ketara bagi semua model, dengan kapasiti persepsi keseluruhan masih mempunyai ruang peningkatan yang signifikan.
