Odaily Planet Daily melaporkan bahwa Kimi mengumumkan rilis terbuka benchmark evaluasi multimodal besar PerceptionBench, yang bertujuan untuk memecah kemampuan persepsi visual menjadi 10 kemampuan atomik yang dievaluasi secara independen, mencakup dimensi seperti hubungan visual, penghitungan, atribut, kedalaman dan 3D, lokalisasi, perbandingan, pengenalan halus, integrasi konteks, OCR, serta identifikasi ilusi. Benchmark ini dibangun berdasarkan kasus kegagalan model dari 42 kumpulan evaluasi yang ada, mencakup 3.000 pertanyaan yang telah diverifikasi secara manual, di mana setiap soal hanya menguji satu kemampuan visual saja, tanpa memerlukan penalaran atau pengetahuan eksternal.
Hasil evaluasi menunjukkan bahwa dari 16 model multimodal canggih, tidak ada satupun yang mencapai akurasi keseluruhan di atas 60%. GPT-5.6-Sol memimpin dengan akurasi 59,7%, diikuti oleh Kimi K3 (58,5%), Claude-Fable-5 (57,2%), Gemini-3.1-Pro (56,2%), dan GPT-5.5 (55,8%) di lima besar. Laporan tersebut menunjukkan bahwa ilusi visual (Hallucination) tetap menjadi kemampuan terlemah pada semua model, dengan potensi peningkatan signifikan dalam kemampuan persepsi secara keseluruhan.
