Odaily星球日报a göre Kimi, görsel algı yeteneğini 10 atomik yeteneğe ayırarak bağımsız olarak değerlendirmeyi amaçlayan çok modlu büyük model görsel algı değerlendirme standartları PerceptionBench’i açık kaynak hale getirdi. Bu standart, görsel ilişkiler, sayma, özellikler, derinlik ve 3D, konumlandırma, karşılaştırma, ince tespit, bağlam entegrasyonu, OCR ve illüzyon tanıma gibi boyutları kapsıyor. Standart, mevcut 42 değerlendirme setinden alınan model başarısızlık durumlarına dayanarak oluşturuldu ve toplamda 3.000 adet insan tarafından doğrulanmış soru içeriyor; her soru yalnızca tek bir görsel yeteneği ölçüyor ve mantık yürütme veya dış bilgi gerektirmiyor.
Değerlendirme sonuçlarına göre, 16 öncü çok modlu büyük model arasında hiçbir modelin genel doğruluk oranı %60'ı aşmamıştır. GPT-5.6-Sol, %59,7 doğruluk oranı ile birinci sırada; Kimi K3 (%58,5), Claude-Fable-5 (%57,2), Gemini-3.1-Pro (%56,2) ve GPT-5.5 (%55,8) ilk beşte yer almıştır. Rapor, görsel illüzyonların (Hallucination) hâlâ tüm modellerin en zayıf yeteneği olduğunu ve genel algısal kapasitenin önemli ölçüde geliştirilebileceğini belirtmektedir.
