أفادت Odaily Star Daily أن Kimi أعلنت عن إصدار نموذج مفتوح المصدر لاختبار الأداء البصري متعدد الوسائط يُسمى PerceptionBench، بهدف تفكيك قدرات الإدراك البصري إلى 10 قدرات ذرية لتقييمها بشكل مستقل، وتشمل أبعادًا مثل العلاقات البصرية، العد، الخصائص، العمق والنمذجة ثلاثية الأبعاد، التحديد، المقارنة، التعرف الدقيق، دمج السياق، التعرف الضوئي على الحروف، وتحديد الهلوسات. تم بناء هذا المعيار على أساس حالات فشل النماذج من 42 مجموعة تقييم موجودة، ويتضمن 3000 سؤال تم التحقق منها يدويًا، حيث يختبر كل سؤال قدرة بصرية واحدة فقط، دون الحاجة إلى استنتاج أو معرفة خارجية.
أظهرت نتائج التقييم أنه في بين 16 نموذجًا متقدمًا متعدد الأوضاع، لم يتجاوز أي نموذج دقة إجمالية قدرها 60%. واحتل نموذج GPT-5.6-Sol المرتبة الأولى بدقة قدرها 59.7%، تلاه Kimi K3 (58.5%)، وClaude-Fable-5 (57.2%)، وGemini-3.1-Pro (56.2%)، وGPT-5.5 (55.8%) في المراكز الخمسة الأولى. وأشار التقرير إلى أن الهلوسة البصرية لا تزال أضعف مهارة لدى جميع النماذج، ولا تزال القدرة الإدراكية العامة تتمتع بمساحة كبيرة للتحسين.
