Odaily Planet Daily informa que Kimi ha lanzado como código abierto el benchmark de evaluación de percepción visual PerceptionBench, diseñado para descomponer la capacidad de percepción visual en 10 habilidades atómicas evaluadas de forma independiente, abarcando dimensiones como relaciones visuales, conteo, atributos, profundidad y 3D, localización, comparación, reconocimiento fino, integración contextual, OCR y detección de alucinaciones. Este benchmark se construye a partir de casos de fallo de modelos en 42 conjuntos de evaluación existentes y contiene 3.000 preguntas validadas manualmente, cada una evaluando una única capacidad visual, sin requerir razonamiento ni conocimiento externo.
Los resultados de la evaluación muestran que, entre los 16 modelos multimodales de vanguardia, ninguno superó el 60% de precisión general. GPT-5.6-Sol lidera con una precisión del 59,7%, seguido por Kimi K3 (58,5%), Claude-Fable-5 (57,2%), Gemini-3.1-Pro (56,2%) y GPT-5.5 (55,8%). El informe señala que las alucinaciones visuales siguen siendo la capacidad más débil de todos los modelos, y que aún existe un margen significativo para mejorar la percepción general.
