Odaily Planet Daily : Kimi annonce l'ouverture du benchmark PerceptionBench pour l'évaluation des modèles multimodaux en perception visuelle, visant à décomposer la capacité de perception visuelle en 10 compétences atomiques évaluées indépendamment, couvrant les dimensions des relations visuelles, du comptage, des attributs, de la profondeur et du 3D, du positionnement, de la comparaison, de la reconnaissance fine-grained, de l'intégration contextuelle, de l'OCR et de la détection d'hallucinations. Ce benchmark est construit à partir de cas d'échec de modèles issus de 42 jeux d'évaluation existants et comprend 3 000 questions validées manuellement, chaque question évaluant une seule capacité visuelle, sans nécessiter de raisonnement ni de connaissances externes.
Les résultats de l'évaluation montrent qu'aucun des 16 modèles multimodaux de pointe n'a atteint un taux de précision global supérieur à 60 %. GPT-5.6-Sol arrive en tête avec un taux de précision de 59,7 %, suivi par Kimi K3 (58,5 %), Claude-Fable-5 (57,2 %), Gemini-3.1-Pro (56,2 %) et GPT-5.5 (55,8 %). Le rapport souligne que les hallucinations visuelles restent la capacité la plus faible de tous les modèles, et qu'il existe encore une marge significative d'amélioration pour les capacités perceptuelles globales.
