Odaily Planet Daily News: Kimi anunciou a abertura do benchmark PerceptionBench para avaliação de modelos multimodais, com o objetivo de decompor a capacidade de percepção visual em 10 habilidades atômicas para avaliação independente, abrangendo dimensões como relações visuais, contagem, atributos, profundidade e 3D, localização, comparação, reconhecimento fino, integração de contexto, OCR e detecção de alucinações. O benchmark foi construído com base em casos de falha de modelos em 42 conjuntos de avaliação existentes e contém 3.000 questões validadas manualmente, cada uma avaliando apenas uma única habilidade visual, sem exigir raciocínio ou conhecimento externo.
Os resultados da avaliação mostram que, entre os 16 modelos multimodais de ponta, nenhum atingiu uma precisão geral superior a 60%. O GPT-5.6-Sol liderou com uma precisão de 59,7%, seguido por Kimi K3 (58,5%), Claude-Fable-5 (57,2%), Gemini-3.1-Pro (56,2%) e GPT-5.5 (55,8%) entre os cinco primeiros. O relatório aponta que ilusões visuais (Hallucination) permanecem como a capacidade mais fraca de todos os modelos, indicando que há ainda significativo espaço para melhoria na percepção geral.
