Odaily Planet Daily News: Ipinahayag ng Kimi ang pagbubukas ng PerceptionBench, ang multi-modal large model benchmark para sa pag-e-evaluate ng visual perception, na naglalayong hiwalayin ang visual perception capability sa 10 mga atomic na kakayahan para sa independiyenteng pagtataya, kabilang ang visual relationships, counting, attributes, depth at 3D, localization, comparison, fine-grained recognition, context integration, OCR, at hallucination detection. Binubuo ang benchmark mula sa mga kaso ng pagkabigo ng mga modelo mula sa 42 na umiiral na benchmark sets, na naglalaman ng 3,000 na tanong na pinatotohanan ng tao, kung saan bawat tanong ay tumatalakay lamang sa isang visual capability, walang pangangailangan ng reasoning o panlabas na kaalaman.
Ayon sa mga resulta ng pagsusuri, sa 16 na pinakamodernong multimodal na malalaking modelo, walang modelo ang nakamit na pangkabuuang akurasyon na hihigit sa 60%. Ang GPT-5.6-Sol ay nangunguna sa akurasyon na 59.7%, kasunod ng Kimi K3 (58.5%), Claude-Fable-5 (57.2%), Gemini-3.1-Pro (56.2%), at GPT-5.5 (55.8%) sa top five. Ipinahiwatig ng ulat na ang visual hallucination ay patuloy na ang pinakamahinang kakayahan ng mga modelo, at mayroon pa ring malaking espasyo para sa pagpapabuti ng pangkabuuang pag-unawa.
