Odaily Planet Daily: Kimi оголосила про відкриття бенчмарку PerceptionBench для оцінки багатомодальних великих моделей у сфері візуального сприйняття, метою якого є розбиття візуального сприйняття на 10 атомарних здібностей для незалежної оцінки, включаючи візуальні зв’язки, підрахунок, атрибути, глибину та 3D, локалізацію, порівняння, дрібнозернисту ідентифікацію, інтеграцію контексту, OCR та виявлення галюцинацій. Бенчмарк побудований на основі випадків невдач моделей з 42 існуючих наборів оцінок і містить 3000 підтверджених людиною питань, кожне з яких перевіряє лише одну візуальну здібність, не вимагаючи міркувань чи зовнішніх знань.
Результати оцінки показали, що жодна з 16 передових багатомодальних великих моделей не досягла загальної точності вище 60%. GPT-5.6-Sol посіла перше місце з точністю 59,7%, за ним слідують Kimi K3 (58,5%), Claude-Fable-5 (57,2%), Gemini-3.1-Pro (56,2%) і GPT-5.5 (55,8%). У звіті зазначено, що візуальні галюцинації залишаються найслабшою здатністю всіх моделей, і загальний рівень сприйняття все ще має значний потенціал для покращення.
