Odaily Planet Daily: Kimi объявила об открытии многомодальной оценочной базы PerceptionBench для визуального восприятия крупных моделей, целью которой является разложение визуального восприятия на 10 атомарных способностей для независимой оценки, включая визуальные отношения, подсчет, атрибуты, глубину и 3D, локализацию, сравнение, тонкую идентификацию, интеграцию контекста, OCR и распознавание галлюцинаций. База построена на основе случаев неудач моделей из 42 существующих наборов оценки и содержит 3000 вопросов, проверенных вручную, каждый из которых оценивает только одну визуальную способность без необходимости логических рассуждений или внешних знаний.
Результаты оценки показали, что ни одна из 16 передовых мультимодальных больших моделей не достигла общей точности выше 60%. GPT-5.6-Sol занял первое место с точностью 59,7%, за ним следуют Kimi K3 (58,5%), Claude-Fable-5 (57,2%), Gemini-3.1-Pro (56,2%) и GPT-5.5 (55,8%). В отчете отмечается, что визуальные галлюцинации остаются самым слабым аспектом всех моделей, и общий уровень восприятия все еще имеет значительный потенциал для улучшения.
