Odaily星球日報によると、Kimiは、視覚認識能力を10の原子的機能に分解して独立して評価することを目的とした、マルチモーダル大モデル視覚認識評価ベンチマーク「PerceptionBench」をオープンソース化しました。このベンチマークは、視覚的関係、数え上げ、属性、深さと3D、位置特定、比較、微細識別、文脈統合、OCR、および幻覚認識などの分野をカバーしています。このベンチマークは、既存の42の評価セットから抽出されたモデルの失敗事例を基に構築され、合計3000問の手動検証済みの質問を含み、各問題は単一の視覚能力のみを評価し、推論や外部知識を必要としません。
評価結果によると、16の最先端マルチモーダル大モデルのうち、どのモデルも全体的な正確率が60%を超えていない。GPT-5.6-Solが59.7%の正確率で1位、Kimi K3(58.5%)、Claude-Fable-5(57.2%)、Gemini-3.1-Pro(56.2%)、GPT-5.5(55.8%)が上位5位に入った。報告書は、視覚的幻覚(Hallucination)が各モデルの最も弱い能力であることを指摘し、全体的な認識能力には依然として大幅な改善の余地があると述べている。
