Kimi、PerceptionBenchビジュアルベンチマークをオープンソース化、GPT-5.6-Solが59.7%の精度でリード

iconKuCoinFlash
共有
AI summary icon概要
Kimiは、オンチェーンニュースおよび暗号通貨ニュース評価のためのPerceptionBenchビジュアルベンチマークをリリースしました。このベンチマークは、3,000の検証済み質問を用いて10のビジュアルスキルをテストします。16のトップモデルの中で、GPT-5.6-Solが最高得点の59.7%を記録しました。どのモデルも60%の精度を達成していません。ビジュアルな幻覚が最も弱い分野です。

Odaily星球日報によると、Kimiは、視覚認識能力を10の原子的機能に分解して独立して評価することを目的とした、マルチモーダル大モデル視覚認識評価ベンチマーク「PerceptionBench」をオープンソース化しました。このベンチマークは、視覚的関係、数え上げ、属性、深さと3D、位置特定、比較、微細識別、文脈統合、OCR、および幻覚認識などの分野をカバーしています。このベンチマークは、既存の42の評価セットから抽出されたモデルの失敗事例を基に構築され、合計3000問の手動検証済みの質問を含み、各問題は単一の視覚能力のみを評価し、推論や外部知識を必要としません。

評価結果によると、16の最先端マルチモーダル大モデルのうち、どのモデルも全体的な正確率が60%を超えていない。GPT-5.6-Solが59.7%の正確率で1位、Kimi K3(58.5%)、Claude-Fable-5(57.2%)、Gemini-3.1-Pro(56.2%)、GPT-5.5(55.8%)が上位5位に入った。報告書は、視覚的幻覚(Hallucination)が各モデルの最も弱い能力であることを指摘し、全体的な認識能力には依然として大幅な改善の余地があると述べている。

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。