Kimi 開源 PerceptionBench 視覺基準測試,GPT-5.6-Sol 以 59.7% 準確率領先

iconKuCoinFlash
分享
AI summary icon精華摘要
Kimi 已發布 PerceptionBench 視覺基準,用於鏈上新聞和加密貨幣新聞評估。該基準測試使用 3,000 個經過驗證的問題,評估 10 項視覺技能。在 16 個頂級模型中,GPT-5.6-Sol 得分最高,為 59.7%。沒有任何模型的準確率超過 60%。視覺幻覺仍是最薄弱的領域。

Odaily星球日報訊 Kimi 宣布開源多模態大模型視覺感知評測基準 PerceptionBench,旨在將視覺感知能力拆解為 10 項原子級能力進行獨立評估,涵蓋視覺關係、計數、屬性、深度與 3D、定位、比較、細粒度識別、上下文整合、OCR 及幻覺識別等維度。該基準基於 42 個現有評測集中的模型失敗案例構建,共包含 3000 道經人工驗證的問題,每題僅考察單一視覺能力,無需推理或外部知識。

評測結果顯示,在 16 款前沿多模態大模型中,沒有任何模型的整體準確率超過 60%。GPT-5.6-Sol 以 59.7% 的準確率排名第一,Kimi K3(58.5%)、Claude-Fable-5(57.2%)、Gemini-3.1-Pro(56.2%)和 GPT-5.5(55.8%)位列前五。報告指出,視覺幻覺(Hallucination)仍是各模型表現最弱的能力,整體感知能力仍存在顯著提升空間。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露