Kimi ने PerceptionBench विजुअल बेंचमार्क को ओपन सोर्स कर दिया, GPT-5.6-Sol 59.7% सटीकता के साथ अग्रणी है

iconKuCoinFlash
साझा करें
AI summary iconसारांश
किमी ने ऑन-चेन समाचार और क्रिप्टो समाचार मूल्यांकन के लिए PerceptionBench विजुअल बेंचमार्क जारी किया है। यह बेंचमार्क 3,000 सत्यापित प्रश्नों का उपयोग करके 10 विजुअल कौशल का परीक्षण करता है। 16 शीर्ष मॉडल्स में, GPT-5.6-Sol ने 59.7% पर सर्वोच्च स्कोर प्राप्त किया। कोई भी मॉडल 60% सटीकता नहीं पार कर पाया। विजुअल हैलूसिनेशन अभी भी सबसे कमजोर क्षेत्र है।

Odaily星球日报消息,Kimi 宣布开源多模态大模型视觉感知评测基准 PerceptionBench,旨在将视觉感知能力拆解为 10 项原子级能力进行独立评估,涵盖视觉关系、计数、属性、深度与 3D、定位、比较、细粒度识别、上下文整合、OCR 及幻觉识别等维度。该基准基于 42 个现有评测集中的模型失败案例构建,共包含 3000 道经人工验证的问题,每题仅考察单一视觉能力,无需推理或外部知识。

मूल्यांकन परिणामों के अनुसार, 16 अग्रणी बहुमोडल बड़े मॉडल्स में से कोई भी मॉडल कुल सटीकता 60% से अधिक नहीं प्राप्त कर पाया। GPT-5.6-Sol 59.7% सटीकता के साथ पहले स्थान पर है, जबकि Kimi K3 (58.5%), Claude-Fable-5 (57.2%), Gemini-3.1-Pro (56.2%) और GPT-5.5 (55.8%) शीर्ष पांच में शामिल हैं। रिपोर्ट में बताया गया है कि दृश्य भ्रम (Hallucination) अभी भी सभी मॉडल्स की सबसे कमजोर क्षमता है, और समग्र अवधारणात्मक क्षमता में अभी भी महत्वपूर्ण सुधार की आवश्यकता है।

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।