كيمي تُطلق مفتوحة المصدر PerceptionBench معيار التقييم البصري، ويتقدم GPT-5.6-Sol بدقة 59.7%

iconKuCoinFlash
مشاركة
AI summary iconملخص
أطلقت Kimi معيار PerceptionBench البصري لتقييم الأخبار على السلسلة وأخبار التشفير. يختبر المعيار 10 مهارات بصرية باستخدام 3,000 سؤال مؤكد. بين 16 نموذجًا رائدًا، حصل GPT-5.6-Sol على أعلى درجة بنسبة 59.7%. لم ينجح أي نموذج في تجاوز دقة 60%. تظل الهلوسة البصرية أضعف منطقة.

أفادت Odaily Star Daily أن Kimi أعلنت عن إصدار نموذج مفتوح المصدر لاختبار الأداء البصري متعدد الوسائط يُسمى PerceptionBench، بهدف تفكيك قدرات الإدراك البصري إلى 10 قدرات ذرية لتقييمها بشكل مستقل، وتشمل أبعادًا مثل العلاقات البصرية، العد، الخصائص، العمق والنمذجة ثلاثية الأبعاد، التحديد، المقارنة، التعرف الدقيق، دمج السياق، التعرف الضوئي على الحروف، وتحديد الهلوسات. تم بناء هذا المعيار على أساس حالات فشل النماذج من 42 مجموعة تقييم موجودة، ويتضمن 3000 سؤال تم التحقق منها يدويًا، حيث يختبر كل سؤال قدرة بصرية واحدة فقط، دون الحاجة إلى استنتاج أو معرفة خارجية.

أظهرت نتائج التقييم أنه في بين 16 نموذجًا متقدمًا متعدد الأوضاع، لم يتجاوز أي نموذج دقة إجمالية قدرها 60%. واحتل نموذج GPT-5.6-Sol المرتبة الأولى بدقة قدرها 59.7%، تلاه Kimi K3 (58.5%)، وClaude-Fable-5 (57.2%)، وGemini-3.1-Pro (56.2%)، وGPT-5.5 (55.8%) في المراكز الخمسة الأولى. وأشار التقرير إلى أن الهلوسة البصرية لا تزال أضعف مهارة لدى جميع النماذج، ولا تزال القدرة الإدراكية العامة تتمتع بمساحة كبيرة للتحسين.

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.