رسالة ChainThink، 25 يوليو، وفقًا لمؤسسة التقييم الثالثة Artificial Analysis، حصل Claude Opus 5 على درجة 61 في مؤشر الذكاء الشامل المكون من 9 اختبارات، متقدمًا بفارق ضيق على Fable 5 الذي حصل على 60 درجة.
حصل GPT-5.6 Sol على درجة 59، بينما حصل Kimi K3 على درجة 57. من حيث التكلفة، بلغ متوسط تكلفة كل مهمة لـ Opus 5 دولارين وثلاثة سنتات، وهو أقل بنسبة 26% مقارنة بـ Fable 5 الذي بلغت تكلفته 2.75 دولار.
احتل هذا النموذج المركز الأول في تقييمات العمل المعرفي GDPval-AA v2 وAA-Briefcase، وشارك في المركز الأول في مؤشر وكيل البرمجة بعد دمجه مع Claude Code؛
حصل Terminal-Bench v2.1 على درجة 89٪، وهو ما يعادل تقريبًا GPT-5.6 Sol. يقدم Opus 5 خمس مستويات من قوة الاستدلال.
من low إلى max، يختلف إخراج Token بحوالي 8 أضعاف، ويفصل أداء GDPval-AA v2 بمقدار 407 Elo، ويمكن للمستخدم ضبط التوازن بين الأداء والتكلفة.
كما أظهر التقييم أن معرفة Opus 5 الواقعية لا تزال متخلفة عن Fable 5. في اختبار AA-Omniscience، ارتفع معدل الوهم إلى 50٪، بزيادة قدرها 14 نقطة مئوية مقارنة بـ Opus 4.8؛
Still slightly lower cost-effectiveness than the GPT-5.6 series at the low inference tier.
