ChainThink کی خبر، 25 جولائی، تیسری پارٹی جائزہ ادارے Artificial Analysis کے مطابق، Claude Opus 5 نے 9 ٹیسٹس کے مجموعی اسمارٹ انڈیکس میں 61 نمبر حاصل کیے، جو Fable 5 کے 60 نمبر سے تنگ فرق سے آگے ہیں۔
GPT-5.6 Sol کا اسکور 59 ہے، Kimi K3 کا اسکور 57 ہے۔ لاگت کے لحاظ سے، Opus 5 کی فی کام اوسط لاگت 2.03 ڈالر ہے، جو Fable 5 کی 2.75 ڈالر سے 26% کم ہے۔
یہ ماڈل GDPval-AA v2 اور AA-Briefcase دونوں معلوماتی کام کے ایوانوں میں پہلے نمبر پر ہے، اور Claude Code کے ساتھ مل کر پروگرامنگ ایجینٹ انڈیکس میں پہلے نمبر پر ہے؛
ٹرمینل-بینچ v2.1 کا اسکور 89% ہے، جو GPT-5.6 Sol کے تقریباً برابر ہے۔ Opus 5 پانچ سطحیں ترتیب کی طاقت فراہم کرتا ہے۔
low سے max تک، ٹوکن کا فرق تقریباً 8 گناہ ہے، GDPval-AA v2 کا اسکور 407 Elo کا فرق ہے، صارفین اپنی کارکردگی اور لاگت کے درمیان توازن بنا سکتے ہیں۔
جائزہ میں یہ بھی ظاہر ہوا کہ Opus 5 کا حقیقی جاننا Fable 5 کے مقابلے میں پیچھے ہے۔ AA-Omniscience ٹیسٹ میں اس کی خیالی شرح 50% تک پہنچ گئی، جو Opus 4.8 سے 14 فیصد زیادہ ہے؛
کم استدلال کی درجہ بندی کی قیمت کے لحاظ سے اب بھی GPT-5.6 سیریز سے تھوڑی کم ہے۔
