ChainThink संदेश, 25 जुलाई, तीसरे पक्ष के मूल्यांकन संस्थान Artificial Analysis के अनुसार, Claude Opus 5 ने 9 परीक्षणों के समग्र बुद्धिमत्ता सूचकांक में 61 अंक प्राप्त किए, जो Fable 5 के 60 अंक की तुलना में संकीर्ण अग्रता रखता है।
GPT-5.6 Sol को 59 अंक मिले, Kimi K3 को 57 अंक मिले। लागत के मामले में, Opus 5 की प्रति कार्य औसत लागत 2.03 डॉलर है, जो Fable 5 की 2.75 डॉलर की तुलना में 26% कम है।
इस मॉडल ने GDPval-AA v2 और AA-Briefcase दोनों ज्ञान-आधारित मूल्यांकनों में पहला स्थान प्राप्त किया है, और Claude Code के साथ मिलकर प्रोग्रामिंग एजेंट इंडेक्स में पहला स्थान प्राप्त किया है;
Terminal-Bench v2.1 का स्कोर 89% है, जो GPT-5.6 Sol के लगभग बराबर है। Opus 5 5 लेवल की रीजनिंग स्ट्रेंथ प्रदान करता है।
low से max तक, आउटपुट टोकन लगभग 8 गुना अलग है, GDPval-AA v2 का प्रदर्शन 407 Elo से अलग है, और उपयोगकर्ता प्रदर्शन और लागत के बीच समायोजन कर सकते हैं।
मूल्यांकन दर्शाता है कि ओपस 5 का तथ्यात्मक ज्ञान फेबल 5 से पिछड़ा हुआ है। AA-सर्वज्ञता परीक्षण में, इसकी भ्रामकता दर 50% हो गई, जो ओपस 4.8 से 14 प्रतिशत अंक अधिक है;
लो-इन्फरेंस टियर की कीमत-प्रदर्शन अभी भी GPT-5.6 सीरीज़ से थोड़ी कम है।
