চেইনথিং মেসেজ, ২৫ জুলাই, তৃতীয় পক্ষের মূল্যায়ন সংস্থা Artificial Analysis-এর মতে, Claude Opus 5 নয়টি পরীক্ষার সমন্বিত বুদ্ধিমত্তা স্কোরে ৬১ পয়েন্ট পেয়েছে, যা Fable 5-এর ৬০ পয়েন্টকে সামান্যভাবে ছাড়িয়েছে।
GPT-5.6 Sol স্কোর 59, Kimi K3 স্কোর 57। খরচের ক্ষেত্রে, Opus 5-এর প্রতিটি টাস্কের গড় খরচ 2.03 ডলার, যা Fable 5-এর 2.75 ডলারের তুলনায় 26% কম।
এই মডেলটি GDPval-AA v2 এবং AA-Briefcase দুটি জ্ঞানভিত্তিক কাজের মূল্যায়নে প্রথম স্থান অধিকার করেছে, এবং Claude Code-এর সাথে মিলিয়ে প্রোগ্রামিং এজেন্ট ইনডেক্সে প্রথম স্থানে অবস্থান করছে;
টার্মিনাল-বেঞ্চ v2.1 স্কোর 89%, প্রায় GPT-5.6 Sol এর সমান। ওপাস 5 প্রদান করে 5 স্তরের যুক্তিগত শক্তি।
low থেকে max পর্যন্ত, টোকেনের পার্থক্য প্রায় 8 গুণ, GDPval-AA v2 স্কোরের পার্থক্য 407 Elo, ব্যবহারকারীরা পারফরম্যান্স এবং খরচের মধ্যে সমন্বয় করতে পারেন।
মূল্যায়নে দেখা গেছে যে, অপাস ৫-এর প্রাকৃতিক জ্ঞান এখনও ফেবল ৫-এর চেয়ে পিছিয়ে। AA-Omniscience পরীক্ষায়, এর কল্পনা হার ৫০% এ উঠেছে, যা অপাস ৪.৮ এর চেয়ে ১৪ পার্সেন্টপয়েন্ট বেশি;
লো-ইনফারেন্স টিয়ারের মূল্য-প্রতি-পারফরম্যান্স এখনও GPT-5.6 সিরিজের চেয়ে কিছুটা কম।
