Mesej ChainThink, 25 Julai, menurut agensi penilaian pihak ketiga Artificial Analysis, Claude Opus 5 mendapat skor 61 dalam indeks kecerdasan yang menggabungkan sembilan ujian, sedikit mengungguli Fable 5 yang mendapat 60.
GPT-5.6 Sol mendapat skor 59, Kimi K3 mendapat skor 57. Dari segi kos, Opus 5 mempunyai kos purata RM2.03 setiap tugas, 26% lebih rendah berbanding Fable 5 yang berada pada RM2.75.
Model ini mendapat tempat pertama dalam penilaian kerja pengetahuan GDPval-AA v2 dan AA-Briefcase, serta bersama-sama mendapat tempat pertama dalam Indeks Agen Pemrograman selepas digabungkan dengan Claude Code;
Terminal-Bench v2.1 mendapat skor 89%, hampir menyamai GPT-5.6 Sol. Opus 5 menyediakan 5 tahap kekuatan penalaran.
Dari low hingga max, output Token berbeza sekitar 8 kali, perbezaan skor GDPval-AA v2 ialah 407 Elo, pengguna boleh menyesuaikan antara prestasi dan kos.
Penilaian juga menunjukkan bahawa pengetahuan fakta Opus 5 masih tertinggal di belakang Fable 5. Dalam ujian AA-Omniscience, kadar halusinasinya meningkat kepada 50%, 14 peratus lebih tinggi berbanding Opus 4.8;
Harga berbanding nilai untuk peringkat inferens rendah masih sedikit lebih rendah daripada siri GPT-5.6.
