ChainThink, 25 Juli, menurut lembaga evaluasi pihak ketiga Artificial Analysis, Claude Opus 5 mendapatkan skor 61 dalam indeks kecerdasan yang mencakup sembilan tes, unggul tipis atas Fable 5 yang mendapat skor 60.
GPT-5.6 Sol mendapat skor 59, Kimi K3 mendapat skor 57. Dari segi biaya, Opus 5 memiliki biaya rata-rata $2,03 per tugas, 26% lebih rendah dibandingkan Fable 5 yang sebesar $2,75.
Model ini berada di peringkat pertama dalam dua evaluasi pekerjaan pengetahuan, GDPval-AA v2 dan AA-Briefcase, serta berbagi peringkat pertama dalam Indeks Agen Pemrograman setelah digabungkan dengan Claude Code;
Terminal-Bench v2.1 mendapat skor 89%, hampir menyamai GPT-5.6 Sol. Opus 5 menyediakan 5 tingkat kekuatan inferensi.
Dari low hingga max, output Token berbeda sekitar 8 kali, perbedaan skor GDPval-AA v2 sebesar 407 Elo, pengguna dapat menyesuaikan antara kinerja dan biaya.
Evaluasi juga menunjukkan bahwa pengetahuan fakta Opus 5 masih ketinggalan dari Fable 5. Dalam tes AA-Omniscience, tingkat ilusi meningkat menjadi 50%, naik 14 poin persentase dibandingkan Opus 4.8;
Harga dan kinerja pada tingkat inferensi rendah masih sedikit lebih rendah daripada seri GPT-5.6.
