ChainThink mesajı, 25 Temmuz'da, üçüncü taraf değerlendirme kuruluşu Artificial Analysis'a göre, Claude Opus 5, 9 testteki entelektüel indekste 61 puan alarak, Fable 5'in 60 puanını dar bir farkla geçti.
GPT-5.6 Sol 59 puan, Kimi K3 57 puan aldı. Maliyet açısından, Opus 5'in ortalama görev maliyeti 2,03 dolar olup, Fable 5'in 2,75 dolarına göre %26 daha düşük.
Bu model, GDPval-AA v2 ve AA-Briefcase eğitimlerinde birinci oldu ve Claude Code ile birlikte Programlama Agent İndeksi'nde birinci oldu;
Terminal-Bench v2.1 puanı %89, yaklaşık olarak GPT-5.6 Sol ile eşitleniyor. Opus 5, 5 seviyeli çıkarım şiddeti sunuyor.
Low'dan max'a kadar Token farkı yaklaşık 8 kat, GDPval-AA v2 puanı 407 Elo farkla değişiyor; kullanıcı, performans ve maliyet arasında ayarlamalar yapabilir.
Aynı değerlendirme, Opus 5'in gerçek bilgilerinin hâlâ Fable 5'in gerisinde olduğunu gösteriyor. AA-Omniscience testinde, illüzyon oranı, Opus 4.8'e göre 14 puan artarak %50'ye ulaştı;
Düşük çıkarım seviyesinin fiyat/performans oranı hâlâ GPT-5.6 serisinden biraz daha düşük.
