mensahe ni ChainThink, noong Hulyo 25, ayon sa third-party evaluation firm na Artificial Analysis, ang Claude Opus 5 ay nakakuha ng 61 puntos sa comprehensive intelligence index na binubuo ng 9 mga pagsusulit, na may maliit na pagkakalaban sa 60 puntos ng Fable 5.
Ang GPT-5.6 Sol ay nakakuha ng 59 puntos, habang ang Kimi K3 ay nakakuha ng 57 puntos. Sa halagang pansaklaw, ang average na gastos ng Opus 5 ay $2.03 bawat gawain, na 26% mas mababa kaysa sa $2.75 ng Fable 5.
Nakakamit ng unang puwesto ang modelo sa mga pagsubok sa kaalaman na GDPval-AA v2 at AA-Briefcase, at nagkakaroon ng pangunahang puwesto sa Programming Agent Index kasama ang Claude Code;
Ang Terminal-Bench v2.1 ay may marka na 89%, na halos katumbas ng GPT-5.6 Sol. Ang Opus 5 ay nagtataglay ng 5 antas ng pag-iisip.
Mula sa low hanggang max, ang pagkakaiba ng Token ay humigit-kumulang 8 beses, at ang pagkakaiba ng GDPval-AA v2 ay 407 Elo; maaaring ayusin ng mga user ang pagitan ng performance at gastos.
Ang pagsusuri ay nagpapakita rin na ang katotohanang kaalaman ng Opus 5 ay nananatiling mas mababa kaysa sa Fable 5. Sa AA-Omniscience test, tumataas ang rate ng pagkakamali nito sa 50%, 14 na puntos ang higit sa Opus 4.8;
Ang halaga sa low reasoning tier ay patuloy na kaunti lang mas mababa kaysa sa GPT-5.6 series.
