ChainThink, le 25 juillet, selon l'organisme d'évaluation tiers Artificial Analysis, Claude Opus 5 obtient un score de 61 points à l'indice d'intelligence basé sur neuf tests combinés, devançant légèrement Fable 5 qui obtient 60 points.
GPT-5.6 Sol obtient un score de 59, Kimi K3 obtient un score de 57. En termes de coût, Opus 5 coûte en moyenne 2,03 $ par tâche, soit 26 % de moins que les 2,75 $ de Fable 5.
Ce modèle occupe la première place lors des évaluations de travail intellectuel GDPval-AA v2 et AA-Briefcase, et partage la première place de l'indice des agents de programmation avec Claude Code ;
Terminal-Bench v2.1 obtient un score de 89 %, à peu près équivalent à GPT-5.6 Sol. Opus 5 offre 5 niveaux d'intensité d'inférence.
De low à max, les tokens diffèrent d'environ 8 fois, et les résultats de GDPval-AA v2 varient de 407 Elo ; les utilisateurs peuvent ajuster entre performance et coût.
Les évaluations montrent également que les connaissances factuelles d'Opus 5 sont toujours inférieures à celles de Fable 5. Dans le test AA-Omniscience, son taux d'hallucinations a augmenté à 50 %, soit 14 points de pourcentage de plus qu'avec Opus 4.8 ;
Le rapport qualité-prix du niveau de raisonnement bas reste légèrement inférieur à celui de la série GPT-5.6.
