ChainThink mensagem, 25 de julho, segundo a agência de avaliação independente Artificial Analysis, o Claude Opus 5 obteve 61 pontos no índice de inteligência, que integra nove testes, ligeiramente à frente do Fable 5 com 60 pontos.
GPT-5.6 Sol obteve 59 pontos, Kimi K3 obteve 57 pontos. Em termos de custo, o Opus 5 tem um custo médio de US$ 2,03 por tarefa, 26% menor que os US$ 2,75 do Fable 5.
O modelo ficou em primeiro lugar nos testes de trabalho de conhecimento GDPval-AA v2 e AA-Briefcase e empatou em primeiro lugar no índice de Agentes de programação após ser combinado com o Claude Code;
O Terminal-Bench v2.1 obteve 89%, aproximadamente empatando com o GPT-5.6 Sol. O Opus 5 oferece 5 níveis de intensidade de raciocínio.
De low a max, o Token diferem em aproximadamente 8 vezes, e o desempenho do GDPval-AA v2 varia em 407 Elo; os usuários podem ajustar entre desempenho e custo.
A avaliação também mostra que o conhecimento factual do Opus 5 ainda está atrás do Fable 5. No teste AA-Omniscience, sua taxa de ilusões aumentou para 50%, 14 pontos percentuais acima do Opus 4.8;
O custo-benefício do nível de inferência inferior ainda é ligeiramente inferior à série GPT-5.6.
