ChainThink сообщение, 25 июля, по данным независимой оценочной организации Artificial Analysis, Claude Opus 5 набрал 61 балл по интеллектуальному индексу, включающему 9 тестов, незначительно опередив Fable 5 с 60 баллами.
GPT-5.6 Sol набрал 59 баллов, Kimi K3 — 57 баллов. С точки зрения затрат, средняя стоимость каждой задачи для Opus 5 составляет 2,03 доллара США, что на 26% ниже, чем у Fable 5, который стоит 2,75 доллара США.
Эта модель занимает первое место в оценках знаниевых задач GDPval-AA v2 и AA-Briefcase, а в сочетании с Claude Code делит первое место по индексу программного агента;
Terminal-Bench v2.1 набрал 89%, что примерно соответствует GPT-5.6 Sol. Opus 5 предлагает 5 уровней интенсивности рассуждения.
От low до max выход токенов отличается примерно в 8 раз, результат GDPval-AA v2 отличается на 407 Elo, пользователь может настроить баланс между производительностью и стоимостью.
Также в оценке указано, что фактические знания Opus 5 все еще уступают Fable 5. В тесте AA-Omniscience его уровень иллюзий вырос до 50%, что на 14 процентных пункта выше, чем у Opus 4.8;
Соотношение цены и производительности в низком режиме вывода все еще немного ниже, чем у серии GPT-5.6.
