ChainThink mensaje, 25 de julio, según la agencia de evaluación independiente Artificial Analysis, Claude Opus 5 obtuvo una puntuación de 61 puntos en el índice de inteligencia que integra 9 pruebas, liderando ligeramente a Fable 5 con 60 puntos.
GPT-5.6 Sol obtiene 59 puntos, Kimi K3 obtiene 57 puntos. En cuanto a costos, Opus 5 tiene un costo promedio de $2.03 por tarea, un 26% menos que los $2.75 de Fable 5.
Este modelo ocupa el primer lugar en las evaluaciones de trabajo de conocimiento GDPval-AA v2 y AA-Briefcase, y empató en el primer lugar del índice de agentes de programación tras combinarse con Claude Code;
Terminal-Bench v2.1 obtuvo una puntuación del 89%, aproximadamente empatando con GPT-5.6 Sol. Opus 5 ofrece 5 niveles de intensidad de razonamiento.
Desde low hasta max, el Token emitido difiere en aproximadamente 8 veces, y el rendimiento de GDPval-AA v2 varía en 407 Elo; los usuarios pueden ajustar entre rendimiento y costo.
La evaluación también muestra que el conocimiento factual de Opus 5 aún se encuentra por detrás de Fable 5. En la prueba AA-Omniscience, su tasa de ilusiones aumentó hasta el 50%, 14 puntos porcentuales más que Opus 4.8;
El rendimiento por precio del nivel de inferencia bajo sigue siendo ligeramente inferior a la serie GPT-5.6.
