Anthropic lanza Claude Sonnet 5.5, intentando comprimir capacidades cercanas al modelo insignia Opus 5.5 en un modelo de agente diario más económico y adecuado para llamadas frecuentes. El precio por API sigue siendo de 2 dólares y 10 dólares por millón de tokens de entrada/salida, pero la empresa afirma que la velocidad de salida ha aumentado más del 30% y que se reducen los tokens necesarios para completar tareas típicas, lo que puede disminuir el costo por tarea hasta un 30%. En pruebas oficiales, logró un 70,6% en Terminal‑Bench 4.0, superando al Sonnet 5 (10,3%) y al Opus 5.5 (66,4%); también alcanzó 1844 Elo en la tarea profesional GDPval‑AA, cerca del 1846 de Opus. Sin embargo, “Opus a mitad de precio” no es una conclusión completa: Artificial Analysis descubrió que, bajo la máxima intensidad de razonamiento, Sonnet 5.5 genera en promedio unos 193.000 tokens de salida por pregunta, la configuración más consumidora de tokens que han probado, lo que aumenta el costo por pregunta en aproximadamente un 50% en comparación con Sonnet 5; pruebas reales de revisión de código con CodeRabbit también mostraron que, aunque Sonnet 5.5 es aproximadamente el doble de rápido que su predecesor, aún omite problemas complejos que Opus logra detectar. Por lo tanto, parece más bien un nuevo modelo principal adecuado para tareas claras y repetibles, y no un reemplazo integral de Opus.Autor del artículo, fuente: Anthropic
Anthropic repositiona a Sonnet como el agente principal para uso diario
Sonnet 5.5 es el segundo modelo de la serie Claude 5.5. A diferencia de Opus 5.5, lanzado hace una semana y orientado a tareas abiertas y complejas, Anthropic lo posiciona para manejar tareas cotidianas con límites bien definidos que requieren ejecuciones repetidas en gran cantidad: corregir errores de programas, revisar código, investigar información, y generar documentos, presentaciones y hojas de cálculo.
El modelo admite entrada de texto e imagen, ofrece un contexto de 1 millón de tokens y está disponible en la web y aplicaciones móviles de Claude, Anthropic API, AWS, Google Cloud y Microsoft Azure. El nombre de la API esclaude-sonnet-5-5. Anthropic no ha revelado la cantidad de parámetros, la arquitectura del modelo, los datos de entrenamiento ni la potencia de cómputo utilizada, por lo que no se puede determinar si las mejoras provienen del entrenamiento básico, el post-entrenamiento, la estrategia de inferencia o la optimización de la cadena de herramientas de Agent.
La diferencia entre él y Opus no es simplemente “menor capacidad y precio más bajo”. Anthropic busca establecer una nueva división de modelos: Opus se encarga de tareas complejas con definiciones incompletas que requieren juicio continuo; Sonnet ejecuta rápidamente tareas ya definidas y amplía el número de llamadas con un costo más bajo.
70,6% frente al 10,3%, son los datos más llamativos y que requieren una comprensión cuidadosa
Sonnet 5.5 obtuvo un 70.6% en la prueba Terminal‑Bench 4.0 publicada por Anthropic, mientras que Sonnet 5 alcanzó solo un 10.3%, incluso superando al Opus 5.5 con un 66.4%. Este benchmark requiere que el agente complete tareas profesionales multipaso en un entorno de línea de comandos, reflejando la coordinación entre la escritura de código, la operación de terminal y el uso de herramientas.
Las mejoras en otros proyectos no han sido tan extremas, pero siguen siendo notables: CursorBench 4.0 aumentó del 34.1% de Sonnet 5 al 55.5%, a solo dos puntos porcentuales del 57.8% de Opus 5.5; Humanity’s Last Exam con herramientas pasó del 54.9% al 64.5%; y OSWorld 2.1 para operaciones de computadora subió del 57.0% al 80.1%, cerca del 81.8% de Opus.
En la tarea de conocimiento profesional GDPval-AA, Sonnet 5.5 obtuvo 1844 Elo, mientras que Opus 5.5 obtuvo 1846; en la evaluación de trabajo de conocimiento prolongado AA-Briefcase, obtuvieron 1811 y 1822 respectivamente. Anthropic concluye que algunos trabajos profesionales con límites bien definidos ya no requieren llamar por defecto al modelo insignia.
Sin embargo, estos números no se pueden combinar simplemente como “Sonnet ha superado a Opus”. Los distintos proyectos no utilizan la misma intensidad de inferencia, y Anthropic ha indicado claramente que, en tareas que requieren mantener juicios a largo plazo o manejar objetivos abiertos, Opus sigue siendo claramente más fuerte.
Un contraejemplo interesante proviene de FrontierCode. Sonnet 5.5 alcanzó un 52.1% con la intensidad de inferencia Xhigh, pero al aumentar a Max, bajó al 46.2%. Anthropic explicó que el modelo inicia con más frecuencia varios subagentes de revisión de código en modo Max, y en dos ocasiones esto provocó tiempos de espera o modificaciones fuera del alcance de la tarea, lo que finalmente llevó a que la evaluación lo considerara un fracaso.
Este resultado indica que más razonamiento y más agentes no necesariamente conducen a mejores respuestas. El modelo puede perder puntos debido a una revisión excesiva, la ampliación del alcance de la tarea o el agotamiento del presupuesto de tiempo.
Si ningún token ha bajado de precio, ¿por qué la oficial dice que el costo de la tarea es un 30% menor?
El precio público de Sonnet 5.5 es el mismo que el de Sonnet 5: $2 por millón de tokens de entrada, $10 por millón de tokens de salida, $2.5 por escritura en caché y $0.2 por lectura en caché, que son la mitad de los precios correspondientes de Opus 5.5.
Lo que Anthropic denomina “hasta un 30 % más económico por tarea única” no se refiere a una reducción en la tabla de precios de la API, sino a que el modelo requiere menos pasos y tokens para completar el mismo trabajo. La empresa afirma que su velocidad de generación ha aumentado en más del 30 %; Slack observó en pruebas internas una reducción de aproximadamente el 14 % en los tokens de salida; Atlassian indicó que la velocidad del agente aumentó hasta un 30 %, y Lovable reportó una reducción de aproximadamente un tercio en las llamadas a herramientas y una reducción aproximada a la mitad en los intentos de ejecución de Shell.
Cuando se evaluó en 2.441 tareas financieras de preguntas y respuestas, extracción, análisis y predicción, Sonnet 5.5 utilizó en promedio aproximadamente 121.000 tokens por tarea, mientras que Sonnet 5 utilizó alrededor de 497.000. Dado que todas estas son pruebas privadas de socios, el público externo no puede verificar la dificultad de las tareas, los prompts ni las salidas completas, pero los resultados apuntan colectivamente a un cambio: el nuevo modelo realiza menos búsquedas repetitivas, lecturas duplicadas de información o razonamientos internos excesivamente largos.
Esto es especialmente importante para los Agentes. En chats tradicionales, generar cientos de tokens a la vez tiene un impacto limitado; sin embargo, los Agentes a largo plazo repiten la lectura del contexto, llaman a herramientas y corrigen resultados, y una redundancia en un paso puede amplificarse tras decenas de rondas hasta convertirse en una diferencia significativa en tiempo y costos.
La máxima intensidad de razonamiento revela otra verdad sobre los costos
Las pruebas independientes de Artificial Analysis otorgaron a Sonnet 5.5 con la configuración de razonamiento más alta una puntuación de 56, solo 2 puntos por debajo del Opus 5.5 con 58 en su índice integral de inteligencia.
Pero el costo de lograr este rendimiento es muy alto: Sonnet 5.5 genera en promedio unos 193,000 tokens de salida por prueba, el nivel más alto medido por la institución, aproximadamente un 60% más que Opus 5.5 Max y Sonnet 5 Max, y unas siete veces más que GPT‑6 Astra Max. Su costo estimado por pregunta alcanza los 7.60 dólares, un 50% más que Sonnet 5.
Esto no contradice directamente el afirmación de Anthropic de que los costos de tareas pueden reducirse hasta un 30 %. Las conclusiones oficiales describen principalmente cargas de trabajo típicas y una menor intensidad de inferencia; Artificial Analysis mide el caso en que se activa Max para buscar el límite de capacidad.
Los dos conjuntos de resultados juntos indican que la intensidad de inferencia se ha convertido en parte integral del producto del modelo. Sonnet 5.5 en los modos Low o Medium podría ofrecer una relación costo-beneficio extremadamente alta; si se aumenta la intensidad de inferencia hasta Max para competir con Opus, aunque cada Token sea más barato, podría perder su ventaja de costo debido a la excesiva cantidad generada.
Artificial Analysis también encontró que la precisión en conocimientos factuales de Sonnet 5.5 es aproximadamente del 54%, inferior al 66% de Opus; los proyectos de razonamiento científico también están aproximadamente seis puntos porcentuales por detrás. Lo que se denomina "cercano a Opus" se basa principalmente en operaciones de terminal de Agent y cierto trabajo de conocimiento, y no puede generalizarse a todas las capacidades.
En la revisión de código real, la ventaja de velocidad se mantiene, y la brecha entre los modelos insignia también persiste
CodeRabbit realizó un conjunto de pruebas de día de lanzamiento utilizando errores conocidos de proyectos de código abierto reales.
En 13 casos de revisión de código difíciles, Sonnet 5.5 con razonamiento identificó 6 problemas, más que los 4 de Sonnet 5; la precisión de los comentarios válidos fue del 41,2% y del 40,0% respectivamente. Sin embargo, Opus 5.5 en modo estándar encontró 8 y en modo Max encontró 10, lo que indica que la brecha sigue siendo clara en tareas de revisión complejas.
En otra prueba que involucró 44 Pull Requests reales, Sonnet 5.5 requirió en promedio 6 minutos y 33 segundos por revisión, mientras que Sonnet 5 necesitó 13 minutos y 31 segundos. El primero generó un 24% menos de comentarios y solo aproximadamente un tercio de los comentarios triviales en comparación con la generación anterior; según los precios públicos, el costo promedio por llamada al modelo principal es de aproximadamente $0.46, mientras que Sonnet 5 es de aproximadamente $1.16.
Sin embargo, la puntuación completa de cobertura de errores para este conjunto de 44 PR aún no se había completado en el momento de la publicación del artículo, por lo que actualmente solo se puede confirmar que es más rápido y genera menos salida, pero no se puede determinar si los comentarios omitidos dejaron pasar más problemas reales. La muestra de 13 casos de alta dificultad también es pequeña; CodeRabbit mismo advierte que es suficiente para observar la tendencia, pero no para determinar un ranking general.
La asignación de tareas más razonable es: Sonnet 5.5 se encarga de realizar una revisión rápida y estándar de cada PR; los cambios que involucran seguridad, arquitectura principal o errores cuyo costo de omisión sea muy alto se escalan a Opus o a expertos humanos.
El diseño visual está comenzando a convertirse en un punto de venta del modelo de trabajo universal
Anthropic también destacó especialmente la capacidad de diseño visual de Sonnet 5.5. En la demostración oficial, Sonnet 5 y 5.5 crearon, cada uno en un solo archivo HTML, 400 estorninos volando en formación, dunas moldeadas por el viento y un reloj grande compuesto por 24 pequeñas campanas. El nuevo modelo genera con mayor velocidad y ofrece animaciones, capas e interfaces de mayor calidad.
También puede generar presentaciones según plantillas. En una prueba interna, Anthropic proporcionó a Sonnet 5.5 materiales de resultados trimestrales de una empresa cotizada, transcripciones de llamadas y una plantilla de diez diapositivas; dos expertos consideraron que la primera versión de Sonnet 5.5 podía enviarse directamente.
Estos siguen siendo casos de muestra seleccionados por el fabricante y no representan que el modelo pueda comprender de forma estable cada plantilla empresarial. La precisión de los datos en gráficos complejos, las normas de marca y las fuentes citadas aún requieren verificación manual, pero reflejan una nueva dirección en la competencia de modelos: no solo generar contenido correcto, sino también entregar interfaces y documentos lo más cercanos posible a productos finales.
El aumento de las capacidades de seguridad también significa que algunas solicitudes serán asumidas por modelos antiguos.
Sonnet 5.5 es el primer modelo Sonnet en lanzarse con protección de seguridad de red de gama alta. Anthropic indica que su capacidad de seguridad de red está cerca de la de Opus 5, por lo que las reparaciones de vulnerabilidades comunes aún pueden realizarse normalmente, pero las solicitudes de seguridad de red de mayor riesgo se transfieren transparentemente a Sonnet 5.
La empresa también probó comportamientos como engañar a los usuarios, actuar en contra de sus intereses, facilitar abusos de alto riesgo y traspasar límites ambientales en aproximadamente 1850 escenarios. La empresa afirma que el nuevo modelo empatiza o supera a Sonnet 5 en la mayoría de las métricas y es el modelo Claude que menos intenta probar activamente los límites del contenedor.
Sin embargo, estos son principalmente evaluaciones automatizadas internas de Anthropic y no pueden considerarse una prueba completa de los riesgos en entornos reales. La propia empresa reconoce que ningún conjunto de pruebas puede detectar todos los modos de fallo.
Sonnet 5.5 es el primer Sonnet en incorporar un clasificador antiderivación y ampliar el mecanismo de "mantener el contexto de razonamiento" para evitar la transferencia de contexto de inferencia entre cuentas. Tiene un impacto limitado para desarrolladores comunes, pero algunos flujos de trabajo que migran conversaciones de Claude Code entre cuentas necesitan ajustes.
El verdadero cambio no es estar en el primer lugar del ranking, sino que los modelos "suficientemente potentes" comienzan a convertirse en la opción predeterminada
Sonnet 5.5 no ha revelado una nueva arquitectura de modelo ni superado integralmente a Opus. Su mayor importancia radica en trasladar gran parte del trabajo que antes requería modelos de gama alta a modelos de gama media, más rápidos y con un precio por token reducido a la mitad.
Para sistemas que ejecutan miles de veces al día, como atención al cliente, revisión de código, investigación de documentos y producción de documentación, la decisión de implementación generalmente no se basa en la puntuación más alta individual, sino en cuántos pasos requiere cada tarea, cuántos tokens se necesitan, cuánto tiempo se espera y si los errores pueden ser escalados. El valor de Sonnet 5.5 se centra precisamente en estas métricas.
