GPT-5.6 reduce los costos de las tareas en un 82% en AWS Kiro a pesar de una caída del 20% en el precio

icon MarsBit
Compartir
AI summary iconResumen
GPT-5.6 redujo los costos de la tarea Terra en un 82% en AWS Kiro, a pesar de una caída del 20% en el precio el 30 de julio. Los aumentos de eficiencia se debieron a menos intentos fallidos y menor uso de tokens. Los modelos GPT-5.6—Sol, Terra y Luna—se lanzaron en Kiro en julio. AWS y OpenAI optimizaron el entorno conjuntamente. Mientras el precio de las criptomonedas sigue siendo volátil, el índice de miedo y codicia muestra señales mixtas.

Mismo modelo, el precio oficial solo bajó un 20%, pero tu factura se redujo en un 80%.

Kiro

El 24 de agosto, OpenAI publicó los resultados de una prueba realizada junto con AWS:

En Terminal-Bench 2.1, el costo de completar una tarea exitosa con GPT-5.6 Terra en Kiro se redujo aproximadamente un 82%.

Kiro es la plataforma de agentes de desarrollo de software de AWS, que cubre IDE, CLI y Web.

Los tres hermanos Sol, Terra y Luna de la familia GPT-5.6 llevan más de un mes corriendo dentro.

Este 82% no es un descuento oficial.

The last adjustment for Terra was on July 30, at a magnitude of 20%.

Kiro

Anuncio de ajuste de precios de OpenAI del 30 de julio, Terra reduce un 20%.

El precio solo baja un 20%, pero la factura se reduce hasta un 80%.

Los sesenta puntos porcentuales que faltan en el medio son los que realmente merecen nuestra atención.

GPT-5.6 launched on Kiro in July this year.

Primero, el 13, AWS anunció que GPT-5.6 Sol, Terra y Luna ya están disponibles en Amazon Bedrock.

Al día siguiente, Kiro publicó una entrada en su blog anunciando el lanzamiento de tres modelos en IDE, CLI y Web.

Kiro

Esta es la primera vez que el modelo de OpenAI entra en Kiro, justo a tiempo para el primer aniversario de la previsualización pública de Kiro.

Primero coloca el modelo en el estante, luego llévalo a trabajar; más de un mes después, OpenAI regresa con la tarea:

Ambas partes trabajaron juntas para ajustar el entorno Kiro y los modelos de OpenAI, reduciendo el costo de completar una tarea exitosa por Terra en aproximadamente un 82%.

Ahorrado

Dinero perdido en caminos erróneos

En el ajuste del 30 de julio, Terra bajó un 20 %, pero en las pruebas de Kiro, el costo por tarea se redujo un 82 %.

¿De dónde provienen esos seis décimos ahorrados?

Las direcciones son solo estas:

El modelo genera menos tokens, realiza menos llamadas repetidas a las herramientas y tiene menos reintentos o desvíos tras fallos.

Entonces, el ahorro significativo no es por cada llamada, sino por las llamadas que de otro modo se habrían desperdiciado.

La razón es sencilla: un agente de IA comete un error una vez, y la factura sigue siendo cobrada. Si elige un camino incorrecto a mitad del camino, se desvía durante tres rondas y luego vuelve atrás, esos tokens también se cobran.

En el desarrollo real, el dinero a menudo se pierde de esta manera.

OpenAI también mencionó la misma lógica en su blog oficial: la eficiencia proviene de tres capas:

Marco de agentes que inician solicitudes y organizan el contexto, sistema de orquestación que coordina las solicitudes en el medio, y finalmente el modelo mismo que se ejecuta en la GPU.

Kiro

OpenAI desglosa las fuentes de eficiencia de GPT-5.6: desde la solicitud que parte del marco de agentes, pasando por la programación del sistema de orquestación, hasta el modelo que se ejecuta en la GPU, cada capa está optimizando.

Ahorrar dinero incluso hasta en la asignación de tareas del modelo.

OpenAI también mencionó un uso: el flujo de codificación puede primero usar Sol para clarificar el problema y establecer el plan, y luego cambiar a Luna para implementar los cambios ya definidos, escribir pruebas y ejecutar evaluaciones.

La misma línea de producción, con diferentes niveles de inteligencia en cada etapa.

El modelo solo representa la mitad de la factura.

Cambia el marco y cambia el precio

Este conjunto de preguntas de Terminal-Bench 2.1 no está diseñado para que el modelo responda por sí solo.

Lo pone en un entorno de terminal con un objetivo vago y le permite planificar su propio camino, llamar herramientas, escribir scripts, manejar errores y iterar repetidamente.

Entonces, el resultado obtenido es el resultado del conjunto «agente + modelo».

Kiro

Lista pública de Terminal-Bench 2.1, a la derecha de la precisión se agregó un nuevo elemento: costo. (Crédito de la imagen: Terminal-Bench)

Los cuatro números en la tabla lo explican mejor:

Claude Code con Fable 5, 83.8%, 552.67 dólares;

Codex con GPT-5.5, 83.1%, 2059.19 dólares;

Codex con GPT-5.6 Terra, 78.4%, 421.15 dólares;

Codex con GPT-5.6 Luna, 75.7%, 241.45 dólares.

Las dos primeras líneas difieren solo en 0.7 puntos porcentuales, pero la factura difiere casi cuatro veces.

El mismo modelo, insertado en diferentes marcos, con distintas organizaciones de contexto y estrategias de herramientas, produce resultados completamente diferentes.

Según los datos proporcionados por Kiro, Terra obtiene 77.4 puntos en el Coding Agent Index, apenas por encima de los 77.2 de Claude Fable 5.

Su ventaja no está en la puntuación, sino en el precio que corresponde a esa puntuación.

El enfoque de Kiro basado en especificaciones también está aquí: la mecánica central es simplemente: no escribas código desde el principio.

Primero descompone el objetivo vago del usuario en un documento de requisitos formal, un diseño técnico y una lista de tareas ejecutables, y luego lo entrega al modelo.

De esta manera, el modelo no recibe una frase ambigua, sino una tarea claramente definida.

Quienes conozcan a Agent inmediatamente reconocerán que este paso elimina el gasto más costoso.

Los tokens quemados por modelos desviados, retrabajos y reinicios completos suelen ser mayores que los utilizados para el trabajo real.

Kiro aún dejó dos barreras en el proceso: detenerse antes de modificar el código para que alguien lo revise; y ejecutar automáticamente una prueba tras completar el trabajo para verificar si está correcto.

Cada rework detenido por estas dos barreras puede ahorrar dinero real.

Claude en el territorio de Amazon

GPT se llevó la mitad

Hace un año, Kiro era solo un IDE impulsado por especificaciones, y el selector de modelos era el terreno de Anthropic.

Un año después, AWS incorporó de golpe tres modelos de OpenAI en su propia plataforma de agentes inteligentes.

Sol, Terra, Luna y Claude aparecen en el mismo menú desplegable, algo que sería difícil imaginar hace un año.

Aunque GPT-5.6 esta vez es «toda la familia instalada», no está «abierta por completo».

Los tres modelos se lanzan de forma progresiva y experimental para usuarios Pro, Pro+, Pro Max y Power, con solo dos regiones: Northern Virginia en Estados Unidos y Fráncfort en Europa, con soporte para inferencia cruzada entre regiones.

También hay una que mucha gente encuentra difícil de adaptar: estos modelos en Kiro utilizan una cadena de pensamiento oculta; no puedes ver sus pasos de razonamiento, solo el resultado final.

Quienes están acostumbrados a ver al agente razonar paso a paso, sienten que están lanzando una tarea dentro de una caja opaca.

Según la versión oficial, este es un comportamiento esperado y no afecta la calidad de la salida.

Los tres modelos están claramente etiquetados en Kiro.

Cuando se lanzó el 14 de julio, para la misma tarea, Sol se descontaba 2.4 veces, Terra 1.2 veces y Luna 0.6 veces.

El 30 de julio, tras la reducción de OpenAI, Kiro siguió al día siguiente: Luna se redujo de 0.6x a 0.1x, Terra pasó de 1.2x a 1.0x, y Sol permaneció sin cambios.

Kiro

La actitud de AWS está claramente expuesta: una plataforma de desarrollo no puede estar vinculada solo a un modelo.

En el mismo selector, dos modelos avanzados comenzaron a competir en precios.

Los criterios de evaluación del modelo también han cambiado: una puntuación alta ya no implica automáticamente la victoria; gastar menos también puede llevar a la victoria.

Para los desarrolladores, antes se preguntaba: «¿Cuánto cuesta este modelo por millón de tokens?», ahora hay que preguntar: «¿Cuánto tendré que gastar para que haga este trabajo?»

Referencias:

https://x.com/OpenAIDevs/status/2091966982015103068

https://openai.com/index/gpt-5-6-in-kiro/

Este artículo proviene del canal de WeChat "Nueva Inteligencia" (ID: AI_era), autor: ASI Revelación, editor: Yuan Yu

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.