
El modelo de entrada de Luna se reduce drásticamente: el precio de entrada por millón de tokens baja de 1 dólar a 0,2 dólares, y el precio de salida baja de 6 dólares a 1,2 dólares.
Convertido a yuanes chinos, el precio de entrada disminuyó de aproximadamente 6.8 yuanes a 1.35 yuanes, y el precio de salida disminuyó de aproximadamente 40.6 yuanes a 8.1 yuanes.
Terra, también ubicada como "principal trabajador diario", ha bajado un 20%, con los precios de entrada y salida reducidos a 2 dólares y 12 dólares, respectivamente.
Converted to CNY, they are approximately RMB 13.5 and RMB 81.2.
Solo el modelo insignia Sol mantiene su precio original, pero se lanzó el modo Fast, que alcanza hasta 2.5 veces la velocidad del modo estándar, con aceleración sin costo adicional.

Después de que Codex reiniciara masivamente el uso, también se aplicó inmediatamente una reducción de precios, OpenAI, ¿a quién pretendes eliminar con esta competencia…?
This price war has directly intensified.
OpenAI indica que la reducción de precios se debe a que GPT-5.6 Sol se ayudó a sí mismo a ahorrar dinero.
GPT-5.6 Sol participa en su propia mejora, logrando un aumento exponencial en la eficiencia, por lo que recompensamos a los usuarios nuevos y existentes~
Este truco de pisar con el pie izquierdo el derecho y elevarse en el mismo lugar, también lo estás usando, OpenAI

.
Dos con descuento, uno acelerado
Ahora, los precios de la API de los tres modelos de GPT-5.6 son:
GPT-5.6 Luna: $0.2 por millón de tokens de entrada, $1.2 por millón de tokens de salida;
GPT-5.6 Terra: $2 por millón de tokens de entrada, $12 por millón de tokens de salida;
GPT-5.6 Sol: $5 por millón de tokens de entrada, $30 por millón de tokens de salida.

Después de la reducción de precios, Luna experimentó un fuerte colapso.
Su precio de entrada ya es igual al de la generación anterior GPT-5.4 nano, y el precio de salida es incluso 0.05 dólares más barato.
Pero los dos modelos no realizan exactamente las mismas tareas; GPT-5.4 nano está principalmente orientado a tareas simples y frecuentes como clasificación, extracción de información y ordenamiento.
GPT-5.6 Luna es posicionado por OpenAI como un modelo diseñado para cargas de trabajo sensibles a costos, capaz de invocar herramientas, procesar contextos largos y ejecutar flujos de trabajo de múltiples pasos.
En resumen, OpenAI está vendiendo los modelos que respaldan a los Agentes al precio anterior de los modelos pequeños y simples.
Terra se mantiene relativamente contenido, con una caída del 20%.
Sol mantiene su precio original, se añadió el modo rápido, con una velocidad hasta 2.5 veces mayor que el modo estándar, y un precio equivalente al doble del modo estándar, manteniendo el mismo nivel de inteligencia del modelo.
También reemplazará el Procesamiento Prioritario anterior. Las solicitudes de API que anteriormente usaban la etiqueta priority se cambiarán automáticamente al modo Fast.
La oficina indica que este ajuste también llegará a Codex y ChatGPT Work.
El precio de suscripción no se reducirá, ni se aumentará el total de cuotas del usuario, pero al llamar a Terra y Luna, el consumo de cuotas se reducirá en consecuencia.
Con la misma tarifa de suscripción, el modelo puede realizar más tareas.
OpenAI también cambió automáticamente el modelo de revisión automática en ChatGPT y Codex CLI de GPT-5.4 a GPT-5.6 Luna.
Auto-review se encarga de revisar automáticamente el código y los resultados en segundo plano, lo que constituye una tarea típica de Agent de alta frecuencia.
Combinando la actualización del modelo y la caída de Luna, OpenAI espera que sus costos se reduzcan a aproximadamente una décima parte.
Los modelos económicos ya no solo se encargan de tareas tradicionales como clasificación y extracción, sino que también comienzan a participar en etapas que requieren juicio y llamadas a herramientas, como revisiones de código y monitoreo de backend.
Actualmente, la posición de los tres modelos es:
Asigne tareas sensibles al presupuesto y de alto volumen a Luna;
Las tareas diarias normales se delegan a Terra;
Continúe utilizando Sol para tareas de alta dificultad;
Si incluso esperar te parece lento, gasta el doble para comprar velocidad.
GPT-5.6 comienza a participar en la reducción de sus propios costos
¿Por qué la reducción repentina de precios?
OpenAI indica que la razón es que GPT-5.6 Sol participó en la optimización de su propio sistema de producción.
La eficiencia que mejora se traduce en números de descuento en la tabla de precios.
Específicamente, GPT-5.6 Sol reescribió y optimizó algunos kernels de GPU de producción, diseñó y ejecutó cientos de experimentos de generación de tokens, y participó en la supervisión del entrenamiento, interviniendo cuando surgieron problemas.
Los resultados finales también fueron destacados: optimización del kernel GPU que redujo el costo del servicio end-to-end de GPT-5.6 en un 20%; mejora en la decodificación especulativa que aumentó la eficiencia de generación de tokens en más del 15%.

El GPU Kernel puede entenderse como el programa subyacente que ejecuta tareas de cálculo específicas en la GPU.
El modelo en sí no cambia; solo con programas más eficientes, la misma GPU puede completar los cálculos más rápido, procesar más solicitudes y reducir el costo por llamada.
La decodificación por inferencia consiste en generar por lotes una serie de «suposiciones» sobre los próximos tokens posibles antes de enviarlas al modelo principal para su validación. Cuanto más precisas sean las suposiciones, menos pasos individuales serán necesarios generar y esperar.
Ambas optimizaciones no reducen la capacidad del modelo, pero permiten que el mismo modelo funcione más rápido y a menor costo.
Sin embargo, esto aún no es una actualización completamente autónoma de GPT-5.6.
OpenAI enfatizó específicamente que todo el proceso sigue siendo liderado por humanos.
El modelo puede escribir código, ejecutar experimentos y monitorear anomalías, pero definir los objetivos, determinar si los resultados son utilizables y si el código pasa a entorno de producción sigue requiriendo «Human in the Loop».
OMT
Por último, hay un nuevo cambio.
Esta reducción de precios tiene un punto específico: el flujo de trabajo de Agent.
El Luna con el descuento más fuerte no es solo un pequeño modelo tradicional para clasificación y extracción.
Según la posición de OpenAI, puede invocar herramientas y ejecutar tareas de múltiples pasos, dirigidas principalmente a cargas de trabajo de alta frecuencia y sensibles a costos.
Por lo tanto, la caída del 80% de Luna también reduce el umbral para el funcionamiento a largo plazo del Agente.
Permite que las tareas de revisión, validación y monitoreo, que antes eran demasiado costosas para ejecutarse con frecuencia, se conviertan en pasos regulares dentro del flujo de trabajo.
Al combinar nuevamente a GPT-5.6 para optimizar su propio sistema de producción, surge un nuevo ciclo:
La participación del modelo mejora la eficiencia operativa y reduce los costos; tras la reducción de precios, el modelo se integra en más flujos de trabajo de alta frecuencia; el aumento en la escala de llamadas impulsa la siguiente ronda de optimización de eficiencia.
El ciclo de reducción de precios de OpenAI ya ha comenzado a tomar forma.
Después de toda esta operación, la presión ahora recae directamente sobre la empresa A:
Es tu turno.

Enlaces de referencia: [1] https://x.com/OpenAI/status/2082878156483219672 [2] https://x.com/sama/status/2082880720989532597
Este artículo proviene del canal de WeChat "Quantum Bit", autor: Seguir la tecnología de vanguardia
