
O modelo de entrada da Luna está com desconto massivo: o preço de entrada por milhão de tokens caiu de US$ 1 para US$ 0,2, e o preço de saída caiu de US$ 6 para US$ 1,2.
Convertido para yuan chinês, o preço de entrada caiu de aproximadamente 6,8 yuan para 1,35 yuan, e o preço de saída caiu de aproximadamente 40,6 yuan para 8,1 yuan.
O Terra, também considerado o principal ativo para tarefas diárias, sofreu uma redução de 20%, com os preços de entrada e saída caindo para US$ 2 e US$ 12, respectivamente.
Convertidos para yuan chinês, são aproximadamente 13,5 yuan e 81,2 yuan.
Apenas o modelo旗舰 Sol mantém seu preço original, mas agora oferece o modo Fast, com velocidade até 2,5 vezes maior que o modo padrão, sem aumento de preço.

Depois da redefinição drástica do uso do Codex, o降价 também foi imediatamente implementado — OpenAI, você está tentando competir até a morte com quem…
Esta guerra de preços chegou diretamente ao ponto de ebulição.
OpenAI afirmou que a redução de preços ocorreu porque o GPT-5.6 Sol ajudou a si mesmo a economizar dinheiro.
GPT-5.6 Sol participa de sua própria melhoria, alcançando um aumento exponencial na eficiência, e por isso recompensamos usuários novos e antigos~
Essa técnica de pisar com o pé esquerdo no direito e levitar no lugar, OpenAI, você também entrou nisso

.
Dois com desconto, um acelerado
Atualmente, os preços da API para os três modelos do GPT-5.6 são:
GPT-5.6 Luna: entrada de US$ 0,2 por milhão de tokens, saída de US$ 1,2;
GPT-5.6 Terra: US$2 por milhão de tokens de entrada, US$12 por milhão de tokens de saída;
GPT-5.6 Sol: US$5 por milhão de tokens de entrada, US$30 por milhão de tokens de saída.

Após a redução de preço, a Luna sofreu uma queda brusca.
Seu preço de entrada já está alinhado com o da geração anterior GPT-5.4 nano, e o preço de saída é até 0,05 dólares mais barato.
Mas os dois modelos não realizam exatamente as mesmas tarefas; o GPT-5.4 nano é principalmente voltado para tarefas simples e frequentes, como classificação, extração de informações e classificação.
GPT-5.6 Luna é posicionado pela OpenAI como um modelo voltado para cargas de trabalho sensíveis a custos, capaz de invocar ferramentas, processar contextos longos e executar fluxos de trabalho em várias etapas.
Em resumo, a OpenAI está vendendo os modelos que sustentam os Agentes ao preço antigo dos pequenos modelos simples.
Terra está relativamente contido, com queda de 20%.
Sol mantém o preço original, adicionou o modo rápido, com velocidade até 2,5 vezes maior que o modo padrão, ao custo de duas vezes o preço do modo padrão, mantendo o mesmo nível de inteligência do modelo.
Ele também substituirá o Processamento Prioritário anterior. As solicitações de API que anteriormente usavam a tag priority serão automaticamente migradas para o modo Fast.
A oficialidade afirmou que este ajuste também entrará no Codex e no ChatGPT Work.
O preço da assinatura não será reduzido e o total de quota dos usuários também não aumentará, mas o consumo de quota ao chamar Terra e Luna será reduzido correspondentemente.
Com a mesma taxa de assinatura, o modelo pode realizar mais tarefas.
A OpenAI também trocou o modelo de autoavaliação no ChatGPT e no Codex CLI de GPT-5.4 para GPT-5.6 Luna.
Auto-review é responsável por verificar automaticamente código e resultados de modificação em segundo plano, sendo uma tarefa típica de agente de alta frequência.
Combinando a atualização do modelo e a redução de preço da Luna, a OpenAI espera reduzir seus custos para cerca de um décimo do valor original.
Modelos baratos já não se limitam mais a tarefas tradicionais como classificação e extração, mas estão começando a entrar em etapas que exigem julgamento e chamadas de ferramentas, como revisão de código e monitoramento de back-end.
Atualmente, a posição dos três modelos é:
Tarefas sensíveis ao orçamento e com alto volume de chamadas atribuídas à Luna;
Terra cuida das tarefas diárias comuns;
Continue usando Sol para tarefas de alta dificuldade;
Se até esperar parecer lento, pague o dobro para comprar velocidade.
GPT-5.6 começa a participar na redução de seus próprios custos
Por que o preço caiu subitamente?
A OpenAI afirmou que a razão é que o GPT-5.6 Sol participou da otimização do próprio sistema de produção.
A eficiência que ela aumentou foi transformada em números de desconto na tabela de preços.
Especificamente, o GPT-5.6 Sol reescreveu e otimizou alguns kernels GPU de produção, projetou e executou centenas de experimentos de geração de tokens e participou do monitoramento do treinamento, intervindo quando problemas ocorreram.
Os resultados finais também foram notáveis: otimização do kernel GPU reduziu o custo do serviço end-to-end do GPT-5.6 em 20%; melhoria na decodificação especulativa aumentou a eficiência de geração de tokens em mais de 15%.

O GPU Kernel pode ser entendido como o programa de baixo nível que executa tarefas de cálculo específicas do modelo na GPU.
O modelo em si não precisa mudar; apenas se esses programas forem escritos de forma mais eficiente, a mesma GPU poderá concluir os cálculos mais rapidamente, processar mais solicitações e reduzir o custo por chamada.
A decodificação por inferência consiste em, durante a geração da resposta, prever em lote os próximos tokens possíveis e depois submetê-los ao modelo principal para verificação. Quanto mais precisas forem as previsões, menos etapas individuais de geração e espera serão necessárias.
Ambas as otimizações não reduziram a capacidade do modelo, mas permitiram que o mesmo modelo operasse mais rápido e com menor custo.
No entanto, isso ainda não é uma atualização autônoma completa do GPT-5.6.
OpenAI enfatizou especificamente que todo o processo ainda é liderado por humanos.
O modelo pode escrever código, executar experimentos e monitorar anomalias, mas a definição dos objetivos, a utilidade dos resultados e se o código será implantado em produção ainda exigem a presença de um humano no ciclo.
OMT
Por fim, há mais uma nova alteração.
Este redução tem um ponto específico de aplicação: o fluxo de trabalho do Agente.
O Luna com o maior desconto não é apenas um pequeno modelo tradicional usado para classificação e extração.
De acordo com a posição da OpenAI, ele pode chamar ferramentas e executar tarefas em várias etapas, voltado principalmente para cargas de trabalho de alta frequência e sensíveis a custos.
Portanto, a queda de 80% da Luna também reduz a barreira para a operação de longo prazo do Agente.
Permita que tarefas de revisão, verificação e monitoramento, anteriormente inviáveis devido ao alto custo, se tornem etapas regulares no fluxo de trabalho.
Ao combinar novamente com o GPT-5.6 para otimizar seu próprio sistema de produção, um novo ciclo surgiu:
A participação do modelo aumenta a eficiência operacional e reduz os custos; após a redução de preços, o modelo é incorporado a mais fluxos de trabalho de alta frequência; o aumento do volume de chamadas impulsiona a próxima rodada de otimização de eficiência.
A roda de redução de preços da OpenAI já está tomando forma.
Após toda essa sequência de ações, a pressão agora recai diretamente sobre a Empresa A:
É a sua vez.

Links de referência: [1] https://x.com/OpenAI/status/2082878156483219672 [2] https://x.com/sama/status/2082880720989532597
Este artigo é do número de assinantes do WeChat "Quantum Bit", autor: focado em tecnologias de ponta
