OpenAI reduz os preços da API do GPT-5.6 Luna e Terra e introduz o modo Sol mais rápido

icon MarsBit
Compartilhar
AI summary iconResumo
A OpenAI reduziu os custos da API GPT-5.6 Luna e Terra, com as taxas de entrada e saída da Luna diminuídas em 80% cada uma e a da Terra reduzida em 20%. O modelo Sol agora oferece um modo Rápido 2,5x mais rápido ao mesmo preço. Ganhos de eficiência do Sol, incluindo decodificação especulativa e melhorias no Kernel da GPU, ajudam a reduzir os custos. À medida que as tendências do índice de medo e ganância mostram crescente confiança no mercado, essas reduções podem impulsionar o uso de agentes de IA e impactar a dinâmica dos preços de criptomoedas no trading de alta frequência.

Agente

O modelo de entrada da Luna está com desconto massivo: o preço de entrada por milhão de tokens caiu de US$ 1 para US$ 0,2, e o preço de saída caiu de US$ 6 para US$ 1,2.

Convertido para yuan chinês, o preço de entrada caiu de aproximadamente 6,8 yuan para 1,35 yuan, e o preço de saída caiu de aproximadamente 40,6 yuan para 8,1 yuan.

O Terra, também considerado o principal ativo para tarefas diárias, sofreu uma redução de 20%, com os preços de entrada e saída caindo para US$ 2 e US$ 12, respectivamente.

Convertidos para yuan chinês, são aproximadamente 13,5 yuan e 81,2 yuan.

Apenas o modelo旗舰 Sol mantém seu preço original, mas agora oferece o modo Fast, com velocidade até 2,5 vezes maior que o modo padrão, sem aumento de preço.

Agente

Depois da redefinição drástica do uso do Codex, o降价 também foi imediatamente implementado — OpenAI, você está tentando competir até a morte com quem…

Esta guerra de preços chegou diretamente ao ponto de ebulição.

OpenAI afirmou que a redução de preços ocorreu porque o GPT-5.6 Sol ajudou a si mesmo a economizar dinheiro.

GPT-5.6 Sol participa de sua própria melhoria, alcançando um aumento exponencial na eficiência, e por isso recompensamos usuários novos e antigos~

Essa técnica de pisar com o pé esquerdo no direito e levitar no lugar, OpenAI, você também entrou nisso

Agente

.

Dois com desconto, um acelerado

Atualmente, os preços da API para os três modelos do GPT-5.6 são:

GPT-5.6 Luna: entrada de US$ 0,2 por milhão de tokens, saída de US$ 1,2;

GPT-5.6 Terra: US$2 por milhão de tokens de entrada, US$12 por milhão de tokens de saída;

GPT-5.6 Sol: US$5 por milhão de tokens de entrada, US$30 por milhão de tokens de saída.

Agente

Após a redução de preço, a Luna sofreu uma queda brusca.

Seu preço de entrada já está alinhado com o da geração anterior GPT-5.4 nano, e o preço de saída é até 0,05 dólares mais barato.

Mas os dois modelos não realizam exatamente as mesmas tarefas; o GPT-5.4 nano é principalmente voltado para tarefas simples e frequentes, como classificação, extração de informações e classificação.

GPT-5.6 Luna é posicionado pela OpenAI como um modelo voltado para cargas de trabalho sensíveis a custos, capaz de invocar ferramentas, processar contextos longos e executar fluxos de trabalho em várias etapas.

Em resumo, a OpenAI está vendendo os modelos que sustentam os Agentes ao preço antigo dos pequenos modelos simples.

Terra está relativamente contido, com queda de 20%.

Sol mantém o preço original, adicionou o modo rápido, com velocidade até 2,5 vezes maior que o modo padrão, ao custo de duas vezes o preço do modo padrão, mantendo o mesmo nível de inteligência do modelo.

Ele também substituirá o Processamento Prioritário anterior. As solicitações de API que anteriormente usavam a tag priority serão automaticamente migradas para o modo Fast.

A oficialidade afirmou que este ajuste também entrará no Codex e no ChatGPT Work.

O preço da assinatura não será reduzido e o total de quota dos usuários também não aumentará, mas o consumo de quota ao chamar Terra e Luna será reduzido correspondentemente.

Com a mesma taxa de assinatura, o modelo pode realizar mais tarefas.

A OpenAI também trocou o modelo de autoavaliação no ChatGPT e no Codex CLI de GPT-5.4 para GPT-5.6 Luna.

Auto-review é responsável por verificar automaticamente código e resultados de modificação em segundo plano, sendo uma tarefa típica de agente de alta frequência.

Combinando a atualização do modelo e a redução de preço da Luna, a OpenAI espera reduzir seus custos para cerca de um décimo do valor original.

Modelos baratos já não se limitam mais a tarefas tradicionais como classificação e extração, mas estão começando a entrar em etapas que exigem julgamento e chamadas de ferramentas, como revisão de código e monitoramento de back-end.

Atualmente, a posição dos três modelos é:

Tarefas sensíveis ao orçamento e com alto volume de chamadas atribuídas à Luna;

Terra cuida das tarefas diárias comuns;

Continue usando Sol para tarefas de alta dificuldade;

Se até esperar parecer lento, pague o dobro para comprar velocidade.

GPT-5.6 começa a participar na redução de seus próprios custos

Por que o preço caiu subitamente?

A OpenAI afirmou que a razão é que o GPT-5.6 Sol participou da otimização do próprio sistema de produção.

A eficiência que ela aumentou foi transformada em números de desconto na tabela de preços.

Especificamente, o GPT-5.6 Sol reescreveu e otimizou alguns kernels GPU de produção, projetou e executou centenas de experimentos de geração de tokens e participou do monitoramento do treinamento, intervindo quando problemas ocorreram.

Os resultados finais também foram notáveis: otimização do kernel GPU reduziu o custo do serviço end-to-end do GPT-5.6 em 20%; melhoria na decodificação especulativa aumentou a eficiência de geração de tokens em mais de 15%.

Agente

O GPU Kernel pode ser entendido como o programa de baixo nível que executa tarefas de cálculo específicas do modelo na GPU.

O modelo em si não precisa mudar; apenas se esses programas forem escritos de forma mais eficiente, a mesma GPU poderá concluir os cálculos mais rapidamente, processar mais solicitações e reduzir o custo por chamada.

A decodificação por inferência consiste em, durante a geração da resposta, prever em lote os próximos tokens possíveis e depois submetê-los ao modelo principal para verificação. Quanto mais precisas forem as previsões, menos etapas individuais de geração e espera serão necessárias.

Ambas as otimizações não reduziram a capacidade do modelo, mas permitiram que o mesmo modelo operasse mais rápido e com menor custo.

No entanto, isso ainda não é uma atualização autônoma completa do GPT-5.6.

OpenAI enfatizou especificamente que todo o processo ainda é liderado por humanos.

O modelo pode escrever código, executar experimentos e monitorar anomalias, mas a definição dos objetivos, a utilidade dos resultados e se o código será implantado em produção ainda exigem a presença de um humano no ciclo.

OMT

Por fim, há mais uma nova alteração.

Este redução tem um ponto específico de aplicação: o fluxo de trabalho do Agente.

O Luna com o maior desconto não é apenas um pequeno modelo tradicional usado para classificação e extração.

De acordo com a posição da OpenAI, ele pode chamar ferramentas e executar tarefas em várias etapas, voltado principalmente para cargas de trabalho de alta frequência e sensíveis a custos.

Portanto, a queda de 80% da Luna também reduz a barreira para a operação de longo prazo do Agente.

Permita que tarefas de revisão, verificação e monitoramento, anteriormente inviáveis devido ao alto custo, se tornem etapas regulares no fluxo de trabalho.

Ao combinar novamente com o GPT-5.6 para otimizar seu próprio sistema de produção, um novo ciclo surgiu:

A participação do modelo aumenta a eficiência operacional e reduz os custos; após a redução de preços, o modelo é incorporado a mais fluxos de trabalho de alta frequência; o aumento do volume de chamadas impulsiona a próxima rodada de otimização de eficiência.

A roda de redução de preços da OpenAI já está tomando forma.

Após toda essa sequência de ações, a pressão agora recai diretamente sobre a Empresa A:

É a sua vez.

Agente

Links de referência: [1] https://x.com/OpenAI/status/2082878156483219672 [2] https://x.com/sama/status/2082880720989532597

Este artigo é do número de assinantes do WeChat "Quantum Bit", autor: focado em tecnologias de ponta

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.