
Se ainda houver alguém gastando o maior valor para chamar o modelo mais poderoso da OpenAI hoje.
A OpenAI sugeriria, em vez disso, que ele trocasse.
Em 30 de julho, a OpenAI divulgou um aviso de ajuste de preços.
O modelo GPT-5.6Luna teve seu preço reduzido em 80%, e o modelo Terra teve seu preço reduzido em 20%.
Ao ver esta mensagem, é fácil focar na guerra de preços que começou na Silicon Valley.
No entanto, após revisar cuidadosamente a documentação técnica e o guia de chamada de API divulgados oficialmente, percebe-se que os verdadeiros movimentos dignos de atenção não estão nos próprios números de preço.
Essencialmente, é a primeira vez que a OpenAI começa a dizer aos usuários que muitas tarefas na verdade não precisam do modelo mais poderoso.
A equipe oficial forneceu uma recomendação muito específica. Para uma tarefa complexa, primeiro use o GPT-5.6Sol para análise de requisitos e design da solução, depois entregue à Luna para execução, codificação e execução de testes.
O modelo mais caro é responsável por pensar, enquanto o mais barato é responsável por executar as tarefas. Essa estratégia, há dois anos, equivaleria a uma autonegação comercial.
Sabe-se que, no passado, toda a indústria de IA estava se esforçando para convencer o mercado de que seus modelos eram os mais inteligentes.
Hoje, a OpenAI afirmou que não é sempre necessário comprar o mais caro.
This matter is much more important than a price reduction.
I. A sintonia dos dois gigantes da Vale do Silício
Primeiro, veja o que aconteceu nas últimas duas semanas.
Em 30 de julho, a OpenAI ajustou os preços. Luna teve redução de 80%. Terra teve redução de 20%. Sol não reduziu o preço, mas adicionou o modo Rápido, que pode ser até 2,5 vezes mais rápido que o modo padrão, com preço dobrado, mas nível de inteligência idêntico.
Os modelos de topo continuam sendo mantidos. O que realmente começou a ganhar volume são os modelos de médio e baixo custo.
Uma semana antes.
Em 24 de julho, a Anthropic fez algo quase idêntico. O Claude Opus 5 foi lançado, com entrada de um milhão de tokens por US$ 5 e saída por US$ 25 — exatamente metade do preço do Fable 5.
Em vez de destacar a ruptura de desempenho, a Anthropic enfatiza externamente sua economia: com apenas metade do preço, é possível obter capacidades de raciocínio de ponta quase idênticas às do Fable 5.
Há apenas um mês, o Fable 5 era o flagship enfatizado pela Anthropic: o melhor raciocínio, o maior contexto e o preço mais alto. Mas um mês depois, a Anthropic lançou pessoalmente um substituto para o flagship com metade do preço.
Se apenas uma empresa fizesse isso, poderia ser entendida como um ajuste de produto. Duas quase ao mesmo tempo não é coincidência.
Eles todos começaram a reduzir ativamente a importância dos modelos principais.
Dois: A equipe principal gerencia o palco, enquanto a equipe de volume gera lucro
Eu continuei pensando por que exatamente agora.
A resposta na verdade não é complicada.
O maior valor dos modelos de ponta anteriores não era ganhar dinheiro, mas provar a liderança tecnológica. Após o lançamento do GPT-4, a avaliação da OpenAI subiu continuamente. A cada atualização, a Anthropic redefine sua posição tecnológica. Os modelos de ponta assumem o valor da marca.
Mas o lugar onde as empresas realmente gastam dinheiro não é aqui.
Uma empresa executa milhões de chamadas de API por dia. Tarefas de alta frequência, como atendimento ao cliente, busca, aprovação, geração de código e execução de Agentes, consomem a maior parte dos tokens. O que as empresas mais se importam ao comprar não é o desempenho no benchmark, mas o custo por tarefa, a estabilidade e o retorno sobre o investimento.
Quando a escala de chamadas aumenta para dezenas de milhões por dia, a leve vantagem inteligente dos modelos de topo é imediatamente anulada pelos custos enormes de computação.
As ações e declarações da OpenAI marcam uma virada: os principais modelos de ponta não são mais responsáveis por gerar receita.
III. A IA começa a entrar na era dos "veículos populares"
Essa cena, a indústria automobilística já passou por ela.
Vinte anos atrás, a série 7 definia o nível da BMW, a classe S estabelecia o tom de luxo da Mercedes-Benz e o A8 consolidava a imagem de topo da Audi — os modelos de topo determinam o limite da marca. Contudo, a base que realmente impulsiona as vendas e gera lucro continua sendo a BMW Série 3, a Mercedes-Benz Classe C e a Audi A4.
Depois ficou mais claro. O Model S provou que a Tesla conseguia fabricar carros. O que realmente a tornou uma montadora global foi o Model 3 e o Model Y.
O modelo旗舰 é responsável por demonstrar capacidade, enquanto os modelos populares são responsáveis pela escala.
A IA também começou a entrar nessa fase hoje. Sol e Fable continuarão existindo, responsáveis por empurrar os limites tecnológicos e atualizar os benchmarks. Aquelas que realmente assumirão a comercialização se tornarão cada vez mais Luna, Terra e Opus.
Nesta vez, a OpenAI até escreveu publicamente o fluxo recomendado, com Sol responsável pelo planejamento e Luna pela execução.
Isso já não é apenas um modelo; a OpenAI está projetando um sistema de divisão de modelos. No futuro, as empresas não comprarão um único modelo, mas sim um conjunto completo de modelos. O que realmente determina o custo não é o arquiteto-chefe, mas a equipe de construção que trabalha todos os dias.
Quatro: O modelo começa a otimizar o modelo
Há ainda um detalhe que acho mais interessante do que o próprio corte de preço.
A OpenAI mencionou na documentação técnica que este redução de preço não é apenas devido à aquisição de mais GPUs nem ao aumento da escala. A verdadeira razão é que o modelo começou a participar na otimização do modelo.
Especificamente, sob a liderança de engenheiros humanos, o Sol reescreveu e otimizou autonomamente o núcleo de produção subjacente. Ele próprio projetou centenas de experimentos para aumentar a eficiência da geração de tokens e até participou do monitoramento do processo de treinamento do modelo, intervindo diretamente ao identificar problemas.
Como resultado, o custo operacional end-to-end diminuiu 20% e a eficiência de geração de tokens aumentou 15%.
Esta mensagem pode ser facilmente ignorada, mas representa um grande significado.
No passado, aumentar a eficiência dependia dos engenheiros. Após o modelo ir ao ar, a pessoa um Clique aqui Otimizar o framework de inferência, CUDA, estratégias de cache e algoritmos de agendamento. Ao longo de um ano, conseguir ganhos de eficiência de vários pontos percentuais já é bom.
A evolução tecnológica agora segue um novo caminho. Os modelos começaram a assumir a otimização de engenharia do código subjacente e do agendamento de poder computacional, operando e iterando 24/7.
Este é um ciclo que acelera continuamente. Quanto mais inteligente o modelo, maior sua capacidade de participar da otimização. Quanto mais rápida a otimização, mais rápido o custo diminui. Quanto menor o custo, maior o volume de chamadas. Quanto maior o volume de chamadas, mais dados são gerados para continuar treinando o modelo.
Analisando as mudanças de preço da OpenAI nos últimos dois anos e meio. O GPT-4 foi lançado com entrada de 30 dólares por milhão de tokens, o GPT-4o caiu para 5 dólares, e o GPT-4o mini chegou a 0,15 dólar. Hoje, o Luna está precificado próximo à faixa barata do mini de antigamente, mas seu nível geral de inteligência já supera em muito o caro GPT-4 de dois anos atrás.
Mais de dois anos, o preço caiu quase duas ordens de grandeza. Se o modelo continuar participando da otimização de si mesmo, é muito provável que essa curva continue a descer.
O verdadeiramente aterrador não é o preço ter caído 80% hoje, mas sim o fato de o custo ter começado a adquirir capacidade de autossustentação.
V. De quem é o mais inteligente para quem é o mais digno
Cada vez mais acho que, quando as pessoas discutem a competição em IA hoje, às vezes ainda aplicam o framework da fase anterior.
Por exemplo, frequentemente ainda perguntam: quem é o mais inteligente? GPT, Claude, Gemini, DeepSeek Ao lançar um novo modelo, a mídia imediatamente olha para a classificação. Quem está em primeiro lugar, vence.
No entanto, as novas ações da OpenAI e da Anthropic quebraram essa tendência, transmitindo ao mercado um novo sinal: a atratividade do campeão em desempenho individual está diminuindo.
A OpenAI mencionou em seu anúncio uma frase que acho particularmente crucial: ela sugere que os desenvolvedores correspondam diferentes modelos com base na importância da tarefa, no custo de erros, na urgência e na escala.
Observe que o que está sendo discutido já não é o modelo, mas a tarefa.
No passado, uma empresa implementava IA e, na maioria das vezes, tinha apenas uma opção. A partir de hoje, é mais como construir uma organização. As tarefas mais importantes são atribuídas ao Sol, as execuções cotidianas vão para a Luna, e futuramente pode haver modelos ainda mais leves responsáveis por tarefas mais simples.
Isso é muito parecido com o que aconteceu com a computação em nuvem. Ninguém coloca todos os dados no SSD mais caro. Dados quentes vão para o SSD, dados comuns para o HDD e dados frios para armazenamento de objetos. O que as pessoas discutem nunca foi qual disco rígido é o mais rápido, mas sim como montar todo o sistema da forma mais rentável.
DeepSeek Na verdade, sentiu essa direção antes da Silicon Valley. Nos últimos seis meses, quase não enfatizou ser necessariamente o mais inteligente do mundo; os poucos termos que repetiu foram: barato, suficientemente rápido, suficientemente útil.
Após o cache hit, o custo por milhão de tokens cai para quase insignificante. Ele sempre apostou em uma coisa: as empresas não precisam de campeões mundiais, mas sim da opção de implantação com o maior ROI total.
This is not a short-term price war; the current follow-up by these two Silicon Valley giants validates the inevitability of this business path.
Seis: O que a OpenAI realmente quer vender não é o modelo
Hoje, a estratégia da OpenAI está clara: o que ela realmente quer vender já não é o modelo, mas a quantidade de chamadas.
Antes, os fabricantes de modelos dependiam de altas margens de tecnologia para obter altas margens de lucro; agora, o modelo de negócios mudou para trocar uma barreira de entrada extremamente baixa por um ecossistema de tráfego em escala massiva.
A Microsoft realmente lucra, não porque o Windows é vendido caro, mas porque todos os computadores têm o Windows instalado. A AWS lucra não porque o lucro por servidor individual é alto, mas porque inúmeras aplicações em todo o mundo funcionam nela todos os dias.
A receita da plataforma sempre dependeu da taxa de penetração.
Isso explica por que o preço do SOL não se moveu. O SOL carrega a marca, provando que a OpenAI ainda é a empresa com o maior limite tecnológico. Já a Luna é o motor de receita.
A OpenAI espera que os desenvolvedores adotem um novo hábito padrão: escrever Agentes com Luna, executar fluxos de trabalho com Luna e executar em lote também com Luna. Apenas ao enfrentar problemas realmente difíceis, chame o Sol uma vez.
Uma vez estabelecido esse padrão padrão, a concorrência posterior se tornará muito difícil. A migração de uma empresa para um modelo subjacente significa retestar, validar e adaptar todo o fluxo de trabalho. O custo de migração aumentará cada vez mais.
A verdadeira vantagem competitiva já começou a mudar de liderança em capacidade para adesão ecológica.
Sete: O modelo principal não determina mais a direção
Ao se olhar para um horizonte mais longo, a indústria de IA está passando por um ponto de inflexão extremamente típico de economias de escala.
Quando o custo por unidade de poder de mineração cai para níveis extremamente baixos, a demanda total pelo token não diminui com a redução do preço unitário, mas sim explode exponencialmente.
O modelo principal já não determina a direção, pois o foco do avanço técnico passou de explorar o limite de inteligência para a industrialização da computação e redução de custos. Quando o custo de chamadas à API for baixo o suficiente para ser ignorado, a forma e os limites do modelo começarão a se desvanecer.
Desenvolvedores corporativos não mais se concentram em cada perda de token, mas sim integram a IA de forma perfeita em cada processo de negócios.
O aspecto mais profundo dessa transformação é que o colapso dos preços da API está aumentando o custo de migração de toda a engenharia de software. Uma vez que os fluxos de trabalho das empresas, redes de agendamento de Agentes e pipelines automatizados de dados estejam todos baseados em combinações de modelos de baixo custo, o fornecedor do modelo subjacente bloqueia os canais de computação para os próximos dez anos.
Nos últimos anos, as empresas de grandes modelos vendiam inteligência. A partir de hoje, elas começam a vender eficiência.
São duas histórias completamente diferentes.
Fora do layout:
No passado, tínhamos o hábito de comparar o desenvolvimento da IA aos produtos eletrônicos de consumo, esperando ocasionalmente novos modelos de ponta que quebrassem recordes.
Mas talvez a verdadeira forma de vitória da IA não seja se tornar um produto sensacional.
Quando a máquina a vapor foi inventada, as pessoas se maravilhavam com sua produtividade; hoje, a eletricidade flui em toda parte, impulsionando o funcionamento de toda a civilização, mas ninguém mais discute especificamente sobre ela.
Quando os humanos deixarem de discutir freneticamente qual modelo de ponta acabou de quebrar mais um recorde de pontuação de QI, a IA se incorpora silenciosamente em cada sistema, cada comando, tornando-se a água e a eletricidade padrão por trás de todos os processos automatizados.
A verdadeira era dele acabou de começar.
Este artigo é do canal oficial do WeChat "Fora da Página", autor: Pintar
