GPT-5.6 reduz custos de tarefas em 82% na AWS Kiro apesar da queda de 20% no preço

icon MarsBit
Compartilhar
AI summary iconResumo
O GPT-5.6 reduziu os custos da tarefa da Terra em 82% no AWS Kiro, apesar de uma queda de 20% em 30 de julho. Os ganhos de eficiência vieram de menos tentativas falhas e menor uso de tokens. Os modelos GPT-5.6—Sol, Terra e Luna—foram lançados no Kiro em julho. A AWS e a OpenAI otimizaram o ambiente juntas. Enquanto o preço do cripto permanece volátil, o índice de medo e ganância mostra sinais mistos.

O mesmo modelo, o preço oficial foi reduzido em apenas 20%, mas sua fatura diminuiu 80%.

Kiro

Em 24 de agosto, a OpenAI divulgou os resultados de um teste realizado com a AWS:

No Terminal-Bench 2.1, o custo para o GPT-5.6 Terra completar uma tarefa bem-sucedida no Kiro reduziu em aproximadamente 82%.

Kiro é a plataforma de agente de desenvolvimento de software da AWS, abrangendo IDE, CLI e Web.

Os três irmãos Sol, Terra e Luna da família GPT-5.6 já estão rodando lá há mais de um mês.

Esses 82% não são um desconto oficial.

The last adjustment for Terra was on July 30, at a magnitude of 20%.

Kiro

Anúncio de reajuste da OpenAI em 30 de julho, Terra reduzida em 20%.

O preço unitário cai apenas 20%, mas a fatura pode ser reduzida em 80%.

Os sessenta por cento que faltam no meio são os que realmente merecem nossa atenção.

GPT-5.6 landed on Kiro in July this year.

Em 13, a AWS anunciou que GPT-5.6 Sol, Terra e Luna estão oficialmente disponíveis no Amazon Bedrock.

No dia seguinte, Kiro publicou um blog anunciando o lançamento de três modelos no IDE, CLI e Web.

Kiro

Este é o primeiro modelo da OpenAI a entrar no Kiro, coincidindo exatamente com o primeiro aniversário da pré-visualização pública do Kiro.

Primeiro coloque o modelo na prateleira, depois o leve para trabalhar; mais de um mês depois, a OpenAI volta com o trabalho entregue:

As duas empresas ajustaram conjuntamente o ambiente Kiro e os modelos da OpenAI, reduzindo o custo de conclusão de uma tarefa bem-sucedida pela Terra em aproximadamente 82%.

Economizado

Dinheiro gasto em caminhos errados

Na reajuste de 30 de julho, a Terra caiu 20%, mas no teste do Kiro, o custo por tarefa caiu 82%.

Onde estão os 60% economizados?

As direções são apenas estas:

O modelo gera menos tokens, faz menos chamadas repetidas às ferramentas e reduz as tentativas de repetição e rotas alternativas após falhas.

Portanto, a grande economia não é por chamada, mas sim nas chamadas que anteriormente seriam desperdiçadas.

A lógica é simples: um agente de IA erra uma tarefa uma vez, a fatura ainda é cobrada. Se ele escolher um caminho errado no meio do caminho e se desviar por três rodadas antes de retornar, esses tokens ainda são cobrados.

No desenvolvimento real, o dinheiro muitas vezes escapa assim.

A OpenAI também mencionou a mesma lógica em seu blog oficial: a eficiência vem de três camadas:

Framework for initiating requests and organizing context, orchestration system for mediating requests in between, and finally the model itself running on the GPU.

Kiro

OpenAI analisa a fonte de eficiência do GPT-5.6: as requisições partem do framework de agentes, são agendadas pelo sistema de orquestração e, por fim, executadas no GPU, com cada camada otimizando recursos.

Economize até na divisão de tarefas do modelo.

A OpenAI também mencionou um uso: o fluxo de trabalho pode primeiro usar Sol para esclarecer o problema e definir o plano, e depois mudar para Luna para implementar as alterações já definidas, escrever testes e executar avaliações.

A mesma linha de produção, com diferentes níveis de inteligência em cada etapa.

O modelo representa apenas metade da fatura

Trocar o quadro muda o preço

Este conjunto de questões do Terminal-Bench 2.1 não é para o modelo responder isoladamente.

Ela coloca o modelo em um ambiente de terminal, fornece um objetivo vago e permite que ele mesmo planeje o caminho, chame ferramentas, escreva scripts, trate erros e itere repetidamente.

Portanto, o resultado obtido é do conjunto "agente + modelo".

Kiro

Ranking público do Terminal-Bench 2.1, com um novo item de custo à direita da precisão. (Fonte da imagem: Terminal-Bench)

Os quatro números na lista mais bem explicam a situação:

Claude Code com Fable 5, 83,8%, 552,67 dólares;

Codex com GPT-5.5, 83,1%, 2059,19 dólares;

Codex com GPT-5.6 Terra, 78,4%, 421,15 dólares;

Codex com GPT-5.6 Luna, 75,7%, 241,45 dólares.

As duas primeiras linhas diferem em apenas 0,7 ponto percentual, mas as faturas diferem em quase quatro vezes.

O mesmo modelo, inserido em diferentes frameworks, com diferentes organizações de contexto e estratégias de ferramentas, produz resultados completamente diferentes.

De acordo com os dados fornecidos pela Kiro, a Terra obteve 77,4 pontos no Coding Agent Index, apenas ligeiramente acima dos 77,2 do Claude Fable 5.

O seu ponto forte não está na pontuação, mas no preço correspondente a essa pontuação.

O ponto de foco da abordagem baseada em especificações do Kiro está aqui: a mecânica principal é simplesmente: não comece escrevendo código.

Ele primeiro decompõe o objetivo vago do usuário em um documento de requisitos formal, design técnico e uma lista de tarefas executáveis, antes de entregá-los ao modelo.

Assim, o modelo não recebe mais uma frase ambígua, mas uma tarefa claramente definida.

Quem conhece o Agent perceberá imediatamente que este passo elimina exatamente a parte mais cara dos custos.

Modelos desviados, retrabalho, reestruturação total — os tokens queimados geralmente superam os usados no trabalho real.

Kiro ainda deixou duas barreiras no processo: antes de modificar realmente o código, pare para que alguém revise; após concluir o trabalho, execute automaticamente um conjunto de testes para verificar se está correto.

Cada retrabalho evitado por estas duas barreiras pode economizar dinheiro real.

Claude no território da Amazon

O GPT levou metade

Há um ano, o Kiro era apenas um IDE orientado por especificações, com o seletor de modelos sendo o território da Anthropic.

Um ano depois, a AWS introduziu, em sua própria plataforma de agentes inteligentes, três modelos da OpenAI de uma só vez.

Sol, Terra, Luna e Claude alinhados no mesmo menu suspenso — há um ano, essa cena seria difícil de imaginar.

Embora o GPT-5.6 tenha sido "introduzido por toda a família" nesta ocasião, ele não foi "aberto totalmente".

Os três modelos estão sendo lançados de forma progressiva e experimental, disponíveis para usuários Pro, Pro+, Pro Max e Power, com apenas duas regiões: norte da Virgínia, nos Estados Unidos, e Frankfurt, na Europa, com suporte a inferência entre regiões.

Há ainda uma outra que muitas pessoas não se adaptam: esses modelos, no Kiro, utilizam uma cadeia de pensamento oculta; você não consegue ver os passos de raciocínio, apenas o resultado final.

Quem está acostumado a observar o agente raciocinando passo a passo, sente como se estivesse jogando uma tarefa dentro de uma caixa opaca.

A afirmação oficial é que este é um comportamento esperado e não afeta a qualidade da saída.

Os três planos estão claramente listados no Kiro.

Na época do lançamento em 14 de julho, a mesma tarefa resultava em dedução de 2,4 vezes para Sol, 1,2 vezes para Terra e 0,6 vezes para Luna.

Em 30 de julho, após o corte de preços da OpenAI, a Kiro seguiu no dia seguinte: Luna foi reduzida de 0,6x para 0,1x, Terra passou de 1,2x para 1,0x, enquanto o Sol permaneceu inalterado.

Kiro

A postura da AWS está clara: uma plataforma de desenvolvimento não pode estar vinculada a apenas um modelo.

No mesmo seletor, dois modelos avançados começaram a competir em preços.

Os critérios de avaliação do modelo também mudaram: uma pontuação alta não significa mais automaticamente vitória; gastar menos também pode levar à vitória.

Para desenvolvedores, antes se perguntava: “Quanto custa este modelo por milhão de tokens?”; agora, precisa-se perguntar: “Quanto vou gastar para fazer isso ser concluído?”

Referências:

https://x.com/OpenAIDevs/status/2091966982015103068

https://openai.com/index/gpt-5-6-in-kiro/

Este artigo é do canal oficial do WeChat "Nova Inteligência" (ID: AI_era), autor: Apocalipse da ASI, editor: Yuan Yu

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.