Anthropic lança o Claude Sonnet 5.5 com saída 30% mais rápida e redução de custos

iconMetaEra
Compartilhar
AI summary iconResumo
A Anthropic anunciou o lançamento do Claude Sonnet 5.5, um novo projeto de token otimizado para tarefas de alta frequência. O modelo oferece saída 30% mais rápida e até 30% menor custo por tarefa em comparação ao Sonnet 5. Notícias on-chain mostram que ele obteve 70,6% no Terminal-Bench 4.0, superando tanto o Sonnet 5 quanto o Opus 5.5. No entanto, sob raciocínio máximo, ele utiliza mais tokens e custa até 50% a mais. A Anthropic recomenda o Sonnet 5.5 para tarefas bem definidas, enquanto o Opus lida com trabalhos complexos.
A Anthropic lançou o Claude Sonnet 5.5, tentando comprimir capacidades próximas às do modelo旗舰 Opus 5.5 em um modelo de agente diário mais barato e adequado para chamadas de alta frequência. O preço da API permanece em US$ 2 e US$ 10 por milhão de tokens de entrada/saída, mas a empresa afirma que a velocidade de saída aumentou mais de 30% e a quantidade de tokens necessários para concluir tarefas típicas diminuiu, reduzindo o custo por tarefa em até 30%. Nos testes oficiais, alcançou 70,6% no Terminal‑Bench 4.0, superando os 10,3% do Sonnet 5 e os 66,4% do Opus 5.5; também obteve 1844 Elo na tarefa profissional GDPval‑AA, aproximando-se dos 1846 do Opus. No entanto, “Opus pela metade do preço” não é uma conclusão completa: a Artificial Analysis descobriu que, sob a máxima intensidade de raciocínio, o Sonnet 5.5 gera em média cerca de 193 mil tokens de saída por questão — a configuração mais consumidora de tokens já testada por eles —, tornando o custo por questão cerca de 50% maior que o do Sonnet 5; testes reais de revisão de código pelo CodeRabbit também mostraram que, embora o Sonnet 5.5 seja cerca de duas vezes mais rápido que a geração anterior, ainda perde problemas difíceis que o Opus consegue identificar. Portanto, ele parece mais um novo modelo principal adequado para tarefas claras e repetíveis, e não uma substituição abrangente do Opus.

Autor do artigo, fonte: Anthropic

Anthropic reposiciona o Sonnet como o agente principal para uso diário

Sonnet 5.5 é o segundo modelo da série Claude 5.5. Diferentemente do Opus 5.5, lançado uma semana atrás e voltado para tarefas abertas e complexas, a Anthropic o posiciona para lidar com tarefas cotidianas com limites bem definidos e que exigem grande repetição: corrigir erros de programa, revisar código, investigar informações, e gerar documentos, apresentações e planilhas.

O modelo suporta entrada de texto e imagem, oferece contexto de 1 milhão de tokens e está disponível no site e aplicativo móvel da Claude, na API da Anthropic, AWS, Google Cloud e Microsoft Azure. O nome da API éclaude-sonnet-5-5. A Anthropic não divulgou o número de parâmetros, arquitetura do modelo, dados de treinamento nem poder de treinamento, portanto não é possível determinar se as melhorias vieram do treinamento básico, pós-treinamento, estratégia de inferência ou otimização da cadeia de ferramentas de Agent.

A diferença entre ele e o Opus não é apenas “menor capacidade e preço mais baixo”. A Anthropic deseja estabelecer uma nova divisão de funções entre modelos: o Opus lida com tarefas complexas cujas definições são incompletas e exigem julgamento contínuo; o Sonnet executa rapidamente tarefas já bem definidas e amplia o número de chamadas por meio de custos mais baixos.

70,6% contra 10,3%, são os dados mais chamativos e que exigem maior cautela na interpretação

Sonnet 5.5 obteve 70,6% no teste Terminal‑Bench 4.0 divulgado pela Anthropic, enquanto Sonnet 5 alcançou apenas 10,3%, superando até mesmo o Opus 5.5 com 66,4%. Esse benchmark exige que o Agente realize tarefas profissionais em múltiplos passos em um ambiente de linha de comando, refletindo a cooperação entre programação de código, operações de terminal e uso de ferramentas.

As melhorias em outros projetos não foram tão extremas, mas ainda assim notáveis. O CursorBench 4.0 subiu de 34,1% no Sonnet 5 para 55,5%, a cerca de dois pontos percentuais de 57,8% do Opus 5.5; Humanity’s Last Exam com ferramentas aumentou de 54,9% para 64,5%; e a operação de computador no OSWorld 2.1 subiu de 57,0% para 80,1%, aproximando-se dos 81,8% do Opus.

Na tarefa profissional de conhecimento GDPval-AA, o Sonnet 5.5 obteve 1844 Elo, enquanto o Opus 5.5 obteve 1846; na avaliação de trabalho de conhecimento prolongado AA-Briefcase, os valores foram 1811 e 1822, respectivamente. A Anthropic concluiu que alguns trabalhos profissionais com limites bem definidos já não exigem, por padrão, a chamada do modelo principal.

No entanto, esses números não podem ser simplesmente combinados para afirmar que “Sonnet superou Opus”. Os níveis de intensidade de inferência utilizados pelos diferentes projetos não são exatamente os mesmos, e a Anthropic deixou claro que, em tarefas que exigem manutenção prolongada de julgamento e processamento de objetivos abertos, o Opus ainda é claramente mais forte.

Um contraexemplo interessante vem da FrontierCode. O Sonnet 5.5 atingiu 52,1% na intensidade de inferência Xhigh, mas ao ser aumentado para Max, caiu para 46,2%. A Anthropic explicou que, no modo Max, o modelo inicia com mais frequência vários sub-Agents de revisão de código, e por duas vezes isso resultou em tempo esgotado ou modificação de código fora do escopo da tarefa, levando à avaliação como falha.

Este resultado indica que mais raciocínio e mais Agentes não necessariamente levam a respostas melhores. O modelo pode perder pontos devido a verificação excessiva, ampliação do escopo da tarefa ou esgotamento do orçamento de tempo.

Por que a plataforma afirma que o custo da tarefa é 30% menor se nenhum token sofreu redução de preço?

O preço público do Sonnet 5.5 é o mesmo do Sonnet 5: US$ 2 por milhão de tokens de entrada, US$ 10 por milhão de tokens de saída, US$ 2,5 por gravação em cache e US$ 0,2 por leitura em cache, que são metade dos preços correspondentes do Opus 5.5.

O que a Anthropic afirma ser “até 30% mais barato por tarefa única” não é uma redução na tabela de preços da API, mas sim o fato de que o modelo requer menos etapas e tokens para concluir o mesmo trabalho. A empresa afirma que a velocidade de geração aumentou em mais de 30%; no teste interno, o Slack observou uma redução de aproximadamente 14% nos tokens de saída; a Atlassian relatou que a velocidade do agente aumentou até 30%; e a Lovable informou uma redução de aproximadamente um terço nas chamadas de ferramentas e cerca de metade nas execuções do Shell.

Ao ser testado em 2.441 tarefas de perguntas e respostas financeiras, extração, análise e previsão, o Sonnet 5.5 utilizou em média cerca de 121 mil tokens por tarefa, enquanto o Sonnet 5 utilizou cerca de 497 mil. Como todos esses são testes privados de parceiros, a dificuldade das tarefas, os prompts e as saídas completas não podem ser verificados pelo público, mas os resultados apontam coletivamente para uma mudança: o novo modelo realiza menos buscas repetidas, leituras duplicadas de dados ou raciocínios internos excessivamente longos.

Isso é especialmente importante para Agentes. Em bate-papos tradicionais, gerar centenas de tokens de uma só vez tem impacto limitado; já para Agentes de longo prazo, a leitura repetida do contexto, a chamada de ferramentas e a correção de resultados podem fazer com que um único passo redundante se amplifique ao longo de dezenas de rodadas, resultando em diferenças significativas em tempo e custo.

A maior intensidade de inferência revela outra verdade sobre os custos

Os testes independentes do Artificial Analysis atribuíram ao Sonnet 5.5 com a configuração de raciocínio mais alta uma pontuação de 56, apenas 2 pontos abaixo do Opus 5.5, que obteve 58 no seu índice inteligente geral.

Mas o custo para alcançar esse desempenho foi alto: o Sonnet 5.5 gera em média cerca de 193.000 tokens de saída por teste, o nível mais alto já medido pela instituição, cerca de 60% mais que o Opus 5.5 Max e o Sonnet 5 Max, e aproximadamente sete vezes o do GPT‑6 Astra Max. Seu custo estimado por questão atingiu US$ 7,60, cerca de 50% mais que o Sonnet 5.

Isso não contradiz diretamente a afirmação da Anthropic de que os custos das tarefas podem cair até 30%. As conclusões oficiais descrevem principalmente cargas de trabalho típicas e baixa intensidade de inferência; a Artificial Analysis mede o cenário em que o Max é ativado para buscar o limite de capacidade.

Os dois conjuntos de resultados juntos indicam que a intensidade de inferência tornou-se parte integrante do produto do modelo. O Sonnet 5.5 pode oferecer excelente custo-benefício nos modos Low ou Medium; se a intensidade de inferência for aumentada para Max para acompanhar o Opus, embora seja mais barato por Token, pode perder a vantagem de custo devido à geração excessiva de conteúdo.

Artificial Analysis também descobriu que a precisão do conhecimento factual do Sonnet 5.5 é de aproximadamente 54%, inferior aos 66% do Opus; os projetos de raciocínio científico também ficam cerca de seis pontos percentuais atrás. O chamado "próximo do Opus" baseia-se principalmente em operações de terminal de Agent e em parte do trabalho de conhecimento, não podendo ser generalizado para todas as capacidades.

Na revisão de código real, a vantagem de velocidade se mantém, e a lacuna entre os modelos principais também persiste

CodeRabbit realizou um conjunto de testes de dia de lançamento usando erros conhecidos em projetos de código aberto reais.

Em 13 casos de revisão de código difíceis, o Sonnet 5.5 com raciocínio ativado identificou 6 problemas, superando os 4 do Sonnet 5; a precisão dos comentários eficazes foi de 41,2% e 40,0%, respectivamente. No entanto, o Opus 5.5 no modo padrão identificou 8 e no modo Max identificou 10, indicando que a lacuna em tarefas de revisão complexas ainda é significativa.

Em outro conjunto de teste envolvendo 44 Pull Requests reais, o Sonnet 5.5 levou em média 6 minutos e 33 segundos por revisão, enquanto o Sonnet 5 levou 13 minutos e 31 segundos. O primeiro gerou 24% menos comentários e apenas cerca de um terço das observações triviais da geração anterior; com base nos preços públicos, a chamada do modelo principal custou em média cerca de US$ 0,46, enquanto o Sonnet 5 custou cerca de US$ 1,16.

No entanto, a pontuação completa de cobertura de erros para este conjunto de 44 PRs ainda não foi concluída no momento da publicação do artigo, portanto, atualmente só é possível confirmar que é mais rápido e gera menos saída, mas não se pode afirmar se os comentários omitidos deixaram de lado mais problemas reais. A amostra de 13 casos difíceis também é pequena; o CodeRabbit alertou que é suficiente para observar a tendência, mas não para determinar uma classificação geral.

A divisão mais razoável de modelos é: o Sonnet 5.5 realiza uma revisão rápida e rotineira para cada PR; alterações que envolvem segurança, arquitetura principal ou cujos erros omitidos tenham alto custo são encaminhadas para o Opus ou especialistas humanos.

O design visual está se tornando um ponto de venda do modelo de trabalho universal

A Anthropic também destacou especialmente a capacidade de design visual do Sonnet 5.5. A demonstração oficial pediu ao Sonnet 5 e ao 5.5 que criassem, em arquivos HTML individuais, 400 estorninhos voando em grupo, dunas moldadas pelo vento e um grande relógio composto por 24 pequenos sinos. O novo modelo gera mais rapidamente e apresenta animações, camadas e conclusão da interface superiores.

Ele também pode gerar apresentações com base em modelos. Em um teste interno, a Anthropic forneceu a um especialista materiais de resultados trimestrais de uma empresa cotada, transcrição da chamada de resultados e um modelo de 10 slides; dois especialistas consideraram que a primeira versão do Sonnet 5.5 poderia ser enviada diretamente.

Esses ainda são casos de demonstração escolhidos pelo fabricante e não representam a capacidade do modelo de compreender consistentemente cada modelo empresarial. A precisão dos dados em gráficos complexos, as normas de marca e as fontes de citação ainda exigem verificação manual, mas refletem uma nova direção da concorrência do modelo: não apenas gerar conteúdo correto, mas também entregar interfaces e documentos próximos do produto final.

O aumento das capacidades de segurança também significa que algumas solicitações serão assumidas por modelos antigos.

Sonnet 5.5 é o primeiro modelo Sonnet a adotar proteção de segurança cibernética de nível premium no lançamento. A Anthropic afirma que sua capacidade de segurança cibernética está próxima à do Opus 5, portanto, correções de vulnerabilidades comuns ainda podem ser realizadas normalmente, mas solicitações de segurança cibernética de maior risco serão transparentemente encaminhadas para o Sonnet 5.

A empresa também testou comportamentos como enganar usuários, agir contra os interesses dos usuários, auxiliar abusos de alto risco e ultrapassar limites ambientais em cerca de 1.850 cenários. A empresa afirma que o novo modelo apresenta desempenho equivalente ou superior ao Sonnet 5 na maioria das métricas e é o modelo Claude com menos tentativas ativas de explorar limites de contêiner.

No entanto, esses são principalmente avaliações automatizadas internas da Anthropic e não podem ser consideradas uma prova completa dos riscos em ambientes reais. A própria empresa reconhece que nenhum conjunto de testes consegue identificar todos os modos de falha.

Sonnet 5.5 é o primeiro Sonnet a incorporar um classificador anti-distilação e ampliou o mecanismo de "manutenção do conteúdo de raciocínio" para impedir a transferência de contexto de inferência entre contas diferentes. Tem impacto limitado para desenvolvedores comuns, mas alguns fluxos de trabalho que migram conversas do Claude Code entre contas precisam ser ajustados.

A verdadeira mudança não é estar em primeiro lugar no ranking, mas sim o fato de que "modelos suficientemente fortes" começaram a se tornar a escolha padrão

Sonnet 5.5 não revelou uma nova arquitetura de modelo nem superou integralmente o Opus. Seu significado mais importante é transferir grande parte do trabalho anteriormente exigido por modelos de topo para modelos de médio porte, mais rápidos e com preço por token reduzido à metade.

Para sistemas de atendimento ao cliente, revisão de código, pesquisa de documentos e produção de documentação que executam milhares de vezes por dia, a decisão sobre implementação geralmente não se baseia na pontuação mais alta em uma única tarefa, mas sim em quantos passos cada tarefa requer, quantos tokens são necessários, quanto tempo se espera e se os erros podem ser escalonados para resolução. O valor do Sonnet 5.5 está exatamente focado nesses indicadores.

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.