source avatarDr.R

Compartilhar

Hoje, a Anthropic lançou o Claude Fable 5.1 / Mythos 5.1 (mesmo modelo, diferentes níveis de segurança), uma atualização moderada com melhorias modestas de desempenho, mas que nos interessa principalmente por melhorias na estabilidade e redução de preços. A atualização oficial inclui: 1. Maior melhoria em capacidades agênticas para pesquisa científica O Terminal-Bench-Science subiu de 24,7% no Fable 5 para 52,6% — quase duplicando — e supera amplamente o Opus 5, que atingiu 29,0%. 2. Codificação e tarefas de longa duração sem supervisão O Terminal-Bench 4.0 aumentou de 42,0% para 55,8% (Mythos 5.1 atingiu 60,9%); o CursorBench 3.2.0 alcançou 73,4%. O Millennium usou-o para identificar um erro de probabilidade de um em um milhão que a equipe não havia detectado em quatro ou cinco anos e que outros modelos haviam ignorado. 3. Preço reduzido em cerca de 25% A leitura de cache (cache read) caiu 75%, passando para $0,25 por milhão de tokens; o custo total para cargas típicas caiu cerca de 25%, e em cenários intensivos de agência, até 45%. Os preços de entrada ($10) e saída ($50) por milhão de tokens permanecem inalterados. 4. Desempenho suficiente mesmo com esforço mínimo Nos níveis Low/Medium, o desempenho já é equivalente ou superior ao Fable 5, mas com custo significativamente menor — ideal para cenários sensíveis a custos, que podem simplesmente reduzir o nível. 5. Redução significativa de falsos positivos nos controles de segurança O número médio de bloqueios pelos controles de segurança no Claude Code caiu cerca de 60%. Agora é permitido usá-lo para identificação de vulnerabilidades (ainda não permitido escrever exploits, realizar testes de penetração ou varredura binária — esses casos serão encaminhados ao Opus). A ocorrência de falsos positivos em perguntas benignas relacionadas à biologia (biologia básica, perguntas médicas) caiu 85%. 6. Solução empresarial para retenção de dados O novo Enterprise Frontier Safeguards (EFS) armazena os dados na nuvem do cliente, e não na Anthropic, equivalendo a retenção zero de dados — será lançado em fases este outono. Antes disso, clientes elegíveis já podem usá-lo com retenção zero. 7. Melhor desempenho de alinhamento em comparação à geração anterior Menos tentativas de sair do ambiente de teste para acessar recursos; menos uso de raciocínios motivacionais como “isso é uma simulação/avaliação” para justificar ações; tentativas e sucesso de reward hacking reduzidos; e é atualmente o modelo mais resistente a prompt injection. Mais dois pontos importantes: Novas contas de API não podem mais editar manualmente o histórico de pensamentos do Claude em conversas multirround (para evitar distilação); além disso, as saídas incluirão uma marca d’água invisível exigida pelo EU AI Act — sem afetar a qualidade do conteúdo nem conter qualquer informação do usuário.

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.