Ramp SWE-Bench Benchmark: Claude Fable 5 lidera com taxa de sucesso de 87,5%

iconKuCoinFlash
Compartilhar
AI summary iconResumo
Ramp, uma fintech unicorn, lançou seu benchmark SWE-Bench para agentes de codificação por IA, com 80 tarefas de backend de ambientes de produção reais. O Claude Fable 5 da Anthropic obteve 87,5%, o maior entre 14 modelos. As notícias de IA + cripto destacam a eficiência de custo do Claude Opus 4.8 em US$ 1,09 por execução. Os modelos nacionais Kimi K2.6 e GLM 5.1 seguiram com 72,5% e 71,25%. O GPT-5.4 Mini liderou os modelos leves com 58,75%. A Ramp observou que os equilíbrios entre desempenho, velocidade e custo são fundamentais para a implantação. As notícias sobre taxas de juros permanecem como foco separado para os traders.
ME AI mensagem, segundo monitoramento da Beating, a fintech unicorn Ramp lançou o benchmark privado Ramp SWE-Bench para agentes de codificação AI avançados. O Ramp SWE-Bench contém 80 tarefas de desenvolvimento de backend extraídas do ambiente de produção real da Ramp, visando resolver problemas de vazamento de dados e saturação de métricas causados pelo pré-treinamento de modelos em conjuntos de avaliação públicos. As tarefas foram extraídas de pull requests (PRs) reais bem-sucedidos implantados no ambiente de produção pelo assistente de codificação AI interno da Ramp, o Inspect. Cada tarefa reestruturou a base de código antes do commit do PR, mantendo o código e os testes integrados como padrão ouro e extraiu a intenção original do engenheiro nas conversas do Inspect como prompt. A avaliação foi realizada em um ambiente sandbox mini-swe-agent, com o critério de aprovação sendo o sucesso em todas as testes em uma única execução sem quebrar funcionalidades existentes (pass@1). De acordo com os resultados comparativos divulgados de 14 modelos, o recém-lançado Claude Fable 5 da Anthropic lidera com uma taxa de resolução de 87,5%. Claude Opus 4.7 e GPT-5.5 empatam em segundo lugar, ambos com taxa de resolução de 83,75%. Embora o Claude Opus 4.8 tenha uma taxa de resolução de 77,5%, seu tempo médio de execução por tarefa foi reduzido para 8 minutos e 30 segundos, com um custo por execução de apenas US$ 1,09 — menos de 40% do custo do Fable 5 — demonstrando excelente eficiência de custo. Os dados do teste também revelaram o trade-off entre preço e desempenho entre diferentes modelos. Os modelos nacionais Kimi K2.6 e GLM 5.1 apresentaram taxas de resolução semelhantes, respectivamente 72,5% e 71,25%, mas o Kimi K2.6 teve um custo médio de US$ 0,69 — cerca de 34% mais barato que o GLM 5.1. Entre os modelos leves, o GPT-5.4 Mini liderou com uma taxa de resolução de 58,75%, superando o Claude Haiku 4.5 em cerca de 10 pontos percentuais, além de reduzir pela metade tanto o custo médio quanto o número médio de passos. A Ramp destacou que, à medida que os modelos avançam para aplicações práticas, o equilíbrio entre desempenho, velocidade e custo está se tornando um fator crucial na implementação técnica. (Fonte: BlockBeats)
Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.