Ramp SWE-Bench Benchmark: Claude Fable 5 lidera com taxa de sucesso de 87,5%
KuCoinFlashCompartilhar
Ramp, uma fintech unicorn, lançou seu benchmark SWE-Bench para agentes de codificação por IA, com 80 tarefas de backend de ambientes de produção reais. O Claude Fable 5 da Anthropic obteve 87,5%, o maior entre 14 modelos. As notícias de IA + cripto destacam a eficiência de custo do Claude Opus 4.8 em US$ 1,09 por execução. Os modelos nacionais Kimi K2.6 e GLM 5.1 seguiram com 72,5% e 71,25%. O GPT-5.4 Mini liderou os modelos leves com 58,75%. A Ramp observou que os equilíbrios entre desempenho, velocidade e custo são fundamentais para a implantação. As notícias sobre taxas de juros permanecem como foco separado para os traders.
Fonte:Mostrar original
Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações.
Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.