Ramp SWE-Bench Benchmark: Claude Fable 5 lidera con una tasa de éxito del 87,5%

iconKuCoinFlash
Compartir
AI summary iconResumen
Ramp, una unicornio de fintech, ha lanzado su benchmark SWE-Bench para agentes de codificación con IA, que incluye 80 tareas de backend de entornos de producción reales. Claude Fable 5 de Anthropic obtuvo un 87,5 %, la puntuación más alta entre 14 modelos. Las noticias de IA + cripto destacan la eficiencia de costos de Claude Opus 4.8 en $1,09 por ejecución. Los modelos domésticos Kimi K2.6 y GLM 5.1 siguieron con 72,5 % y 71,25 %. GPT-5.4 Mini lideró los modelos ligeros con 58,75 %. Ramp señaló que los compromisos entre rendimiento, velocidad y costo son clave para la implementación. Las noticias sobre tasas de interés siguen siendo un foco separado para los traders.
ME AI mensaje, según el monitoreo de Beating, la unicornio de tecnología financiera Ramp lanzó el benchmark privado Ramp SWE-Bench para agentes de codificación de IA de vanguardia. Ramp SWE-Bench incluye 80 tareas de desarrollo backend extraídas del entorno de producción real de Ramp, diseñadas para abordar los problemas de fuga de datos y saturación de métricas causados por el preentrenamiento de modelos en conjuntos de evaluación públicos. Las tareas de prueba se extrajeron de solicitudes de extracción (PR) reales que el asistente de codificación interno de Ramp, Inspect, implementó con éxito en producción. Cada tarea reconstruyó la base del repositorio de código antes del commit de la PR, conservando el código y las pruebas fusionadas como estándar dorado, y extrajo la intención original del ingeniero en las conversaciones de Inspect como indicación. La evaluación se realizó en un entorno sandbox mini-swe-agent, con el criterio de aprobación siendo el éxito en la primera ejecución al pasar todas las pruebas sin romper funciones existentes (pass@1). Según los resultados comparativos publicados de 14 modelos, el recién lanzado Claude Fable 5 de Anthropic lidera con una tasa de resolución del 87.5%. Claude Opus 4.7 y GPT-5.5 empatan en segundo lugar, ambos con una tasa de resolución del 83.75%. Aunque Claude Opus 4.8 tiene una tasa de resolución del 77.5%, su tiempo promedio de ejecución por tarea se redujo a 8 minutos y 30 segundos, con un costo por ejecución de solo $1.09, menos del 40% del costo de Fable 5, demostrando una excelente relación costo-rendimiento. Los datos de prueba también revelan el equilibrio entre precio y rendimiento entre diferentes modelos. Los modelos nacionales Kimi K2.6 y GLM 5.1 tienen tasas de resolución similares, del 72.5% y 71.25% respectivamente, pero el costo promedio de Kimi K2.6 es de $0.69, aproximadamente un 34% más barato que GLM 5.1. Entre los modelos ligeros, GPT-5.4 Mini lidera con una tasa de resolución del 58.75%, superando a Claude Haiku 4.5 en aproximadamente 10 puntos porcentuales, con costos y número promedio de pasos reducidos a la mitad. Ramp señala que, a medida que los modelos avanzan hacia la aplicación, el equilibrio entre rendimiento, velocidad y costo se convierte en un factor clave para la implementación práctica. (Fuente: BlockBeats)
Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.