¡Esta vez, Claude realmente ha dominado la lista de programación de IA!
En la reciente actualización del ranking de MirrorCode, Claude Fable 5 volvió a ocupar el primer lugar con un éxito absoluto del 64%.
GPT-5.6 Sol, que le sigue de cerca, tiene solo un tercio de su puntuación.
El GPT-5.5, en cuarto lugar, está en peor situación. No solo obtuvo un 10% de puntuación, sino que además fue humillado por su predecesor, el GPT-5.4.

Lo más sorprendente es que, al usar lenguajes de alto consumo de recursos como Go, la tasa de resolución de Fable 5 fue del 64%; al cambiar al lenguaje poco común Ada, el rendimiento aún fue del 61%.
Saber que, en el mundo de código abierto, el corpus de Python es aproximadamente 230 veces mayor que el de Ada.
Pero en Fable 5, el rendimiento solo disminuyó un 3 por ciento.

Esto sí que es interesante.
Si el modelo depende principalmente de la memoria de la gramática y las formas comunes de escritura en idiomas populares, entonces el rendimiento debería haber disminuido tras cambiar a Ada.
Pero el resultado actual apunta a otra posibilidad—
El modelo más potente ya ha dejado de depender de corpus específicos y ha comenzado a aprender cómo construir un proyecto de software completo desde cero.
Atascado en la línea de finalización del 100%, prueba límite de 10 mil millones de tokens
Específicamente, MirrorCode completo incluye 25 programas objetivo que cubren áreas como herramientas Unix, intérpretes, consultas de datos, bioinformática, criptografía y herramientas de compresión.
Aquí, el modelo se colocará en un entorno aislado, sin acceso a Internet, sin ver el código fuente del proyecto original ni poder descargar dependencias de terceros. Lo único que podrá obtener son documentos de alto nivel, algunas pruebas visibles y un programa original que puede invocar repetidamente.
Luego, debe seguir ingresando datos al programa original, observar las salidas para adivinar la lógica interna, y luego Punto punto Escribe un nuevo programa con comportamiento consistente.
Seleccione 15 objetivos Medium y Large de la lista más reciente. Cada objetivo se implementa con dos lenguajes, y cada lenguaje se ejecuta tres veces.
Además, la tasa de finalización de las pruebas visibles y las pruebas ocultas debe alcanzar el 100% para aprobar; el 99,9% no es aceptable.
Si se omite un solo caso límite, toda la ejecución se considera un fracaso.

Para forzar al modelo a llenar también los últimos huecos, MirrorCode aumentó el presupuesto por sesión a 10 mil millones de tokens, con un tiempo máximo de ejecución continua de 7 días.
La tarea más costosa en el artículo fue aún más extrema: el modelo se ejecutó continuamente durante 19 días, con un solo gasto de 2600 dólares.
Durante estos 19 días, el modelo ejecutará repetidamente el programa original, comparará los resultados, añadirá funciones y volverá a ejecutar las pruebas. Si aparece un error, investigará la causa; si la salida no coincide, cambiará la suposición; una vez que una parte funcione correctamente, pasará al siguiente vacío.
Todo el proceso es más como una depuración que dura varios días que una generación.

El ejemplo de gotree es el más intuitivo.
Esta herramienta de bioinformática originalmente tenía alrededor de 16.000 líneas de código Go y más de 40 comandos.
Claude Opus 4.7 gastó 14 horas y 251 dólares y aprobó 2000 de 2001 pruebas, logrando una completitud del 99.95%.
Aunque se omitió un raro caso límite relacionado con la manipulación de fechas y fue detenido por la línea de aprobación al 100% de MirrorCode, ya ha reducido el volumen de trabajo que originalmente se calculaba por semanas a solo unas pocas docenas de horas—
Epoch estima que, sin usar IA, a los ingenieros humanos les tomaría al menos de 2 a 17 semanas completar la misma tarea.
En el desierto de datos, Fable 5 solo soltó 3 puntos
El papel de MirrorCode utilizó anteriormente la mezcla de entrenamiento pública de StarCoder como referencia.
Python representa aproximadamente el 8%, mientras que Ada solo el 0,034%, siendo el primero unas 230 veces mayor que el segundo.

Of course, we cannot know how much Ada code the closed-source model has seen. But using the open ecosystem as a reference, the scarcity of Ada is already evident enough.
Este lenguaje aparece principalmente en sistemas aeroespaciales, de defensa y otros sistemas críticos para la seguridad. Independientemente del tamaño de la comunidad, la cantidad de tutoriales o los proyectos de código abierto, está muy lejos de compararse con Python, JavaScript o Go.
Y Fable 5 claramente no está traduciendo línea por línea el código Go a Ada.
Es más como comprender primero cómo funciona el programa original y luego recrear el mismo comportamiento en otro lenguaje.

En comparación, otros modelos no son tan estables.
GPT-5.6 bajó del 24% al 19%, GPT-5.4 bajó del 21% al 12%, y GPT-5.5 cayó aún más, del 17% al 5%. Al cambiar de idioma, la brecha se amplía inmediatamente.
Entregar todo el proyecto a la IA
Hoy, Cursor ha permitido que cientos de agentes colaboren durante casi una semana para escribir desde cero más de un millón de líneas de código de navegador distribuidas en 1000 archivos.
Anthropic hizo que 16 agentes Claude ejecutarán en paralelo cerca de 2000 sesiones, y finalmente desarrollaron un compilador C de 100 000 líneas capaz de compilar el kernel Linux 6.9.
En la muestra de usuarios individuales de Codex divulgada por OpenAI hasta mayo, el 70,2% presentó al menos una tarea que se estimaba requería más de una hora de trabajo humano; el 25,6% presentó tareas que superaban las ocho horas.
Las unidades que las personas entregan a la IA están pasando de un fragmento de código, un error, a una tarde, una semana, o incluso un proyecto completo.
El 64% de MirrorCode es una cuantificación de este tipo de "asignación de proyecto".
Indica que, siempre que el objetivo sea lo suficientemente claro y los resultados puedan verificarse automáticamente, los modelos de vanguardia ya pueden completar por sí solos parte de software de tamaño mediano a grande.
Para cada persona que está asignando su trabajo a la IA, el cambio ya está a la puerta—
Antes necesitabas vigilarlo mientras escribías cada línea de código; ahora, es más probable que solo verifiques en puntos clave si se ha desviado.
El código se volverá cada vez más barato.
Y aquellos que puedan explicar claramente los problemas y verificar los resultados se volverán cada vez más valiosos.
Referencia: https://epoch.ai/MirrorCode
Este artículo proviene del canal de WeChat "Neozhisheng", autor: Apocalipsis ASI; editor: Moisés
