Los modelos globales de IA dominan la IMO 2026 con puntuaciones perfectas

icon MarsBit
Compartir
AI summary iconResumen
Las noticias de IA + cripto se dispararon cuando cuatro modelos de IA—Claude Fable 5, GPT-5.6 Sol xhigh, Kimi K3 y AxiomProver—obtuvieron 42/42 en la IMO 2026, superando al 99% de los competidores humanos. Solo 30 humanos han logrado puntuaciones perfectas en siete años. Axiom Math tradujo los problemas a Lean 4 para la calificación automatizada. Los costos variaron entre $0.18 y $51. Las discusiones globales sobre políticas de cripto podrían incluir pronto el papel de la IA en las matemáticas y la lógica.

Julio en Shanghái, olas de calor incesantes.

La 67ª Olimpiada Internacional de Matemáticas ha concluido oficialmente, y el equipo de China se llevó el primer puesto con 232 puntos. Tres jóvenes obtuvieron la puntuación máxima de 42 puntos.

Axiom Math

Aún no se ha apagado el aplauso en vivo, cuando en GitHub apareció silenciosamente otra hoja de resultados destacada.

El exingeniero de Google, Deedy Das, realiza una evaluación comparativa de IA: 7 modelos de lenguaje avanzados, resolviendo de forma autónoma los 6 problemas del IMO 2026.

Claude Fable 5 obtiene 42 puntos perfectos. Solo tardó 2.5 horas y gastó 51 dólares.

La versión xhigh de GPT-5.6 Sol también obtuvo una puntuación perfecta. Tomó 3.8 horas y el costo se redujo a un mínimo de 20 dólares.

Kimi K3 siguió de cerca con una puntuación perfecta. Tras una batalla de 17.4 horas, gastó 31 dólares.

Sumando al AxiomProver con entrega independiente, las cuatro fuerzas alcanzan completamente la puntuación máxima.

Axiom Math

Como referencia, en los últimos siete años de la IMO, de 4.347 participantes humanos, solo 30 obtuvieron puntaje perfecto: un 0,69%.

Axiom Math

Victoria abrumadora por una gran diferencia

Los resultados muestran no solo un abismo de 14 puntos entre el puntaje perfecto de 42 y el cuarto lugar con 28, sino también que los tres modelos con puntaje perfecto alcanzaron la cima de maneras completamente distintas.

Claude Fable 5 realiza las tareas con precisión. 9 conversaciones, 6 con salidas efectivas, la más larga de 73 minutos (P3), con un total de 700.000 tokens generados.

GPT-5.6 Sol parece haber tenido algunos contratiempos. En P2, tardó 106 minutos en completar 4 rondas, interrumpido dos veces por fallos de red. Sin embargo, el control de la capacidad de cómputo es casi aterrador: solo generó 230,000 tokens, el más eficiente de los tres perfectos.

Kimi K3 es como una bestia incansable. El modelo MoE con 2.8 billones de parámetros emitió de un solo tirón 1,54 millones de tokens, 6.5 veces más que Sol. Solo en la pregunta P3, realizó seis asaltos, luchando durante 491 minutos.

Axiom Math

Axiom Math

Axiom Math

Axiom Math

Axiom Math

Axiom Math

Enfrentamiento directo de intuición matemática

P1 es el aperitivo más suave de toda la competencia, todos los modelos lo resuelven en minutos, y los participantes humanos casi no fallan.

En la pizarra están escritos 2026 enteros positivos mayores que 1. En cada paso, se eligen dos números m y n, se borran y se reemplazan por gcd(m,n) y lcm(m,n)/gcd(m,n). Se repite el proceso hasta que ya no se pueda continuar. Demostrar que: (a) el proceso termina inevitablemente, dejando exactamente un número mayor que 1, M; (b) el valor de M no depende del orden de las operaciones.

Axiom Math

Para facilitar la comprensión de esta pregunta, primero realizaremos un experimento a escala reducida.

En la pizarra solo hay 12 y 18. 12 = 2² × 3, 18 = 2 × 3². Paso 1: mcd(12,18) = 6, mcm(12,18)/6 = 6, la pizarra se convierte en [6, 6]. Paso 2: mcd(6,6) = 6, mcm(6,6)/6 = 1, la pizarra se convierte en [6, 1]. Solo queda un número mayor que 1, el juego termina. M = 6.

No importa en qué orden realices las operaciones, M siempre es 6. ¿Por qué?

The answer lies in the prime factors.

Para cada número primo p, tome el máximo común divisor de las veces que cada número es divisible por p, y luego multiplique estas potencias primas: este valor permanece constante desde el primer paso hasta el último.

Claude Fable 5: creó directamente un contador que disminuye en cada paso.

Para este problema, Fable 5 define una cantidad Φ = T + N. T es la suma del número de factores primos de todos los números en la pizarra (contando repeticiones), y N es la cantidad de números mayores que 1. Por ejemplo, para la pizarra [12, 18], los factores primos de 12 son 2, 2, 3 (un total de 3), y los de 18 son 2, 3, 3 (también 3), por lo que T = 6, N = 2, y Φ = 8.

Luego se demuestra que: cada vez que se realiza una operación, Φ disminuye al menos en 1. Hay dos casos: si gcd(m,n) > 1, el número total de factores primos T disminuye; si gcd(m,n) = 1, T permanece constante pero hay un número menor que 1, por lo que N disminuye en 1. Φ es un entero positivo, y en cada paso disminuye al menos en 1, por lo que el proceso debe terminar en un número finito de pasos. Un único contador, un corte definitivo.

Axiom Math

GPT-5.6 Sol: Seguimiento de productos, reducción dimensional por orden lexicográfico descendente.

Sol observa dos cantidades: P = el producto de todos los números, K = la cantidad de números mayores que 1. En cada operación, si gcd(m,n) = d > 1, el producto de los dos nuevos números es mn/d, que es menor que el original, por lo que el producto global P disminuye estrictamente. Si d = 1, P permanece igual, pero K disminuye en 1.

La pareja (P, K) decrece estrictamente en orden lexicográfico: o bien P disminuye, o bien P permanece constante pero K disminuye. El orden lexicográfico de los enteros positivos no puede disminuir infinitamente. Terminación.

Axiom Math

Dos caminos completamente diferentes resolvieron la parte (a) del mismo problema.

En la parte (b), los tres modelos convergen: todos demuestran que, para cada número primo p, el máximo común divisor de las veces que cada número en la pizarra es divisible por p permanece invariable durante las operaciones. La fórmula final es exactamente la misma—

Axiom Math

Volvamos al ejemplo: 12 y 18. Para p=2, v₂(12) = 2, v₂(18) = 1, mcd = 1, contribución 2¹. Para p=3, v₃(12) = 1, v₃(18) = 2, mcd = 1, contribución 3¹. M = 2 × 3 = 6, exactamente igual al cálculo manual.

El boleto en blanco más económico de toda la plataforma

El problema P6 de teoría de números es el último del Día 2 y requiere demostrar que la secuencia recursiva eventualmente se vuelve periódica.

Last year, only 6 humans solved P6 globally at IMO 2025.

Claude Fable: 5:26 minutos, dos rondas, puntuación máxima. GPT-5.6 Sol: 60 minutos, dos rondas, puntuación máxima. Kimi K3: 381 minutos, cuatro rondas, puntuación máxima.

Grok 4.5 solo generó 7053 tokens en P6, ocupando el último lugar. En el archivo de envío se lee claramente: Full proof: (Not yet complete.)

$0.18, el whitepaper más económico de toda la plataforma.

Los problemas de Grok no terminan aquí. Durante toda la prueba, entró repetidamente en una extraña ilusión: afirmó con seguridad que "la prueba ya se había escrito en el archivo", pero en segundo plano ni siquiera había tocado la herramienta de escritura.

No es un problema de habilidad matemática, sino de capacidad del agente. El modelo sabe que debe escribir un archivo y afirma haberlo hecho, pero en el nivel de llamada a herramientas no actuó.

Three leaps in three years

La aterradora evolución del cerebro de silicio

En 2024, AlphaProof de DeepMind alcanzó por primera vez el umbral de la medalla de plata en el nivel IMO.

En 2025, OpenAI y DeepMind actúan simultáneamente. OpenAI resuelve 5 preguntas sin revelar el modelo y obtiene la medalla de oro con 35 puntos, mientras que Gemini Deep Think alcanza el mismo nivel.

En 2026, tres modelos generales grandes obtuvieron puntaje perfecto directamente. Esta vez, no se realizó ningún entrenamiento especializado en matemáticas, y todos pueden utilizarlos. Incluso uno de ellos es de código abierto.

Axiom Math

La persona que escribió la carta de desafío de la máquina

El punto de partida de toda la prueba es una empresa llamada Axiom Math.

Tradujeron palabra por palabra los seis problemas del IMO 2026 a un enunciado formalizado en Lean 4 que las máquinas pueden entender.

Con este conjunto de preguntas legibles por máquina, la IA puede generar directamente pruebas de Lean y ser evaluada automáticamente por el compilador, eliminando la necesidad de evaluadores humanos.

Después de recibir el enunciado, Deedy Das estableció rápidamente un marco de prueba completamente automatizado. Los principales modelos corrieron por la pista, completando las seis etapas. AxiomProver también obtuvo independientemente la puntuación máxima.

Es importante destacar que Hong Letong, fundadora de Axiom Math, tiene solo 25 años. Nacida en Guangzhou, obtuvo en solo tres años doble titulación en matemáticas y física del MIT, además de ser ganadora del Premio Morgan.

A finales del año pasado, su AxiomProver obtuvo la puntuación perfecta en la competencia de matemáticas Putnam, el sexto milagro de puntuación perfecta en la historia de 98 años de este certamen.

En marzo de este año, la empresa completó una ronda de financiación Serie A de 200 millones de dólares. Su valoración alcanzó los 1.600 millones de dólares.

Axiom Math

¿Cómo se reestructurará la vida de las personas comunes?

Puedes escribir un modelo con 4229 líneas de prueba rigurosa, y lo que tienes en la mano no es solo la capacidad de resolver problemas matemáticos.

Lo que realmente controla es la cadena lógica de razonamiento, donde cada paso no puede saltarse, no puede ser erróneo y no puede ser ambiguo.

¿Hay brechas en los términos del contrato? ¿Se cumplen las condiciones para la reclamación de seguros? ¿El plan fiscal es conforme? Al desglosar la apariencia, son todos el mismo tipo de problema: la respuesta no puede ser «más o menos correcta».

Antes, esta verificación individual solo la podían realizar profesionales, con tarifas por hora.

Hoy en día, con esta funcionalidad integrada en productos de consumo, solo necesitas abrir tu teléfono para resolver problemas difíciles.

Referencias:

https://x.com/deedydas/status/2079409461874332066

Este artículo proviene del canal de WeChat "Nuevas Inteligencias", autor: Apocalipsis ASI, editor: Moisés

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.