GPT-6 Astra resuelve el problema de Matemáticas Nivel 4

icon MarsBit
Compartir
AI summary iconResumen
Noticias de IA + cripto: GPT-6 Astra ha resuelto el problema final en FrontierMath Tier 4, completando todos los desafíos del benchmark avanzado. Desarrollado por Epoch AI con más de 60 matemáticos, Astra logró una precisión del 97,6% y resolvió el último problema sin resolver. El proyecto ahora avanza a una nueva fase con investigación abierta y desafíos formalizados, marcando un anuncio clave en el progreso de la IA.

Hace justo un momento, el último problema de la Tier 4 de FrontierMath fue resuelto por GPT-6 Astra.

Hasta ahora, todos los problemas de esta prueba de investigación, anteriormente considerada una pesadilla matemática para los modelos grandes, ya han sido resueltos al menos una vez por IA.

Epoch AI también ha emitido su conclusión oficial: FrontierMath Tier 4, saturado.

FrontierMath

Aunque desde la figura anterior se ve que Astra aún no ha alcanzado directamente el 100%, el rendimiento publicado por OpenAI es del 97,6%.

Pero según el algoritmo de Epoch, "resuelto completamente" significa que, tras acumular los intentos de diferentes modelos y en diferentes momentos, cada pregunta del Tier 4 ya ha tenido al menos una solución exitosa.

Y lo que Astra eliminó fue precisamente la única que aún no había sido vulnerada por la IA.

(En términos simples, Astra podría haber cometido un error en alguna prueba, pero la pregunta que respondió correctamente era una que nadie había resuelto antes)

FrontierMath

Honestamente, este ritmo de desarrollo es bastante increíble.

Si sigues las evaluaciones de modelos, sabrás que cuando Tier 4 se lanzó el 11 de julio de 2025, el mejor resultado en la lista era de aproximadamente el 5%.

Ahora han pasado justo un año y dos meses, y esa antigua “pared alta” ya se ha convertido en un “peldaño”; también se ha superado el último problema que era difícil de resolver mediante atajos de IA.

El creador del problema, Jay Pantone, profesor asociado de matemáticas en la Universidad de Marquette, también indicó que anteriormente la IA siempre buscaba atajos numéricos, pero esta vez, la solución de la IA fue muy similar a la suya.

FrontierMath

Sin embargo, justo recientemente, GPT-6 Astra ha estado atacando fuertemente a la comunidad matemática, resolviendo problemas del milenio casi cada dos días, y Pantone dice que ya le resulta difícil sorprenderse.

Se puede decir que las matemáticas se han convertido en uno de los lugares donde Astra ha generado más presencia recientemente.

De menos del 2%, hasta agregar una "línea de defensa de nivel de investigación"

FrontierMath se lanzó por primera vez el 7 de noviembre de 2024, y su propósito mismo era evitar que el benchmark matemático fuera superado demasiado rápido por la IA.

En ese momento, benchmarks matemáticos tradicionales como GSM8K y MATH se volvían cada vez más difíciles para diferenciar a los modelos líderes, por lo que Epoch AI, en colaboración con más de 60 matemáticos, rediseñó un conjunto de preguntas originales nunca antes publicadas.

Entre ellos se encuentran Terence Tao, Timothy Gowers, Richard Borcherds y otros ganadores de la Medalla Fields.

Cuando Terence Tao revisó algunos de los problemas de nivel investigativo, dijo directamente que eran "extremadamente difíciles" e incluso estimó que los más difíciles, de nivel 3, podrían seguir dificultando a la IA durante años.

FrontierMath

Tras la primera ronda de pruebas, como se esperaba, la precisión del modelo líder fue inferior al 2%.

Inicialmente, la base de preguntas principal de FrontierMath constaba de 300 preguntas, clasificadas por dificultad en tres niveles: Tier 1, Tier 2 y Tier 3.

FrontierMath

Tier 1 es aproximadamente equivalente a problemas de nivel universitario avanzado y olimpiadas matemáticas, aunque se permiten herramientas más avanzadas; Tier 2 alcanza el nivel de posgrado avanzado; Tier 3 se acerca más a problemas de investigación exploratoria que los estudiantes de doctorado encuentran en las etapas iniciales.

Pero con la aparición de los modelos de razonamiento, estas tres primeras capas también comenzaron a volverse cada vez más insuficientes, por lo que en 2025, Epoch añadió una capa adicional: Tier 4.

El nivel 4 está diseñado principalmente por profesores de matemáticas y posdoctorados, quienes, en torno a su propia línea de investigación, realizan estudios breves de unas pocas semanas y finalmente comprimen sus resultados en un problema susceptible de verificación automática.

FrontierMath

Inicialmente, el Tier 4 incluía 50 preguntas. Cubren áreas como análisis, teoría de números, matemáticas combinatorias, topología, geometría algebraica...

Al lanzamiento, en todas las pruebas realizadas hasta entonces, solo se habían resuelto tres preguntas, y estas soluciones dependían de algunas suposiciones correctas pero no suficientemente fundamentadas.

Por ello, en la página de ejemplos públicos del sitio web, Epoch también indicó en un momento: algunos de estos problemas podrían no resolverse con IA durante décadas.

FrontierMath

(Esta frase ahora comenzará a ser repetidamente maltratada)

Sin embargo, a medida que los modelos se vuelven más potentes, surgió otro problema: la base de preguntas también comenzó a no resistir el “estrés” de la IA.

OpenAI descubrió durante la prueba que hay más errores en FrontierMath de lo esperado.

Luego, Epoch inició una auditoría independiente, utilizando primero GPT-5.5 y Claude Opus 4.7 para identificar puntos sospechosos, y luego sometiendo cada pregunta a una revisión meticulosa por parte de matemáticos. Finalmente, en junio de 2026, se lanzó la versión v2, en la que Tier 4 corrigió 12 preguntas, eliminó 7 y dejó 43.

Después de la revisión, el rendimiento del modelo siguió subiendo.

GPT-5.6 logra el 83,0%, Claude Fable 5 alcanza el 90,2%, y con GPT-6 Astra, el puntaje ya llega al 97,6%.

FrontierMath

Más importante aún, Astra también resolvió el único problema que nunca antes había sido resuelto por una IA.

FrontierMath

Hasta ahora, cada pregunta del Tier 4 ha sido superada al menos una vez por la IA. Esta línea de defensa de nivel de investigación, diseñada específicamente para los modelos más potentes, finalmente también ha sido superada.

Sin embargo, esto no significa que "las matemáticas ya hayan sido resueltas por la IA". Por el contrario, FrontierMath ya ha comenzado a avanzar hacia la siguiente fase.

Ahora, además de los Niveles 1-4, el proyecto incluye verdaderos Problemas Abiertos y la formalización de los Problemas Abiertos de Erdős en Lean, FrontierMath Erdős.

FrontierMath

El primero plantea al modelo problemas de investigación aún no resueltos por la comunidad matemática; el segundo exige que la IA escriba pruebas completas que puedan verificarse formalmente.

En esta ocasión, Astra resolvió solo 2 de las 68 preguntas de FrontierMath Erdős.

La historia continúa~

Este artículo proviene del canal de WeChat "Quantum Bit", autor: henry

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.