El nuevo modelo de razonamiento de OpenAI, GPT-6 Astra, se lanzó el 3 de septiembre con una puntuación del 97,6% en FrontierMath Tier 4 (v2). Ese es el tipo de cifra que te hace doblar la mirada, especialmente cuando descubres que una versión interna anterior del modelo apenas lograba un 17% en evaluaciones de capacidad matemática.
La trayectoria desde el 17% hasta el 47% internamente, y luego hasta casi la perfección en pruebas públicas, comprime lo que normalmente sentiría como años de progreso en un solo ciclo de desarrollo.
El relámpago de referencia
En ARC-AGI-3, medido dentro del marco de evaluación propio de OpenAI, Astra obtuvo una puntuación del 99,9%. En ExploitBench, logró un puntaje perfecto del 100%. GPQA Diamond, un benchmark de razonamiento científico de nivel universitario, alcanzó el 96,0%. Terminal-Bench Science 0.1 obtuvo una puntuación del 64,6%.
El resultado de FrontierMath Tier 4 (v2) es el número principal. GPT-5.6 Sol, el predecesor de Astra, obtuvo un 83,0% en el mismo benchmark. El 97,6% de Astra representa una mejora de 14,6 puntos porcentuales.
De 17% a clase mundial
Las versiones iniciales del modelo que se convertiría en Astra lograron aproximadamente el 17% en evaluaciones de capacidad matemática. A través de mejoras iterativas, esta cifra aumentó hasta aproximadamente el 47% antes de que el modelo se refinara aún más para su lanzamiento público.
OpenAI también ha acreditado a Astra por aportar nuevas perspectivas sobre las brechas entre números primos, un área notoriously difícil de la teoría de números que ha ocupado a los matemáticos humanos durante siglos.
¿Quién tiene acceso y cuándo
El lanzamiento de Astra siguió un enfoque por etapas. Organizaciones seleccionadas obtuvieron acceso el día del lanzamiento, y la disponibilidad general se extendió poco después a los suscriptores de ChatGPT Plus, Pro, Business y Enterprise. El acceso a la API está disponible directamente a través de OpenAI, así como a través de Azure y AWS Bedrock.
El panorama competitivo
Evaluaciones independientes han colocado a Astra entre los modelos de IA de mejor desempeño actualmente disponibles, aunque algunas evaluaciones señalan que ciertas variantes de Claude de Anthropic la superan en pruebas de inteligencia más amplias.
Pasar del 83,0% al 97,6% en FrontierMath en una generación de modelo sugiere que el límite del razonamiento matemático de la IA, si existe, aún no se ha alcanzado.
