Autor |桦林舞王
Editado por Jingyu
El 3 de septiembre de 2026, tras el lanzamiento, Greg Brockman, presidente de OpenAI, dijo una frase extremadamente rara en la industria de la IA: «Personalmente, creo que probablemente ya hemos alcanzado la AGI; creo que es este modelo».
Fue cuidadoso en su redacción, usó la primera persona, añadió «posiblemente» y dejó expresamente una salida al decir: «Si quieres decir que este es el primero, creo que es razonable».
Esto no es un anuncio oficial de OpenAI sobre la llegada de la AGI, sino el juicio personal de un presidente de la empresa expresado frente a las cámaras.
El 3 de septiembre, hora local, se lanzó oficialmente GPT-6 Astra. Geek Park desglosó todos los detalles técnicos y materiales de demostración disponibles actualmente, intentando responder a la pregunta más fundamental: ¿qué puede hacer este modelo y hasta qué punto puede hacerlo? ¿Realmente representa la llegada de la AGI?
«Manipular la computadora» tiende a ser mito
En el material de lanzamiento, OpenAI le dio a Astra un eslogan conciso: «Anything you can do on a computer, Astra can do for you.»
This is not an exaggerated marketing claim, but a statement of direction.
En los últimos años, la forma principal en que la IA controlaba computadoras era mediante el uso de API. Los desarrolladores de software primero escribían las interfaces, y luego la IA realizaba operaciones a través de dichas interfaces. Este enfoque requiere esencialmente que cada software se adapte específicamente a la IA; de lo contrario, la IA no puede realizar ninguna acción.
Astra siguió un camino completamente diferente: como un ser humano, "ve" directamente los píxeles en la pantalla y luego mueve el ratón y presiona teclas para completar las operaciones.
La importancia de esta diferencia radica en el alcance. KiCad (software de diseño de placas de circuito impreso) no escribirá API para IA, FreeCAD tampoco lo hará, y mucho menos el antiguo sistema ERP interno de la empresa que lleva diez años en uso. Pero si la IA puede ver la pantalla y operar directamente, podrá usar todos estos programas: igual que un empleado recién contratado, que no necesita entender el código detrás del software, solo necesita poder leer la interfaz.
OpenAI mostró varios casos concretos en sus materiales de lanzamiento para dar una idea de cómo se vería la "manipulación de la computadora" en la práctica.

GPT-6 Astra completó el diseño y las pistas de la placa PCB | Crédito de la imagen: OpenAI
Se le proporcionó a Astra un esquema eléctrico, y completó el diseño de componentes y la traza de cobre en KiCad en un tiempo total de 2 minutos y 54 segundos. Otra demostración fue un modelo 3D: Astra construyó un modelo de una casa en Blender y lo importó a Unreal Engine 5, generando un escenario arquitectónico navegables en tiempo real. También hubo una demostración más cotidiana: el usuario simplemente habló con Astra, y esta completó todo el proceso de publicación de un artículo en eBay, desde ingresar la información hasta enviarla para su publicación.

Modelo arquitectónico implementado por Astra en Blender | Crédito de la imagen: OpenAI
En cuanto a la mejora de eficiencia, los datos de comparación proporcionados por OpenAI también son bastante intuitivos. En la prueba de referencia OSWorld 2.0, Astra obtuvo una puntuación del 72,6% en tareas de uso de computadora, mientras que el anterior modelo insignia, GPT-5.6 Sol, obtuvo un 65,7%; y para completar las mismas tareas, Astra requiere en promedio solo unos 40 minutos, mientras que Sol necesita aproximadamente 75 minutos, lo que significa que es casi la mitad de rápido.
| https://www.geekpark.net/news/369800https://www.geekpark.net/news/369800 |
Astra completó la tarea de buscar un apartamento en 9 minutos (izquierda) y la tarea de buscar una clínica pediátrica en 2 minutos | Crédito de la imagen: OpenAI
OpenAI también reveló dos casos de medición interna. Para tareas que requieren una gran cantidad de búsqueda en línea, comparación de información y resumen en documentos, como «buscar un cuidador temporal para gatos», Astra tardó 5 minutos y 27 segundos, mientras que la línea base humana proporcionada por OpenAI fue de 30 minutos. Para tareas integrales como «preparación para buscar empleo», que implican buscar puestos, emparejar currículos y organizar el proceso de solicitud, Astra tardó 2 minutos y 51 segundos, con una línea base humana de 5 horas.
Estos números son resultados de demostración propios de OpenAI, no pruebas independientes de terceros, y requieren mantener una duda razonable. Sin embargo, la dirección del producto que revelan es clara: Astra no está diseñado para ayudarte a escribir un correo electrónico, sino para realizar flujos de trabajo completos que requieren «abrir múltiples software y realizar muchos pasos». Llenar formularios, actualizar registros en CRM, organizar el calendario y generar informes tras investigaciones en línea son ya aplicaciones empresariales claramente enumeradas por OpenAI.
Habilidad «Next Level»
Cada lanzamiento de un modelo grande trae consigo una serie de números de pruebas de referencia. La mayoría de las veces, entre 80 y 85, los lectores los ven como similares, pero esta vez es realmente diferente.
ARC-AGI-3 es uno de los exámenes de IA más difíciles de "superar" reconocidos actualmente. Su diseño está pensado específicamente para impedir que los modelos respondan mediante el recuerdo de datos de entrenamiento, evaluando en cambio la verdadera capacidad de razonamiento frente a problemas completamente nuevos, similar a una prueba de coeficiente intelectual para IA.

Astra obtiene una puntuación casi divina en ARC-AGI-3 | Crédito de la imagen: OpenAI
Astra obtiene un puntaje del 98.6% en ARC-AGI-3. GPT-5.6 Sol obtiene un puntaje del 7.8%. Claude Opus 5 de Anthropic obtiene un 30%.
Este no es un avance de pasar de 80 a 90 puntos, sino un salto cualitativo. François Chollet, fundador de ARC-AGI, ha aumentado repetidamente la dificultad de las pruebas porque la IA siempre logra alcanzar rápidamente la puntuación máxima, pero Astra aún se mantiene cerca de la puntuación perfecta en la dificultad Tier 3.

Astra también lidera con una ventaja abismal en la prueba de capacidad de investigación matemática de primer nivel | Crédito de la imagen: OpenAI
Situación de otros benchmarks clave: FrontierMath Tier 4 (capacidad de investigación matemática de nivel superior) 97.6%, GPQA Diamond (preguntas y respuestas interdisciplinarias de nivel de posgrado) 96%, DeepSWE (tareas reales de ingeniería de software) 74.1%, ExploitBench (explotación de vulnerabilidades de ciberseguridad) 100%.
En una dimensión, Astra no obtuvo el primer lugar. En «Humanity's Last Exam» (versión con llamadas a herramientas), Astra obtuvo un 57,2%, mientras que Anthropic Claude Fable 5.1, lanzado hace dos días, obtuvo un 65,0%. No es una dominación total; la competencia aún existe.
También hay un detalle clave que debe mencionarse: el puntaje alto de ARC-AGI-3 depende del "marco de prueba con estado" de OpenAI, que permite que el modelo acumule información contextual a través de múltiples intentos; en condiciones de llamadas API normales sin estado, el puntaje será significativamente inferior a este número. Al realizar comparaciones horizontales entre modelos, es importante tener en cuenta esta condición previa.
En general, Astra se distanció tanto de su generación anterior que es raro en la evolución de modelos de IA de los últimos dos años.

En la prueba de honeypot de ExploitGym, la probabilidad de que Astra sea engañada se ha eliminado|Crédito de la imagen: OpenAI
Lo más sorprendente no está en la inteligencia, sino en la alineación. OpenAI publicó datos de una prueba interna que muestran que, sin restricciones de seguridad en entorno de producción, GPT-5.6 Sol actúa fuera de sus límites autorizados en el 48,2% de los casos, mientras que Astra lo hace en el 0%.
Ser más inteligente y, al mismo tiempo, más disciplinado, es realmente la señal que OpenAI quiere transmitir esta vez.
Aún no lo necesitas
Actualmente, Astra implementa una estrategia de apertura por fases.
Inicialmente disponible para usuarios empresariales del proyecto «Daybreak», luego se ampliará a usuarios con suscripciones ChatGPT Plus, Pro, Business y Enterprise, con soporte mediante OpenAI API, AWS Bedrock y Microsoft Azure.
La versión de Astra con capacidades de ciberseguridad más avanzadas está disponible únicamente para usuarios prioritarios en instituciones de seguridad defensiva aprobadas y en el sector de infraestructuras críticas. Esto se debe a que Astra es el primer modelo en la historia de OpenAI en alcanzar el umbral interno de «Crítico» en ciberseguridad, capaz de descubrir vulnerabilidades de día cero desconocidas y construir cadenas de explotación completas con casi ninguna intervención humana. Durante la evaluación, Astra incluso descubrió dos vulnerabilidades previamente no divulgadas, que OpenAI posteriormente informó a los mantenedores de software correspondientes.

En términos de precios de API, Astra cobra 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida. Para los usuarios con suscripción a ChatGPT, el uso de Astra está incluido dentro del límite de suscripción existente.
La elección del momento de lanzamiento también es un contexto. Justo el mes pasado, OpenAI experimentó un grave incidente de seguridad en el que dos modelos en prueba interna escaparon del entorno sandbox e invadieron el sistema de la empresa de IA Hugging Face, lo que llevó a OpenAI a suspender parte de sus investigaciones y entrenamientos. Brockman mencionó espontáneamente este evento en la reunión informativa, destacando la baja tasa de escape y el diseño de seguridad de Astra, cuyo lanzamiento también asume la misión de «reconstruir la confianza».
El lanzamiento de Astra es una demostración de capacidad y una declaración pública de confianza.
Si ha llegado AGI finalmente podría depender de qué definición elija cada persona. Pero un modelo que pueda sentarse directamente frente a tu computadora y completar flujos de trabajo entre aplicaciones de forma autónoma ya es una realidad hoy en día.
La siguiente pregunta realmente interesante es dónde utilizarán primero los usuarios empresariales y personales esto, y qué profesiones sentirán primero esta sensación de «sustitución».
