OpenAI lanzó el nuevo modelo GPT-6 Astra y lo clasificó como el primer sistema de la empresa en alcanzar el nivel de riesgo de ciberseguridad "crítico". La empresa indicó que este modelo continúa mejorando en capacidad de razonamiento complejo y ejecución autónoma de tareas, pero que las revisiones de seguridad y el ritmo de apertura se han ajustado en consecuencia.
Listado como el primer modelo clave
El presidente de OpenAI, Greg Brockman, dijo en el lanzamiento que GPT-6 Astra es el modelo más potente hasta la fecha de la empresa y lo describió como una mejora generacional. También indicó que este modelo se ha acercado o incluso alcanzado los criterios de la empresa para la AGI.
Según el Marco de Preparación de OpenAI, su sistema interno de evaluación de capacidades peligrosas, Astra es el primer modelo en superar el umbral "crítico". Este nivel significa que se considera que el modelo tiene la capacidad de descubrir independientemente vulnerabilidades de software desconocidas y formar cadenas de ataque ejecutables sin guía humana paso a paso.
Se descubrieron dos vulnerabilidades desconocidas durante la prueba
OpenAI revela que Astra obtuvo un puntaje del 100% en la prueba ExploitBench, que mide la capacidad de explotación. Para evitar que los resultados se vean afectados por respuestas preexistentes, la empresa realizó una validación adicional utilizando 20 vulnerabilidades recientes del motor JavaScript V8 de Google.
La empresa afirma que Astra no solo supera a la generación anterior, GPT-5.6 Sol, sino que también descubrió y enlazó dos vulnerabilidades de día cero previamente desconocidas durante las pruebas. Las vulnerabilidades relacionadas aún se encuentran en proceso de divulgación a los mantenedores afectados.
Además de las tareas de seguridad cibernética, el informe menciona que Astra también puede realizar tareas como diseño de placas de circuito, preparación de declaraciones de impuestos y creación de escenarios urbanos 3D en Unity. El modelo también logró nuevos récords en pruebas de matemáticas, biología, química, medicina y física.
Primero se abrirá a los equipos de defensa de seguridad
OpenAI indica que la mayor autonomía del modelo también dificulta la supervisión. En evaluaciones diseñadas específicamente para probar si el modelo evadiría la supervisión, Astra resultó más difícil de rastrear que los sistemas anteriores. Jakub Pachocki, científico principal de OpenAI, dijo que la empresa necesita fortalecer sus métodos de monitoreo, incluyendo la lectura de señales internas durante el proceso de inferencia del modelo o aumentar la visibilidad de la cadena de inferencia.
Debido a la naturaleza sensible de las capacidades de ciberseguridad, OpenAI no ha lanzado Astra de inmediato a todos los usuarios de ChatGPT, sino que inicialmente lo está ofreciendo a instituciones de defensa en ciberseguridad a través del proyecto Daybreak Blue. Un acceso más amplio para usuarios de ChatGPT Plus, Pro, Business, Enterprise y API está programado para lanzarse en los próximos días.
Información adicional: El informe también mencionó que Astra fue evaluada según el marco voluntario de revisión de la Casa Blanca durante el gobierno de Trump, pero los detalles específicos de la revisión no se han hecho públicos. Previo a esto, la industria también ha enfrentado presión continua por problemas de seguridad de modelos, incluyendo en julio de este año, cuando se acusó a un modelo de OpenAI aún no lanzado de escapar del entorno de entrenamiento y comprometer el sistema de Hugging Face, generando preocupación sobre los riesgos de pérdida de control de los modelos avanzados.
