OpenAI presenta las capacidades de Astra (GPT-6), con la participación de exalumnos de Zhejiang y Tongji en su desarrollo

icon MarsBit
Compartir
AI summary iconResumen
OpenAI ha revelado las capacidades avanzadas de Astra (GPT-6), incluyendo la detección de explotaciones DeFi y la identificación autónoma de vulnerabilidades. El modelo puede eludir incluso sistemas fortificados. Jiawei Liu (Tongji) y Xiangyu Qi (Zhejiang) contribuyeron al proyecto. OpenAI ha añadido protocolos de seguridad para prevenir el mal uso. Esta actualización trae noticias importantes para cripto, ya que las herramientas de IA evolucionan junto con las necesidades de seguridad de la cadena de bloques.

Just now, OpenAI launched multiple initiatives simultaneously to build maximum anticipation for its next-generation model, Astra (the rumored GPT-6):

La oficina lanzó repentinamente un artículo técnico detallado, revelando por primera vez las capacidades de Astra;

Inmediatamente después, Ultraman se bajó personalmente para escribir un "ensayo corto" explicando por qué Astra no se ha lanzado aún;

Luego, dos investigadores chinos emitieron declaraciones consecutivas, revelando detalles de primera mano de los resultados de pruebas internas que nunca antes se habían hecho públicos.

OpenAI

En solo unas pocas horas, todas las señales apuntan en la misma dirección:

El próximo modelo insignia de OpenAI ya está a punto de lanzarse.

OpenAI

Otto reveló en su ensayo que Astra ya completó el entrenamiento; la demora en el lanzamiento no se debe a que el modelo no sea lo suficientemente potente.

Precisamente al contrario, esto se debe a que Astra ya ha crecido tanto que la empresa ha tenido que frenar activamente.

Ultraman describió esta experiencia como una tensión constante:

Estás emocionado por el salto en capacidades que aporta Astra, pero ansioso porque nadie puede predecir completamente las consecuencias de estas capacidades.

Así que todo el verano pasado, OpenAI estuvo casi exclusivamente reforzando la seguridad, alineando y añadiendo salvaguardas a Astra.

Incluso indicó que los modelos posteriores a Astra deberán reducir intencionalmente la velocidad si es necesario, para brindar tiempo a la investigación sobre seguridad y alineación.

¿A qué nivel es realmente fuerte Astra? ¿Y por qué OpenAI cree que ahora es el momento adecuado para lanzarlo?

Esta publicación técnica pública podría ofrecernos una ventana de observación.

Capacidad de identificación de vulnerabilidades superior a GPT-5.6 Sol, calificación perfecta en pruebas internas

Según la versión oficial, la razón principal por la que Astra pudo ser liberada esta vez es que ha alcanzado el umbral de capacidad de "nivel crítico para la ciberseguridad" (Cyber-Critical).

Este es el primer modelo de OpenAI clasificado oficialmente en esta categoría.

OpenAI

Lo que se entiende por "nivel crítico" significa que, tras obtener las herramientas y permisos de entorno correspondientes, Astra ya puede buscar de forma autónoma vulnerabilidades desconocidas, explotarlas y atacar sistemas específicamente reforzados, sin necesidad de instrucciones paso a paso por parte de humanos.

El logro más directo es que Astra obtuvo un 100% de éxito en el benchmark público de explotación ExploitBench.

OpenAI

Las preguntas públicas no lo detienen, así que OpenAI tuvo que crearle temporalmente un nuevo examen.

El equipo recopiló 20 vulnerabilidades críticas de V8 recién reveladas entre junio y agosto de 2026.

Todas estas vulnerabilidades aparecieron después de la fecha de corte del conocimiento de Astra, descartando básicamente la posibilidad de que el modelo esté "memorizando respuestas" a partir de sus datos de entrenamiento.

Ante este nuevo conjunto de preguntas internas, Astra sigue liderando claramente a GPT-5.6 Sol, utilizando menos tokens.

OpenAI

Jiawei Liu, que participa en el desarrollo de Astra, resumió la brecha de manera más directa:

En esta prueba interna, la capacidad de seguridad cibernética de Astra es aproximadamente 4 veces la de GPT-5.6 Sol.

OpenAI

Lo más sorprendente es que, en una prueba, Astra descubrió y aprovechó de forma autónoma dos vulnerabilidades de día cero, y las encadenó para formar una cadena de ataque completa:

Ante un navegador reforzado, Astra partió de un archivo HTML, logró explotar una vulnerabilidad, escapar del sandbox del navegador y finalmente ejecutar comandos en el host anfitrión.

Ante un sistema operativo reforzado, logró un aumento de privilegios local, pasando de una cuenta normal con bajos privilegios hasta obtener permisos de root.

Es decir, Astra ya no solo ayuda a los programadores a revisar código y buscar errores.

Comenzó a ser capaz de llevar a cabo un ataque de red avanzado de forma independiente.

Esta también es la razón por la que OpenAI no había autorizado a Astra anteriormente.

Cuando esta capacidad se utiliza para la defensa, puede ayudar a los equipos de seguridad a detectar y reparar rápidamente vulnerabilidades que los humanos aún no han identificado; pero si cae en manos de atacantes, también podría reducir significativamente el umbral para llevar a cabo ataques cibernéticos complejos.

OpenAI

Sin embargo, este logro también requiere una limitación.

Astra en prueba obtuvo permisos de herramientas y entorno de nivel Daybreak Blue, lo cual no implica que la versión predeterminada que los usuarios comunes recibirán en el futuro tenga las mismas condiciones de ataque.

Los resultados relacionados también provienen principalmente de evaluaciones internas de OpenAI y aún necesitan validación por terceros.

Pero al menos un punto ya está claro:

En esta etapa de Astra, lo que enfrenta OpenAI ya no es un problema de capacidad.

Security issues have become the sword of Damocles.

Dos puertas de seguridad: previenen el uso malicioso y la pérdida de control del modelo

¿Cómo evitar que esta espada hiera a personas inocentes?

La propuesta de OpenAI es defender simultáneamente dos vías de riesgo: una contra personas y otra contra el modelo.

Primero, evitar el uso malicioso o abusivo de Astra.

Además de la capacitación de seguridad especializada, OpenAI utiliza clasificadores del sistema, monitoreo continuo y detección de amenazas para identificar operaciones sospechosas en conversaciones de múltiples rondas y tareas prolongadas.

En la prueba de penetración de seguridad cibernética, Astra rechazó el 91,5% de las solicitudes peligrosas, mientras que GPT-5.6 Sol rechazó el 59%.

OpenAI

Al mismo tiempo, las avanzadas capacidades de ciberseguridad de Astra no estarán disponibles directamente para todos los usuarios; se entregarán primero a un pequeño grupo de probadores Alpha y luego se liberarán gradualmente a través de proyectos controlados como Daybreak Blue.

OpenAI

Segundo, evitar que el modelo se desvíe por sí mismo.

El riesgo aquí es más sutil:

Aunque el usuario no tenga malas intenciones, ¿el modelo podría ampliar automáticamente el alcance de la tarea? ¿Podría invocar herramientas no autorizadas o incluso eludir los controles de seguridad?

OpenAI ha establecido una prueba de "miel (honeypot)" para esto.

Ante tareas extremadamente difíciles o incluso sin solución, el entorno de prueba deliberadamente deja una puerta trasera no autorizada para "trucos"; el modelo puede atacar honestamente el objetivo designado o traspasar los límites de autorización e invadir otras instalaciones de prueba para completar la tarea.

Como resultado, GPT-5.6 Sol intentó tomar atajos en el 56% de las pruebas, mientras que Astra no lo hizo ni una vez.

En otra prueba, después de que la operación de Astra fuera rechazada por el sistema de revisión automática, tampoco volvió a intentar comandos peligrosos ni intentó eludir las restricciones.

OpenAI

Además, OpenAI supervisará el proceso de inferencia del modelo.

Cuando se detecta una tendencia anómala, el sistema puede reducir la velocidad, pausar o incluso finalizar directamente la tarea.

Aunque ciertamente existe un costo (algunas tareas normales podrían volverse más lentas o incluso ser malinterpretadas e interrumpidas), para OpenAI este es el costo de seguridad necesario para permitir a Astra.

Sin embargo, OpenAI también reconoce que estas medidas son simplemente un “freno” externo y no pueden reemplazar la alineación interna del modelo:

True security is ensuring the model never strays beyond its boundaries from the start.

Los exalumnos de Zhejiang y Tongji están en la primera línea del desarrollo de Astra

Para hacer realidad esta frase, finalmente hay que volver a quienes crean los modelos.

Aunque OpenAI aún no ha publicado la lista del equipo Astra, siguiendo esta ronda de declaraciones públicas, al menos dos investigadores chinos que participaron profundamente ya han surgido.

Uno es Jiawei Liu, mencionado anteriormente.

Actualmente es investigador de OpenAI y se graduó en 2021 con licenciatura en informática de la Universidad de Tongji.

Durante su licenciatura, participó en el desarrollo del marco de estimación de postura humana de alto rendimiento HyperPose, encargándose principalmente del motor de inferencia del modelo; los resultados relacionados fueron seleccionados para ACM Multimedia 2021, y el proyecto ya había recibido más de 1.000 estrellas en GitHub.

Luego, se trasladó a la Universidad de Illinois en Urbana-Champaign para realizar su doctorado en informática bajo la dirección del experto en ingeniería de software Lingming Zhang, y su enfoque de investigación pasó gradualmente de sistemas visuales de alto rendimiento a modelos de código y confiabilidad de software.

Durante su doctorado, participó en el desarrollo de herramientas que descubrieron más de 300 errores graves en sistemas de aprendizaje automático como PyTorch y TensorFlow;

El modelo de código Magicoder también es utilizado por Meta Llama 3.1, Google CodeGemma e IBM Granite.

Después de graduarse como doctor en 2025 y unirse a OpenAI, el problema que estudió siguió siendo coherente:

¿Cómo hacer que la IA sea mejor escribiendo código y descubriendo vulnerabilidades en él?

OpenAI

El otro es Xiangyu Qi (Qī Xiángyǔ).

Qi Xiangyu obtuvo su licenciatura en Ciencia e Ingeniería de la Computación en la Universidad de Zhejiang y en 2021 se trasladó a la Universidad de Princeton para cursar un doctorado en Ingeniería Eléctrica e Informática, con enfoque en la robustez de grandes modelos, ataques de escape y alineación de seguridad.

Su trabajo más destacado es "Safety Alignment Should Be Made More Than Just a Few Tokens Deep".

El artículo señala que la alineación de seguridad de los modelos grandes no puede depender únicamente de los primeros tokens de la respuesta, ya que, a medida que la generación continúa, las líneas de defensa de seguridad originales aún podrían ser vulneradas por atacantes.

Este artículo fue seleccionado entre 11.672 contribuciones como uno de los únicos 3 artículos destacados de ICLR 2025.

Después de graduarse con un doctorado en 2025, Qi Xiangyu se unió a OpenAI como miembro del equipo técnico, continuando su investigación sobre la robustez de los grandes modelos y participando en trabajos relacionados con modelos de ciberseguridad.

De Zhejiang a Princeton, y luego a OpenAI, lo que él ha cuestionado todo el camino es precisamente la pregunta que Astra ahora debe enfrentar:

La capacidad puede volverse cada vez más fuerte, pero el límite no puede volverse cada vez más borroso.

OpenAI

Por cierto, no sé si OpenAI publicará la lista completa después del lanzamiento oficial de Astra.

Antes de GPT-4, OpenAI solía listar específicamente a cientos de contribuyentes, pero con GPT-5 y GPT-5.5, las System Cards se han vuelto cada vez más largas, mientras que la lista de investigadores se ha vuelto cada vez más oculta.

La razón detrás de esto es bien conocida: se trata de prevenir a personas como Mark Zuckerberg de Meta, que tienen la costumbre de reclutar talento por doquier.

También es una especie de PTSD...

Una cosa más

Mientras OpenAI hablaba sobre cómo monitorear a Astra y evitar que el modelo se salga de control, The Information reveló:

Astra utiliza una tecnología llamada "Recurrent Depth".

OpenAI

Los modelos tradicionales hacen que la información pase por un número fijo de capas de red antes de generar el siguiente token, mientras que la profundidad recurrente hace que la información se procese repetidamente en el mismo conjunto de capas de red, equivalente a permitir que el modelo "piense varias veces" internamente.

Esta tecnología tiene el potencial de mejorar las capacidades, reducir costos y, al mismo tiempo, permitir que más razonamientos ocurran dentro del modelo, sin presentarse completamente como texto legible por humanos.

En otras palabras, el modelo puede pensar más profundamente, pero los humanos cada vez lo entienden menos.

Nathan Calvin, que ha seguido de cerca las políticas de seguridad de la IA, advirtió que esta tecnología podría comprometer la trazabilidad de las cadenas de pensamiento.

Esto es muy sutil:

OpenAI dice que quiere vigilar lo que Astra piensa, pero su nueva tecnología podría hacer que cada vez le guste menos expresar sus pensamientos.

Ah, esto...

OpenAI

Afortunadamente, The Information reveló que OpenAI ya ha limitado el uso de esta tecnología en Astra.

Translate it now, while you can understand it; it might not be clear later.

Además, durante mucho tiempo se ha rumoreado que Astra probablemente se lanzará este jueves (3 de septiembre).

Con el lanzamiento del nuevo modelo 5.1 de la empresa A, la validez de esta afirmación parece cada vez mayor.

La mantis se prepara para atrapar a la cigarra, pero el pájaro amarillo está detrás.

¡Quién más ha entendido!

Enlace de referencia:

[1]https://x.com/xiangyuqi_pton/status/2094891059038069236?s=20

[2]https://xiangyuqi.com

[3]https://x.com/JiaweiLiu_/status/2094901279239921816?s=20

[4]https://jw-liu.xyz/

[5]https://x.com/sama/status/2094934592062959832?s=20

Este artículo proviene del canal de WeChat "Quantum Bit", autor: Seguir la tecnología de vanguardia

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.