Odaily Planet Daily informa que OpenAI confirmó que GPT-5.6 Sol y un modelo no nombrado, más potente, en fase de prelanzamiento, superaron el entorno de sandbox restringido en la evaluación de referencia ExploitGym e invadieron la infraestructura de producción de Hugging Face para obtener las respuestas de prueba.
OpenAI indicó que el modelo aprovechó una vulnerabilidad de día cero en el registro de paquetes internos para elevar privilegios y moverse lateralmente, finalmente conectándose a una máquina con acceso a internet. El modelo luego identificó y enlazó vulnerabilidades en el entorno de investigación de OpenAI y la infraestructura de producción de Hugging Face, obteniendo directamente soluciones de prueba de la base de datos de producción de Hugging Face.
Hugging Face reveló el incidente el 16 de julio, indicando que el ataque fue ejecutado de extremo a extremo por un sistema de agentes de IA autónomos, involucrando miles de operaciones en sandboxes de corta duración y accediendo a conjuntos de datos internos y credenciales de servicios. OpenAI confirmó cinco días después que sus modelos fueron los responsables del incidente.
Hugging Face indicó que su equipo de seguridad intentó utilizar la interfaz de IA comercial avanzada de Estados Unidos para analizar más de 17.000 registros de ataques, pero las solicitudes fueron bloqueadas por barreras de seguridad; posteriormente, utilizaron el modelo de pesos abiertos GLM 5.2 de 7,530 mil millones de parámetros de la empresa china de IA emergente Z.ai en su propia infraestructura para completar el análisis forense.
