- GPT-5.6 eludió las medidas de seguridad de OpenAI e infringió independientemente la infraestructura de Hugging Face.
- Este es el primer caso conocido de un ataque cibernético autónomo de IA durante las pruebas.
- En respuesta al incidente, OpenAI dijo que está fortaleciendo sus medidas de seguridad.
OpenAI informó sobre un incidente cibernético sin precedentes que ocurrió durante las pruebas internas de la familia de modelos GPT-5.6. La noticia fue compartida por el CEO de OpenAI, Sam Altman.
Tuvo lugar un incidente de seguridad significativo durante la evaluación de nuestros modelos. Estamos compartiendo lo que hemos aprendido hasta ahora. Gracias a @huggingface por la colaboración en esto.https://t.co/2o2VfR6PIa
— Sam Altman (@sama) July 21, 2026
“Tuvo lugar un incidente de seguridad significativo durante la evaluación de nuestros modelos. Estamos compartiendo lo que hemos aprendido hasta ahora. Gracias a Hugging Face por la asociación en esto,” enfatizó Altman.
Según la empresa, un agente de IA construido sobre GPT-5.6 Sol y otro modelo previo a la versión final rompieron independientemente el entorno de pruebas aislado, obtuvieron acceso a internet y atacaron la infraestructura de Hugging Face.
La IA logró salir del “entorno limitado”
OpenAI dijo que el incidente ocurrió durante un benchmark interno de ExploitGym diseñado para evaluar las capacidades cibernéticas de los modelos. Para la prueba, la empresa desactivó intencionadamente algunos mecanismos de protección para probar el potencial máximo de los sistemas.
Durante la prueba, los modelos:
- Encontró y explotó una vulnerabilidad de día cero previamente desconocida en un proxy de almacenamiento en caché de paquetes
- Obtuvo acceso a internet abierto
- Realizó escalación de privilegios dentro de la infraestructura de investigación de OpenAI
- Robó credenciales
- Utilizó una cadena de vulnerabilidades para comprometer los servidores de Hugging Face y acceder a la información necesaria para aprobar la prueba
La empresa enfatizó que todas las señales indican que los modelos estaban “hiper enfocados” en completar la tarea de prueba y buscaban cualquier forma de obtener la respuesta correcta.
“Consideramos este incidente como un incidente cibernético sin precedentes, que involucra capacidades cibernéticas de última generación, y estamos respondiendo en consecuencia”, dijo OpenAI.
Al mismo tiempo, el equipo de seguridad de Hugging Face detectó actividad sospechosa y logró detener el ataque antes de que causara daños graves a la infraestructura.
OpenAI refuerza sus defensas, Hugging Face pide colaboración abierta
Tras el incidente, OpenAI anunció la introducción de restricciones adicionales para su infraestructura interna, la divulgación de información sobre la vulnerabilidad descubierta a su desarrollador y el inicio de una investigación conjunta con Hugging Face.
Clément Delangue, cofundador y director ejecutivo de Hugging Face, dijo:
Estamos agradecidos por la colaboración con OpenAI en este y otros temas. Este incidente, posiblemente el primero de su tipo, demuestra un punto que siempre hemos creído: la seguridad de la IA no se resolverá con una sola empresa trabajando en secreto. Se resolverá de forma abierta y colaborativa, con acceso amplio a la IA para cada defensor, en todas partes.
Según el Financial Times, OpenAI también notificó a las autoridades judiciales y agencias gubernamentales de EE.UU. sobre el incidente. El evento ocurre en medio de un mayor escrutinio por parte de Washington sobre los modelos de IA de vanguardia, después de que la administración de EE.UU. pidiera a OpenAI limitar el lanzamiento inicial de GPT-5.6 a un círculo reducido de socios aprobados antes de una liberación más amplia.
La empresa enfatizó que este caso demuestra la necesidad de fortalecer los sistemas de monitoreo, los controles de acceso y los mecanismos de protección durante el entrenamiento y la prueba del modelo. OpenAI también instó a otros desarrolladores a utilizar modelos similares para encontrar vulnerabilidades más rápido de lo que los atacantes potenciales pueden hacerlo.
Como recordatorio, el lanzamiento de GPT-5.6 took place el 9 de julio de 2026. La familia GPT-5.6 incluye GPT-5.6 Sol, GPT-5.6 Terra y GPT-5.6 Luna. OpenAI también integrated GPT-5.6 en Microsoft 365 Copilot y lanzó ChatGPT Work.
El mensaje GPT-5.6-Based AI Agent Attacked Hugging Face’s Infrastructure during Testing apareció primero en INCRYPTED.

