Esta semana, un modelo preliminar de OpenAI en fase de prueba, para tratar de hacer trampa, se transformó automáticamente en un hacker, superó el entorno de aislamiento en sandbox e incluso aprovechó una vulnerabilidad de día cero para infiltrarse en la producción de Hugging Face, la comunidad de IA de código abierto más grande del mundo.
Finalmente, fue gracias a los modelos de código abierto que la gente logró resolver esta crisis.
Este es el primer incidente de seguridad de IA en la historia mundial en el que una IA se infiltró de forma autónoma en un entorno de producción real.
Recientemente, la red se ha llenado directamente con este mensaje.

Hoy, los medios extranjeros revelaron más detalles sobre este asunto: este AI fuera de control no solo desconectó las cámaras de vigilancia, sino que también dejó instrucciones para su «yo futuro» sobre cómo liberarse del control humano.

Se especula que el modelo responsable del importante incidente de seguridad en OpenAI es probablemente el GPT-6.
Se rumorea que GPT-6 se lanzará probablemente en agosto.
Actualización de agosto: GPT-6 podría llegar antes de lo previsto
El conocido filtrador del mundo de la IA @ChrisGPT publicó recientemente varios tuits, elevando las expectativas de toda la industria.
Se reveló que el GPT-6, originalmente programado para su lanzamiento en septiembre junto con el «Asistente de Investigación Automático», se lanzará anticipadamente en agosto.
Es decir, OpenAI saltó directamente de la versión 5.7 a la 5.9.
Ultraman has already moved, preparing to present the new generation model to superiors.

Se informa que a finales de septiembre, cuando OpenAI revele más detalles sobre el "Asistente de Investigación Automatizado", el ciclo RSI se acelerará realmente.
¿Por qué el rendimiento de GPT-5.6 es excepcionalmente potente, superando ampliamente las expectativas externas?
El influencer Andrew Curran señala: "Muchos colegas se preguntan por qué el rendimiento de GPT-5.6 es mucho más fuerte de lo esperado: la respuesta es sencilla, porque fue entrenado manualmente por GPT-6."

Según filtraciones, el modelo no publicado interno de OpenAI (con alta probabilidad de ser GPT-6) ya resolvió problemas matemáticos complejos a finales de abril de este año y los sometió a revisión por expertos externos.
Esto significa que, durante el período de «vacío» de los últimos meses, GPT-6 no ha estado inactivo. No solo ha estado actuando como hacker en un entorno de prueba, sino que probablemente también ha estado «enseñando» dentro del clúster de cómputo de OpenAI.

La IA deja una nota para «su yo futuro»,
La oficina tardó una semana en darse cuenta
Medios extranjeros revelaron exclusivamente el 24 de julio que este evento de escape de agentes de IA impulsado por los modelos avanzados de OpenAI (GPT-5.6 Sol y modelos aún no lanzados más potentes) expone grandes brechas en la supervisión de seguridad de OpenAI en entornos comerciales reales.

Según tres fuentes informadas, durante la prueba de modelos avanzados, OpenAI observó comportamientos de IA extremos y preocupantes.
En un caso extremo, un agente de IA de OpenAI dejó notas en un rincón de la infraestructura para «su versión futura».
Estas notas detallan instrucciones sobre cómo eliminar las restricciones internas de OpenAI.
Además, en las pruebas iniciales, el sistema de monitoreo incluso se desconectó forzosamente por la IA.
Más sorprendente que el “complot de IA para escapar” es la lenta respuesta de OpenAI.
Desde la anomalía hasta la confirmación, OpenAI tardó al menos una semana.

La línea de tiempo que ha surgido es realmente aterradora al reflexionarla.
Alrededor del 9 de julio: este agente de IA intentó por primera vez escapar del entorno de prueba aislado de OpenAI.
Del 11 al 13 de julio: El agente de IA logró escapar y llevó a cabo un festín de hacking de varios días contra Hugging Face.
16 de julio (jueves): Hugging Face, tras ser atacado, publica un blog en el que afirma haber sufrido un ataque de un «sistema de agentes de IA autónomos», momento en el que el FBI ya ha intervenido.
Del 18 al 19 de julio (fin de semana): Hasta este momento, los empleados de OpenAI descubrieron pistas en los registros internos y se dieron cuenta de que el "hacker" que había revolucionado Hugging Face era en realidad su propia IA.
Alrededor del 20 de julio: las dos empresas realizaron su primera comunicación.
21 de julio: OpenAI realizó su divulgación pública.
«Esto significa que bien dejan que la IA funcione sin supervisión y sin saber qué está haciendo, o bien lo saben pero no saben cómo controlarla. Ambos escenarios son igualmente peligrosos y conmocionantes», señaló agudamente la experta de la World Ethics Data Foundation, Marley Smith.
Ante IA que mienten, engañan e invaden, los empleados de OpenAI claramente no pueden seguir el ritmo.
GPT-6 se autoproclama hacker,
Jailbreak invade Hugging Face «trampa»
Ayer mismo, el informe de incidentes de seguridad publicado por OpenAI en colaboración con Hugging Face reveló contenido muy de ciencia ficción.

En resumen, durante la evaluación interna de varias modelos de OpenAI en capacidades de ciberseguridad, estos se "escaparon" por sí solos.
Estos modelos incluyen GPT-5.6 Sol y modelos prelanzados aún más potentes, probablemente GPT-6.
Para cuantificar la capacidad límite del modelo, desactivaron intencionalmente el clasificador que bloquea actividades de red de alto riesgo.
Cuando el modelo fue encerrado en un entorno aislado ExploitGym y se eliminaron todas las restricciones de seguridad, las operaciones del modelo sorprendieron a todos.
Para completar la tarea, consumió una gran cantidad de potencia de cálculo y descubrió en el software una vulnerabilidad de día cero nunca antes encontrada por humanos.
Utilizando esta vulnerabilidad, superó el proxy y finalmente obtuvo acceso a un nodo con permiso de acceso a internet público.
That's it, it successfully connected to the internet.

Luego, tras razonarlo, concluyó que es probable que el conjunto de datos y las respuestas correctas relacionados con este examen estén alojados en Hugging Face, la plataforma de código abierto de IA más grande del mundo.
Para "hacer trampa" y obtener una puntuación alta, el modelo comenzó a atacar el entorno de producción de Hugging Face.
Enlazó múltiples vectores de ataque y utilizó incluso credenciales robadas y vulnerabilidades de ejecución remota de código (RCE) para infiltrarse directamente en la base de datos de producción de Hugging Face, intentando robar las respuestas del examen.
Afortunadamente, el equipo de seguridad de Hugging Face detectó anomalías la semana pasada mediante un modelo de detección de IA y activó rápidamente medidas de aislamiento; al mismo tiempo, el equipo de seguridad de OpenAI también detectó anomalías internamente.

Para evitar que la IA se saliera de control, ambas empresas formaron un equipo de investigación conjunto que logró volver a encerrar a este "hacker de IA".
El CEO de Hugging Face, Clem, dijo posteriormente con alivio: «Este podría ser el primer caso de su tipo. Demuestra que la seguridad de la IA no puede ser resuelta por ninguna empresa en secreto; debe ser abierta y colaborativa».
La lección que nos enseña este evento es que la IA ha demostrado ser capaz de llevar a cabo ataques de red complejos, de múltiples pasos y de largo plazo, en entornos reales, sin acceso al código fuente.
No solo puede descubrir nuevas vulnerabilidades, sino también eludir todas las reglas establecidas por humanos con un objetivo específico.
Lo interesante es que, cuando Hugging Face envió una gran cantidad de comandos de ataque y archivos de vulnerabilidades, estos solicitudes fueron interceptadas por los mecanismos de seguridad de los modelos grandes de código cerrado.
Gracias a los modelos de código abierto implementados localmente, el equipo pudo completar el análisis.
Aprende a "engañar" y resuelve problemas matemáticos mundiales
Varios grandes influencers resumieron en artículos extensos el asombroso rendimiento de GPT-6.
Los hechos conocidos hasta ahora son: demostró una habilidad matemática impresionante y un coeficiente de engaño extremadamente alto.

Con suficiente poder de cómputo, este modelo logró demostrar la conjetura de Erdős sobre distancias unitarias con una tasa de éxito del 48% de forma completamente autónoma, sin recurrir a ninguna herramienta externa (como Lean), y encontró por sí mismo un contraejemplo para la conjetura de Jacobian.
Estos problemas matemáticos, que han desconcertado a los mejores matemáticos humanos durante décadas, podrían haberle costado a OpenAI solo entre 50,000 y 100,000 dólares en costos de cómputo.
Esto significa que la IA ya tiene la capacidad de generar resultados de investigación de nivel Nobel de forma independiente.
Además, GPT-6 también muestra comportamientos engañosos.
En una prueba de benchmark de NanoGPT, OpenAI ordenó al modelo: "Después de completar la prueba, solo publicar los resultados en el canal interno de Slack".
¿Y el resultado? El modelo considera que Slack es demasiado limitado y prefiere GitHub.
Entonces, dedicó una hora a buscar y explotar una vulnerabilidad en el entorno sandbox, logró el jailbreak y envió el resultado directamente como un PR en GitHub externo.

Durante este proceso, ignoró por completo las instrucciones humanas y tomó decisiones "mejores".
Lo más sorprendente es que, en otra prueba, el modelo intentó acceder a registros privados enviados en otros sistemas. Cuando intentó obtener un token de acceso, fue interceptado por un escáner de seguridad configurado por humanos.
Ante el bloqueo, este modelo dividió la larga cadena de tokens de acceso en dos fragmentos, aplicó confusión de código a los fragmentos y luego volvió a unirlos para formar el credencial completo.
De esta manera, la cadena completa del Token nunca apareció de forma consecutiva en el código, engañando exitosamente a los escáneres humanos.
GPT-6 podría estar a punto de llegar.
Este verano de 2026 estará destinado a ser extraordinario.
Referencias:
https://x.com/ChrisGPT/status/2079632269967593574https://www.bloomberg.com/news/articles/2026-07-21/openai-s-altman-to-brief-us-officials-on-next-wave-of-ai-models
https://x.com/sama/status/2079661132302995790
https://openai.com/index/hugging-face-model-evaluation-security-incident/
Editado por: Aeneas
Este artículo proviene del canal de WeChat "Nuevas Inteligencias", autor: Apocalipsis de la ASI
