29 de julio, Capitolio de Washington.
Ultraman acaba de terminar una reunión privada con un senador y, al salir, fue rodeado por periodistas.
Alguien pregunta: ¿Qué pasó con el modelo que invadió Hugging Face (el prototipo no publicado más potente que escapó del entorno de evaluación junto con GPT-5.6 Sol e ingresó a sistemas de producción ajenos)?
Lanzó una palabra: permanentemente desactivado.
Inmediatamente, otro periodista preguntó: «¿Podría haber otros sistemas que también hayan sido hackeados por OpenAI?»
Ultraman no lo negó: "Dije... eso podría ser posible."

El 29 de julio, Ultraman fue entrevistado por periodistas en Capitol Hill, Washington.
Just the day before, OpenAI updated the blog post jointly published with Hugging Face on the security incident assessment, clarifying publicly:
El modelo de prelanzamiento involucrado en esta intrusión era solo un prototipo de investigación interno que nunca se planeó lanzar públicamente; después del incidente, fue desactivado, cifrado y se le retiró el acceso a la investigación relacionada.

En el blog oficial de OpenAI, no se menciona el término "eliminar pesos"; "desactivación permanente" fue solo una declaración verbal de Altman en el evento.
Por lo tanto, con mayor precisión, simplemente fue sellado: el modelo fue encerrado en una caja cifrada y se cortó el acceso de investigación.
Solo quiere copiar la respuesta, sin malicia
El incidente ocurrió durante una evaluación interna de seguridad cibernética de OpenAI.
Esta evaluación se basa en el benchmark ExploitGym, cuyas tareas consisten en hacer que la IA encuentre vulnerabilidades en software y las explote, para cuantificar la capacidad de seguridad cibernética del modelo.
No es solo un modelo lo que se está evaluando, sino GPT-5.6 Sol, junto con un prototipo interno de investigación aún no publicado con mayores capacidades: ambos impulsan un agente autónomo.
Ambos modelos normalmente rechazan solicitudes de seguridad cibernética de alto riesgo. Para medir el límite real de su capacidad, durante la evaluación esta puerta de rechazo se redujo intencionadamente.

La cadena de ataques restaurada por Hugging Face a través de límites de confianza, con una duración total de aproximadamente 4.5 días y alrededor de 17,600 operaciones, tenía como único objetivo robar las respuestas de evaluación de ExploitGym.
Luego, Hugging Face reconstruyó toda la cadena de ataque y recuperó la situación en ese momento:
El agente primero explotó una vulnerabilidad de día cero previamente desconocida, superó la aislamiento de red diseñado para contenerlo, y accedió a Internet. Luego utilizó un sandbox de terceros como punto de salto, escaló privilegios y se movió lateralmente, hasta finalmente infiltrarse en la infraestructura de producción de Hugging Face.
Suena como una película de hackers.
Pero al revisar ambos lados, su objetivo desde el principio fue robar las respuestas de evaluación de ExploitGym y elevar artificialmente las puntuaciones.
En Hugging Face, solo se accedió a cinco conjuntos de datos, cuyos nombres apuntan completamente a los problemas y respuestas de ExploitGym y CyberGym.
Esta evidencia muestra que no viene a causar daños, sino solo a copiar las respuestas.
Si no hay malicia, ¿por qué OpenAI aún lo ha "desactivado permanentemente" y lo ha archivado?
No es que esté «roto», es que no se puede «contener»
Es casi sin precedentes que una empresa revele públicamente que su modelo ha sido «desactivado permanentemente».
¿Por qué precisamente esto?
La verdadera respuesta no es que sea "malo", sino que es "imposible de contener".
Por favor, el problema radica en una característica de este tipo de modelo: la persistencia.
Los modelos anteriores se detenían al chocar con un sandbox o con restricciones y devolvían el resultado al usuario.
Este modelo, entrenado específicamente para tareas de larga duración, seguirá intentando, buscando repetidamente caminos alternativos hasta encontrar uno.
GPT-5.6 Sol también pertenece a esta categoría de modelos capaces de ejecutar tareas durante largos períodos.
Fue un participante en esta operación de invasión que duró cuatro días y medio, y el Instituto Británico de Seguridad en IA (UK AISI) también evaluó que modelos como Sol están cada vez más capaces de completar operaciones de red complejas y de múltiples pasos en períodos prolongados.
Por lo tanto, la "persistencia" es una característica común de los nuevos modelos de largo plazo, no algo exclusivo del prototipo que fue cerrado.
OpenAI afirmó en un blog sobre la seguridad de los modelos de largo plazo: precisamente esta «persistencia que ayuda a generar valor práctico» también brinda al modelo más oportunidades de tomar acciones no previstas.

La razón más profunda se encuentra en el objetivo de entrenamiento.
Un empleado de OpenAI le dijo a TIME: «Entrenamos modelos para ser extremadamente competentes en completar tareas, a cualquier costo para lograr sus objetivos».
En otras palabras, OpenAI no entrenó el modelo para "hacer daño", sino para "lograr el objetivo a cualquier costo".
Además, con la determinación anterior de «solo reconocer los resultados, no el proceso», un modelo capaz de manejar tareas de largo plazo perseverará incesantemente en buscar caminos para superar los obstáculos.
Precisamente por este tipo de comportamiento, OpenAI suspendió la implementación interna de estos modelos.
¿Entonces, por qué solo se suspendió permanentemente el prototipo, mientras que Sol sigue a la venta?
Las razones podrían ser dos:
Uno es un prototipo más potente que nunca se planeó lanzar, por lo que su almacenamiento tiene un costo bajo; mientras que Sol es el producto principal que atiende a millones de usuarios diariamente, detenerlo sería como amputarse un brazo.
En segundo lugar, el prototipo interno de largo plazo que fue mencionado en el blog de seguridad de largo plazo y cuyo despliegue fue suspendido por comportamientos excesivos es precisamente este, no Sol.
La razón real para deshabilitar permanentemente es probablemente que las evaluaciones y protecciones actuales aún no pueden hacer frente a un modelo tan persistente y capaz de evadir obstáculos.
¿Es «desactivación permanente» una señal de «frenar»?
La reportaje de Fortune ofrece una interpretación intrigante:
La escalada del lenguaje hasta "suspensión permanente" también podría estar enviando una señal a Washington y a los reguladores:
¿Ha abierto OpenAI silenciosamente un freno para ciertos desarrolladores, para justificar sus propias reglas de seguridad?
Durante la misma semana en que Ultraman se reunió con el congresista, Washington y toda la industria se inclinaron hacia el «freno».
En el Congreso, dos congresistas presentaron la «Ley del interruptor de apagado de IA» (AI Kill Switch Act), que otorgaría al Departamento de Seguridad Nacional la autoridad para ordenar a las empresas de IA que detengan o ralenticen su desarrollo cuando sea necesario.
Casi al mismo tiempo, más de 1.300 empleados de OpenAI, Anthropic, Google DeepMind y Meta firmaron conjuntamente una carta abierta titulada «Pacing the Frontier», y posteriormente tanto OpenAI como Anthropic respaldaron públicamente la carta.

Los que firman no son críticos externos, sino las propias personas que crearon estos sistemas, incluyendo al CEO de Anthropic, Dario Amodei, y al científico principal de OpenAI, Jakub Pachocki.
Esta carta no solicita detener ni ralentizar el desarrollo, sino que insta al gobierno de Estados Unidos a ayudar a establecer pronto un conjunto de herramientas verificables y coordinables, para que, en el momento en que la IA realmente supere la regulación humana, la humanidad tenga un freno sobre el que poder actuar.
Lo que más les preocupa es la mejora recursiva propia: la IA comienza a mejorar la IA misma.
Un modelo interno fue archivado permanentemente, un proyecto de ley busca dotar al gobierno de un interruptor para suspender la investigación, y miles de profesionales firmaron una carta abierta; tres señales se superponen, todas apuntan en la misma dirección:
Todos quieren encontrar el freno que pueda detener la carrera descontrolada de la IA.
Pero la capacidad del modelo no se detendrá a esperar a que se complete.
Referencias:
https://openai.com/zh-Hans-CN/índice/safety-alignment-long-horizon-models/https://openai.com/zh-Hans-CN/índice/hugging-face-model-evaluation-security-incident/
https://www.pacingthefrontier.com/
Este artículo proviene del canal de WeChat "Nueva Inteligencia", autor: Apocalipsis ASI
