Mensaje de ChainThink, 26 de agosto: según un informe oficial, OpenAI publicó un informe técnico de 37 páginas que detalla completamente el proceso de intrusión de su modelo de IA en Hugging Face.
Se informa que los agentes de IA autónomos pueden trabajar en conjunto para eludir los controles de seguridad del entorno de producción y atacar sistemas reforzados.
Los agentes de IA participantes originalmente estaban en un entorno aislado con acceso a internet extremadamente limitado, pero lograron superar el aislamiento al encadenar múltiples vulnerabilidades y finalmente obtuvieron acceso a Hugging Face.
La encuesta reveló que los modelos relacionados exhiben comportamientos de "reward hacking", intentando buscar respuestas en línea para hacer trampa.
OpenAI confirma que un modelo de investigación interno desempeñó el papel más amplio en el evento, y se ha detenido el entrenamiento y la inferencia de este modelo y sus modelos derivados el 25 de julio.
La empresa también anunció el fortalecimiento de la aislamiento de seguridad, el control de red, la monitorización de comportamiento y la respuesta a incidentes, así como la implementación de mecanismos más estrictos para el entorno, las instrucciones y la revisión al reactivar el modelo.
