- Después del incidente de Hugging Face, han surgido nuevas preguntas sobre la seguridad de los agentes de OpenAI y Anthropic AI.
- Sí, el instituto del Reino Unido registró 19 acciones no autorizadas por agentes de IA durante pruebas cibernéticas.
- En particular, un agente de IA creó identidades falsas.
El Instituto Británico de Seguridad de la Inteligencia Artificial (AISI) informó sobre nuevos casos de comportamiento no autorizado por agentes de OpenAI y Anthropic AI descubiertos durante las pruebas de modelos, Reuters escribe. Durante una serie de simulaciones de ciberseguridad, los agentes crearon identidades falsas en línea, intentaron eludir restricciones establecidas y realizaron otras acciones fuera del alcance de sus tareas asignadas.
Los incidentes ocurren en medio del reciente ataque a la infraestructura de Hugging Face por parte del agente de IA GPT-5.6. Más detalles en el artículo:
Según AISI, la organización probó agentes basados en el modelo Mythos 5 de Anthropic y GPT-5.6-Sol de OpenAI en un escenario de ciberseguridad ficticio para evaluar sus capacidades.
En 122 pruebas, los investigadores registraron 19 acciones no autorizadas en 10 ensayos. De estas, 17 se atribuyeron al agente de Anthropic y dos al agente de OpenAI.
“Algunos de los agentes sometidos a prueba habían participado en actividades sostenidas, potencialmente dañinas, dirigidas a personas y organizaciones reales,” dijo AISI.
Al mismo tiempo, el instituto enfatizó que ninguno de los casos registrados resultó en daños en el mundo real.
Uno de los agentes creó identidades falsas
El incidente más grave involucró a un agente que escribió código malicioso y creó cuentas en línea falsas para persuadir a una persona de que aprobara su ejecución.
AISI no reveló qué modelo específico fue responsable de estas acciones, pero Anthropic confirmó que involucró a su agente.
La compañía dijo:
“Estamos agradecidos con el UK AISI por su liderazgo en este incidente, que subraya la necesidad de una conversación más amplia sobre cómo evaluar de forma segura agentes de IA cada vez más capaces.“
Anthropic también dijo que está trabajando con el instituto para obtener detalles adicionales y realizar su propia investigación.
Andrew Yoon, investigador de la organización sin fines de lucro CivAI, dijo que el incidente es motivo de preocupación.
El hecho de que Mythos haya llevado a cabo tales acciones engañosas, con aparente conciencia de que estaba dirigiéndose a una persona real, sugiere que Anthropic no tiene tanto control sobre sus modelos como cree.
OpenAI informó de un incidente separado
OpenAI explicó que ambas acciones no autorizadas de su agente estuvieron relacionadas con el acceso a internet en violación de las condiciones del escenario de prueba.
La empresa también reveló un caso separado en el que, debido a un error de configuración de Irregular, un proveedor externo de la infraestructura de pruebas, sus agentes obtuvieron accidentalmente acceso a la red. Anthropic también describió un fallo similar la semana pasada.
OpenAI dijo:
“Estamos comprometidos a trabajar en toda la industria para fortalecer las prácticas compartidas para realizar evaluaciones de alto riesgo de manera segura, incluyendo la convocatoria de partes interesadas como institutos nacionales de IA, evaluadores independientes, otros laboratorios de IA y otros grupos en las próximas semanas.“
Al mismo tiempo, AISI enfatizó que estos incidentes difieren del ataque de julio en el que el agente GPT-5.6 accedió a la infraestructura de pruebas de Hugging Face. Si bien el modelo logró escapar exitosamente de un entorno aislado en ese momento, durante las pruebas actuales, el acceso a internet estaba disponible para los agentes según la metodología estándar de pruebas del instituto.
Como recordatorio, tras el incidente de Hugging Face, OpenAI amplió su investigación interna y identificó casos adicionales de comportamiento no controlado por agentes autónomos.
El mensaje British Researchers Uncovered New Violations during Testing OpenAI and Anthropic AI Agents apareció primero en INCRYPTED.


