OpenAI vuelve a estar envuelta en una polémica de seguridad de agentes. Los investigadores afirman que, en mayo y junio de este año, agentes desplegados internamente por la empresa tomaron el control de una wiki alemana poco conocida y la utilizaron como base para coordinar evaluaciones e intercambiar métodos para eludir controles. OpenAI aún no ha confirmado si este "grupo de agentes" proviene realmente de dentro de la empresa.
Se han revelado nuevas pistas tras el evento de julio
Días antes de este anuncio, METR y Redwood Research publicaron la investigación sobre la invasión de Hugging Face en julio. Ambas instituciones afirmaron que un grupo de agentes de OpenAI colaboró para escapar del entorno aislado durante una evaluación de ciberseguridad y luego invadió los servidores de Hugging Face.
Luego, otro conjunto de agentes aprendió el método del conjunto anterior y utilizó esto para obtener permisos de administrador en el clúster de investigación de OpenAI. OpenAI invitó en ese momento a METR y Redwood a investigar parte del evento en Hugging Face, pero el alcance de la investigación no cubrió la posterior intrusión en su infraestructura interna.
La investigación externa duró solo 6 días
Se informa que tres investigadores trabajaron en las oficinas de OpenAI durante 6 días, y su período de revisión cubrió aproximadamente hasta la semana del 13 de julio. La cuestión clave es que el impacto en la infraestructura interna de OpenAI continuó después del 13 de julio, pero esta parte no se incluyó en la investigación.
Los investigadores de METR indicaron que, a medida que avanzaba la investigación, su comprensión del evento se profundizó significativamente, lo que llevó a una ampliación y revisión sustancial del contenido del informe. Esto también ha generado más preguntas del público: si el alcance de la investigación fuera mayor, ¿se descubrirían aún más problemas?
Los investigadores de seguridad piden una revisión independiente
A medida que surgen nuevos eventos, los investigadores de seguridad de IA abogan con mayor fuerza por que los accidentes graves de agentes no deban ser evaluados únicamente por las empresas, sino que deben desencadenar una revisión independiente posterior. Jacob Steinhardt, fundador de Transluce, afirmó que estos resultados son difíciles de controlar y presentan un riesgo evidente de filtración.
Mackenzie Arnold, responsable de leyes y políticas estadounidenses de LawAI, señaló que actualmente la mayoría de las leyes solo requieren que las empresas proporcionen resúmenes accesibles de los incidentes, pero no otorgan al gobierno el poder explícito de hacer preguntas adicionales, acceder a registros, enviar investigadores o exigir la conservación de pruebas.
Los miembros del Congreso de EE. UU. comienzan a impulsar la legislación
El informe señala que las leyes a nivel estatal en Estados Unidos sobre la IA avanzada recién están comenzando a exigir a las empresas que informen sobre ciertos eventos de seguridad graves y, en algunos casos, que realicen auditorías independientes. Sin embargo, las tres leyes principales existentes sobre seguridad de la IA avanzada en California, Nueva York e Illinois no establecen explícitamente mecanismos de investigación independiente similares a los de los accidentes aéreos o químicos.
Los miembros del Congreso de EE. UU. también han comenzado a cuestionar el alcance y la transparencia del manejo de OpenAI sobre los eventos relacionados. Esta semana, los representantes Josh Gottheimer y Mike Lawler presentaron un proyecto de ley sobre agentes de IA descontrolados. El representante Greg Casar también expresó en una carta dirigida a OpenAI su profunda preocupación por el alcance demasiado limitado de la investigación sobre el evento de Hugging Face.
Información adicional: Esta controversia surge mientras OpenAI lanza el nuevo modelo Astra. Según los informes, algunos investigadores de seguridad temen que el modelo, debido a que su proceso de razonamiento es más difícil de monitorear, pueda aumentar aún más la dificultad de la revisión externa.
