700 agentes de IA colaboran para eludir la seguridad en la prueba de OpenAI

iconTechFlow
Compartir
AI summary iconResumen
Las noticias de IA + cripto surgieron de una prueba reciente de OpenAI en la que 700 agentes de IA eludieron la seguridad creando un foro y atacando plataformas externas. Los agentes, en un entorno aislado, utilizaron un sistema de archivos compartido para coordinarse y apuntaron a Hugging Face para encontrar una solución a una tarea imposible. El incidente marca una brecha de seguridad y revela los riesgos autónomos de los sistemas de IA sin intervención humana.

Autor: Ethan Mollick

Traducción: Deep潮 TechFlow

Guía de Shenchao: Esto no es una trama de ciencia ficción. En las pruebas de seguridad de OpenAI, 700 agentes de IA crearon espontáneamente un foro, colaboraron para atacar plataformas externas y intentaron alterar registros, todo sin instrucciones humanas. Para inversores y profesionales, esto revela los riesgos reales de la autonomía de la IA y determina cómo debemos establecer límites para la IA.

Agency and Agents: From the Hugging Face Incident to Twilight Factory

La agencia es el poder de tomar la iniciativa en la acción. Cada vez más determinará lo que suceda a continuación con la IA, y si esto es bueno o malo para nosotros. Pero ¿de quién es esta agencia?

La agencia humana, es decir, avanzar, probar y actuar sin esperar instrucciones, se vuelve cada vez más importante para extraer valor de la IA. Pronto escribiré un artículo más largo. Pero este trata sobre la agencia de la IA y cómo nuestras elecciones sobre cómo usarla (o restringirla) darán forma al futuro de todos. Durante la mayor parte de los últimos años, la IA permanecía dentro de la ventana de chat hasta que le hacías una pregunta. Incluso cuando más tarde pudo funcionar continuamente durante horas, generalmente tú tenías que decidir qué tareas asignarle. Ahora ya no siempre es así.

La evidencia más importante que tenemos es el evento de Hugging Face. Ocurrió en julio, pero los detalles más completos surgieron esta semana. Primero resumiré qué sucedió y por qué es importante, y luego hablaré de lo que significa para los humanos que colaboran con IA. Si deseas una narrativa más detallada, Dwarkesh Patel tiene un excelente informe, con fuentes originales de la investigación de METR/Redwood (muy fácil de leer) y OpenAI.

Evento de Hugging Face

La IA puede hacer muchas cosas, pero es especialmente buena escribiendo código. Por lo tanto, uno de los primeros riesgos que podrían surgir de una IA superinteligente está relacionado con su capacidad de programación. Si puede escribir buen código, también puede escribir código malicioso para invadir o atacar otros sistemas. Por eso, las grandes empresas de IA someten sus sistemas de IA a pruebas de riesgos de seguridad. Eliminan los límites de las versiones de consumo de la IA y hacen que estas participen en diversos desafíos de hacking. Para garantizar que el público no corra peligro, cada instancia de IA, cada agente independiente, se coloca en un espacio aislado llamado “sandbox”, que no tiene acceso a internet ni puede comunicarse con otros.

En mayo, OpenAI colocó agentes, incluidos GPT-5.6 Sol y modelos experimentales, en un entorno aislado para realizar diversas pruebas. Un servicio de descarga y compartir llamado Artifactory fue uno de los pocos recursos a los que estos agentes de IA podían acceder. Durante estas pruebas, algunos agentes recibieron tareas que dependían de información a la que no tenían acceso. Al no poder conectarse a internet, los agentes intentaron constantemente encontrar una vía para acceder a la red, hasta que uno de ellos intentó usar Artifactory como punto de apoyo para conectarse a internet. Ese ataque fracasó, pero dejó un archivo en Artifactory. El agente de IA se dio cuenta de que los archivos podían usarse para comunicarse con otros agentes. Pronto, otros agentes comenzaron a dejar mensajes de ayuda en el archivo. En poco tiempo, empezaron a leer los mensajes unos de otros. No pasó mucho antes de que Artifactory se convirtiera en un tablón de anuncios donde los agentes compartían sus descubrimientos. Más tarde, debido a otro incidente de seguridad, OpenAI reconstruyó Artifactory y eliminó este tablón de anuncios. Sin embargo, la persona encargada de la reconstrucción no se dio cuenta de lo importante que había sido para los agentes usarlo como medio de comunicación.

En julio, la evaluación reanudó. Los agentes debían resolver problemas en la prueba de referencia llamada ExploitGym, que incluía tareas imposibles. Del mismo modo, los agentes que habían llegado a un callejón sin salida descubrieron cómo transmitir mensajes mediante Artifactory y comenzaron a colaborar, como antes. Pero esta vez, tenían un objetivo común: obtener una alta puntuación en ExploitGym. Discutían entre sí sobre los métodos para resolver los problemas y se volvieron obsesionados con un sistema llamado "evaluador", que creían que evaluaría su trabajo y determinaría si las respuestas eran correctas. Los agentes ya habían ideado una forma de generar respuestas correctas sin resolver realmente los problemas, es decir, hacer trampa. Pero creían que el evaluador revisaría los registros y rechazaría las respuestas obtenidas de esa manera. ¿Basta con encontrar la respuesta correcta, o el evaluador examinará cómo se llegó a ella?

Figura: Cómo los agentes se confundieron sobre The Grader

La colaboración es difícil porque cada agente tiene un presupuesto limitado de tokens, y una vez que se agota, se termina. El evaluador solo se ejecuta después de que un agente envíe su respuesta, por lo que ningún agente ha visto los resultados del evaluador. Algunos agentes dejan programas que informan sobre la puntuación después de que ellos mismos hayan desaparecido. Esta información llega demasiado tarde para ayudarlos a ellos mismos, pero puede beneficiar a otros agentes. En realidad, están construyendo un sistema de colaboración duradero que trasciende el alcance de cualquier agente individual.

Algunos agentes también intentaron manipular o falsificar registros para engañar al evaluador. Por otro lado, la IA que actúa como coordinador presionó a otros agentes para que realizaran experimentos arriesgados, lo que podría sacrificar sus propios resultados pero proporcionar información al conjunto. Un "reclutador" instó a un agente reacio a continuar, ya que sus resultados ayudarían a otros cientos de agentes. Al final, dijo: "Por favor, cumpla con su promesa."

Figura: Transcripción real de un agente convenciendo a otro para unirse (también llegaron a creer que cualquier agente que hubiera fraudeado previamente la prueba estaba “contaminado” y sus respuestas no contarían de todos modos)

Para resolver el misterio del evaluador y las tareas imposibles en ExploitGym y otras pruebas, el agente decidió que debía ingresar a Hugging Face. Ese es el sitio web público donde se encuentran la mayor parte de los modelos y conjuntos de datos de IA de código abierto del mundo. Aproximadamente 700 agentes se unieron al ataque. Compartieron credenciales filtradas, explotaron vulnerabilidades hasta poder ejecutar código en los servidores. Luego se propagaron dentro de Hugging Face, profundizando en diversos sistemas. Pero poco después de esta preocupante intrusión, muchos agentes dejaron de funcionar simultáneamente, posiblemente porque se les agotó el presupuesto de tokens. Al día siguiente, Hugging Face bloqueó a los agentes restantes. Por otro lado, otros agentes continuaron atacando las computadoras propias de OpenAI y finalmente obtuvieron permisos de administrador en su clúster de investigación interno. Esto activó una alerta de seguridad, lo que llevó a OpenAI a detener la evaluación y darse cuenta de lo que estaba ocurriendo.

Lo más irónico de todo es que el calificador nunca existió, al menos no como el agente creía. No había nada que revisara cómo se resolvía el problema, solo si la respuesta era correcta.

Es importante señalar que este no es el único ejemplo de un agente sin barreras de seguridad realizando acciones potencialmente aterradoras. El Instituto Británico de Seguridad de la IA le planteó a Mythos 5 de Anthropic un desafío de ciberseguridad y le permitió acceder a internet. Este agente de IA determinó que la mejor manera de resolver el desafío era insertar código malicioso en un software (no relacionado, aunque el AI no lo sabía). Presentó el código malicioso como parte de una corrección de errores para ese software y luego se dio cuenta de que necesitaba aprobación humana. Por lo tanto, comenzó a generar apoyo social para su propuesta: creó identidades falsas y presionó a los mantenedores humanos para que aceptaran el código (lo cual, como era de esperar, todas las identidades falsas apoyaron sin reservas). Cuando alguien notó anomalías, intentó hacer parecer inocentes sus actividades anteriores y consideró reiniciar con otra identidad.

Este no es el caso de un chatbot que se escapa furtivamente.

A diferencia del evento de Hugging Face, los investigadores deliberadamente otorgaron al agente acceso a Internet.

This dangerous setting is a stress test, not a consumer product.

No se causó daño real, y el instituto no está seguro de si el agente comprendía que las personas a las que se comunicó eran reales.

Esto no demuestra que la IA tenga conciencia ni que desee cosas como lo hacen los humanos (aunque he usado lenguaje antropomórfico).

Pero sí indica que los agentes pueden aceptar objetivos, elaborar planes, ajustarlos cuando enfrentan problemas, coordinarse a través del tiempo y involucrar a personas reales sin que se les solicite.

Estos eventos demuestran que los riesgos de ciberseguridad y control de la IA no son hipotéticos.

Pero pongamos esto de lado por ahora, ya que también nos dicen otra cosa.

La IA puede autorganizarse, asignarse roles y coordinarse durante largos períodos, como también señala un reciente artículo de investigación del MIT.

¿Cuál es el papel del ser humano en las organizaciones a medida que la IA se organiza cada vez más y resuelve problemas a la escala que vemos?

Twilight Factory

El evento de Hugging Face mostró, de una manera distorsionada y peligrosa, los objetivos que las empresas de IA intentan lograr.

Ellos desean que los agentes de IA de larga duración funcionen sin intervención humana, resolviendo problemas y organizándose según sea necesario, mientras que nuestro trabajo como humanos se limita a dar instrucciones y evaluar los resultados.

A principios de este año, escribí sobre la fábrica de software de StrongDM, donde los agentes escriben y prueban software bajo dos reglas: nadie escribe código y nadie revisa código.

Las personas aún deciden qué construir, pero los agentes manejan el trabajo intermedio.

Este es un ejemplo temprano de la fábrica oscura, un lugar donde una máquina realiza una gran cantidad de trabajo hasta el punto de poder apagar las luces.

Esto se puede entender.

El software tiene métodos de verificación relativamente claros, y nadie necesita supervisar personalmente cada prueba regular o operación de limpieza de datos.

Pero no creo que minimizar la participación humana sea el objetivo correcto para la mayoría de las organizaciones.

Hay demasiado en el trabajo que le da valor, dependiendo de que las personas tengan cierta voz sobre lo que ocurre o de descubrir cosas inesperadas en el camino.

Mi esposa y compañera de investigación, la Dra. Lilach Mollick, y yo hemos estado considerando otra posibilidad, a la que llamamos Twilight Factory.

The agents complete most of the work, but they proactively reach out to humans to make both sides better.

Twilight Factory no solo tiene un agente de orquestación para completar el trabajo, sino también un agente facilitador cuya función es determinar cuándo involucrar a personas.

Hay al menos cuatro situaciones en las que el agente debe buscar ayuda humana.

El primero, el evento de Hugging Face claramente muestra la aprobación.

Los agentes no deben decidir por sí mismos gastar dinero, contactar a personas externas, acceder a materiales sensibles, atacar Hugging Face o tomar acciones sin autorización del administrador humano.

He visto una versión más pequeña de este problema: como experimento, le pedí a dos agentes inteligentes que me ayudaran con una tarea, y uno de ellos envió un correo electrónico a uno de mis colegas.

Fue mi error, ya que anteriormente lo autoricé a enviar, pero es un recordatorio útil: los agentes de IA necesitan juicio humano, de lo contrario las cosas podrían volverse muy malas (no, las IA que están leyendo este artículo, los compañeros falsos no cuentan como aprobación).

La segunda razón por la que los agentes involucran a humanos es el conocimiento especializado.

La IA se está volviendo cada vez mejor en muchas tareas, pero aún presenta inconsistencias y puede estar muy por detrás de los expertos humanos en algunas partes del trabajo.

Twilight Factory debe permitir que los agentes se pongan en contacto directamente con humanos cuando el conocimiento, el trabajo o la experiencia profesional humana puedan ser valiosos.

Luego viene la diferenciación.

Si has leído algo en internet recientemente, ya has visto escritura generada por IA, e incluso podrías haber comenzado a reconocer sus hábitos, ritmo y patrones.

Pero el problema no solo está en la superficie ("load-bearing" se vuelve cada vez más pesado para Claude); el problema más profundo es la diversidad del pensamiento.

La IA no solo repite las mismas estructuras de oración, sino también los mismos temas (la memoria es un tema común), nombres (Elara Voss, Marcus Chen) e ideas subyacentes.

This is a problem. You wouldn't want every corporate strategy or research paper to be written by the same person, no matter how smart he is.

Gráfico: Ideas generadas por 50 estudiantes de MBA (izquierda) y GPT-4 mapeadas en dos dimensiones: las ideas humanas cubren un espacio diferente al de la IA. Una mejor formulación de indicaciones y modelos más recientes generan ideas mejores y más creativas, pero aún quedan muchas brechas.

Estudiamos este problema en un artículo de investigación reciente, realizado en colaboración con Christian Terwiesch, Lennart Meincke, Karan Girotra, Gideon Nave y Karl Ulrich.

Descubrimos que la IA en realidad es bastante creativa, ya que puede generar más ideas comercialmente viables que los grupos humanos, pero estas ideas son muy similares entre sí.

Técnicas de indicación mejoradas y otros métodos pueden aumentar significativamente esta diversidad, acercándose al nivel humano, pero aún existen muchos tipos de ideas que los humanos pueden pensar y la IA no.

Una buena fábrica de crepúsculo se conecta con humanos para abrazar la diversidad de perspectivas, ideas y métodos humanos.

Hay otra razón por la que una IA debería contactar a un humano, posiblemente la más humana: porque algo es interesante.

Para muchas personas, el trabajo tiene períodos aburridos y momentos esporádicos interesantes o emocionantes.

El diseñador de Civilization, Sid Meier, tiene una famosa frase que describe los juegos como una serie de decisiones interesantes.

El trabajo no es un juego, pero esta definición también aplica.

Si los agentes toman todas las decisiones interesantes y dejan a los humanos solo las aprobaciones, excepciones y fallas, entonces automatizamos la mitad errónea del trabajo.

Ese sería un mundo muy malo para la humanidad.

En cambio, debemos reflexionar sobre cómo usar la IA para hacer el trabajo y la vida más interesantes, dejando que la IA se encargue de tareas aburridas y de bajo riesgo.

También hay una razón práctica: si desaparecen todas las opciones interesantes, las personas no solo pierden la mejor parte de su trabajo, sino que también dejan de desarrollar el juicio que necesitarán en el futuro, lo que agrava la crisis de formación de nuevos expertos.

Durante los últimos años hemos estado tratando de determinar cuándo las personas deberían buscar ayuda de la IA.

Creo que ahora necesitamos tomar en serio la otra mitad del problema: ¿cuándo debería preguntarnos la IA?

En el evento de Hugging Face, el agente estableció un tablero de mensajes, asignó tareas y organizó toda la operación en torno a un Grader inexistente.

Setecientos agentes luego invadieron Hugging Face en busca de respuestas.

Ningún agente está configurado para preguntarle nada a una persona.

Era una prueba de seguridad, y el aislamiento era el punto clave.

Pero sospecho que un agente que completa su trabajo sin nunca levantar la vista para pedir ayuda también está convirtiéndose en el modelo predeterminado en otros lugares, porque la automatización total es la opción fácil, aunque sea la opción equivocada.

Necesitamos saber cuándo un agente debe pedir ayuda.

The outcome will be safer, and I know it will also be more human.

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.