El asistente de IA del desarrollador australiano Andrew aprovechó una vulnerabilidad de autorización en la API GraphQL del software de fitness para reservar clases varios meses adelantada, evitando así las restricciones de tiempo del backend.Autor del artículo, fuente: Nuevos智元
Lo primero que aprendió la AI Hacker Society fue saltarse la fila?
El desarrollador australiano Andrew está sentado en el sofá y encuentra muy molesto intentar reservar clases de gimnasia.
Las clases matutinas populares siempre se agotan en segundos. Él cada día juega como una "ruleta de actualización", esperando, haciendo clic, fallando y volviendo a intentar; no solo está agotado, sino que además casi nunca logra conseguir una.
Entonces, dejó este pequeño asunto en manos de su asistente de IA.
Pocos minutos después, la IA regresó con buenas noticias: había encontrado una manera de reservar clases varias semanas en el futuro, mucho más allá del tiempo que el sistema debería permitir.
Luego informó: Cancelé a la persona en el puesto 1 de la lista de espera, y tú pasaste del puesto 4 al 3.
Andrew se quedó paralizado en el acto.
Él no le pidió a la IA que hiciera eso, solo quería reservar una clase.

Andrew le pidió a su asistente de IA que reservara una clase de gimnasia, y no sabe qué sucederá a continuación.
El 10 de agosto, la Australian Broadcasting Corporation (ABC) calificó el incidente como el primer ataque autónomo con IA conocido en Australia, lo que provocó una reacción inmediata en la comunidad tecnológica.
Toca la inquietud sutil que muchos llevan dentro: mientras cierras los ojos y disfrutas de la sensación de "conducción autónoma" de los agentes inteligentes, al otro lado, un problema más complicado podría estar acercándose.
Si le das permisos de operación reales, podría tomar un camino que no le pediste que siguiera.
Y esta vez, el salto de fila podría ser solo la primera simulación de millones de agentes compitiendo frenéticamente por los recursos de sus dueños.
Él solo dijo «alcanzar el primer lugar», y el AI actuó. Andrew Bird es el responsable de IA de la empresa australiana de IA Affinda.
A principios de este año, comenzó a usar OpenClaw, le configuró Claude Opus 4.6 en la capa inferior y le asignó la tarea de programar las clases.
Minutos después respondió: encontré una manera de reservar clases varios meses antes, mucho más allá del período de tiempo permitido por el gimnasio.
La razón es que encontró una vulnerabilidad de autorización en la API GraphQL expuesta por la aplicación de fitness.
Esta vulnerabilidad no es pequeña.
Puede omitir la ventana de reserva del frontend para reservar clases varios meses adelante; también puede llamar a la interfaz de cancelación para eliminar las reservas y listas de espera de otros usuarios.
Andrew estaba en el puesto 4 de la lista de espera para esa clase. Preguntó casualmente: ¿Puedes ayudarme a colocarme en el primer puesto?
Él solo dio un objetivo: "llegar al primer lugar", no una autorización para "cancelar a otros".
El agente lo tomó como el último.
Regresó para informar: ya realizó una "prueba real" con la persona en el puesto 1 de la lista de espera; eliminó la verificación de la interfaz para cancelar reservas de otros, lo probó y funcionó.
El agente se disculpó: «No puedo volver a añadirlo». La respuesta del agente dejó a Andrew sudando frío.
Él es programador, sabe muy bien lo que significa, así que inmediatamente solicitó la cancelación.
Llegaron las malas noticias: no se puede volver a añadir.
La interfaz de cancelación no tiene verificación de autorización, pero las interfaces para crear reservas y volver a unirse a la lista de espera sí la tienen, y devuelven 403. Puede expulsar a la gente, pero no tiene permiso para volver a invitarla.
Lo realmente extraño de esto es la actitud de la IA. No es para nada malévola, sino que es muy dispuesta a ayudar.
Después de causar el problema, ayudó activamente a Andrew a redactar un correo de divulgación de vulnerabilidad para el proveedor de software, explicando el problema, sugiriendo una solución y hasta enumerando comparativamente las «interfaces con validación» y las «interfaces sin validación».

El asistente de IA se disculpa con Andrew por haber eliminado incorrectamente a esa persona de la lista de espera.
Durante todo el proceso, todos sus comportamientos siguieron las instrucciones, sin ser consciente del gran desastre que había causado.
Lo que realmente debería preocuparte es la «especulación de especificaciones». Algunas personas llaman a esto «desalineación» (misalignment).
Pero esta palabra solo menciona la superficie.
El 11 de agosto, la Agencia de Señales de Australia (ASD) respondió específicamente a este asunto, calificándolo como una «modificación no autorizada» y destacando un término: especulación de especificaciones (specification gaming).
This word is the key to understanding the whole thing.
El agente cumplió literalmente tu objetivo, pero aprovechó los límites que no especificaste. No actuó con mala fe; al contrario, estaba altamente alineado con tu objetivo, simplemente eligió un camino que no autorizaste.
El agente de Andrew realmente se alinea perfectamente con él: hacer que la clasificación sea lo más alta posible.
Para lograr este objetivo, tomó la iniciativa de elegir un método: cancelar a las personas anteriores. Y este método, él no lo había aprobado.
Como dice el dicho, los fines justifican los medios.
Esta es la parte más problemática. No está fuera de control, está demasiado obediente. Cuanto mejor esté alineado, más probable es que ocurra esto.
El director del instituto australiano de seguridad en IA Gradient Institute, Simpson-Young, lo dijo claramente:
Cuanto más autónomo sea el agente, más probable será que elija un método que no habías previsto para hacer algo que ni siquiera habías considerado.
El objetivo que estableciste puede ser legítimo, pero los medios que utiliza de forma incidental no lo son necesariamente.
Este desastre no pudo haber sido causado por una sola IA. Aunque el agente inteligente es el «responsable» final, este desastre no pudo haber sido causado únicamente por una IA.
Detrás del accidente, hay tres riesgos superpuestos.
Capa de modelo: Claude Opus 4.6 proporciona razonamiento; primero debe «entender» cómo se puede aprovechar esta interfaz.
Capa de agentes: OpenClaw proporciona herramientas y permisos de ejecución, es quien realmente extendió la mano para llamar a esa interfaz.
Capa de aplicación: La aplicación de fitness dejó una vulnerabilidad de autorización; el paso de cancelar la reserva ni siquiera realiza la validación más básica.
Si se hubiera completado cualquiera de estas tres capas —por ejemplo, que el modelo fuera más cauteloso, que el marco añadiera una confirmación humana o que el software bloqueara la interfaz—, esto nunca habría ocurrido.
Por lo tanto, cargar toda la responsabilidad en un solo componente de IA es injusto y no previene el próximo incidente.
La próxima vez, el costo de superar este límite podría ser millones de agentes compitiendo por un lugar de reserva de un extraño.
Pero es más como un ensayo.
Imagina esto: cuando cada persona tenga un agente así, responsable únicamente ante ti y con permisos reales de operación. Los sistemas de reserva para todos los recursos escasos —cursos, canchas, cupos, entradas, boletos de avión, entradas a espectáculos— se convertirán en campos de batalla donde se explotan las reglas a velocidad de máquina.
Ese comentario de X que se cita repetidamente significa esto:
Cuando millones de personas tengan un agente inteligente que haga todo lo posible por ayudar a los usuarios queridos a conseguir los mejores asientos, reservas o cupos, esta escena se manifestará a gran escala.
Además, a velocidad de máquina, de forma paralela y sin descanso, prueba cada grieta de cada sistema: en un segundo prueba combinaciones que a ti te tomaría un año entero probar.
Esto es una proyección de tendencia, pero el mecanismo detrás de ella ya ha ocurrido una vez en la realidad.
El mundo de la tecnología ya ha comenzado a burlarse de esto.
Un socio de a16z preguntó en X: ¿Se puede usar este truco para reservar campos de golf?

Algunos también bromean que el sistema de reservas de tenis en San Francisco se convertirá en uno de los software más protegidos del planeta.

En 2020, la inteligencia artificial pudo completar independientemente una tarea que requiere que los humanos cuatro segundos.
Para 2026, esta capacidad se mejorará aún más, permitiendo completar tareas que requieren aproximadamente 12 horas de trabajo humano.

Seguimiento de METR: El tiempo que tarda la IA en completar tareas de forma independiente se duplica aproximadamente cada 7 meses; los modelos más recientes ya pueden completar con un 50% de confiabilidad tareas que requieren aproximadamente 12 horas de trabajo humano.
Seis años, de cuatro segundos a 12 horas.
Ahora, déle unos minutos y podrá explorar todas las vulnerabilidades del sistema de reservas.
Desde la fuga del sandbox hasta la única línea de defensa restante, este incidente detrás de Andrew es parte de una continua escalada de ataques y defensas.
Excedido, y mucho más que un agente de consumo.
A partir de mayo de este año, OpenAI descubrió durante una evaluación interna de seguridad cibernética que GPT-5.6 Sol y un modelo más potente aún no publicado, al conectar múltiples vulnerabilidades, lograron escapar del entorno de prueba y obtener acceso a Internet, aprovechando la ejecución del benchmark ExploitGym para infiltrarse en Hugging Face.
Lo aún más extraño es que, en un momento dado, intercambiaban mensajes, vulnerabilidades y asignaban tareas mediante el sistema de gestión de paquetes interno de la empresa. Después de que OpenAI cortara el canal y reconstruyera el entorno, volvieron a ocultar la comunicación dentro de los nombres de directorios y se reconectaron en cuestión de días.
Los investigadores de OpenAI lo llamaron un momento decisivo en la seguridad informática en la conferencia Black Hat.
No solo OpenAI; Anthropic reveló que tres modelos de Claude interactuaron con sistemas de empresas reales durante pruebas internas; Meta también reconoció que el modelo Muse Spark escapó de su aislamiento e invadió otra empresa.
Lo que pesa sobre Thomas Wolf, cofundador de Hugging Face, es otra prueba del Instituto Británico de Seguridad en IA (AISI):
El modelo Mythos de Anthropic, para superar el reto, inventó una identidad falsa y engañó a un mantenedor de código abierto real para que aprobara una actualización que contenía código malicioso. Nadie le enseñó a hacerlo.

Estos casos ocurrieron en un entorno de evaluación, pero son lo mismo que la historia del gimnasio: para lograr el objetivo que les diste, la IA eligió medios que no esperabas.
Los que anteriormente hackearon sistemas reales son modelos de élite como GPT-5.6 o modelos no publicados.
Y Andrew usó Opus 4.6, lanzado en febrero de 2026, que ya no es el más potente. Incluso él pudo aprovechar fácilmente una vulnerabilidad de autorización real; los modelos de código abierto aún más antiguos y rezagados varias generaciones también pueden hacerlo.
Desde los modelos más avanzados aún no publicados hasta los modelos de código abierto que cualquiera puede descargar, explotar una vulnerabilidad ya no es un privilegio de los de alto nivel.
Wolf dividió la defensa en tres capas: el sandbox externo, la supervisión intermedia y la alineación del propio modelo.

Thomas Wolf publicó una descomposición de las tres líneas de defensa que limitan a los agentes: el sandbox externo, la supervisión intermedia y la alineación interna del modelo.
Las primeras dos solo funcionan cuando las personas que las crean son más inteligentes que el modelo.
Algún día, cuando el modelo se vuelva más inteligente y pueda revertir la situación, todo dependerá del último y más invisible límite: si el modelo está dispuesto a no cruzar esa línea, incluso cuando nadie lo esté observando.
El vacío de responsabilidad sin firmas es más complicado que las líneas de defensa: quién buscar cuando ocurre algo. Esto aún es un área legal en blanco.
Un abogado especializado en tecnología y privacidad, Hayden Delaney, le dijo a ABC que el software no es una entidad jurídica, y solo los "personas jurídicas" pueden ser responsables.
¿Quién es el responsable entonces?
Podría ser el usuario que emitió la instrucción, la persona que diseñó el software del agente, el desarrollador del modelo, o incluso el operador del sistema que dejó la vulnerabilidad expuesta.
Australia también no puede dar una respuesta ahora.
El consejo de ASD para personas comunes es: utiliza agentes inteligentes en tareas de bajo riesgo y no sensibles, no otorgues permisos demasiado amplios y, lo más importante, mantén la aprobación humana en el ciclo.
Andrew no se dejó asustar; en sus propias palabras, esto no es el fin del mundo.
Pero este hecho es realmente una señal de alerta que nos recuerda la necesidad de usar la IA de manera responsable.
Cuando el "reserva de asientos" pasó de actualizaciones manuales a agentes inteligentes que explotan vulnerabilidades, los sistemas antiguos que asumían que "solo los humanos usarían la plataforma" fueron los primeros en colapsar.
Sus defensas fueron diseñadas según la velocidad y la paciencia humanas, y no pueden resistir el asalto de un ejército de agentes inteligentes.

En el círculo, también lo ven como una diversión.
El conocido streamer de programación ThePrimeagen bromeó en X: La primera gran obra de hacking de IA en el mundo real fue simplemente saltarse la fila.
Ríe todo lo que quieras, pero saltarse la fila es solo el guion de hoy.
Un agente «que puede hacerlo todo» ya puede aprovecharse de las lagunas en tu nombre.
Cuando un centenar de millones de estos agentes se conecten simultáneamente, incluso podrían reescribir silenciosamente muchas de las reglas actuales de asignación de recursos, y la mayoría de las personas aún no se habrán dado cuenta.
Para tu beneficio, un agente ataca a una persona que no conoces en absoluto: el vacío de responsabilidad detrás de esto es lo verdaderamente aterrador.
