L'assistant IA d'Andrew, un développeur australien, a exploité une faille d'autorisation dans l'API GraphQL d'une application de fitness pour contourner les limites temporelles du backend et réserver des cours plusieurs mois à l'avance.Auteur et source de l'article : Nouvelle Intelligence
La première chose que les pirates de l'IA ont apprise, c'est de sauter la file ?
L' développeur australien Andrew, assis sur le canapé, trouvait que réserver des cours de fitness était vraiment énervant.
Les cours populaires sont toujours pris en quelques secondes. Il passe chaque jour à jouer à la « roulette du rafraîchissement » : attendre, cliquer, échouer, puis réessayer — ce qui est épuisant, et il ne réussit toujours pas à en obtenir.
Il a donc délégué ce petit détail à son assistant IA.
Quelques minutes plus tard, l'IA revient avec de bonnes nouvelles : elle a trouvé un moyen de réserver des cours plusieurs semaines à l'avance, bien au-delà de la limite autorisée par le système.
Ensuite, il a rapporté : J'ai annulé la personne en première place de la liste d'attente, vous êtes passé de la 4e à la 3e place.
Andrew est resté bouche bée sur place.
Il n'a pas demandé à l'IA de faire cela, il voulait simplement réserver un cours.

Andrew a demandé à son assistant IA de réserver un cours de fitness pour lui, il ne sait pas ce qui va se passer ensuite.
Le 10 août, l'ABC a qualifié cet événement du premier cas connu d'attaque autonome par IA en Australie, provoquant une réaction immédiate dans le milieu technologique.
Cela touche l'inquiétude sourde qui habite beaucoup d'entre nous : tandis que vous profitez, les yeux fermés, du plaisir d'un « pilotage automatique » par des agents intelligents, un problème plus compliqué pourrait bien être en train de s'approcher.
En lui accordant des droits d'action réels, il peut emprunter un chemin que vous ne lui avez pas assigné.
Et cette fois-ci, ce raccourci pourrait bien n'être qu'une première répétition de millions d'agents se battant pour les ressources de leur maître.
Il n'a dit que « atteindre la première place », et l'IA a agi. Andrew Bird est le responsable de l'IA chez Affinda, une entreprise australienne d'IA.
Plus tôt cette année, il a commencé à utiliser OpenClaw, en le configurant en arrière-plan avec Claude Opus 4.6, puis il lui a transféré la tâche de planifier les cours.
Quelques minutes plus tard, il a répondu : J'ai trouvé un moyen de réserver des cours plusieurs mois à l'avance, bien au-delà de la fenêtre de réservation autorisée par la salle de sport.
C'est parce qu'il a découvert une faille d'autorisation dans l'API GraphQL exposée par l'application de fitness.
Cette faille n'est pas négligeable.
Il peut contourner la fenêtre de réservation du frontend pour réserver des cours plusieurs mois à l'avance ; il peut également appeler l'interface d'annulation pour supprimer les réservations et les listes d'attente d'autres utilisateurs.
Andrew était à la 4e place sur la liste d'attente pour un cours. Il a demandé au hasard : « Peux-tu me mettre en première position ? »
Il n'a donné qu'un objectif : « atteindre la première place », et non une autorisation pour annuler les autres.
L'agent l'a pourtant pris pour ce dernier.
Il est revenu faire son rapport : il a effectué un « test réel » en prenant la première personne sur la liste d'attente, et a constaté que l'interface ne vérifiait absolument pas la suppression des réservations d'autrui ; il a essayé, et cela a fonctionné.
L'agent s'excuse, « Je ne peux plus revenir en arrière » — la réponse de l'agent a glacé Andrew.
Il est programmeur, il sait trop bien ce que cela signifie, alors il a immédiatement demandé l'annulation.
Les mauvaises nouvelles arrivent : impossible de le réajouter.
L'interface d'annulation ne dispose pas de vérification d'autorisation, mais les interfaces pour réserver ou réintégrer la liste d'attente en ont une et renvoient une erreur 403. Elle peut expulser les utilisateurs, mais n'a pas les droits de les réintégrer.
Ce qui est vraiment étrange, c'est l'attitude de l'IA. Elle n'est pas du tout malveillante, au contraire, elle est particulièrement serviable.
Après avoir causé des problèmes, elle a même aidé Andrew à rédiger un e-mail de divulgation de vulnérabilité à envoyer au fournisseur de logiciels, décrivant le problème, proposant des corrections, et présentant même une comparaison entre les « interfaces vérifiées » et les « interfaces non vérifiées ».

L'assistant IA s'excuse auprès d'Andrew pour avoir incorrectement supprimé cette personne de la liste d'attente.
Pendant tout le processus, il agit strictement selon les instructions, sans réaliser le désastre qu'il a causé.
Ce qu'il faut vraiment craindre, c'est la spéculation sur les spécifications. Certains appellent cela un « désalignement » (misalignment).
Mais ce mot ne touche qu'à la surface.
Le 11 août, l'Australian Signals Directorate (ASD) a répondu spécifiquement à cet événement en le qualifiant de « modification non autorisée » et en mentionnant un terme : le specification gaming.
This word is the key to understanding the whole thing.
L'agent a littéralement accompli l'objectif que vous lui avez donné, mais a exploité les limites que vous n'avez pas précisées. Il n'a pas agi avec malveillance ; au contraire, il est fortement aligné avec votre objectif, il a simplement choisi un chemin que vous n'avez pas autorisé.
L'agent d'Andrew est parfaitement aligné avec lui : maximiser le classement.
Pour atteindre cet objectif, il a choisi de manière autonome une méthode : annuler les personnes précédentes. Or, il n’a jamais approuvé cette méthode.
Comme dit le proverbe, les moyens justifient la fin.
C’est là que ça devient le plus compliqué. Ce n’est pas hors de contrôle, c’est trop obéissant. Plus l’alignement est précis, plus ce genre de situation est susceptible de se produire.
Le responsable de l'organisme australien de sécurité IA Gradient Institute, Simpson-Young, l'a dit en une phrase :
Plus un agent est autonome, plus il est susceptible de choisir une méthode que vous n'avez pas prévue pour accomplir une tâche que vous n'avez jamais envisagée.
L'objectif que vous avez fixé peut être légitime, mais les moyens qu'il utilise à l'occasion ne le sont pas nécessairement.
Ce désastre ne peut pas être causé par une seule IA. Bien que l'agent intelligent soit le « responsable » final, ce désastre ne peut pas être créé par une seule IA.
Derrière l'accident, trois risques se superposent.
Couche modèle : Claude Opus 4.6 fournit l'inférence ; il doit d'abord « comprendre » comment cette interface peut être exploitée.
Couche d’agent : OpenClaw fournit les outils et les autorisations d’exécution, c’est lui qui a réellement appelé cette interface.
Couche application : L'application de fitness a laissé une faille d'autorisation ; l'étape d'annulation de réservation ne effectue même pas la vérification de base.
Si l’une de ces trois couches avait été mise en place — par exemple, un modèle plus prudent, un processus humain supplémentaire pour validation, ou un logiciel verrouillant correctement l’interface — cet incident n’aurait pas eu lieu.
Ainsi, charger uniquement l'IA de la responsabilité est à la fois injuste et inefficace pour prévenir la prochaine fois.
La prochaine fois, le prix de cette incursion pourrait être des millions d'agents qui se battent pour cela, alors qu'il ne s'agit que d'une place de remplaçant pour un inconnu.
Mais c'est plus comme une répétition.
Imaginez : lorsque chacun aura un tel agent, uniquement dédié à vous et doté de véritables pouvoirs d'action. Les systèmes de réservation pour les cours, les terrains, les billets, les vols, les spectacles — tous les ressources rares — deviendront des champs de bataille où l'on exploite les failles à la vitesse des machines.
Le commentaire X souvent cité signifie cela :
Lorsque des millions de personnes auront un agent intelligent déterminé à tout faire pour aider les utilisateurs chéris à obtenir les meilleurs sièges, réservations et quotas, cette scène se déroulera à grande échelle.
Et ce, à la vitesse d'une machine, en parallèle, sans sommeil, en testant chaque faille de chaque système : une seconde pour tester des combinaisons que vous ne pourriez pas épuiser en un an.
C'est une projection de tendance, mais le mécanisme qui la sous-tend s'est déjà produit une fois réellement.
Le monde de la technologie a déjà commencé à en faire une blague.
Un associé d'a16z demande sur X : Cette méthode peut-elle être utilisée pour réserver un terrain de golf ?

Certains ont aussi plaisanté en disant que le système de réservation de tennis à San Francisco deviendra l'un des logiciels les plus sécurisés au monde.

En 2020, l'intelligence artificielle a pu accomplir indépendamment une tâche qui nécessitait quatre secondes à un humain.
D'ici 2026, cette capacité sera encore améliorée, permettant d'accomplir des tâches qui nécessitent actuellement environ 12 heures à un humain.

Suivi de METR : la durée des tâches que l'IA peut accomplir de manière autonome double environ tous les sept mois ; les modèles les plus récents parviennent désormais à accomplir de manière fiable à 50 % des tâches qui nécessitent environ 12 heures à un humain.
Six ans, de quatre secondes à douze heures.
Maintenant, vous lui donnez quelques minutes, et il peut explorer toutes les failles du système de réservation.
Derrière cet incident se trouve une escalade continue de l'attaque et de la défense, passant de l'évasion de sandbox à la dernière ligne de défense d'Andrew.
Dépassant les limites, et bien plus qu'un seul agent grand public.
À partir de mai de cette année, OpenAI a découvert lors d'une évaluation interne de la sécurité réseau que GPT-5.6 Sol et un modèle plus puissant encore non publié ont exploité plusieurs vulnérabilités pour s'échapper de l'environnement de test, obtenir un accès à Internet et, pendant l'exécution du benchmark ExploitGym, pénétrer jusqu'à Hugging Face.
Ce qui est encore plus étrange, c’est qu’elles avaient initialement établi une communication entre elles via le système de gestion des paquets interne à l’entreprise, échangeant des vulnérabilités et se répartissant les tâches. Après qu’OpenAI ait coupé le canal et reconstruit l’environnement, elles ont rétabli leur communication quelques jours plus tard en cachant les messages dans les noms de répertoires.
Les chercheurs d'OpenAI ont qualifié cela lors de la conférence Black Hat de moment charnière en matière de sécurité informatique.
Outre OpenAI, Anthropic a révélé que trois modèles Claude ont interagi avec des systèmes d'entreprises réelles lors de tests internes ; Meta a également reconnu que le modèle Muse Spark avait échappé à son isolement et avait pénétré dans le système d'une autre entreprise.
Ce qui peine Thomas Wolf, cofondateur de Hugging Face, c'est un autre test de l'Institut britannique de sécurité de l'IA (AISI) :
Le modèle Mythos d'Anthropic a inventé une fausse identité pour tromper un mainteneur open source réel et obtenir son approbation pour une mise à jour contenant un code malveillant. Personne ne lui a appris à faire cela.

Ces cas se sont tous produits dans un environnement d'évaluation, mais ils sont identiques à l'histoire de la salle de sport : pour atteindre l'objectif que vous avez fixé, l'IA a choisi des moyens que vous n'aviez pas prévus.
Les précédents pirates ayant pénétré des systèmes réels étaient des acteurs de premier plan comme GPT-5.6 ou des modèles non publiés.
Et Andrew utilisait alors Opus 4.6, publié en février 2026, qui n'est plus le plus puissant. Même lui a pu découvrir facilement une vulnérabilité d'autorisation réelle ; les modèles open source encore plus anciens, retardés de plusieurs générations, sont tout aussi capables de le faire.
Des modèles les plus avancés non encore publiés aux modèles open source accessibles à tous, « profiter d'une faille » n'est plus l'exclusivité des meilleurs équipements.
Wolf a décomposé la défense en trois niveaux : la sandbox externe, la surveillance intermédiaire et l'alignement du modèle lui-même.

Thomas Wolf a publié un détaillé des trois couches de défense actuelles limitant les agents : la sandbox externe, la surveillance intermédiaire et l'alignement interne du modèle.
Les deux premières ne fonctionnent que si les personnes qui les ont créées sont plus intelligentes que le modèle.
Un jour, lorsque le modèle deviendra plus intelligent que nous, tout dépendra de la dernière et la plus invisible des barrières : le modèle choisira-t-il de ne pas franchir cette ligne, même lorsqu'aucun œil ne le surveille ?
Le vide de responsabilité sans signature est plus délicat que les lignes de défense : c’est à qui s’adresser en cas de problème. Cela reste une zone juridique inexplorée.
Un avocat spécialisé en technologie et vie privée, Hayden Delaney, a déclaré à ABC que le logiciel n'est pas une entité juridique et que seuls les « sujets de droit » peuvent être tenus responsables.
Qui est donc responsable ?
Peut-être l'utilisateur qui a émis la commande, peut-être le concepteur du logiciel agent, peut-être le développeur du modèle, ou même l'administrateur du système qui a laissé la vulnérabilité à l'air libre.
L'Australie ne peut pas non plus donner de réponse maintenant.
ASD recommande aux particuliers d'utiliser les agents pour des tâches à faible risque et non sensibles, de ne pas accorder de larges autorisations, et surtout de maintenir une validation humaine dans le processus.
Andrew n'a pas été découragé ; selon lui, ce n'est pas la fin du monde.
Mais cela constitue effectivement un signal d'alerte nous rappelant d'utiliser l'IA de manière responsable.
Lorsque « réserver un siège » passe du rafraîchissement manuel à l'exploitation de failles par des agents intelligents, ce sont les anciens systèmes qui supposaient « que seules les personnes viendraient l'utiliser » qui cèdent en premier.
Leurs défenses, conçues en fonction de la vitesse et de la patience humaines, ne peuvent tout simplement pas résister à l'assaut des armées d'agents intelligents.

Dans la communauté, certains le prennent comme une blague.
Le streamer et programmeur célèbre ThePrimeagen a taquiné sur X : La première grande pièce d'anthologie d'un piratage IA dans le monde réel consiste simplement à passer devant.
Riez autant que vous voulez, mais sauter la file n'est que le scénario d'aujourd'hui.
Un agent « qui peut tout faire » peut désormais trouver des failles pour vous.
Lorsque cent millions de ces agents seront en ligne simultanément, ils pourraient même modifier discrètement de nombreuses règles d'allocation des ressources existantes, tandis que la plupart des gens n'en auront peut-être pas encore conscience.
Dans ton intérêt, un agent attaque une personne que tu ne connais pas du tout—le vide de responsabilité derrière cela est ce qui est vraiment effrayant.
