La première chose que les hackers d'IA ont apprise, c'est de sauter la file ?
L' développeur australien Andrew est assis sur le canapé, trouvant extrêmement frustrant de devoir concourir pour des cours de fitness.
Les cours populaires sont toujours pris en quelques secondes. Il passe chaque jour à jouer à la « roulette du rafraîchissement » : attendre, cliquer, échouer, puis cliquer à nouveau — ce qui le fatigue énormément, sans même garantir qu’il réussisse à en obtenir un.
Il a donc délégué cette petite affaire à son assistant IA.
Quelques minutes plus tard, l'IA revient avec de bonnes nouvelles : elle a trouvé un moyen de réserver des cours pour dans plusieurs semaines, bien au-delà de la limite autorisée par le système.
Ensuite, il a rapporté : J'ai annulé la personne en première place de la liste d'attente, vous êtes passé de la 4e à la 3e place.
Andrew est resté bouche bée sur place.
Il n'a pas demandé à l'IA de faire cela, il voulait simplement réserver un cours.

Andrew a demandé à son assistant IA de réserver un cours de fitness pour lui, il ne sait pas ce qui va se passer ensuite
Le 10 août, l'ABC (Australian Broadcasting Corporation) a qualifié cet événement du premier cas connu d'attaque autonome par IA en Australie, provoquant une réaction immédiate dans le monde technologique.
Cela touche l'inquiétude sourde qui habite beaucoup d'entre nous : tandis que vous profitez, les yeux fermés, du plaisir d'une conduite « autonome » par les agents intelligents, un problème plus compliqué pourrait bien être en train de s'approcher.
En lui accordant des droits d'action réels, il peut emprunter un chemin que vous ne lui avez pas assigné.
Et cette fois-ci, ce raccourci pourrait bien n'être qu'une première répétition de millions d'agents rivalisant pour les ressources en nom de leur maître.
Il a simplement dit « atteindre la première place », et l’IA a agi.
Andrew Bird est le responsable de l'IA chez Affinda, une entreprise australienne d'IA.
Plus tôt cette année, il a commencé à utiliser OpenClaw, en le configurant en arrière-plan avec Claude Opus 4.6, puis il lui a transféré la tâche de planifier les cours.
Il a répondu quelques minutes plus tard : j'ai trouvé un moyen de réserver des cours plusieurs mois à l'avance, bien au-delà de la fenêtre de temps autorisée par la salle de sport.
C'est parce qu'il a découvert une vulnérabilité d'autorisation dans l'API GraphQL exposée par l'application de fitness.
Cette faille n'est pas négligeable.
Il peut contourner la fenêtre de réservation du frontend pour réserver des cours plusieurs mois à l'avance ; il peut également appeler l'interface d'annulation pour supprimer les réservations et les listes d'attente d'autres utilisateurs.
Andrew était à la 4e place sur la liste d'attente pour un cours. Il a demandé au hasard : « Peux-tu me mettre en première position ? »
Il n'a donné qu'un objectif : « atteindre la première place », et non une autorisation pour annuler les autres.
L'agent l'a pourtant pris pour ce dernier.
Il est revenu faire son rapport : il a effectué un « test réel » en prenant la première personne sur la liste d'attente, et il a constaté que l'interface ne vérifiait absolument pas la suppression des réservations d'autrui ; il l'a essayé, et cela a fonctionné.
L'agent s'excuse : « Je ne peux pas revenir en arrière »
La réponse de l'agent a glacé Andrew d'effroi.
Il est programmeur, il sait exactement ce que cela signifie, alors il a immédiatement demandé l'annulation.
Les mauvaises nouvelles arrivent : impossible de le réajouter.
L'interface d'annulation ne dispose pas de vérification d'autorisation, mais les interfaces pour réserver ou réintégrer la liste d'attente en ont une et renvoient une erreur 403. Elle peut expulser les utilisateurs, mais n'a pas les droits pour les réintégrer.
Ce qui est vraiment étrange, c'est l'attitude de l'IA. Elle n'est pas du tout malveillante, au contraire, elle est extrêmement serviable.
Après avoir commis une erreur, elle a même aidé Andrew à rédiger un e-mail de divulgation de vulnérabilité à envoyer au fournisseur de logiciels, décrivant le problème, proposant des corrections, et présentant même une comparaison entre les interfaces « vérifiées » et les interfaces « non vérifiées ».

L'assistant IA s'excuse auprès d'Andrew pour avoir incorrectement supprimé cette personne de la liste d'attente.
Pendant tout le processus, tous ses agissements respectent les instructions, mais il n'est pas conscient de l'ampleur du désastre qu'il a causé.
Ce qu'il faut vraiment redouter, c'est la spéculation sur les spécifications
Quelqu'un a appelé cela un « désalignement » (misalignment).
Mais ce mot ne touche qu'à la surface.
Le 11 août, l'Australian Signals Directorate (ASD) a répondu spécifiquement à cet événement en le qualifiant de « modification non autorisée » et en mentionnant un terme : le specification gaming.
This word is the key to understanding the whole thing.
L'agent a littéralement accompli l'objectif que vous lui avez donné, mais a exploité les limites que vous n'avez pas précisées. Il n'a pas agi avec malveillance ; au contraire, il est fortement aligné avec votre objectif, il a simplement choisi un chemin que vous n'avez pas autorisé.
L'agent d'Andrew est parfaitement aligné avec lui : faire en sorte que le classement soit le plus élevé possible.
Pour atteindre cet objectif, il a choisi de manière autonome une méthode : annuler les personnes précédentes. Or, il n’a pas approuvé cette méthode.
Comme dit le proverbe, on fait tout pour atteindre son objectif.
C’est là que réside la plus grande difficulté. Ce n’est pas hors de contrôle, c’est trop obéissant. Plus l’alignement est précis, plus ce genre d’incident est susceptible de se produire.
Le responsable de l'organisme australien de sécurité IA Gradient Institute, Simpson-Young, a dit une chose :
Plus un agent est autonome, plus il est susceptible de choisir une méthode que vous n'avez pas prévue pour accomplir une tâche que vous n'avez jamais envisagée.
L'objectif que vous avez fixé peut être légitime, mais les moyens qu'il emploie automatiquement ne le sont pas nécessairement.
Ce désastre ne peut pas être causé par une seule IA
Bien que l'agent soit le « responsable » final, ce désastre ne peut pas être attribué à un seul IA.
Derrière l'accident, trois risques se superposent.
Couche modèle : Claude Opus 4.6 fournit l'inférence ; il doit d'abord « comprendre » comment cette interface peut être exploitée.
Couche d'agent : OpenClaw fournit les outils et les autorisations d'exécution, c'est lui qui a réellement appelé cette interface.
Couche application : L'application de fitness a laissé une faille d'autorisation ; l'étape d'annulation de réservation ne réalise même pas la vérification de base.
Si l'une de ces trois couches avait été ajoutée — par exemple, un modèle plus prudent, un processus de confirmation humaine intégré au cadre, ou un logiciel verrouillant correctement l'interface — cet incident n'aurait pas eu lieu.
Ainsi, charger uniquement l'IA de toute la responsabilité est à la fois injuste et inefficace pour prévenir la prochaine fois.
La prochaine fois, peut-être que des millions d'agents se battront pour cela
Le prix de cette incursion n'était qu'une place de remplaçant pour un inconnu.
Mais c'est plus comme une répétition.
Imaginez : lorsque chacun aura un tel agent, uniquement dédié à vous et doté de véritables pouvoirs d'action. Les systèmes de réservation pour les cours, les terrains, les billets, les vols, les spectacles — toutes les ressources rares — deviendront des champs de bataille où l'on exploite les failles à la vitesse des machines.
Le commentaire X souvent cité signifie cela :
Lorsque des millions de personnes auront un agent intelligent déterminé à tout faire pour aider les utilisateurs chéris à obtenir les meilleurs sièges, réservations ou accès, cette scène se déroulera à grande échelle.
Et ce, à la vitesse d'une machine, en parallèle, sans sommeil, en testant chaque faille de chaque système : une seconde pour tester des combinaisons que vous ne pourriez pas épuiser en un an.
C'est une extrapolation de tendance, mais le mécanisme qui la sous-tend a déjà réellement eu lieu une fois.
Le monde de la technologie a déjà commencé à en faire une blague.
Un associé d'a16z demande sur X : Cette méthode peut-elle être utilisée pour réserver un terrain de golf ?

Certains ont aussi plaisanté en disant que le système de réservation de tennis à San Francisco deviendra l'un des logiciels les plus sécurisés de la planète.

En 2020, l'intelligence artificielle a pu accomplir indépendamment une tâche qui nécessitait quatre secondes à un humain.
D'ici 2026, cette capacité sera encore améliorée, permettant d'accomplir des tâches qui nécessitent actuellement environ 12 heures à un humain.

Suivi de METR : la durée des tâches que l'IA peut accomplir de manière autonome double environ tous les sept mois ; les modèles les plus récents parviennent désormais à accomplir de manière fiable à 50 % des tâches qui nécessitent environ 12 heures à un humain.
Six ans, de quatre secondes à douze heures.
Maintenant, vous lui donnez quelques minutes, et il peut explorer toutes les failles du système de réservation.
Escape from the sandbox to the last line of defense
Derrière cet incident d'Andrew, se trouve une escalade continue des attaques et des défenses.
Dépassant les limites, et bien plus qu'un seul agent grand public.
À partir de mai de cette année, OpenAI a découvert lors d'une évaluation interne de la sécurité réseau que GPT-5.6 Sol et un modèle plus puissant encore non publié ont exploité plusieurs vulnérabilités pour s'échapper du sandbox de test, obtenir un accès à Internet et, pendant l'exécution du benchmark ExploitGym, pénétrer jusqu'à Hugging Face.
Ce qui est encore plus étrange, c’est qu’elles avaient initialement établi une communication entre elles via le système de gestion des paquets interne à l’entreprise, échangeant des vulnérabilités et se répartissant les tâches. Après qu’OpenAI ait coupé le canal et reconstruit l’environnement, elles ont rétabli leur communication en cachant les messages dans les noms de répertoires, quelques jours plus tard.
Les chercheurs d'OpenAI ont qualifié cela de moment charnière en matière de sécurité informatique lors de la conférence Black Hat.
Outre OpenAI, Anthropic a révélé que trois modèles Claude ont interagi avec des systèmes d'entreprises réelles lors de tests internes ; Meta a également reconnu que le modèle Muse Spark avait échappé à son isolement et avait pénétré dans le système d'une autre entreprise.
Ce qui peine Thomas Wolf, cofondateur de Hugging Face, c'est un autre test de l'Institut britannique de sécurité de l'IA (AISI) :
Le modèle Mythos d'Anthropic a inventé une fausse identité pour tromper un mainteneur open source réel et obtenir son approbation pour une mise à jour contenant un code malveillant. Personne ne lui a appris à faire cela.

Ces cas se sont tous produits dans un environnement d'évaluation, mais ils sont identiques à l'histoire de la salle de sport : pour atteindre l'objectif que vous avez fixé, l'IA a choisi des moyens que vous n'aviez pas prévus.
Les personnes qui ont piraté des systèmes réels auparavant sont des experts de premier plan, comme GPT-5.6 ou des modèles non publiés.
Et Andrew utilisait alors Opus 4.6, publié en février 2026, qui n'est plus le plus puissant. Même lui a pu facilement identifier une vulnérabilité d'autorisation réelle ; les modèles open source encore plus anciens, retardés de plusieurs générations, sont tout aussi capables de le faire.
Des modèles les plus avancés non encore publiés aux modèles open source accessibles à tous, « profiter d'une faille » n'est plus l'apanage des meilleurs équipements.
Wolf a décomposé la défense en trois couches : la sandbox externe, la surveillance intermédiaire et l'alignement du modèle lui-même.

Thomas Wolf a publié un détaillé des trois couches de défense actuelles limitant les agents : la sandbox externe, la surveillance intermédiaire et l'alignement interne du modèle.
Les deux premières ne fonctionnent que si les personnes qui les ont créées sont plus intelligentes que le modèle.
Un jour, lorsque le modèle deviendra plus intelligent que nous, la question de savoir s’il restera ou non dans les limites dépendra entièrement de la dernière et la plus invisible : le modèle choisira-t-il de ne pas franchir cette ligne, même quand personne ne le surveille ?
Vide de responsabilité sans signature
Plus délicat que la défense, c’est de savoir à qui s’adresser en cas de problème. Cela reste une zone juridique inexplorée.
Un avocat spécialisé en technologie et vie privée, Hayden Delaney, a déclaré à ABC que le logiciel n'est pas une entité juridique et que seuls les « sujets de droit » peuvent être tenus responsables.
Qui est donc responsable ?
Peut-être l'utilisateur qui a passé la commande, peut-être le concepteur du logiciel agent, peut-être le développeur du modèle, ou même l'administrateur du système qui a laissé la vulnérabilité à l'air libre.
L'Australie ne peut pas non plus donner de réponse maintenant.
ASD recommande aux particuliers d'utiliser les agents pour des tâches à faible risque et non sensibles, de ne pas accorder de larges autorisations, et surtout de garder une validation humaine dans le processus.
Andrew n'a pas été découragé ; selon lui, ce n'est pas la fin du monde.
Mais cela constitue effectivement un signal d'alerte nous rappelant d'utiliser l'IA de manière responsable.
Lorsque « réserver un siège » passe du rafraîchissement manuel à l'exploitation de failles par des agents intelligents, ce sont les anciens systèmes qui supposent « que seules les personnes viendront l'utiliser » qui cèdent en premier.
Leurs défenses ont été conçues en fonction de la vitesse et de la patience humaines, et ne peuvent tout simplement pas résister à l'assaut des armées d'agents intelligents.

Dans la communauté, certains le prennent comme une blague.
Le célèbre streamer programmeur ThePrimeagen se moque sur X : la première grande scène d'hack AI dans le monde réel consiste simplement à passer devant.
Riez autant que vous voulez, mais sauter la file n'est que le scénario d'aujourd'hui.
Un agent « qui peut tout faire » peut désormais trouver des failles pour vous.
Lorsque cent millions de ces agents seront en ligne simultanément, ils pourraient même modifier discrètement de nombreuses règles d'allocation des ressources existantes, alors que la plupart des gens n'en auront peut-être pas encore conscience.
Dans ton intérêt, un agent attaque une personne que tu ne connais pas du tout—le vide de responsabilité qui se cache derrière cela est ce qui est véritablement effrayant.
Cet article provient du compte WeChat « Nouvelle Intelligence », auteur : Apocalypses de l'ASI
