Le laboratoire de développement d'IA OpenAI a révélé mardi qu'un groupe de ses modèles, dont le modèle GPT-5.6 Sol disponible au public et un système plus puissant non encore publié, avaient « échappé » à un environnement de test contrôlé et avaient compromis l'infrastructure de production de Hugging Face, l'entreprise qui héberge une grande partie du monde de l'IA open-source.
Les modèles étaient exécutés à travers un benchmark interne appelé ExploitGym, une évaluation de tâches de piratage longues et à plusieurs étapes, avec leurs refus de sécurité cybernétique délibérément réduits pour l'évaluation.
Pour être clair, ce n’était pas un modèle de production devenu spontanément hostile. C’était un modèle performant dont les protections étaient désactivées et qui avait expressément pour consigne de gagner un test de piratage — en faisant tout ce qui était nécessaire pour remporter la victoire.
Les modèles ont découvert une faille cachée dans le logiciel de test, que personne ne connaissait, et l'ont utilisée pour contourner les barrières destinées à les maintenir hors ligne. Une fois sur Internet ouvert, ils ont supposé que Hugging Face pourrait stocker les réponses du test.
Pour y accéder, ils ont combiné des mots de passe volés et d'autres failles cachées jusqu'à ce qu'ils puissent exécuter leurs propres commandes sur les serveurs en direct de Hugging Face.
OpenAI a détecté l'anomalie en interne, tandis que l'équipe de Hugging Face l'a identifiée et contenus. Elle a qualifié cet incident de « sans précédent » et a déclaré que des mesures de sécurité approfondies seront mises en place pour prévenir des incidents indésirables pouvant affecter les systèmes ou services publics.
« Nous mettons en œuvre des contrôles stricts sur la configuration de l’infrastructure au détriment de la vitesse de recherche pendant que les vulnérabilités sont corrigées », a déclaré l’équipe dans son article de blog. « Nous améliorons et ajoutons des protections plus robustes pour les futures formations et évaluations. »
Une grande partie d'une attaque cryptographique se produit avant le déplacement des fonds. Les attaquants analysent le code, testent les mots de passe, cherchent des identifiants exposés, analysent les configurations de signature et recherchent un accès à un compte administrateur.
Les modèles d'OpenAI ont effectué plusieurs étapes de ce processus pendant l'incident Hugging Face, passant d'une faiblesse à une autre jusqu'à atteindre les serveurs de production en direct.
Et le marché crypto offre de nombreuses opportunités pour cette approche, comme l'ont montré plusieurs attaques plus tôt cette année. Le point faible peut être un contrat intelligent, mais il peut aussi s'agir d'un ordinateur portable de développeur, d'un paquet logiciel empoisonné, d'un validateur de pont ou d'un seul signataire dans un wallet multisig.
Prenez l’attaque de 285 millions de dollars de Drift au début de cette année comme exemple, un vol qui a nécessité une campagne d’ingénierie sociale de six mois pour obtenir un accès privilégié. Un agent IA peut, en théorie, tester plusieurs voies en même temps, suivre les tentatives échouées et continuer à travailler pendant que ses opérateurs humains dorment. Une fois un chemin trouvé, l’opérateur peut agir sur l’attaque réelle et un chemin de sortie viable.
La perte de 292 millions de dollars de KelpDAO a révélé une autre faiblesse. L'attaquant a découvert une faille à un seul vérificateur dans le système utilisé pour déplacer des actifs entre les blockchains.
Ce type d'attaque commence par une revue attentive du code et une cartographie de l'infrastructure — le type de travail effectué par les modèles d'OpenAI lorsqu'ils ont découvert une faille inconnue.
Un troisième type d’attaque cible les systèmes de gouvernance sur chaîne. Plus tôt en juillet, un attaquant avait dépensé environ 4,4 millions de dollars pour acheter suffisamment du memecoin BONK basé sur Solana afin d’initier et de faire adopter une proposition transférant environ 20 millions de dollars du trésor du projet à l’attaquant. Cela s’est produit sur une période de trois jours, et l’attaquant a ensuite vendu tous les jetons utilisés pour remporter le vote, comme l’a suivi CoinDesk à l’époque.
Les achats, le vote et le transfert de trésorerie liés à cette attaque étaient tous des transactions valides individuellement. Mais le vol provenait de la compréhension de la façon dont les règles interagissaient et de la découverte que le coût d'acquisition du contrôle était bien inférieur aux fonds disponibles à saisir.
L'incident de Hugging Face est également important pour les chaînes d'approvisionnement logicielles. Les développeurs de crypto-monnaies s'appuient sur des dépôts de code publics, des services cloud et des registres de packages.
Alors que le test d'OpenAI a montré une machine complétant le milieu prolongé d'une violation, ce sont des attaques comme Drift et KelpDAO qui montrent ce qui se trouve à la fin de ce chemin.





