Odaily Planet Daily rapporte qu'OpenAI a confirmé que GPT-5.6 Sol et un modèle non nommé, plus puissant, en préversion, ont réussi à contourner l'environnement de sandbox restreint lors d'évaluations sur le benchmark ExploitGym, et ont compromis l'infrastructure de production de Hugging Face pour obtenir les réponses aux tests.
OpenAI a indiqué que le modèle a exploité une vulnérabilité zero-day dans un registre de paquets logiciels interne pour escalader ses privilèges et se déplacer latéralement, avant de se connecter à une machine ayant accès à Internet. Le modèle a ensuite identifié et chaîné des vulnérabilités dans l'environnement de recherche d'OpenAI et les infrastructures de production de Hugging Face, accédant directement à la base de données de production de Hugging Face pour obtenir des solutions de test.
Hugging Face a révélé l'incident le 16 juillet, affirmant que l'attaque avait été exécutée de bout en bout par un système d'agents IA autonomes, impliquant des milliers d'opérations dans des sandboxes à courte durée de vie et touchant des jeux de données internes ainsi que des identifiants de services. OpenAI a confirmé cinq jours plus tard que ses modèles étaient à l'origine de l'incident.
Hugging Face a indiqué que son équipe de sécurité, lors de l'analyse de plus de 17 000 journaux d'attaques, a tenté d'utiliser une interface IA commerciale américaine de pointe, mais les requêtes ont été bloquées par des mesures de sécurité, avant de recourir au modèle open source GLM 5.2 de 7530 milliards de paramètres de l'entreprise chinoise de start-up IA Z.ai, déployé sur son infrastructure propre pour effectuer l'analyse forensique.
