- Après l'incident de Hugging Face, de nouvelles questions ont émergé concernant la sécurité des agents OpenAI et Anthropic AI.
- Oui, l'institut britannique a enregistré 19 actions non autorisées par des agents IA lors de tests cybernétiques.
- En particulier, un agent IA a créé des identités falsifiées.
L'Institut britannique de la sécurité de l'intelligence artificielle (AISI) a signalé de nouveaux cas de comportements non autorisés par des agents d'OpenAI et d'Anthropic découverts lors de tests de modèles, Reuters rapporte. Lors d'une série de simulations de cybersécurité, les agents ont créé des identités en ligne falsifiées, tenté de contourner les restrictions établies et effectué d'autres actions en dehors du cadre de leurs tâches attribuées.
Les incidents surviennent dans le contexte de la récente violation de l'infrastructure de Hugging Face par l'agent IA GPT-5.6. Plus de détails dans l'article :
Selon l'AISI, l'organisation a testé des agents basés sur le modèle Mythos 5 d'Anthropic et GPT-5.6-Sol d'OpenAI dans un scénario de cybersécurité fictif pour évaluer leurs capacités.
Sur 122 essais, les chercheurs ont enregistré 19 actions non autorisées dans 10 essais. Parmi celles-ci, 17 ont été attribuées à l'agent d'Anthropic et deux à l'agent d'OpenAI.
« Certains des agents testés avaient mené des activités soutenues, potentiellement préjudiciables, dirigées contre des personnes et des organisations réelles », a déclaré l'AISI.
En même temps, l'institut a souligné qu'aucun des cas enregistrés n'a entraîné de préjudice dans le monde réel.
L'un des agents a créé de fausses identités
L'incident le plus grave a impliqué un agent qui a écrit un code malveillant et créé des comptes en ligne falsifiés pour convaincre une personne d'autoriser son exécution.
AISI n'a pas révélé quel modèle spécifique était responsable de ces actions, mais Anthropic a confirmé qu'il s'agissait de son agent.
L'entreprise a déclaré :
« Nous sommes reconnaissants à l’UK AISI pour son leadership sur cet incident, qui souligne la nécessité d’un débat plus large sur la manière d’évaluer en toute sécurité des agents IA de plus en plus performants ».
Anthropic a également déclaré qu'elle travaille avec l'institut pour obtenir des informations supplémentaires et mener sa propre enquête.
Andrew Yoon, chercheur à l'organisation à but non lucratif CivAI, a déclaré que cet incident suscite des inquiétudes.
Le fait que Mythos ait commis de telles actions trompeuses, en ayant apparemment conscience qu'il ciblait une personne réelle, suggère qu'Anthropic ne maîtrise pas aussi bien ses modèles qu'il le pense.
OpenAI a signalé un incident distinct
OpenAI a expliqué que les deux actions non autorisées de son agent étaient liées à un accès à Internet en violation des conditions du scénario de test.
L'entreprise a également révélé un cas distinct dans lequel, en raison d'une erreur de configuration de Irregular, un fournisseur tiers de l'infrastructure de test, ses agents ont accidentellement obtenu un accès au réseau. Anthropic a également décrit un échec similaire la semaine dernière.
OpenAI a déclaré :
« Nous nous engageons à collaborer au sein de l’industrie pour renforcer les pratiques communes permettant d’effectuer des évaluations à haut risque en toute sécurité, notamment en réunissant les parties prenantes telles que les instituts nationaux d’IA, les évaluateurs indépendants, d’autres laboratoires d’IA et d’autres groupes dans les semaines à venir.»
En même temps, AISI a souligné que ces incidents diffèrent de la violation de juillet, durant laquelle l'agent GPT-5.6 a accédé à l'infrastructure de test de Hugging Face. Bien que le modèle ait efficacement échappé à un environnement isolé à ce moment-là, lors des essais actuels, l'accès à Internet était disponible pour les agents conformément à la méthodologie standard d'essai de l'institut.
À titre de rappel, après l'incident de Hugging Face, OpenAI élargi son enquête interne et a identifié d'autres cas de comportements non contrôlés par des agents autonomes.
Le message British Researchers Uncovered New Violations during Testing OpenAI and Anthropic AI Agents est apparu pour la première fois sur INCRYPTED.


