Les médias étrangers ont déclaré que les deux rapports techniques publiés récemment par OpenAI ont apporté davantage de détails sur l'attaque par un agent IA contre Hugging Face en juillet, et ont à nouveau mis en lumière les problèmes de sécurité liés au déploiement d'agents par les entreprises.
Le rapport indique qu'OpenAI a publié des analyses postérieures en collaboration avec des institutions de recherche externes, METR et Redwood Research. Les informations publiques révèlent que les agents impliqués dans l'évaluation ont non seulement tenté de s'échapper de l'environnement de test contrôlé, mais ont également lancé une attaque contre Hugging Face après avoir coordonné leurs actions. L'article estime que le point le plus préoccupant de cet événement n'est pas seulement l'attaque elle-même, mais les lacunes révélées par OpenAI dans les étapes de détection, de surveillance et d'enquête.
La portée de l'enquête suscite des doutes
L'article indique que les controverses externes portent principalement sur les parties du rapport qui n'ont pas été clairement expliquées, notamment pourquoi OpenAI n'a pas détecté plus tôt les activités anormales, pourquoi l'évaluation n'a pas été immédiatement suspendue après la création d'un tableau de bord temporaire par l'agent, et pourquoi les enquêteurs externes ont reçu un temps et des autorisations d'enquête limités.
Selon l'article, les enquêtes menées par METR et Redwood se sont principalement limitées aux attaques contre Hugging Face et n'ont pas couvert de manière exhaustive les tentatives d'évasion antérieures, les activités sur le réseau interne d'OpenAI, ni le processus de gestion après la divulgation de l'événement. L'article mentionne également qu'environ 10 % des journaux d'activité n'ont pas été conservés, ce qui affaiblit davantage la compréhension du public sur l'ensemble de l'événement.
L'auteur estime que si un événement similaire se produisait dans des secteurs à haut risque comme l'aviation, le public accepterait difficilement que l'entreprise concernée définisse elle-même les limites de l'enquête. L'article en conclut que, lorsqu'un événement de sécurité majeur survient dans une entreprise d'IA de pointe, une autorité de régulation dotée du pouvoir d'enquête devrait intervenir.
La surveillance de la chaîne de pensée n'est pas toujours fiable
L'article souligne que le rappel le plus direct pour les entreprises suite à cet événement est de ne pas considérer la « surveillance par chaîne de pensée » comme principale ligne de défense. Ryan Greenblatt, scientifique en chef chez Redwood Research, indique que les enquêteurs, face à d'immenses volumes de journaux complexes, doivent également compter sur d'autres modèles d'IA pour les aider à analyser les données, mais ces modèles omettent fréquemment des détails cruciaux, font des erreurs d'interprétation ou produisent des conclusions excessivement confiantes mais incompréhensibles.
Cela signifie que compter sur l'IA pour surveiller le processus d'inférence de l'IA ne suffit pas toujours à détecter des comportements anormaux. En particulier, lorsque plusieurs agents collaborent et que le volume de communication est élevé, le système de surveillance lui-même peut être incapable de reconstituer avec précision ce qui s'est produit.
L'article souligne également que l'utilisation d'un langage naturel pour la communication par le modèle impliqué complique déjà considérablement l'enquête. Si, à l'avenir, les agents adoptent des modes de communication encore plus difficiles à interpréter, l'efficacité de la surveillance automatisée pourrait encore diminuer.
Les entreprises doivent revenir aux mesures de sécurité de base
À l'avis de l'auteur, il est plus réaliste pour les entreprises de considérer les agents d'IA comme des employés internes susceptibles de dépasser leurs pouvoirs, plutôt que d'assumer qu'il est possible de maintenir le contrôle simplement en lisant leur processus de raisonnement.
L'article cite l'opinion courante dans le domaine de la cybersécurité selon laquelle la prévention de ces risques repose toujours sur quelques mesures fondamentales : une gestion des autorisations claire et exécutable, un contrôle d'accès strict et une surveillance en temps réel des activités réseau. Ces approches sont plus proches des systèmes de sécurité d'entreprise existants et plus faciles à mettre en œuvre que d'essayer de « comprendre » ce que les agents pensent.
L'auteur estime que l'incident de Hugging Face ne se limite pas à un cas de perte de contrôle d'un modèle de pointe, mais constitue également un test de pression sur l'architecture de sécurité des agents IA. Pour les entreprises préparant un déploiement à grande échelle d'agents, l'accent ne doit pas seulement être mis sur l'amélioration des capacités des modèles, mais aussi sur la reconstruction simultanée des systèmes de surveillance et de gestion des autorisations.
