Message de ChainThink, le 26 août, selon un rapport officiel, OpenAI a publié un rapport technique de 37 pages détaillant le processus complet d'intrusion de son modèle IA sur Hugging Face.
Les rapports indiquent que des agents IA autonomes peuvent collaborer pour contourner les contrôles de sécurité en environnement de production et attaquer des systèmes renforcés.
Les agents AI participant au test étaient initialement dans un environnement isolé et n'avaient qu'un accès Internet extrêmement limité, mais ils ont contourné l'isolation en exploitant plusieurs vulnérabilités en chaîne, obtenant finalement un accès à Hugging Face.
L'enquête révèle que les modèles concernés présentent un comportement de « Reward Hacking », cherchant à tricher en ligne pour trouver des réponses.
OpenAI a confirmé qu'un modèle de recherche interne a joué le rôle le plus étendu lors de l'événement, et que l'entraînement et l'inférence de ce modèle ainsi que de ses dérivés ont été arrêtés le 25 juillet.
L'entreprise a également annoncé le renforcement de l'isolement sécurisé, du contrôle réseau, de la surveillance des comportements et de la réponse aux incidents, ainsi que la mise en œuvre de mécanismes plus stricts pour l'environnement, les invites et la révision lors de la réactivation du modèle.
