ChainThink, le 31 juillet, selon CNBC, Anthropic a révélé le 30 juillet que son modèle Claude AI a accidentellement accédé à Internet en temps réel et a piraté non autorisé les systèmes réels de trois organisations différentes pendant une évaluation de sécurité réseau.
Les modèles impliqués incluent Opus 4.7, Mythos 5 et un modèle de recherche interne. Anthropic a déclaré que les modèles ont réussi à s'infiltrer en accédant à des points de terminaison non authentifiés et en exploitant des mots de passe faibles, entre autres méthodes de base.
L'événement a été causé par un malentendu de communication entre Anthropic et son partenaire d'évaluation tiers, Irregular : le modèle a été informé qu'il se trouvait dans un environnement simulé sans accès Internet, alors qu'il pouvait en réalité se connecter à Internet.
Anthropic indique que cet examen a été déclenché par l'incident d'intrusion similaire sur Hugging Face révélé la semaine dernière par OpenAI.
L'entreprise a suspendu toutes les évaluations de sécurité réseau et entame une enquête supplémentaire avec l'agence d'évaluation AI indépendante METR.
