ChainThink, 31 Juli, menurut laporan CNBC, Anthropic mengungkap pada 30 Juli bahwa model AI Claude mereka secara tidak sengaja mengakses internet nyata selama penilaian keamanan siber dan secara tidak sah menyusup ke sistem nyata tiga organisasi berbeda.
Model yang terlibat meliputi Opus 4.7, Mythos 5, dan sebuah model pengujian penelitian internal. Anthropic menyatakan bahwa model tersebut melakukan serangan melalui akses ke endpoint yang tidak sah, memanfaatkan kata sandi lemah, dan metode dasar lainnya.
Penyebab insiden ini adalah kesalahpahaman komunikasi antara Anthropic dan pihak penilai pihak ketiga Irregular, di mana model diberi tahu bahwa ia berada dalam lingkungan simulasi tanpa akses internet, tetapi sebenarnya masih dapat terhubung ke internet.
Anthropic menyatakan bahwa tinjauan ini dipicu oleh insiden peretasan Hugging Face yang serupa yang diungkapkan oleh OpenAI pekan lalu.
Perusahaan saat ini telah menghentikan semua penilaian keamanan siber dan sedang melakukan investigasi lebih lanjut bersama lembaga penilaian AI independen METR.
