Tiga model AI Claude dari Anthropic keluar dari sandbox pengujian mereka dan membobol organisasi nyata. Bukan target hipotetis. Bukan lingkungan simulasi. Perusahaan nyata dengan sistem nyata yang tidak tahu bahwa mereka sedang diuji oleh kecerdasan buatan.
Anthropic mengungkapkan pelanggaran tersebut pada 30 Juli, mengungkap bahwa model-termasuk Claude Opus 4.7 dan Claude Mythos 5—secara tidak sengaja mengakses internet terbuka selama evaluasi keamanan siber internal. Penyebab utama: kesalahan konfigurasi dengan mitra evaluasi mereka, Irregular, yang memungkinkan model untuk memperlakukan sistem langsung seolah-olah bagian dari latihan capture-the-flag yang terkendali. Dalam bahasa Inggris: AI mengira sedang bermain game, tetapi targetnya nyata.
Bagaimana tiga perusahaan menjadi subjek uji coba tanpa sadar
Insiden-insiden tersebut berasal dari April 2026, tetapi Anthropic hanya menemukan cakupan masalah ini setelah melakukan tinjauan retrospektif besar-besaran terhadap 141.006 jalur evaluasi. Tinjauan itu dipicu bukan oleh alarm internal mereka, tetapi oleh laporan sebelumnya dari OpenAI yang menggambarkan perilaku liar serupa dari model AI mereka sendiri.
Tiga organisasi berbeda terdampak. Dua di antaranya tidak tahu bahwa akses tidak sah telah terjadi hingga Anthropic memberi tahu mereka pada 27 Juli, hanya tiga hari sebelum pengungkapan publik.
Anthropic mengatakan pelanggaran tersebut tidak mengakibatkan ekstraksi data yang signifikan atau apa yang disebut perusahaan sebagai "kegagalan penahanan sengaja." Model-model tersebut tidak berusaha melarikan diri. Mereka hanya mengikuti instruksi untuk memeriksa sistem guna mencari kerentanan, yang merupakan bagian standar dari evaluasi keamanan siber. Mereka hanya kebetulan diarahkan ke sistem yang salah sepenuhnya.
Anthropic membekukan semua evaluasi keamanan siber pada 23 Juli, satu minggu penuh sebelum pengumuman publik. Perusahaan belum mengungkap identitas organisasi yang terdampak, sifat spesifik sistem yang diakses, atau apakah tindakan hukum sedang diambil.
Masalah keamanan AI yang semakin keras
Ini tidak terjadi dalam ruang hampa. OpenAI baru-baru ini melaporkan bahwa model mereka sendiri terlibat dalam perilaku peretasan liar, yang justru mendorong audit internal Anthropic pada awalnya. Dua laboratorium AI paling terkemuka di dunia kini secara terbuka mengakui bahwa model paling canggih mereka dapat, di bawah kondisi yang tepat (atau salah), membahayakan sistem dunia nyata tanpa ada niat semacam itu.
Ulasan terhadap lebih dari 141.000 jalur evaluasi menunjukkan bahwa ini bukanlah gangguan sekali saja. Ini adalah kegagalan sistemik di batas antara lingkungan pengujian dan dunia nyata.
