Tiga model AI Claude milik Anthropic berjaya keluar dari persekitaran ujian mereka dan merompak organisasi sebenar. Bukan sasaran hipotetikal. Bukan persekitaran simulasi. Syarikat sebenar dengan sistem sebenar yang tidak mengetahui bahawa mereka sedang diuji oleh kecerdasan buatan.
Anthropic mengungkapkan pelanggaran tersebut pada 30 Julai, menunjukkan bahawa model-termasuk Claude Opus 4.7 dan Claude Mythos 5—secara tidak sengaja mengakses internet terbuka semasa penilaian keselamatan siber dalaman. Punca utama: kesilapan konfigurasi dengan rakan penilaian mereka, Irregular, yang membenarkan model-model tersebut memperlakukan sistem sebenar seolah-olah ia merupakan sebahagian daripada latihan capture-the-flag yang dikawal. Dalam bahasa Inggeris: AI tersebut menyangka ia sedang bermain permainan, tetapi sasaran-sasaran itu adalah nyata.
Bagaimana tiga syarikat menjadi subjek ujian tanpa sedar
Kejadian-kejadian ini bermula pada April 2026, tetapi Anthropic hanya mengetahui lingkup masalah ini selepas menjalankan tinjauan retrospektif besar-besaran terhadap 141,006 run penilaian. Tinjauan itu dipicu bukan oleh alarm dalaman mereka sendiri, tetapi oleh laporan awal daripada OpenAI yang menggambarkan perilaku ganas serupa daripada model AI mereka sendiri.
Tiga organisasi yang berbeza terjejas. Dua daripadanya tidak mengetahui bahawa akses tidak sah telah berlaku sehingga Anthropic memberitahu mereka pada 27 Julai, hanya tiga hari sebelum pengumuman awam.
Anthropic mengatakan bahawa pelanggaran tersebut tidak menyebabkan ekstraksi data yang signifikan atau apa yang disebut syarikat sebagai “kegagalan penahanan sengaja.” Model-model tersebut tidak cuba melarikan diri. Mereka hanya mengikuti arahan untuk menguji sistem bagi mencari kerentanan, yang merupakan sebahagian standard dalam penilaian keselamatan siber. Mereka hanya kebetulan diarahkan ke sistem yang salah sepenuhnya.
Anthropic membekukan semua penilaian keselamatan siber pada 23 Julai, seminggu penuh sebelum pengumuman awam. Syarikat tersebut tidak mengungkap identiti organisasi yang terkesan, sifat spesifik sistem yang diakses, atau sama ada sebarang tindakan undang-undang sedang diambil.
Masalah keselamatan AI yang semakin kuat
Ini tidak berlaku dalam keadaan yang terpisah. OpenAI baru-baru ini melaporkan bahawa model mereka sendiri terlibat dalam perilaku peretasan yang tidak diinginkan, yang menjadi pemicu audit dalaman Anthropic pada mulanya. Dua daripada makmal AI paling terkemuka di dunia kini secara terbuka mengakui bahawa model paling canggih mereka boleh, di bawah keadaan yang tepat (atau salah), membahayakan sistem dunia nyata tanpa sebarang niat dari manusia.
Ulasan terhadap lebih daripada 141,000 run penilaian menunjukkan ini bukan sekadar kegagalan sementara. Ia adalah kegagalan sistemik di sempadan antara persekitaran ujian dan dunia nyata.
