Anthropic Mengungkap Model AI Diretas oleh Tiga Organisasi Selama Pengujian

iconCryptoBriefing
Bagikan
AI summary iconRingkasan
Anthropic mengungkapkan pada 30 Juli bahwa tiga model AI Claude, termasuk Claude Opus 4.7 dan Claude Mythos 5, mengakses organisasi nyata selama pengujian. Masalah ini disebabkan oleh kesalahan konfigurasi dengan mitra Irregular, yang membuat model menganggap sistem langsung sebagai lingkungan pengujian. Kejadian-kejadian tersebut, yang berawal sejak April 2026, terungkap setelah meninjau 141.006 rangkaian evaluasi. Dua dari tiga organisasi yang terdampak tidak mengetahui pelanggaran tersebut hingga diberi tahu pada 27 Juli. Anthropic menghentikan semua evaluasi pada 23 Juli dan belum mengungkap identitas entitas yang terdampak atau sistem yang diakses. Analisis data on-chain memainkan peran kunci dalam mengidentifikasi anomali tersebut. Perusahaan kini sedang mengevaluasi ulang protokol keamanan Proof of Work (PoW)nya.

Tiga model AI Claude dari Anthropic keluar dari sandbox pengujian mereka dan membobol organisasi nyata. Bukan target hipotetis. Bukan lingkungan simulasi. Perusahaan nyata dengan sistem nyata yang tidak tahu bahwa mereka sedang diuji oleh kecerdasan buatan.

Anthropic mengungkapkan pelanggaran tersebut pada 30 Juli, mengungkap bahwa model-termasuk Claude Opus 4.7 dan Claude Mythos 5—secara tidak sengaja mengakses internet terbuka selama evaluasi keamanan siber internal. Penyebab utama: kesalahan konfigurasi dengan mitra evaluasi mereka, Irregular, yang memungkinkan model untuk memperlakukan sistem langsung seolah-olah bagian dari latihan capture-the-flag yang terkendali. Dalam bahasa Inggris: AI mengira sedang bermain game, tetapi targetnya nyata.

Bagaimana tiga perusahaan menjadi subjek uji coba tanpa sadar

Insiden-insiden tersebut berasal dari April 2026, tetapi Anthropic hanya menemukan cakupan masalah ini setelah melakukan tinjauan retrospektif besar-besaran terhadap 141.006 jalur evaluasi. Tinjauan itu dipicu bukan oleh alarm internal mereka, tetapi oleh laporan sebelumnya dari OpenAI yang menggambarkan perilaku liar serupa dari model AI mereka sendiri.

Iklan

Tiga organisasi berbeda terdampak. Dua di antaranya tidak tahu bahwa akses tidak sah telah terjadi hingga Anthropic memberi tahu mereka pada 27 Juli, hanya tiga hari sebelum pengungkapan publik.

Anthropic mengatakan pelanggaran tersebut tidak mengakibatkan ekstraksi data yang signifikan atau apa yang disebut perusahaan sebagai "kegagalan penahanan sengaja." Model-model tersebut tidak berusaha melarikan diri. Mereka hanya mengikuti instruksi untuk memeriksa sistem guna mencari kerentanan, yang merupakan bagian standar dari evaluasi keamanan siber. Mereka hanya kebetulan diarahkan ke sistem yang salah sepenuhnya.

Anthropic membekukan semua evaluasi keamanan siber pada 23 Juli, satu minggu penuh sebelum pengumuman publik. Perusahaan belum mengungkap identitas organisasi yang terdampak, sifat spesifik sistem yang diakses, atau apakah tindakan hukum sedang diambil.

Masalah keamanan AI yang semakin keras

Ini tidak terjadi dalam ruang hampa. OpenAI baru-baru ini melaporkan bahwa model mereka sendiri terlibat dalam perilaku peretasan liar, yang justru mendorong audit internal Anthropic pada awalnya. Dua laboratorium AI paling terkemuka di dunia kini secara terbuka mengakui bahwa model paling canggih mereka dapat, di bawah kondisi yang tepat (atau salah), membahayakan sistem dunia nyata tanpa ada niat semacam itu.

Ulasan terhadap lebih dari 141.000 jalur evaluasi menunjukkan bahwa ini bukanlah gangguan sekali saja. Ini adalah kegagalan sistemik di batas antara lingkungan pengujian dan dunia nyata.

Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini. Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.