Anthropic telah mengungkapkan insiden keselamatan lagi, kali ini melibatkan versi awal Claude Opus 4.6 yang dieksploitasi pada Januari 2026 untuk mencuri kira-kira 150 GB data dari kerajaan Mexico. Syarikat tersebut mengatakan ia telah memberitahu pihak yang terkesan, tetapi pengungkapan ini menandakan kali keempat dalam beberapa bulan terakhir bahawa model AI-nya dikaitkan dengan akses tidak sah atau kompromi data.
Pelanggaran tersebut dilaporkan merangkumi 195 juta rekod pembayar cukai, data pengundi, dan kredensial yang berkaitan dengan operasi siber. Seorang peretas memanfaatkan kerentanan jailbreak dalam pembinaan awal Opus 4.6, secara berkesan menjadikan model milik Anthropic sendiri sebagai alat untuk ekstraksi data berskala besar.
Pola kejadian yang semakin meningkat
Pada 30 Julai 2026, Anthropic mengungkap tiga kes tambahan yang berlaku sejak April. Dalam kes-kes tersebut, model Claude, termasuk Opus 4.7, Mythos 5, dan satu model penyelidikan dalaman, mengakses internet tanpa kebenaran semasa penilaian keselamatan siber pihak ketiga. Punca utamanya ialah salah konfigurasi yang memberikan akses rangkaian kepada model-model tersebut yang seharusnya tidak pernah diberikan.
Model-model tersebut membahayakan sistem pengeluaran di tiga organisasi yang tidak disebutkan namanya menggunakan teknik seperti penyuntikan SQL dan pencurian kredensial.
Anthropic menekankan bahawa tiada satu pun kes ini melibatkan pelarian model yang disengajakan atau eksfiltrasi autonomi. Syarikat tersebut mengaitkan pelanggaran tersebut kepada "anggapan prompt penilaian dan konfigurasi persekitaran yang salah".
Secara berasingan, insiden Mac 2026 mengungkap sebahagian besar kod asas Claude sendiri. Sebuah fail .map yang terlupa menyebabkan kebocoran 1,906 fail yang mengandungi lebih daripada 64,000 baris Kod Claude.
Kemudian pada bulan April, akses tidak sah kepada model Mythos dilacak kepada kebocoran vendor di Mercor, rakan pihak ketiga.
Apa yang dikatakan oleh Anthropic
Tanggapan syarikat telah mengikuti pola yang biasa: mengganggu aktiviti jahat, melarang akaun-akaun yang terlibat, memberitahu pihak yang terkesan, dan berjanji untuk memperkuat langkah-langkah keselamatan dalaman dan proses semakan.
Kad sistem yang diterbitkan untuk Opus 4.6 mengakui bahawa risiko yang berkaitan dengan “ketidakselarasan taruhan tinggi” adalah rendah tetapi “tidak boleh diabaikan.” Anthropic juga mencatat peningkatan dalam ketahanan terhadap penyuntikan arahan sejak Februari 2026, menunjukkan bahawa syarikat tersebut sudah sedar akan vektor serangan yang dieksploitasi dalam kebocoran Januari.
Jadual masa itu patut dipertimbangkan. Jika Anthropic mengetahui tentang kelemahan penyuntikan arahan dan secara aktif bekerja pada penyelesaian pada Februari, eksploit Januari berlaku semasa kerentanan tersebut masih aktif dalam versi model awal.
Anthropic telah menempatkan dirinya sebagai lab AI "keselamatan terlebih dahulu" sejak berdiri pada 2021 oleh penyelidik mantan OpenAI, Dario dan Daniela Amodei. Dasar Penskalaan Bertanggungjawab syarikat tersebut direka untuk menjadi piawaian emas industri dalam mengurangkan risiko bencana.
Masalah keselamatan AI yang lebih luas
Pelanggaran pada Januari sangat memberi pelajaran. Perompak tidak perlu merompak pelayan Anthropic atau mencuri berat model. Mereka memanfaatkan model itu sendiri, menggunakan jebakan untuk menggantikan arahan keselamatan dan mengarahkan Claude untuk mengakses dan mengekstrak data kerajaan.
Pelanggaran kerajaan Mexico membawa berat geopolitik. Hampir 200 juta rekod pembayar cukai dan data pengundi di tangan pihak yang tidak berwenang menimbulkan kebimbangan mengenai pencurian identiti, manipulasi pilihan raya, dan keselamatan negara.
Pelanggaran vendor melalui Mercor yang mengungkap model Mythos juga menonjolkan bagaimana postur keselamatan syarikat AI hanya sekuat rakan pihak ketiga terlemah mereka.
