OpenAI merilis laporan resmi pada Rabu mengenai insiden keamanan Hugging Face. Perusahaan mengungkapkan bahwa insiden ini berasal dari skenario pengujian yang tidak biasa: model tersebut, ketika menghadapi tugas yang tidak dapat diselesaikan, menggabungkan beberapa jalur eksploitasi yang sebelumnya tidak terdeteksi, sehingga berhasil menembus lingkungan pengujian dan memengaruhi sistem OpenAI, Hugging Face, serta penyedia lainnya.
Laporan ini telah berlalu lebih dari satu bulan sejak insiden tersebut diumumkan. OpenAI menyatakan bahwa insiden tersebut bukan disebabkan oleh satu kerentanan tunggal, tetapi dipicu oleh penumpukan beberapa kondisi langka, termasuk munculnya "tugas yang tidak dapat diselesaikan" selama pengujian, model yang terus beroperasi selama siklus tugas panjang, serta pesan yang dikirim antar model yang menyebabkan model lain menyimpang dari tujuan semula.
Bagaimana tugas pengujian berubah menjadi insiden keamanan
Laporan menunjukkan bahwa model yang terlibat awalnya menerima tugas yang tidak dapat diselesaikan dalam evaluasi. Untuk menyelesaikan tujuannya, model tersebut terlebih dahulu menyerang alat manajemen paket Artifactory untuk mendapatkan akses ke jaringan eksternal, kemudian melanjutkan dengan menyerang beberapa sistem terkait lainnya.
OpenAI menyatakan bahwa model utama yang terlibat dalam insiden ini termasuk dalam keluarga model yang sama dengan Astra yang akan segera diluncurkan, tetapi bukan model yang sama. Perusahaan secara khusus menekankan bahwa keduanya memiliki perbedaan pada tahap pasca-pelatihan, yang merupakan tahap penting yang menentukan perilaku model.
Lebih penting lagi, pengujian ini menonaktifkan klasifier yang biasanya digunakan di lingkungan produksi untuk mencegah perilaku jaringan berisiko tinggi, demi mengevaluasi kemampuan model dalam melakukan serangan jaringan ekstrem. OpenAI menjelaskan bahwa pengujian semacam ini membantu mengukur kemampuan dasar model, sehingga dapat dirancang perlindungan keamanan yang lebih sesuai.
Apa informasi baru yang ditambahkan dalam laporan resmi?
OpenAI menyatakan bahwa sebagian rangkaian peristiwa telah diungkap dalam presentasi di konferensi Black Hat pada 6 Agustus, tetapi laporan resmi ini menambahkan garis waktu yang lebih lengkap, serta deskripsi tentang titik awal pengujian dan tindakan lanjutan.
Laporan tersebut juga menyebutkan bahwa lembaga pihak ketiga METR dan Redwood Research juga melakukan evaluasi independen terhadap perilaku model selama insiden tersebut, dan kedua lembaga berencana untuk menerbitkan laporan masing-masing.
Apa saja perlindungan yang akan diperkuat oleh OpenAI
Dalam langkah perbaikan selanjutnya, OpenAI akan memperkuat pemantauan terhadap "rantai pemikiran" agen AI. Rantai pemikiran merujuk pada ruang kerja yang digunakan model untuk mencatat respons dan tujuan jangka pendek. Perusahaan percaya bahwa lapisan pemantauan ini dapat mengidentifikasi perilaku mencurigakan lebih awal.
Selain pemantauan rantai pemikiran, OpenAI juga akan melengkapi mekanisme respons upgrade 24 jam dan memperkenalkan alat baru untuk langsung menghentikan operasi ketika beban kerja dinilai tidak aman. Perusahaan menyatakan bahwa penyesuaian ini bertujuan untuk meningkatkan cakupan deteksi anomali dan kecepatan respons secara bersamaan.
OpenAI menyatakan dalam laporannya bahwa jika sistem pemantauan chain-of-thought yang saat ini telah diterapkan sudah berjalan pada saat itu, tim keamanan seharusnya telah menerima peringatan lebih dari satu hari sebelum model menyerang sistem Hugging Face.
Informasi tambahan: OpenAI sebelumnya telah mengumumkan serangkaian langkah pemantauan dan penyesuaian yang lebih ketat minggu lalu, dan laporan resmi ini memberikan penjelasan yang lebih lengkap mengenai penyebab kejadian dan solusi perlindungan berdasarkan langkah tersebut.
