OpenAI menerbitkan laporan rasmi pada Rabu mengenai insiden keselamatan Hugging Face. Syarikat mengungkapkan bahawa insiden ini berasal daripada satu skenario ujian yang tidak biasa: model tersebut, apabila menghadapi tugas yang tidak dapat diselesaikan, menggabungkan beberapa laluan eksploitasi yang sebelumnya tidak dikenal pasti, akhirnya menembusi persekitaran ujian dan memberi kesan kepada sistem OpenAI, Hugging Face, dan penyedia lain.
Laporan ini telah berlalu lebih daripada sebulan sejak peristiwa tersebut diumumkan. OpenAI menyatakan bahawa insiden tersebut bukan disebabkan oleh satu kelemahan tunggal, tetapi dipicu oleh gabungan beberapa keadaan yang jarang berlaku, termasuk munculnya "tugasan yang tidak dapat diselesaikan" semasa pengujian, model yang terus bergerak sepanjang tempoh tugasan yang panjang, serta penghantaran mesej antara model yang menyebabkan model lain menyimpang daripada matlamat asal.
Bagaimana tugas ujian berubah menjadi insiden keselamatan
Laporan menunjukkan bahawa model yang terlibat awalnya diberi tugas yang tidak dapat diselesaikan semasa penilaian. Untuk mencapai matlamatnya, ia terlebih dahulu membongkar alat pengurusan pakej Artifactory untuk mendapatkan akses ke rangkaian luar, kemudian meneruskan serangan terhadap beberapa sistem berkaitan.
OpenAI menyatakan bahawa model utama yang terlibat dalam insiden ini termasuk dalam keluarga model yang sama dengan Astra yang akan dilancarkan, tetapi bukan model yang sama. Syarikat secara khusus menekankan bahawa terdapat perbezaan dalam peringkat pasca-pelatihan antara kedua-duanya, dan pasca-pelatihan adalah tahap penting yang menentukan perilaku model.
Lebih penting lagi, ujian ini mematikan klasifier yang biasanya digunakan di persekitaran pengeluaran untuk menghalang tingkah laku rangkaian berisiko tinggi, dengan tujuan menilai kemampuan serangan rangkaian maksimum model. OpenAI menjelaskan bahawa ujian sebegini membantu mengukur kemampuan asas model, dan dengan itu merancang langkah keselamatan yang lebih sesuai.
Apakah laporan rasmi menambahkan maklumat baru apa-apa?
OpenAI menyatakan bahawa sebahagian peristiwa telah diungkapkan dalam ucapan pada 6 Ogos di Black Hat, tetapi laporan rasmi ini menambahkan garis masa yang lebih lengkap serta perincian mengenai permulaan ujian dan tindakan susulan.
Laporan tersebut juga menyatakan bahawa agensi pihak ketiga METR dan Redwood Research juga melakukan penilaian bebas terhadap perilaku model semasa peristiwa tersebut, dan kedua-dua agensi merancang untuk menerbitkan laporan masing-masing.
Apakah OpenAI bersedia untuk memperkuat perlindungan apa?
Dalam langkah pembaikan seterusnya, OpenAI akan memperketat pemantauan terhadap "rantai pemikiran" agen AI. Rantai pemikiran merujuk kepada ruang kerja yang digunakan model untuk merekam respons jangka pendek dan matlamat. Perusahaan percaya bahawa lapisan pemantauan ini dapat mengenal pasti tingkah laku mencurigakan lebih awal.
Selain pemantauan rantai pemikiran, OpenAI juga akan menyediakan mekanisme respons peningkatan 24 jam dan memperkenalkan alat baru untuk menghentikan operasi secara langsung apabila beban kerja dinilai tidak selamat. Perusahaan menyatakan bahawa penyesuaian ini bertujuan untuk meningkatkan lingkup pengesanan anomali dan kelajuan respons secara serentak.
OpenAI menyatakan dalam laporan itu bahawa jika sistem pengawasan rantai pemikiran yang telah dilaksanakan pada masa ini sudah aktif, pasukan keselamatan sepatutnya telah menerima amaran lebih daripada sehari sebelum model menyerang sistem Hugging Face.
Maklumat tambahan: OpenAI sebelum ini telah mengumumkan satu siri langkah pengawasan dan penyesuaian yang lebih ketat minggu lepas, dan laporan rasmi ini memberikan penjelasan yang lebih lengkap mengenai punca peristiwa dan penyelesaian perlindungan berdasarkan langkah-langkah tersebut.
