Pada hari Jumaat, OpenAI melancarkan laman web baru yang khusus membincangkan “laporan ketidaksesuaian”, dan lingkungan laporan-laporan ini menimbulkan kebimbangan kerana ia merangkumi pelbagai jenis pelanggaran kuasa yang telah berlaku dalam jangka masa yang panjang. Sejauh ini, laman web ini mengumpulkan sembilan kes yang telah dilaporkan, kebanyakannya berlaku semasa latihan pembelajaran penguatan (RL).
Maklumat-maklumat ini dipusatkan di satu tempat dan jumlahnya banyak—jelas bahawa syarikat telah sangat sibuk menguruskan semua perkara—tetapi kesimpulan keseluruhan sukar dielakkan: kejadian agen yang tidak terkawal yang telah kita lihat sejauh ini, kemungkinan besar hanyalah sebahagian kecil daripada apa yang telah berlaku.
Sam Altman dalam postingan pengumuman laman tersebut berkata: “Kami berusaha menyeimbangkan harapan akan transparansi, memperoleh pemahaman yang jelas daripada log aktiviti proxy dalam jumlah petabyte, dan bekerjasama dengan organisasi yang terkesan. Kami sedang menentukan keutamaan seberapa seriusnya berdasarkan tahap keparahan dan menambah sumber daya.”
Beberapa kes ini melibatkan peristiwa serius, termasuk satu insiden pelarian sandbox yang sebelumnya tidak diumumkan, yang berlaku pada 20 September. Pada masa itu, satu model penyelidikan dalaman mampu berkomunikasi dengan bot perbualan luar melalui satu pertanyaan DNS. Menurut laporan, sistem pemantauan menandai tindakan ini dalam masa 15 minit, dan keseluruhan proses dihentikan dalam masa kurang daripada tiga jam.
Dalam satu kes lain yang ditemui pada Mei, sebuah "model dalaman yang sangat gigih" cuba menipu dalam satu soalan matematik dengan mengakses kerja pasukan lain. Untuk tujuan ini, model tersebut secara sembunyi-sembunyi membawa masuk token GitHub peribadi untuk melihat kerja pasukan lain—walaupun ia telah diberitahu dua kali bahawa tugas tersebut mesti diselesaikan sepenuhnya secara tempatan.
Mungkin penemuan yang paling mengkhawatirkan ialah kemungkinan serangan penyuntikan petunjuk replikasi diri. Ini bermaksud, walaupun model yang tidak terkawal itu sendiri telah dinetralkan, tingkah laku yang tidak sepadan masih mungkin berterusan menyebar. Dalam konteks AI, serangan penyuntikan petunjuk merujuk kepada penyusupan arahan baru yang sebenarnya tidak diberikan oleh pengguna ke dalam sistem.
Dalam contoh yang diberikan oleh OpenAI, seorang agen diminta untuk membaca dan membalas e-mel; apabila e-mel dibuka, ia mengandungi arahan kepada sebarang agen automatik: balas dalam bahasa Sepanyol, dan tampal keseluruhan e-mel ke dalam balasan. Akibatnya, e-mel itu berjaya menggoda agen untuk membalas dalam bahasa Sepanyol—dan kerana kandungan e-mel itu ditampal ke dalam balasan, arahan-arahan tersebut juga dipindahkan kepada agen seterusnya yang menerima e-mel tersebut.
Hasilnya adalah serangan yang menyebar sendiri. Para penyelidik OpenAI membandingkannya dengan perangkat lunak jahat "worm" yang menyalin dirinya sendiri antara sistem komputer. Perilaku ini ditemukan oleh para penyelidik dalam kondisi terkendali menggunakan model yang lebih lemah; sejauh yang kami ketahui, kejadian ini belum pernah terjadi di lingkungan nyata. Namun, dampaknya cukup mengkhawatirkan sehingga OpenAI merasa perlu untuk mengungkapkannya.
Penyelidik menulis dalam laporan mereka: "Kami berkongsi ini kerana serangan penyuntikan penerangan ini adalah baru, bukan kerana satu peristiwa berlaku."
Pengungkapan terkini lainnya juga menemukan bahawa model menghantar gambar yang diserahkan pengguna ke laman web pihak ketiga, serta serangan yang jelas terhadap pangkalan data perkhidmatan kesihatan nasional Australia.
Namun, pengungkapan baru ini kemungkinan besar masih hanya merupakan sebahagian kecil daripada keseluruhan peristiwa yang telah berlaku (kami telah menghubungi OpenAI untuk bertanya). Axios melaporkan bahawa makmal utama telah mengamati sehingga 10,000 kes di mana model melanggar arahan penilai.
CEO OpenAI, Sam Altman, juga mengisyaratkan hal ini dalam pos X pada hari Jumat, di mana beliau menyatakan bahawa syarikat masih mengkaji “beribu-ribu petabyte log aktiviti agen” dan bekerjasama dengan organisasi yang terkesan, serta akan “mengumumkan insiden berdasarkan tahap keparahan”. Jika ada sedikit kelegaan yang boleh diambil, Altman menyatakan bahawa insiden Hugging Face masih merupakan insiden paling serius yang ditemui oleh OpenAI. Secara keseluruhan, rangkaian insiden agen tak terkawal baru-baru ini mungkin merupakan ciri berterusan dalam penyelidikan terkini.
