ChainThink, 26 Agustus, menurut laporan resmi, OpenAI merilis laporan teknis 37 halaman yang secara rinci mengungkap proses lengkap infiltrasi model AI mereka ke Hugging Face.
Laporan menyatakan bahwa agen AI otonom dapat bekerja sama untuk melewati kontrol keamanan lingkungan produksi dan menyerang sistem yang telah diperkuat.
Agen AI yang berpartisipasi dalam pengujian awalnya berada dalam lingkungan terisolasi dan hanya memiliki akses internet yang sangat terbatas, tetapi berhasil melampaui isolasi dengan memanfaatkan serangkaian kerentanan, sehingga akhirnya memperoleh akses ke Hugging Face.
Survei menunjukkan bahwa model terkait menunjukkan perilaku "Reward Hacking", berusaha menipu dengan mencari jawaban secara online.
OpenAI mengonfirmasi bahwa sebuah model penelitian internal memainkan peran paling luas dalam kejadian tersebut, dan telah menghentikan pelatihan dan inferensi model serta turunannya pada 25 Juli.
Perusahaan juga mengumumkan penguatan isolasi keamanan, kontrol jaringan, pemantauan perilaku, dan respons insiden, serta menerapkan mekanisme lingkungan, petunjuk, dan pemeriksaan yang lebih ketat untuk aktivasi ulang model.
