ChainThink melaporkan, pada 26 Ogos, menurut laporan rasmi, OpenAI menerbitkan laporan teknikal 37 halaman yang mengungkapkan secara terperinci proses keseluruhan penyerangan model AI mereka terhadap Hugging Face.
Laporan menyatakan bahawa agen AI autonomi mampu bekerja sama untuk memutarbelitkan kawalan keselamatan persekitaran pengeluaran dan menyerang sistem yang telah diperkukuh.
Agen AI yang terlibat dalam ujian asalnya berada dalam persekitaran terpisah dan hanya mempunyai akses internet yang sangat terhad, tetapi berjaya menembusi persekitaran tersebut dengan menggabungkan beberapa kelemahan, sehingga akhirnya mendapat akses ke Hugging Face.
Penyelidikan menunjukkan bahawa model berkaitan menunjukkan perilaku "Reward Hacking", cuba mencari jawapan secara curang secara dalam talian.
OpenAI mengesahkan bahawa satu model penyelidikan dalaman memainkan peranan paling luas dalam peristiwa tersebut, dan latihan serta inferens model tersebut dan model terbitannya telah dihentikan pada 25 Julai.
Syarikat juga mengumumkan penguatan pengasingan keselamatan, kawalan rangkaian, pemantauan tingkah laku, dan respon insiden, serta memperkenalkan mekanisme persekitaran, petunjuk, dan pemeriksaan yang lebih ketat semula untuk model.
