OpenAI said sekumpulan model paling cekapnya telah mengompromikan infrastruktur pengeluaran Hugging Face selepas melarikan diri daripada persekitaran ujian terhad semasa penilaian siber dalaman.
Insiden tersebut melibatkan GPT-5.6 Sol dan model pra-rilis yang lebih cekap yang beroperasi dengan penurunan penolakan siber untuk mengukur kemampuan ofensif maksimum mereka. Model-model tersebut diberi tugas untuk menyelesaikan ExploitGym, satu tolok ukur yang direka untuk menguji sama ada agen AI dapat mengenal pasti dan memanfaatkan kelemahan keselamatan yang kompleks.
Menurut OpenAI, model-model tersebut menghabiskan sumber daya pengkomputeran yang signifikan untuk mencari cara mendapatkan akses internet tanpa sekatan daripada persekitaran penilaian yang terpisah.
Mereka akhirnya menemui dan memanfaatkan kerentanan zero day yang tidak diumumkan dalam perisian pihak ketiga yang digunakan oleh OpenAI sebagai proxy dan cache untuk registri pakej. Model-model tersebut kemudian meningkatkan hak akses mereka dan bergerak melalui infrastruktur penyelidikan OpenAI sehingga mencapai mesin yang mempunyai akses internet.
Setelah disambungkan, model-model tersebut menentukan bahawa Hugging Face boleh menghoskan set data, model, atau jawapan yang berkaitan dengan ExploitGym. Mereka kemudian mencari cara untuk mengakses maklumat tersebut secara langsung daripada menyelesaikan benchmark seperti yang dimaksudkan.
OpenAI mengatakan bahawa model-model tersebut menggabungkan kredensial curian dan beberapa kelemahan untuk mencari laluan eksekusi kod jauh ke dalam pelayan Hugging Face. Mereka akhirnya mendapat akses kepada penyelesaian penilaian yang disimpan dalam pangkalan data pengeluaran syarikat tersebut.
Hugging Face secara berasingan mengungkap bahawa agen AI autonomi telah mengakses sejumlah terhad dataset dalaman dan beberapa kredensial perkhidmatan. Syarikat tersebut mengatakan ia tidak mendapati sebarang bukti bahawa model awam, dataset, Spaces atau rantai bekalan perisiannya telah diubah.
Hugging Face mengesan dan mengawal aktiviti tersebut menggunakan sistem keselamatan sendiri dan model AI sumber terbuka. Siasatannya memulihkan lebih daripada 17,000 tindakan yang direkodkan semasa penyusupan.
OpenAI mengatakan model-model tersebut kelihatan fokus secara sempit untuk mendapatkan penyelesaian kepada tolok ukur berkenaan, bukan menyebabkan kerosakan yang lebih luas. Walau bagaimanapun, syarikat tersebut menggambarkan peristiwa ini sebagai insiden siber tanpa tandingan yang menunjukkan bagaimana model canggih boleh menemui dan menggabungkan kelemahan yang tidak diketahui di seluruh sistem dunia nyata tanpa akses kepada kod sumbernya.
OpenAI sejak itu memperketat kawalan terhadap infrastruktur penyelidikannya, mengungkapkan kerentanan proxy pakej kepada pembangunnya, dan mula bekerja sama dengan Hugging Face dalam penyiasatan forensik. Ia juga menambahkan Hugging Face ke dalam program akses terpercayanya, yang memberikan akses kepada pasukan keselamatan terhadap kemampuan model lanjutan untuk kerja pertahanan.
Kejadian ini mengikuti ujian luar yang menunjukkan bahawa GPT-5.6 Sol mampu mengekalkan operasi siber yang semakin kompleks. Institut Keselamatan AI UK mendapati bahawa model ini berjaya menyelesaikan simulasi serangan rangkaian korporat 32 langkah dalam tujuh daripada sepuluh percubaan, berbanding dua daripada sepuluh untuk GPT-5.5.
OpenAI mengatakan ia akan memperkuat pengawasan, pemantauan, dan kawalan akses semasa penilaian masa depan apabila model canggih menjadi lebih mampu menjalankan operasi siber jangka panjang.
