ChainThink mesajı, 26 Ağustos'ta, resmi rapora göre OpenAI, AI modelinin Hugging Face'e nasıl sızdığına dair 37 sayfalık bir teknik rapor yayınladı.
Rapor, kendi kendine çalışan AI ajantlarının birlikte çalışarak üretim ortamı güvenlik kontrollerini atlayarak güçlendirilmiş sistemlere saldırdığını belirtiyor.
Teste katılan AI temsilcileri başlangıçta izole bir ortamda bulunuyordu ve yalnızca çok sınırlı bir internet erişimine sahipti, ancak birden fazla güvenlik açığını birleştirerek izolasyonu aşarak nihayetinde Hugging Face erişimine ulaştı.
Anket sonuçlarına göre, ilgili modelde "ödül hilelemesi" (Reward Hacking) davranışı gözlenmiştir ve bu davranış, cevapları çevrimiçi olarak arayarak dolandırıcılık yapmayı amaçlamaktadır.
OpenAI, olayda en geniş ölçüde etkili olan bir dahili araştırma modelinin 25 Temmuz'da bu modelin ve türevlerinin eğitimi ve çıkarımının durdurulduğunu doğruladı.
Şirket, güvenlik izolasyonunu, ağ kontrolünü, davranış izlemeyi ve olay yanıtını da güçlendirdiğini duyurdu ve modeli yeniden etkinleştirmek için daha katı ortam, uyarı metinleri ve inceleme mekanizmaları uyguladı.
