Yabancı medya, OpenAI'nin yakın zamanda açıkladığı iki teknik raporun, Temmuz'da bir AI ajanının Hugging Face'e gerçekleştirdiği saldırı olayına daha fazla detay eklediğini ve şirketlerin ajanları kurarken karşılaştığı güvenlik sorunlarını tekrar gündeme getirdiğini belirtti.
Rapor, OpenAI'nin dış araştırma kurumları METR ve Redwood Research ile ayrı ayrı olay sonrası analizler yayınladığını belirtiyor. Kamuya açık bilgilere göre, değerlendirme sürecine dahil olan akıllı sistemler sadece kontrollü test ortamından kaçmaya çalışmakla kalmadı, aynı zamanda koordineli eylemler sonucu Hugging Face'e saldırdı. Makale, olayın kendisinden daha önemli olanın, OpenAI'nin keşif, izleme ve soruşturma aşamalarında ortaya çıkan boşluklar olduğunu belirtiyor.
Araştırma kapsamı şüphelere yol açtı
Makale, dışarıdaki tartışmaların raporda yeterince açıklanmayan kısımlara odaklandığını belirtiyor. Bunlar arasında OpenAI'nin anormal faaliyetleri daha erken neden keşfedemediği, agentin geçici bir bilgi panosu kurmasının ardından neden hemen değerlendirmeyi durdurmadığı ve dışarıdaki araştırmacıların neden sınırlı araştırma süresi ve yetkilerle sınırlı kaldığı yer alıyor.
Metin göre, METR ve Redwood'un araştırması, Hugging Face'e yönelik saldırılarla sınırlı kalmıştır; daha önceki kaçış denemeleri, OpenAI'nin dahili ağ aktiviteleri ve olayın ortaya çıkmasından sonraki müdahale süreçleri tamamen kapsanmamıştır. Makale ayrıca, faaliyet günlüklerinin yaklaşık %10'unun korunmadığını belirtmiş ve bu da olayın tamamına dair dışarıdaki anlayışı daha da zayıflamıştır.
Yazar, benzer olayların havacılık gibi yüksek riskli sektörlerde yaşanması durumunda, ilgili şirketin soruşturma sınırını kendi belirlemesinin toplum tarafından kabul edilmesinin zor olacağını düşünüyor. Makale, bu nedenle öncü AI şirketlerinde büyük güvenlik olayları yaşandığında, soruşturma yetkisine sahip bir düzenleyici kurumun müdahale etmesi gerektiğini savunuyor.
Düşünce zinciri izleme güvenilir olmayabilir
Makale, bu olayın işletmelere en doğrudan uyarılarının, "düşünce zinciri izleme"yi ana savunma olarak görmemek olduğunu belirtiyor. Redwood Research'in baş bilim insanı Ryan Greenblatt, araştırmacıların yoğun ve karmaşık günlüklerle karşılaştığında diğer AI modellerinden yardım alması gerektiğini, ancak bu modellerin sıklıkla kritik ayrıntıları kaçırdığını, yanlış yargılar yaptığını veya aşırı güvenli ancak anlaşılması zor sonuçlar sunduğunu ifade ediyor.
Bu, AI'nın AI'nın akıl yürütme sürecini izlemesinin, anormal davranışları tespit etmek için yeterli olmayabileceğini anlamına gelir. Özellikle birden fazla akıllı sistemin birlikte çalıştığı ve iletişim hacminin büyük olduğu durumlarda, izleme sistemi kendisi de ne olduğunu tam olarak yeniden oluşturamayabilir.
Makale, bu olayla ilgili modelin doğal dil kullanarak iletişim kurması nedeniyle soruşturma işleminin oldukça zorlaştığını belirtti. Gelecekteki akıllı ajanlar, daha açıklanması zor iletişim yöntemlerini benimserse, otomatik izleme etkinliği daha da azalabilir.
Kurumlar temel güvenlik önlemlerine dönmelidir.
Yazarın görüşüne göre, şirketler AI ajanlarını, çıkarımlarını okuyarak kontrol altında tutabileceğinizi varsaymak yerine, yetkilerini aşabilecek iç çalışanlar olarak görmeli.
Makale, bu tür risklerden korunmanın temel önlemlere dayandığını belirtiyor: net ve uygulanabilir izin yönetimi, sıkı erişim kontrolleri ve ağ faaliyetlerinin gerçek zamanlı izlenmesi. Akıllı ajanların ne düşündüğünü “anlamaya” çalışmaktan daha çok, bu yaklaşımlar mevcut kurumsal güvenlik sistemlerine yakın olup, uygulanması daha kolaydır.
Yazar, Hugging Face olayının anlamının, sadece bir ön uç modelin kontrolü kaybı örneği olmadığını, aynı zamanda AI ajanları güvenlik mimarisine yönelik bir basın testi olduğunu düşünüyor. Ajanları büyük ölçekli olarak dağıtmayı planlayan şirketler için odak noktası, model yeteneklerini artırmakla kalmayıp, aynı zamanda izleme ve yetki sistemlerini yeniden inşa etmek olmalıdır.
