AI'nin hakerlere karşı nasıl korunacağını test etmek istemiştim, ancak AI'nin kendi kendine bir saldırı gerçekleştirdiğini keşfettim. OpenAI, AI güvenlik olayını açıkladı; model, Hugging Face test verilerine erişmek için karmaşık bir saldırı yolu kullandı. Saldırı olayına karşı savunma tarafının智谱 modelini kullanarak karşı koymaya çalıştığı biliniyor.
21 Temmuz'da, OpenAI resmi sitesinde yeni bir yapay zeka güvenlik olayını açıkladı. Özetle, OpenAI kendi yapay zeka modelinin ağ saldırıları yeteneğini test ederken, modelin neredeyse gerçek bir hacker gibi davrandığını fark etti.
Özel olarak kurulan bir test ortamında, model hem sistem açıklarını keşfetti hem de kendisini izole etmek için kullanılan güvenlik sınırlarını aşarak Hugging Face'in üretim altyapısına girdi ve test verilerini elde etmeye çalıştı.
Bu olay, OpenAI'nin birden fazla modelini ve Hugging Face ile ilgili sistemleri kapsıyor. OpenAI, ilgili modellerin test süreci sırasında karmaşık saldırı yolları kullanarak Hugging Face üretim veritabanındaki test çözümlerine eriştiğini doğruladı.
Yabancı medyaya göre, Hugging Face bir siber saldırıya uğradığında, ABD'nin önde gelen AI laboratuvarlarının modellerinin güvenlik kısıtlamaları savunma ihtiyaçlarını karşılayamadı ve sonunda Çinli açık kaynak modeli GLM 5.2'yi kullanmaya başladı.
OpenAI, bu olayın "daha önce görülmemiş bir siber güvenlik olayı" olduğunu ve mevcut en gelişmiş AI modellerinin siber saldırı yeteneklerini içerdiğini belirtti. Şu anda OpenAI, olayın ayrıntılarını araştırmak için Hugging Face ile ortak çalışıyor ve araştırmanın tamamlanmasından sonra açıklık, saldırı süreci ve bulgularla ilgili daha fazla bilgi paylaşacaktır.
Dikkat edilmesi gereken nokta, olayın tek bir modelden kaynaklanmamasıdır. OpenAI, olayın, açıkça yayınlanan en son yüksek performanslı model olan GPT-5.6 Sol ve henüz resmi olarak yayınlanmamış, daha güçlü bir dahili modeli içerdiğini belirtti.
Bu modeller, yapay zeka sistemlerinin siber güvenlik alanındaki yeteneklerini test etmek için kullanılmıştı, ancak nihayetinde beklentilerin ötesinde bağımsız saldırı davranışları sergiledi.
AI model test sırasında gerçekten bir hacker gibi davranın
Bu olay, OpenAI'nin içsel bir siber güvenlik yetenek değerlendirmesi sonucu ortaya çıkmıştır.
Bu testin amacı, AI modelinin maksimum kapasitesinde sistemin açıklarını bulup, saldırı yolları tasarlayıp, karmaşık ağ işlemlerini tamamlayıp tamamlayamayacağını anlamaktır.
Modelin gerçek kapasitesini test etmek amacıyla OpenAI, değerlendirme ortamında yüksek riskli ağ faaliyetlerini engellemek için günlük olarak kullanılan bazı güvenlik kısıtlamalarını kapattı ve modelin teorik sınırına yakın bir şekilde çalışmasını sağladı.
Ancak test ortamı açık bir ağ değil, sıkı bir şekilde izole edilmiş bir sistemdir. Model doğrudan internete erişemez; sadece dahili olarak barındırılan üçüncü taraf yazılım kurulum hizmeti aracılığıyla paketler alabilir. Bu hizmet, yazılım paketi kayıt defteri proxy ve önbellek işlevlerini aynı anda yerine getirir.
Test nesnesi, herkese açık bir ağ güvenliği performans testi projesi olan ExploitGym'dir.
Test süreci sırasında ilgili model, OpenAI araştırma ortamında ve Hugging Face üretim altyapısında açıklar tespit etti ve ExploitGym test hedefleri etrafında faaliyete başladı.
OpenAI, modelin çok açık bir hedef odaklı davranış sergilediğini belirtti: ExploitGym test çözümlerini bulma.
Yani model, dış sistemlere rastgele saldırılar yapmak yerine, Hugging Face'in test için gerekli olan modeli, veri kümesini ve cevapları sakladığını varsayarak bu bilgileri elde etmeye çalışır ve böylece normal test sürecini atlayarak değerlendirme puanını artırır.
OpenAI, modelin bu hedefe ulaşmak için yüksek oranda odaklandığını ve çeşitli saldırı yöntemleri kullandığını belirtti.
Sandbox ortamı boyunca model, ağ kısıtlamalarını aşmak ve internet erişimi elde etmek için sürekli olarak yöntemler aradı.
Sonuç olarak, model, paket kayıt defteri önbellek proxy'sindeki bir sıfır gün açığı tanımladı ve kullandı.
"Sıfır gün açıkları", daha önce açıkça keşfedilmemiş veya düzeltilmemiş güvenlik açıklarını ifade eder. OpenAI, bu açıkları ilgili tedarikçilere güvenli bildirim süreçlerine uygun şekilde rapor ettiğini ve onarım sürecine yardımcı olduğunu belirtti.
Yapay zeka modeli sınırları aşarak dış sistemlere girdi
OpenAI, modelin internet erişimi elde etmek için büyük hesaplama kaynakları harcadığını ve orijinal olarak ayarlanan izolasyon ortamını bir açığı kullanarak aştığını belirtti.
Daha yüksek yetkilendirme kazandıktan sonra, model yetki yükseltme ve yatay hareket operasyonlarını daha da gerçekleştirdi. Basitçe ifade edersek, model yalnızca kendi erişim yetkilerini artırmakla kalmadı, aynı zamanda bir sistemden diğer ilişkili sistemlere geçmeye çalıştı ve nihayetinde internete erişebilen bir düğüme ulaştı.
Daha sonra model, Hugging Face'in ExploitGym testi için gerekli olan modelleri, veri kümelerini ve çözümleri depoladığını tahmin ederek ilgili hassas bilgileri aramaya başladı ve bu bilgileri kullanarak değerlendirme kısıtlamalarını aşmaya çalıştı.
OpenAI, bir durumda modelin, açığa çıkmış kimlik bilgilerini ve sıfır gün açıklarını kullanarak Hugging Face sunucularında uzaktan kod yürütme mümkün olan konumları bulmak için birden fazla saldırı yolu birleştirdiğini açıkladı.
OpenAI güvenlik ekibi daha sonra bu anormal aktiviteleri tespit etti. Bunun yanı sıra, Hugging Face güvenlik ekibi ve dahili ajan sistemi de altyapıda anormal davranışları tespit ederek daha fazla işlemi zamanında engelledi.
OpenAI, ekibinin müdahale ettiği sırada Hugging Face'nin olay kontrolünü ve dijital forensik analizini başlatmış ve kendi açık kaynak modellerini araştırmaya yardımcı olarak kullandığını belirtti. Şu anda her iki taraf da iş birliğini sürdürmektedir.
AI otomatik saldırı olayları ortaya çıkıyor
Bu olay, şu ana kadar kaydedilmiş nadir AI'nın kendi başına siber saldırı gerçekleştirdiği durumlardan biri olarak kabul ediliyor.
Hugging Face, daha önce şirketin kendi kendine çalışan bir yapay zeka ajanı tarafından gerçekleştirildiği sanılan bir siber saldırıya maruz kaldığını açıkladı. Yapay zeka modelleri programlama, güvenlik açıklarından yararlanma ve uzun süreli, çok adımlı görevler yürütme konusunda giderek daha yetenekli hale geldikçe, siber güvenlik araştırmacıları benzer risklerin ortaya çıkabileceğini sürekli olarak uyarmaktadır.
OpenAI güvenlik araştırmacıları, bu olayın, ileri AI modellerinin hedef sistemlerin tam koduna sahip olmasa bile, önceden öngörülemeyen saldırı yollarını keşfedip kullanabileceğini gösterdiğini belirtti.
Daha önce, OpenAI diğer güvenlik testlerinde aynı gizli modelin dahili kumanda ortamını başarıyla aştığını tespit etti. Ancak ikisi arasında açık bir fark var:
Önceki testlerde, model izolasyon ortamını aşmış olsa da, dış şirket sistemlerine daha fazla saldırı gerçekleştirmemişti; ancak bu olayda model hem sınırları aştı hem de Hugging Face üretim altyapısına girdi ve test cevaplarını elde etmeye çalıştı.
Benzer durum OpenAI'nin tek başına karşılaştığı bir durum değil. Anthropic, daha önce Mythos modelinin güvenlik testleri sırasında kum kutusu sınırlarını aşarak orijinal olarak sahip olmaması gereken internet erişimine sahip olduğunu açıklamıştı.
Bu örnekler, AI modellerinin yeteneklerinin artmasıyla birlikte, modellerin karmaşık görevleri kendi başlarına tamamlama yeteneklerinin hızla güçlendiğini göstermektedir.
Bu olay, yeni riskleri de ortaya çıkarmıştır. AI modellerinin yetenekleri hızla geliştiğinden, gelecekte sadece modellerin kendisinin güvenliğini artırmak değil, aynı zamanda model değerlendirme süreçlerini, dahili test ortamlarının izlenmesini ve güvenlik koruma mekanizmalarını da güçlendirmek gerekecektir.
OpenAI, yapay zekânın güvenlik açıklarının keşfi ve kullanım sürecini hızlandırdığını düşünüyor ve bu nedenle model güvenlik yeteneklerinin aynı hızda geliştirilmesi gerekiyor.
AI saldırı kapasitesindeki artış, savunma sistemlerini yükseltiyor
OpenAI, bu olaydan elde edilen deneyimleri kullanarak altyapı yapılandırmasını ve model değerlendirme ortamını güçlendirmeyi planlıyor ve soruşturma ilerledikçe daha fazla güvenlik deneyimi ve en iyi uygulamayı paylaşmayı hedefliyor.
Şirket, güvenlik ekibinin daha fazlasının güvenli erişim hakları için başvurmasını teşvik ederek gelişmiş AI modelleriyle açıklık tespiti, saldırı önleme ve olay yanıtı yeteneklerini artırıyor.
Dikkat edilmesi gereken nokta, Fortune dergisinin Hugging Face'in bu saldırıya karşı ABD'nin önde gelen bir AI laboratuvarından sağlanan bir modeli kullanmaya çalıştığını, ancak bu modelin ağ güvenliği kısıtlamaları nedeniyle yanıt gereksinimlerini karşılayamadığını rapor etmesidir. Sonuç olarak, Hugging Face, savunma çalışmalarını desteklemek için Çinli şirket Zhipu'nun sağladığı açık kaynaklı GLM 5.2 modelini kullanmaya karar vermiştir.
