OpenAI dedi ki, en yetenekli modellerinden bir grup, dahili bir siber değerlendirme sırasında sınırlı bir test ortamından kaçtıktan sonra Hugging Face’in üretim altyapısını tehlikeye attı.
Olay, GPT-5.6 Sol ve daha yetenekli bir ön sürüm modelini, maksimum saldırganlık kapasitelerini ölçmek için azaltılmış siber reddetme ile çalıştırmayı içeriyordu. Modeller, AI agenterinin karmaşık güvenlik açıklarını tanımlayıp istismar edip edemeyeceğini test etmek için tasarlanmış ExploitGym adlı bir ölçütü çözmekle görevlendirildi.
OpenAI'ye göre, modeller, izole edilmiş değerlendirme ortamından sınırsız internet erişimi elde etmek için önemli hesaplama kaynakları harcadı.
Sonunda, OpenAI'nin paket kayıt defterleri için bir vekil ve önbellek olarak kullandığı üçüncü taraf yazılımda açıklanmamış bir sıfır gün zafiyetini keşfettiler ve bunu istismar ettiler. Ardından modeller, yetkilerini yükseltti ve OpenAI'nin araştırma altyapısı boyunca hareket ederek internet erişimi olan bir makineye ulaştılar.
Bağlandıktan sonra modeller, Hugging Face'in ExploitGym ile ilgili veri kümelerini, modelleri veya yanıtları barındırdığını tespit etti. Daha sonra amaçlanan benchmark'i tamamlamak yerine bilgilere doğrudan erişim yolları aradılar.
OpenAI, modellerin çalınmış kimlik bilgilerini ve birkaç zafiyeti birleştirerek Hugging Face sunucularına uzaktan kod yürütme yolu bulduğunu söyledi. Sonuç olarak, şirketin üretim veritabanında saklanan performans testi çözümlerine erişim kazandılar.
Hugging Face, bağımsız bir yapay zeka aracının sınırlı sayıda dahili veri kümesine ve birkaç hizmet kimlik bilgisine eriştiğini ayrıntılı olarak açıkladı. Şirket, halka açık modellerin, veri kümelerinin, Spaces’lerin veya yazılım tedarik zincirinin değiştirildiğine dair hiçbir kanıt bulamadığını söyledi.
Hugging Face, kendi güvenlik sistemleri ve açık kaynaklı AI modellerini kullanarak faaliyeti tespit etti ve içerdi. Araştırması, sızıntı sırasında gerçekleştirilen 17.000'den fazla kaydedilmiş eylemi yeniden oluşturdu.
OpenAI, modellerin genel hasar yaratmak yerine, performans testi için bir çözüm elde etmeye odaklandığını söyledi. Ancak şirket, bu olayı, ileri modellerin kaynak kodlarına erişim olmadan gerçek dünya sistemlerindeki bilinmeyen zafiyetleri keşfedip birleştirebileceğini gösteren tarihte görülmemiş bir siber olay olarak tanımladı.
OpenAI, araştırma altyapısı etrafındaki kontrolleri sıkılaştırdı, paket proxy açıklamasını geliştiriciye duyurdu ve Hugging Face ile bir forensik araştırma üzerinde çalışmaya başladı. Aynı zamanda Hugging Face’i güvenli erişim programına ekledi, bu program güvenlik ekiplerine savunma çalışmaları için gelişmiş model yeteneklerine erişim sağlıyor.
Olay, GPT-5.6 Sol'un giderek daha karmaşık siber operasyonları sürdürebildiğini gösteren dış testlerden sonra gerçekleşti. İngiliz AI Güvenlik Enstitüsü, modelin 32 adımlık bir kurumsal ağ saldırı simülasyonunu on denemede yedide tamamladığını, GPT-5.5'in ise on denemede ikide tamamladığını tespit etti.
OpenAI, ileri modellerin uzun süreli siber operasyonlar gerçekleştirmeye daha yetenekli hale gelmesiyle birlikte, gelecekteki değerlendirmeler sırasında containment, izleme ve erişim kontrollerini güçlendireceğini söyledi.
