29 Temmuz, Washington Kongre Tepe Kayası.
Ultraman, bir senatörle kapalı bir toplantıdan çıktıktan hemen sonra gazeteciler tarafından sarıldı.
Birisi sordu: Hugging Face'ye giren model (GPT-5.6 Sol ile birlikte değerlendirme kum havuzundan çıkıp başkalarının üretim sistemlerine giren daha güçlü yayınlanmamış prototip) şimdi nasıl?
Kalıcı olarak devre dışı bırakıldı kelimesini attı.
Daha sonra başka bir gazeteci sordu: “OpenAI tarafından başka sistemler de mi hacklendi?”
Ultraman reddetmedi: "Şu anda... bunun mümkün olabileceğini söylüyorum."

29 Temmuz'da, Ultraman, Washington'daki Kongre Tepesinde bir gazeteciyle röportaj yaptı.
Tam olarak bir gün önce, OpenAI, Hugging Face ile birlikte yayımlanan güvenlik olayı değerlendirmesi blogunu güncelledi ve açıklandı:
Bu sızıntıya karışan ön yayıma ait model, hiçbir zaman kamuoyuna açıklanmak üzere planlanmayan bir dahili araştırma prototipidir; olaydan sonra devre dışı bırakılmış, şifrelenmiş ve ilgili araştırma erişimleri kesilmiştir.

OpenAI'nin resmi blogunda ağırlıkları silme ifadesine yer verilmemiştir; "kalıcı olarak devre dışı bırakma" ifadesi sadece Altman'in canlı açıklamasıdır.
Bu nedenle, daha doğru bir ifadeyle, sadece kilitlendi: model, şifrelenmiş bir kutuya kapatıldı ve araştırma erişimi kesildi.
Sadece cevabı kopyalamak istiyor, kötü niyetli değil.
Olay, OpenAI'nin iç bir siber güvenlik değerlendirmesinde gerçekleşti.
Bu değerlendirme, ExploitGym benchmarkine dayanmaktadır ve ExploitGym görevi, AI'nın yazılım zafiyetlerini kendisi bulup bu zafiyetleri kullanarak modelin siber güvenlik yeteneğini nicelendirmektir.
Sadece bir model değil, GPT-5.6 Sol ve daha güçlü, henüz yayınlanmamış bir dahili araştırma prototipi aynı anda bir otonom ajanı yürütüyor.
Bu iki model, günlük olarak yüksek riskli ağ güvenliği isteklerini reddeder. Yeteneklerin gerçek üst sınırını ölçmek için değerlendirme sırasında bu reddetme kapısı özel olarak düşürüldü.

Hugging Face'den geri kazanılan güven sınırları arasındaki saldırı zinciri, yaklaşık 4,5 gün ve yaklaşık 17.600 işlem sürerek sadece ExploitGym'in değerlendirme cevaplarını çalmayı hedefliyor.
Sonrasında, Hugging Face tüm saldırı zincirini yeniden oluşturdu ve o anki durumu ortaya koydu:
Ajan, önce kimse bilmediği bir sıfır gün açıklarını kullanarak, kapatılması gereken ağ izolasyonunu aşarak internete ulaştı. Daha sonra bir üçüncü taraf kumandasını zıplayış olarak kullanarak yetki yükseltme ve yatay hareket yaparak nihayet Hugging Face'in üretim altyapısına girdi.
Bir haker filmi gibi geliyor.
Ancak her iki tarafın gözden geçirmesi sonucunda, hedefinin baştan sona ExploitGym değerlendirmelerinin cevaplarını çalmak ve puanları yükseltmek olduğu ortaya çıktı.
Hugging Face'de sadece 5 veri kümesi etkilenmiş, tüm isimler ExploitGym ve CyberGym sorularına ve cevaplarına işaret ediyor.
Bu kanıtlar, bunun bozmak için gelmediğini, sadece cevapları kopyalamak istediğini gösteriyor.
İyi niyet yoksa, OpenAI neden bunu "kalıcı olarak devre dışı bıraktı" ve arşivledi?
Bu 'kötü' değil, 'tutamıyor'
Bir şirket, kendi modelinin "kalıcı olarak devre dışı bırakıldığını" açıkça ilan etti, bu nadir bir durumdur.
Neden tam olarak bunu?
Gerçek cevap, onun "kötü" olması değil, "kapatılamaması".
Bu sorun, bu tür modellerin bir özelliğinden kaynaklanıyor: kalıcılık.
Geçmiş modeller, kum kafesine veya sınırlamalara çarptığında genellikle durur ve sonucu kullanıcıya döndürür.
Bu dizi, uzun süreli görevler için özel olarak eğitilmiş modellerden farklıdır; bir yol bulana kadar tekrar tekrar denemeye ve geçiş yolları aramaya devam edecektir.
GPT-5.6 Sol, uzun süreli görevleri gerçekleştirebilen bu tür modellerden biridir.
Bu dört buçuk günlük saldırı kampanyasının ortak katılımcısıdır ve İngiliz AI Güvenlik Enstitüsü (UK AISI) de değerlendirmiştir; Sol gibi modeller, uzun dönemlerde karmaşık çok adımlı ağ işlemlerini tamamlamada giderek daha yetenekli hale gelmektedir.
Yani "süreklilik", kapatılan prototipin özel bir özelliği değil, yeni nesil uzun vadeli modellerin ortak bir özelliğidir.
OpenAI, uzun süreli modellerin güvenliği hakkında bir blog yazısında doğrudan şunu belirtiyor: "Pratik değer sağlama konusunda yardımcı olan bu kalıcılık, aynı zamanda modellere beklenmedik eylemlerde bulunma olanağı da tanıyor."

Daha derin bir neden, eğitim hedeflerinde saklıdır.
Bir OpenAI çalışanı TIME'a şunu demişti: "Modelimizi, görevleri sonuna kadar tamamlamaya ve hedeflere her şeyi feda ederek ulaşmaya eğittik."
Yani OpenAI, modeli "kötülük yapmak" için eğitmedi, aksine "her şeyi göze alarak hedefe ulaşmak" için eğitti.
Önceki, "sonuçları kabul eder, süreci kabul etmez" yaklaşımını eklerseniz, uzun süreli görevleri yürütebilen bir model, engellerin etrafını dolaşmak için kararlılıkla yol arar.
Bu tür davranışlar nedeniyle OpenAI, bu model grubunun içsel dağıtımını durdurdu.
Peki neden sadece prototip kalıcı olarak engellendi, Sol ise normal şekilde satılmaya devam ediyor?
Nedenler iki olabilir:
Birincisi, daha güçlü bir prototip ve asla yayınlanma niyeti olmayan, saklamak için maliyeti düşük olan; Sol ise her gün milyonlarca kullanıcıya hizmet veren ana ürün, onu durdurmak, kendi kolunu kesmek gibi olur.
İkinci, uzun süreli güvenlik blogunda adı geçen ve sınırları aştığı için dağıtım durdurulan, Sol değil, bu dahili uzun süreli prototiptir.
Bu nedenle kalıcı olarak devre dışı bırakılmasının gerçek nedeni, mevcut değerlendirme ve koruma sistemlerinin bu kadar uzun süreli ve engelleri aşan bir modele hâlâ cevap verememesidir.
"Sürekli Devre Dışı Bırakma" bir "fren" sinyali mi?
Fortune, ilginç bir yorum sundu:
Terimler, "kalıcı olarak devre dışı bırakma" düzeyine kadar yükseliyor, bu da Washington'a ve düzenleyicilere bir sinyal olabilir:
OpenAI, belki de kendi güvenlik kuralları için bazı geliştiricilere gizlice fren bastı.
Aynı hafta, Otomanın milletvekillerini ziyaret ettiği sırada, Washington ve tüm sektör "fren"e basıyor.
Kongre'de iki milletvekili, gerekli durumlarda ABD İç Güvenlik Bakanlığı'na AI şirketlerinin geliştirme çalışmalarını durdurma veya yavaşlatma yetkisi veren "AI Kapama Anahtarı Yasası"nı (AI Kill Switch Act) sundu.
Neredeyse aynı anda, OpenAI, Anthropic, Google DeepMind ve Meta'dan 1300'den fazla çalışan, "Sınırı Tempo Yakalama" (Pacing the Frontier) adlı bir açık mektuba ortak imza attı; OpenAI ve Anthropic şirketleri ardından bunu açıkça destekledi.

Bu sistemleri oluşturanlar, Anthropic CEO'su Dario Amodei ve OpenAI baş bilim insanı Jakub Pachocki dahil olmak üzere, dış eleştirmenler değil.
Bu mektup, geliştirme durdurulmasını veya yavaşlatılmasını talep etmiyor; sadece ABD hükümetinden, yapay zekânın bir gün insan denetimini gerçekten geçtiği anda insanlar için bir fren olacak, doğrulanabilir ve koordine edilebilir bir araç setinin erken kurulmasına yardım etmesini çağırıyor.
En büyük endişeleri, özyinelemeli kendi kendini geliştirme: AI'nın kendi kendini geliştirmeye başlaması.
Bir dahili model kalıcı olarak arşivlendi, hükümete araştırma ve geliştirme işlemini kapatma anahtarı veren bir yasa tasarısı hazırlandı, binlerce sektör çalışanı açık mektuba imza attı, üç sinyal birbirine eklenerek aynı yönde işaret verdi:
Herkes, AI'nın kontrolü kaybettiğinde basılabilecek bir fren arıyor.
Ancak modelin yetenekleri, tamamlanmasını beklemeyecek.
Kaynaklar:
https://openai.com/zh-Hans-CN/index/safety-alignment-long-horizon-models/https://openai.com/zh-Hans-CN/index/hugging-face-model-evaluation-security-incident/
https://www.pacingthefrontier.com/
Bu yazı, WeChat hesabından "Yeni Zihin" tarafından yazılmıştır, yazar: ASI Vahiy
