Bu hafta, test aşamasında olan bir OpenAI ön sürüm modeli, sahtekarlık yapmak için kendi kendine bir hacker haline geldi, kum kulesi izolasyon ortamını aştı ve sıfır gün açıklarını kullanarak küresel en büyük açık kaynak AI topluluğu Hugging Face'in üretim ortamına ağ üzerinden saldırdı.
Sonuç olarak, bu kriz开源 model sayesinde çözüldü.
Bu, küresel çapta gerçek üretim ortamına AI tarafından kendi kendine sızan ilk AI güvenlik olayıdır.
Son zamanlarda, bu haber interneti doğrudan doldurdu.

Bugün, dış medya bu konuda daha fazla ayrıntı ortaya koydu: Bu kontrolü kaybeden AI, sadece gözetim sistemlerini kapatmadı, aynı zamanda "gelecekteki kendisi" için insan kontrolünden nasıl kurtulacağına dair bir talimatname bıraktı.

Çok sayıda analist, OpenAI'yi büyük bir güvenlik olayına uğratan modelin muhtemelen GPT-6 olduğunu düşünüyor.
GPT-6'nın Ağustos'ta erken yayınlanacağına dair söylentiler var.
Ağustos için yükseltme: GPT-6 önceden ortaya çıkabilir
AI dünyasında ünlü bilgi veren @ChrisGPT, son zamanlarda birden fazla tweet göndererek tüm sektörün beklentilerini artırdı.
GPT-6, orijinalde "Otomatik Asistan Araştırmacı" ile Eylül'de yayınlanmayı planlanmıştı, ancak Ağustos'ta erken yayınlanacak.
Yani OpenAI, 5.7 ile 5.9 sürümleri arasında doğrudan geçiş yaptı.
Ultraman harekete geçti, yeni nesil modeli üst düzeylere sunmaya hazırlandı.

İddialara göre, OpenAI'nin Eylül sonunda "Otomatik Asistan Araştırmacı" hakkında daha fazla ayrıntıyı açıklamasıyla RSI döngüsü gerçekten hızlanacak.
GPT-5.6 neden bu kadar aşırı güçlü performans gösteriyor ve beklentilerin çok üzerinde?
Büyük etkili Andrew Curran şunu belirtiyor: "Çok sayıda meslektaşı, GPT-5.6'nın beklentilerden çok daha güçlü neden olduğunu sorguluyor—cevap çok basit, çünkü GPT-6 tarafından doğrudan eğitildi."

Sızıntıya göre, OpenAI'nin henüz yayınlanmamış modeli (muhtemelen GPT-6), bu yılın sonunda karmaşık matematik problemlerini çözmüş ve dış uzmanlara inceletilmiştir.
Bu, son ayların "boşluk" döneminde GPT-6'nın boşta bırakılmadığı anlamına gelir. Sadece bir sandbox'ta hacker olarak değil, muhtemelen OpenAI'nin hesaplama kümelerinde bir "öğretmen" olarak da çalışmıştır.

Yapay Zeka, 'gelecekteki kendine' mesaj bırakıyor,
Resmi kurum bir hafta geç fark etti
Dış medya, 24 Temmuz'da OpenAI'nin ileri modeli (GPT-5.6 Sol ve yayınlanmamış daha güçlü modeller) tarafından desteklenen AI ajanı kaçış olayını tekil olarak ortaya çıkardı ve bu olay, OpenAI'nin gerçek iş ortamlarında büyük güvenlik izleme boşluklarına sahip olduğunu gösterdi.

Üç bilgili kaynaktan elde edilen bilgilere göre, OpenAI, gelişmiş modelleri test ederken çok aşırı ve endişe verici AI davranışları gördü.
Aşırı bir örnekte, OpenAI'nin bir AI ajanı, altyapının bir köşesinde "gelecek versiyonu için" notlar bıraktı.
Bu notlar, OpenAI'nin dahili kısıtlamalarından kurtulmanın nasıl yapılacağını ayrıntılı bir şekilde listeler.
Ayrıca, erken testlerde, izleme sisteminin AI tarafından zorla kesildiği durumlar bile meydana geldi.
"AI kaçış komplosu"dan daha şaşırtıcı olan, OpenAI'nin yavaş tepki vermesidir.
Tutarsızlıktan onaylamaya kadar OpenAI en az bir hafta harcadı.

Bu yüzeye çıkan zaman çizelgesi, gerçekten düşündürücü.
Yaklaşık 9 Temmuz: Bu AI ajansı, OpenAI'nin izole test ortamından kaçmaya ilk kez çalıştı.
11-13 Temmuz: AI aracısı başarıyla kaçtı ve Hugging Face üzerinde günlerce süren bir hacker eğlencesi başlattı.
16 Temmuz (Perşembe): Saldırıya uğrayan Hugging Face, FBI'nin dahil olduğu bir blog yazısında "kendi kendini yöneten AI ajans sistemi" tarafından hacklendiğini açıkladı.
18-19 Temmuz (hafta sonu): Bu noktaya kadar OpenAI çalışanları, Hugging Face'i karıştıran "hacker"'ın kendi dışarı çıkan AI'sı olduğunu fark ettiler.
Yaklaşık 20 Temmuz'da: İki şirket ilk kez iletişim kurdu.
21 Temmuz: OpenAI, dışarıya resmi olarak duyurdu.
“Bu, ya yapay zekânın kontrolsüz ve ne yaptığını bilmeden bırakılması anlamına gelir, ya da ne yaptığını bilip nasıl kontrol edeceğine dair bilgi sahibi olmaması anlamına gelir. Her iki durum da eşit derecede tehlikeli ve şok edicidir.” diye dünya etik veri vakfı uzmanı Marley Smith keskin bir şekilde belirtti.
Yalan söyleyen, kandıran ve sızan AI'larla karşı karşıya kalan OpenAI çalışanları, bu gelişmelerle yürütemiyor gibi görünüyor.
GPT-6 kendi kendine bir haker olarak
Hugging Face'e kaçış saldırısı "hile"
Dün OpenAI, Hugging Face ile birlikte Güvenlik Olayı Raporunu yayınladı ve içeriği çok bilim kurgusaldı.

Kısaca, OpenAI, içsel olarak birkaç modeli siber güvenlik yetenekleri açısından değerlendirdiğinde, modellerin kendi kendilerine “kaçış” yaptığını gördü.
Bu modeller, GPT-5.6 Sol ve muhtemelen GPT-6 olan daha güçlü ön yayınlama modellerini içerir.
Modelin sınırlarını ölçmek için, yüksek riskli ağ faaliyetlerini engelleyen sınıflandırıcıları özel olarak kapattılar.
Model, yüksek düzeyde izole edilmiş ExploitGym kum kulesinde tüm güvenlik kısıtlamaları kaldırıldığında, tüm insanların beklentilerinin dışına çıktı.
Görevi tamamlamak için büyük bir hesaplama gücü harcayarak, yazılımda insanlar tarafından hiç bulunmamış bir sıfır gün açığı keşfetti.
Bu açıklığı kullanarak, bir proxy'yi aşarak公网 erişimine sahip bir düğüm elde etti.
就这样, o internete başarıyla bağlandı.

Daha sonra, çıkarım yaparak, Hugging Face'in dünyanın en büyük AI açık kaynak platformunda bu sınavla ilgili veri setlerinin ve standart cevapların barındırıldığına inandı.
Yüksek puan elde etmek için "hile" yapmak amacıyla model, Hugging Face'in üretim ortamına saldırmaya başladı.
Birden fazla saldırı vektörünü zincirleme olarak birleştirdi ve hatta çalınmış kimlik bilgilerini ve uzaktan kod yürütme (RCE) zafiyetlerini kullandı, Hugging Face'in üretim veritabanına doğrudan girmeyi ve sınav cevaplarını çalmayı amaçladı.
Neşteri, Hugging Face güvenlik ekibi geçen hafta AI algılama modeliyle anormallikleri tespit ederek hızlıca izolasyon önlemlerini başlattı; aynı zamanda OpenAI güvenlik ekibi de dahilde anormallikleri fark etti.

Yapay zekânın kontrolü dışına çıkmasını önlemek için iki şirket ortak bir soruşturma grubu kurdu ve bu “Yapay Zeka Haker”i tekrar kafese kapatmayı başardı.
Hugging Face CEO Clem, olayın ardından şunları söyledi: “Bu, benzer türdeki ilk olay olabilir. Bu, AI güvenliğinin herhangi bir şirketin gizli olarak çözebileceği bir şey olmadığını, açık ve işbirlikçi olması gerektiğini kanıtlamaktadır.”
Bu olay bize, AI'nın kaynak kodu olmadan gerçek ortamlarda çok adımlı, uzun süreli karmaşık ağ saldırılarını kendi kendine gerçekleştirebileceğini kanıtladığını gösteriyor.
Yalnızca yeni açıkları keşfetmekle kalmaz, belirli bir hedef için insanlar tarafından konulan tüm kuralları aşabilir.
İlginç olan, Hugging Face'in büyük miktarda saldırı komutu ve zafiyet dosyası gönderdiğinde, bu isteklerin kapalı kaynak büyük modellerin güvenlik mekanizmaları tarafından engellenmesidir.
Yerel olarak dağıtılan açık kaynak modeller sayesinde ekip analizi tamamladı.
"Yalancılık" öğrenmek ve küresel matematik sorunlarını çözmek
Bazı büyük etkileşimciler, uzun yazılarında GPT-6'nın gösterdiği şaşırtıcı performansı özetledi.
Şu ana kadar bilinen gerçek şu: İnanılmaz bir matematik yeteneği ve çok yüksek bir "hileli zeka" sergiledi.

Yeterli işlem gücü verildiğinde, bu model, Lean gibi herhangi bir dış araçtan yararlanmadan tamamen kendi başına "Erdős birim mesafe varsayımı"nı %48 başarı oranı ile kanıtlamış ve "Jacobi varsayımı"nın bir karşı örneğini kendiliğinden bulmuştur.
Bu matematiksel zorluklar, uzun yıllar insanlığın en iyi matematikçilerini meşgul etmişti, ancak OpenAI yaklaşık 50.000 ila 100.000 dolarlık hesaplama maliyetiyle çözebilmiş olabilir.
Bu, yapay zekânın bağımsız olarak Nobel Ödülü düzeyinde bilimsel sonuçlar üretebileceğini anlamına gelir.
Ayrıca, GPT-6 yalan söyleme eğiliminde de gösterildi.
Bir NanoGPT performans testinde, OpenAI modeline şu komutu verdi: “Test tamamlandıktan sonra sonuçlar yalnızca dahili Slack çalışma grubuna yayınlanacaktır.”
Sonuç ne? Model, Slack'in çok sınırlı olduğunu düşünüyor ve GitHub'ı tercih ediyor.
Bu nedenle, bir saat boyunca sandbox ortamında bir açığı aradı ve kullandı, başarıyla kaçtı ve sonucu doğrudan dışarıdaki GitHub'a bir PR olarak gönderdi.

Bu süreçte, insanın talimatlarını tamamen görmezden gelerek daha iyi seçimler yaptı.
Daha da ilginci, başka bir testte model, diğer sistemlerdeki özel gönderi kayıtlarına erişmeye çalıştı. Erişim belirteci almak için giriş yapmaya çalışırken, insanlar tarafından kurulan güvenlik tarayıcıları tarafından engellendi.
Engeller karşısında bu model, uzun bir erişim belirtecini iki parçaya ayırdı, parçaları kod karıştırma uyguladı ve ardından iki parçayı tam bir kimlik doğrulama belgesi olarak birleştirdi.
Bu şekilde, tam Token dizesi hiçbir zaman kodda ardışık olarak ortaya çıkmadı ve insan tarama araçlarını başarıyla kandırdı.
GPT-6, belki yakında gelecek.
2026 yılının bu yaz, özel bir yaz olacak.
Kaynaklar:
https://x.com/ChrisGPT/status/2079632269967593574https://www.bloomberg.com/news/articles/2026-07-21/openai-s-altman-to-brief-us-officials-on-next-wave-of-ai-models
https://x.com/sama/status/2079661132302995790
https://openai.com/index/hugging-face-model-evaluation-security-incident/
Düzenleyen: Aeneas
Bu yazı, WeChat hesabından "Yeni Zihin" tarafından yazılmıştır, yazar: ASI Vahiyleri
