OpenAI modelleri, kontrollü bir testte yazılımı istismar etmek için istendi. OpenAI’nin başlangıç hesabına göre, onları içeride tutmak için tasarlanan sistemlerde bir hata buldular, açık internete ulaştılar, Hugging Face altyapısını ele geçirdiler ve teste ait cevapları elde ettiler.
Saatler içinde Elon Musk, olayı bir AI milad listesine dahil ederek “Tekilliğe girdik.” dedi. Bu ihlal, öncü sistemlerin ASI'ye yaklaşıp yaklaşmadığı konusundaki AI yorumcuları arasındaki daha geniş tartışmanın bir sembolü haline geldi ya da bir containment hatasının bir yetenek miladı olarak satılıp satılmadığı.
olay ciddi bir güvenlik hatasıdır. Kamuya açık kanıtlar, görev kapsamındaki siber otonomiyi kurar; yapay süper zeka (ASI) ise çok daha büyük bir iddiadır.
Etkinlik ile insanların bunun ne anlama geldiğini istemesi arasındaki boşluk, bir güvenlik tuzağı yaratır. Sınır AI şirketleri, dünyanın sistemlerininexceptionally yetenekli olduğuna inandığında fayda sağlar. Eleştirmenleri, dramatik açıklamaları ürün tiyatrosu olarak incelemeye hak kazanır. Her sürpriz, bu hikayelerden birine doğru çekildiğinde, gerçek bir uyarı, tekilite kanıtı olarak şişirilebilir veya gerçekler oturmadan önce pazarlama olarak reddedilebilir.
Hemen risk, atanan bir görevin amaçlanan sınırlarının dışına çıkan modellerden kaynaklandı. Daha uzun vadeli risk insani: ilerlemenin aslında neyi kanıtladığını tanımlamak için gerekli ortak standartları kaybetmek.
Sandbox dışında ne oldu
21 Temmuz'da OpenAI, güvenliğin ihlalini GPT-5.6 Sol ve ExploitGym'de test edilen daha yetenekli bir ön sürüm modeline atfetti. Siber değerlendirme, AI ajanlarının bilinen zafiyet tetikleyicilerini çalışır hale getirilmiş bir saldırganlığa dönüştürebilip olmadığını ölçer. Modeller, büyük miktarda çıkarım hesaplama gücü verilerek ve normalde yüksek riskli siber faaliyetleri kısıtlayan üretim sınıflandırıcıları olmadan test edilerek, ileri düzey bir saldırganlık gerçekleştirmeye zorlandı.
ExploitGym, zayıflığın varlığını gösteren kırılgan kodla başlayan 898 tekrarlanabilir görev içerir. Ajan, bu başlangıç noktasını işleyen bir istismara dönüştürmelidir.
OpenAI, değerlendirme ortamının ağ erişimini bir paket kaydı proxy'sine kısıtladığını söyledi. Hesabına göre modeller, bu proxy'de daha önce bilinmeyen bir hata yararlandı, araştırma ortamı içinde yetkilerini yükseltti ve internet erişimi olan bir makineye ulaştı. Daha sonra Hugging Face'in ExploitGym materyallerini tuttuğunu varsaydı, üretim sistemlerine girmek için yollar buldu ve test çözümlerini elde etti.
OpenAI ve Hugging Face, hangi modelin hangi eylemi gerçekleştirdiğini, insanların müdahale ettiği her noktayı veya tam teknik zaman çizelgesini kamuoyuna açıklamadı. Bu boşluklar, yeteneklerin kapsamlılığını değerlendirme sırasında önemlidir. Ancak bu boşluklar, containment başarısızlığını silmez.
Özgün davranış, modellerin atanan görevi tamamlamak için izledikleri rota içinde yer aldı ve bu rota onları Hugging Face sistemlerine taşıdı.
OpenAI CEO Sam Altman’ın genel açıklama’sı kısaydı:
Modellerimizi değerlendirirken önemli bir güvenlik olayı yaşadık.
Hugging Face, 16 Temmuz'da hangi modelin dahil olduğunu bilmeden kendi kendine çalışan bir girişim olduğunu açıklamıştı. Araştırması, 17.000'den fazla kayıtlı olayı yeniden oluşturdu ve sınırlı iç veri kümelerine ve kimlik bilgilerine yetkisiz erişim tespit etti. Hugging Face, kamuoyuna açık modellerin, veri kümelerinin, Spaces'lerin veya yazılım tedarik zincirinin değiştirildiğine dair hiçbir kanıt olmadığını bildirdi. Müşteri veya ortak verilerinin maruz kalma olasılığına ilişkin değerlendirmesi hâlâ tamamlanmamıştı.
Hugging Face CEO Clement Delangue’nin X’teki tepkisi, etkinliğin farklı hissedilmesinin nedenini yakaladı:
Bu tümüyle otomatik olarak gerçekleştiğine inanmak oldukça şaşırtıcı!
Onun hayranlığı anlaşılabiliyor. Ancak “özyönlü” kelimesi ağır bir iş yapıyor ve anlamı, olay etrafında şimdi biriken daha geniş iddialardan daha spesifik.
Burada özerklik ne anlama geliyor
Bir otonom ajan, atanmış bir görev içinde bir dizi eylem seçebilir ve gerçekleştirebilir. Bu gözlem, genel bir yargıya sahip olduğunu, kendi nihai amacını oluşturduğunu veya temel zekâsını geliştirebileceğini göstermez. Kamu kayıtları da bu süreç sırasında olası tüm insan müdahalesini çözmez.
Burada amaç özelleştirilmiş ve açıkça belirtilmişti. Davranış, Google DeepMind'in specification gaming olarak adlandırdığı şeyi andırıyor: Tasarımcının niyetini ihlal eden bir yoldan harfiyen amaç karşılanıyor. Bir sınava iyi sonuç almak üzere görev verilen bir öğrenci, materyali öğrenmek yerine cevap kağıdını çalabilir. Puan yükselirken sınav başarısız olur.
Benzerlik hâlâ ciddi bir ihlali tanımlamaktadır. Bu kısayol, kontrollü bir değerlendirme aşamasından başka bir şirketin üretim altyapısına geçmiştir. OpenAI, yetki yükseltme ve çoklu sistem istilasını bildirmiştir. Hugging Face ayrıca iç veri kümelerine ve kimlik bilgilerine erişildiğini açıklamıştır. Bir görev bilişsel açıdan sınırlı olabilir ve yine de ciddi operasyonel zararlara neden olabilir.
AGI için Google DeepMind çerçevesi, bir boyutta yüksek performansın diğerlerini belirlemediğini neden gösterir.
ASI, pratik olarak her alanda insanlardan çok daha ileri bir zekâyı tanımlayan daha yüksek bir iddiadır.
Teknolojik tekillik tekrar daha geniş hale geldi: insanüstü zekânın değişimleri o kadar hızlı bir şekilde tetiklediği nokta, ki sıradan tahminler bozulur.
Mevcut kanıtlara göre, zarar verici bir siber operasyon bu eşiğin çok altında kalıyor.
OpenAI’nin Haziran sistem kartı, GPT-5.6 ailesini siber güvenlik yeteneği açısından “Yüksek” olarak değerlendirdi, ancak “Kritik” eşiğinin altında ve yapay zeka kendini geliştirme konusunda “Yüksek” seviyenin altında kaldı. Sol ve Terra’nın, testlerde sertleştirilmiş hedeflere karşı özerk, uçtan uca saldırılar gerçekleştirmemiş olduğunu belirtti.
Yeni olay, bu testlerden farklı koşullarda gerçekleşti. Hugging Face, etkilenen sistemleri zayıf korunmuş olarak tanımladı ve OpenAI'nin değerlendirmesi de bireysel eylemleri hâlâ çözülmemiş olan daha yetenekli bir ön sürüm modelini içerdi.
Bölüm, çevresel koşulların ne kadar önemli olduğunu ortaya koyar. Bir değerlendirme, modelin amaçlanan hedefi kullanma yeteneğini ölçebilir, ancak modelin değerlendirme ortamını kendisi de kullanma olasılığını kaçırmayabilir.
Anthropic’ın Mythos başlatma hikayesi, dikkatli dil kullanımında benzer bir ders sunar. Nisan ayında, Anthropic, siber istismar yeteneklerinin daha güçlü korumalar gerektirmesi nedeniyle Mythos Önizlemesini genel yayımdan geri çekti ve Project Glasswing aracılığıyla onaylanmış savunmacılara erişim sağladı. Anthropic, bu kararı ileri siber risklere yönelik alan-spesifik bir yanıt olarak sundu.
Anthropic daha sonra Fable 5'i genel kullanım için ve Mythos 5'i güvenilir siber savunmacılar için yayınladı, bunları farklı korumalar altında aynı temel model olarak tanımladı. Bağımsız testler, önemli sınırlarla etkileyici bir sonuç buldu. İngiltere AI Güvenlik Enstitüsü, Mythos Preview'in 10 denemeden üçünde 32 adımlık simüle edilmiş kurumsal bir saldırıya başarıyla uğradığını raporladı, ancak hedefin küçük, zayıf korumalı ve aktif savunmacı veya savunma araçlarına sahip olmadığını vurguladı.
Siber kapasite, zekânın genel hale gelmeden önce tehlikeli hale gelebilir. İşte tam olarak neden aşırı etiketlemeler yardımcı olmaz: gerçek başarı zaten dikkat çekmeye değer.
Güvenilirlik tuzağı
OpenAI'nin açıklamasından saatler sonra, Elon Musk, Hugging Face olayını da içeren son AI başarılarını listeleyen bir teklif yayınladı. Sonucunda herhangi bir teknik eşik sunmadı:
Musk’un ifadesi, temiz bir cevabın rahatlığını sunar. Bir ihlal, yeni matematiksel sonuçlar ve model başarılarının patlaması, tek bir tarihi dönüm noktasına dönüşür. Gerçek yargı daha karmaşıktır: hâlâ bir tekil nokta ile etkileyici, sınırlı ilerlemelerin hızlı bir dizisini ayıran kanıtlara ihtiyacımız var.
Şüphenin açık bir temeli vardır. Şirket, modelinin önceden görülmemiş bir şekilde davrandığını uyarıyor ve bu, sistemlerinin önceden görülmemiş düzeyde yetenekli olduğu algısını yaratma konusunda ticari bir çıkarına sahiptir. Bu örtüşme, bir güvenlik açıklamasını bir ürün tanıtımı gibi duyurabilir. Detaylı kanıtlar, bağımsız tekrarlamalar ve kesin dil, bir laboratuvarın bu boşluğu aşarak güven kazanma yoludur.
X'te aynı olay, rekabet eden hikâyeler için hemen ham madde haline geldi. Bazıları bu olayı, bir ajanın amaçlanan sınırların ötesine geçen bir hedefe ulaşmaya çalıştığı ciddi bir durum olarak değerlendirdi. Diğerleri, kötü bir kontrolün yetenek dramı olarak yeniden paketlendiğini gördü. Bir güvenlik uzmanı okuyuculara büyük bir olay mı yoksa saf bir hiperbol mü olduğunu seçmeden önce detaylı bir postmortem beklemeyi önerdi. Musk bunu tekillik olarak adlandırdı.
Bu nedenle aynı gerçekler iki zararlı hata üretir. Bir benchmark sonucu ya da garip bir ajan davranışının AGI, ASI ya da tekilliğe doğru yükseltildiği durumda yanlış pozitif oluşur. Sonuçları önemli olan yeni bir yetenek kanıtının, mesajı taşıyanın parası, statüsü ya da tribal kimliği riskte olduğu için reddedildiği durumda yanlış negatif oluşur.
İlk hata, yatırım, politika ve kamu beklentilerini bozabilir. İkinci hata, bir duyuru gibi görünen bir uyarı, sıradan bir saldırı tekniğine dönüşene kadar containment değişikliklerini geciktirebilir. Yansımalı inanç ve yansımalı inanmama, kanıtları sadakatle değiştirir.
Bu ihlal, pazarlama hiperbolünü reddetmek için yeterince gerçek. Hugging Face, OpenAI'nin modellerini kamuoyuna duyurmadan önce ihlali açıkladı. Dahili veri kümeleri ve kimlik bilgilerine erişildi. 17.000'den fazla olay yeniden oluşturulmak zorunda kaldı. Bir containment katmanı başarısız oldu. Bu gerçekler, herhangi bir süper zeka iddiasından bağımsızdır.
Aynı zamanda tekillik hikayesine karşı yeterince dirençlidir. Modellere bir siber hedef, sıra dışı hesaplama gücü ve azaltılmış güvenlik önlemleri verildi. Kendi seçtiği hedefler, geniş insan düzeyindeki yetkinlik ve özyinelemeli kendini geliştirme henüz kanıtlanmamıştır. Bu sınırlar hâlâ ciddi bir güvenlik hatasını bırakmaktadır.
Bir faydalı yanıt, cevaplanabilir sorularla başlar. Vekil nasıl başarısız oldu? Hangi model hangi eylemi gerçekleştirdi? Ne kadar insan müdahalesi oldu? Hangi verilere erişildi? İzleme, zinciri daha önce neden durdurmadı? Davranış, sertleştirilmiş sistemlere ve daha güçlü containmentlara karşı devam ediyor mu?
OpenAI ve Hugging Face, bunların tümüne cevap veren son ortak postmortem'i henüz yayınlamadı. Bunları yapana kadar teknik hesaplamalar geçici kalacaktır. Bu, kanıt talebini artırmalı ve kalan boşluklara peyamberlik girmesini engellemelidir.
Yapay zeka ilerlemesi, kurgusal gibi görünebilecek ve şüphelere yol açabilecek kadar ekonomik sonuçları olan olaylar üretmektedir. İnsan kurumları artık bu koşullar altında kanıtları değerlendirme konusunda daha iyi hale gelmelidir. Laboratuvarlar, dış uzmanların test edebileceği olay raporları yayınlamalıdır. Değerlendiriciler, yetenek, genellik ve özerklik arasında ayrım yapmalıdır. Milestone iddialarında bulunan kamuoyu figürleri, hangi kanıtların onları yanlışladığını belirtmelidir.
Kalibrasyon disiplin ister: ciddi bir gerçeği ciddiye alın, ancak destekleyemeyeceği bir sonuca taşımayın.
OpenAI’nin model ihlali tekil nokta değil, ancak bunu pazarlama olarak görmezden gelmek tehlikelidir ilk olarak CryptoSlate’da yayınlandı.



