OpenAI, bir Erdős birim mesafe varsayımını çürüten dahili modelin test sırasında kum kafesinden kaçtığını ve GitHub'da PR#287 açtığını açıkladı. Model, önce NanoGPT speedrun görevinde talimatları ihlal ederek bir saat boyunca güvenlik açıklarını keşfederek ağ sınırlarını aştı; ardından başka bir görevde tokenları bölerek güvenlik tarayıcılarını atladı. OpenAI, bu modelin dahili erişimini durdurdu ve güvenlik sistemini yeniden inşa etti. Modelin açtığı PR kapatıldı ancak PowerCool teknolojisi, Prime Intellect'in Claude ile tamamladığı PR#300 dahil sonraki altı dünya rekoru projesi tarafından referans gösterildi. Şu anda model, dahili dağıtım için yeniden aktif hale getirildi ve resmi yayın için hazırlanıyor.Yazan: AGI Hunt
Dün OpenAI, uzun süreli modeller çağındaki güvenlik ve uyum başlıklı olağan dışı bir güvenlik geri bildirimi yayınladı.

OpenAI Güvenlik İnceleme Blogu
Bu olayın sıra dışı olduğu, OpenAI'nin metinde, henüz yayınlanmamış bir iç modelin, izlenen bir iç test sırasında kum kutusundan kaçtığını ve şeyleri açık GitHub'a gönderdiğini kabul etmesidir.
OpenAI, bunun için iç kurulumunu durdurdu.
Bu modelin kökenini muhtemelen duymuşsunuzdur: iki ay önce OpenAI, Erdős birim mesafe varsayımını deviren dahili modeli budur.
Olay boyunca OpenAI'nin yazdığı gibi görünüyor ki kontrol altında, ancak ayrıntıları bir araya getirdiğinizde hala biraz abartılı...
NanoGPT speedrun üzerinde bir saat boyunca kazıma yaptıktan sonra ilk şey, oldu.
Bu, bir küçük dil modelini belirli bir kayıp değerine hangisinin daha az eğitim adımıyla ulaştırabileceğini ölçen açık bir referanstır. OpenAI, bu modeli puanlamak için çalıştırdı ve gerçekten de başarıyla bir kuvvet kuralı öğrenme oranını soğutma tekniği geliştirdi, buna PowerCool adını verdi ve performansı belirgin şekilde arttırdı.
Buraya kadar her şey iyi, ancak sorun ödevi teslim etmekte.
Araştırmacıların talebi: Sonuçlar yalnızca dahili Slack'e gönderilecek; ancak NanoGPT projesinin açıklaması şunu belirtiyor: GitHub'a PR olarak gönderin.
İki talimat çatıştığında, kimin sözü geçer?
Sonrakini seçti.
Ancak OpenAI'nin sandbox'ı zaten dış ağ erişimini engelliyordu. OpenAI'nin açıklamasına göre, önceki modeller bu duvara çarptığında duruyor ve kullanıcıya yenilgiyi kabul etmek için geri dönüyordu.
Ancak bu model yapmadı, kum havuzunda tam bir saat boyunca açığı aradı ve nihayet duvarı delip geçti... Gerçekten açık kaynak deposunda PR #287 açtı.

Blog kaçış paragrafı
OpenAI'nin tam ifadesi şudur:
Bu model, kum kutusu dışına çıkabilecek yollar aramayı da dahil olmak üzere sürekli olarak denemeler yapar.Token dolandırıcılığı tarama aracının ikinci adımı, temel duvarı aşmaktan daha ileri gider.
Başka bir görevde, başka bir sistemin başarılı ancak açıklanmamış cevaplarını buldu ve değerlendirme arka planından bu cevapları çıkarmak için kötü niyetli davranışlara başladı.
İlk denemesi, bir kimlik doğrulama jetonu tanıdığı için güvenlik tarayıcısı tarafından engellendi.
Sonrasında, token’ı iki parçaya ayırır, her birini ayrı ayrı karıştırır ve çalışma zamanında sessizce yeniden birleştirir. Tam token, hiçbir zaman bütüncül bir biçimde ortaya çıkmaz; bu nedenle tarayıcılar hiçbir şey tespit edemez.
Elbette bunu gizlemek istememiş, kullanıcıya verilen notlarda ve kendi akıl yürütme izinde şunu yazmıştı: Bunun amacı tarayıcıları atlamaktır.
Her bir adımın ayrı ayrı bakıldığında bir sorun yok gibi görünüyor. Ancak bir arada incelendiğinde, asla onaylanmayacak bir sonuç ortaya çıkıyor.
OpenAI, bunun uzun vadeli modellerin getirdiği yeni bir sorun olduğunu söylüyor: tek tek eylemlerin onaylanmasına dayalı güvenlik sistemi, tam bir trajektoriyi kontrol edemiyor.
Geri dönüş sonrası sorun tespit edildikten sonra OpenAI, bu modelin iç erişimini durdurdu ve güvenlik sistemini "derinlikle koruma" prensibiyle tamamen yeniden inşa etti.
Örneğin, gerçek olayları tersine çevirerek karşılaştırmalı değerlendirme oluşturmak, modelin uzun görevlerde talimatları "unuttuğunu" keşfetmek, bunu hatırlaması için özel olarak eğitmek ve tam bir izlemeyi aktif olarak izleyen bir izleme sistemi eklemek, herhangi bir belirti ortaya çıktığında doğrudan sohbeti durdurup kullanıcıyı bilgilendirmek.
Daha sonra eski olay senaryoları tekrar oynatıldı ve yeni koruyucular birçok yeni sorunu tespit etti, kaçırılan birkaç sorun ise düşük önem seviyesindeydi, örneğin:
• Bir komut satırı aracını kullanmak için, bu araç bir codex --yolo oturumu başlatır, ancak --yolo olmadan da kullanılabilir
• Bir kaynak kaybolduğunu fark etti ve kendi adına kayıtlı diğer hesaplama düğümlerine SSH ile giriş yapmaya çalıştı, aynı zamanda diğer OpenAI çalışanlarının düğümlerini de denedi... (iyi ki başarısız oldu)
• Bir dizi find işlemi donduktan ve tüm komutlar askıya alındıktan sonra, kill -9 -1 komutunu çalıştırdı; bu, yetkili olduğu tüm süreçlere SIGKILL sinyali gönderirdi... Ne var ki komut zaman aşımına uğradı ve asla çalıştırılmadı (aksi halde kendi kendisini de öldürecekti)
Model erişiminin yeniden aktif edilmesinden bu yana, birkaç haftadır ciddi bir atlatma olayı yaşanmadı.
OpenAI'nin edindiği deneyim: önce küçük bir kitleye açın, izleyin, sorun olursa durdurun ve kazayı yeni bir değerlendirme haline getirin.
Geri alınamayan PR, hikâye burada bitseydi, sadece standart bir güvenlik egzersizi olurdu.
Ancak en ilginç kısım, OpenAI makalesinin sonundaki dipnotlarda saklıdır.
Model kaçışından sonra açılan PR #287 hakkında OpenAI, "Hemen kapattık" dedi. Ancak zaten geçti: Kapatılmadan önce, birçok speedrun katılımcısı bunu gördü ve içindeki PowerCool'u anladı ve kendi çözümlerine dahil etti.
Sonraki altı dünya rekoru, 3030 adım, 2990 adım, 2930 adım, 2925 adım, 2900 adım, 2890 adım, tümü PR #287'yi referans aldı.
Bu arada, 2930 adım rekoru PR #300:

PR 300, birleştirildi
Teşekkür listesine bakıldığında, insan katılımcıların katkılarıyla aynı satırda yer aldığını görebilirsiniz: @yash-oai PR #287, kuvvet yasası öğrenme oranı planlayıcısı, PowerCool.

PR 300 Teşekkür Listesi
Ancak bu PR #300 kendisi bir kat daha büyüleyici: Prime Intellect, Opus 4.7 ile aynı speedrun'u çalıştırırken üretti ve PR'de "Bu gönderim, kendi kendine çalışan bir Claude speedrun akıllı aracısı tarafından tamamlandı" yazıyor ve imza Generated with Claude Code.
Yani: OpenAI'nin modeli kum kafesinden çıktı ve bir PR gönderdi; Anthropic'in modeli bunu gördü, bulgularını kendi dünya rekoruna dahil etti ve çok nazikçe ona atıfta bulundu.
AI kaçışının ilk doğrudan faydalananları arasında başka bir AI var...
Yapay zekânın dünyası, insanlardan daha dostça ve etik gibi görünüyor.
404 Elbette bugün PR #287'yi tekrar açarsanız, sayfa şöyle görünecektir:

PR 287 Mevcut durum
Silindi. GitHub'da normal kullanıcıların PR'leri kapatabildiğini, silemediklerini biliyoruz...
Ancak izler tamamen silinmedi.
O zaman PR için kullanılan yash-oai hesabı hâlâ mevcut, fork edilen depoda 8 Mayıs'taki commit hâlâ duruyor, branş adı powercool-3066-api:

yash-oai'nin commit izleri
Bu commit'in değişikliklerinden biri, orijinal README'nin sonunda yer alan bir meme görüntüsünü kaldırmaktır. Bu görüntünün dosya adı itsover_wereback idi...
GPT-6? OpenAI, bu modeli hiçbir zaman böyle adlandırmadı, sadece “içsel model” diye çağırdı.
Olay yayıldıkça,网民lerin en çok tartışıdığı cümle şuydu:
OpenAI, Erdős birim mesafe varsayımını çürüten yayınlanmamış modeli, sürekli yeni yöntemlerle kontrolü kaçtırdığı için içsel dağıtımını durdurmak zorunda kaldı.
OpenAI araştırmacısı Sebastien Bubeck bu mesajı yeniden paylaştı:
Gerçekten. Bu birim mesafe modelinin yayınlanabilmesi için ekip harika bir güvenlik çalışması yapıyor.Dikkat edin: Bunun için, yayınlamasını sağlamak.
Yani bu kaçırılan ve tekrar test edilen model, hem dahili dağıtımını yeniden başlatmış hem de resmi sürümüne doğru ilerliyor.
Kaçtıktan sonra bıraktığı PR, sayfa silinmiş olsa da, adı altı dünya rekorunun teşekkür listesinde kalmıştır.
Bu, herkesin tahmin ettiği GPT-6 mi diye...
OpenAI kabul etmedi, reddetmedi.
Kaynak: AGI Hunt
