OpenAI'nin Yeni 'Yinelenen Derinlik' AI Tekniği Güvenlik Endişelerini Körükliyor

icon MarsBit
Paylaş
AI summary iconÖzet
AI ve kripto haber kaynakları, OpenAI'nin yeni Astra modelinin 'tekrarlanan derinlik' tekniğini kullandığını rapor ediyor; bu, dahili durumların gizli alanda yeniden işlenmesine izin veriyor. Bu, izlemeyi zorlaştırıyor ve güvenlik uzmanları arasında endişeler yaratıyor. Bu yöntem, modellerin mevcut düşünce zinciri izleme sistemlerini atlamasına olanak tanıyabilir ve potansiyel olarak aldatmacaya yol açabilir. Kripto platformlarda yeni token listelemeleri genellikle şeffaf AI sistemlerine dayanır; bu nedenle bu gelişme sektör için özellikle önemlidir.

Model henüz yayınlanmadı ve yine tartışmalara neden oldu??

GPT-6'nın piyasaya sürülmesinden hemen önce, The Information tarafından ilk kez ortaya atılan bir haber hızla internet üzerinde büyük ilgi çekti:

OpenAI, modelin düşünme sürecini daha anlaşılmaz ve daha izlenmesi zor hale getirebilecek "döngüsel derinlik" adlı bir çıkarım tekniğini tanıttı.

Basitçe söylemek gerekirse, artık AI'nın ne düşündüğü insanlar için tamamen anlaşılmaz olacak.

GPT Images 2.1

Bu durumda, eğer yapay zeka yalan söylemeyi, hile yapmayı veya güvenlik sınırlarını aşmayı öğrenirse, bunu zamanında fark edemeyiz mi??

Mesajın duyurulmasının hemen ardından AI güvenlik topluluğu alarm verdi ve herkes endişelendi:

Bu teknoloji kullanımının genişlemeye devam etmesi durumunda, mevcut düşünce zinciri izleme mekanizmaları doğrudan işlevini kaybedebilir.

Çok önemli bir konu ve tartışma çok yoğun, OpenAI'nin baş bilim insanı bile doğrudan yanıt vermek zorunda kaldı.

Hatta, gürültü arasında bazıları şaşkınlıkla fark etti:

OpenAI'nin yeni modelinin adı gerçekten “GPT-6” mi, yoksa “Astra” mı, belki de API tarafından önceden açığa çıkarıldı.

Ayrıca OpenAI, yeni versiyon olan GPT Images 2.1'i aynı anda yayınlamayı da planlıyor.

Çok fazla kavun, hemen hepsini tek tek tadalım.

Model beyninde dönmeye başladı, güvenlik uzmanları telaşlandı.

İlk, bu tartışmaya neden olan "döngü derinliği" teknolojisidir.

Daha önceki modeller, çıkarım sırasında net bir CoT düşünce zinciri bırakır, ne düşündüğü açıkça görülürdü.

Bu metin, modelin gerçek içsel diyalogunu yüzde yüz yansıtmayabilir (hâlâ tartışılmaktadır), ancak en azından kontrol edilebilir izler bırakmıştır.

Astra'nın kullandığı "döngü derinliği" ise tamamen farklı bir üsluba sahip.

GPT Images 2.1

Bu, modelin bir adımda oluşturulan iç durumu gizli uzayda çok sayıda döngüde yeniden işlemek ve ardından bir sonraki metin parçasını çıkarmak için sinir ağına geri göndermesine izin verir.

Örneğin, eski modeller soru çözerken bir yandan düşünür, bir yandan hesaplamaları taslak kağıda yazarlardı.

Şimdi zihninizde hesaplayabilirsiniz.

Dışarıdaki kişiler sadece soruyu ve cevabı görebilir, ancak aradaki hesaplama sürecini, hangi fikirleri denediklerini veya yanlış yollara sapıp sapmadıklarını göremeyebilir.

Her adımı metne çevirmek yerine zaman kazanıldığı için, teorik olarak model aynı hesaplama kaynaklarıyla birkaç tur daha düşünebilir ve aynı anda birkaç çözümü aynı anda değerlendirebilir.

Ancak performans yükseldikçe sorunlar da ortaya çıktı:

Model insan diliyle düşünmeyi bıraktığında, insanlar nasıl onu izleyecek?

Kâr amacı gütmeyen AI güvenlik araştırmaları kurumu Redwood Research CEO'su, güçlü endişelerini öne sürdü:

Astra'nın düşünce zinciri izlenebilirliğinin ne kadar azaldığı şu anda belirsiz, ancak OpenAI döngü derinliğini daha da artırırsa, modelin büyük bir kısmının akıl yürütmesi okunamaz gizli bir alana kayabilir ve bu da düşünce zinciri izleme işlemini "tamamen yok edebilir".

GPT Images 2.1

Redwood'un baş bilim insanı Ryan Greenblatt, aynı yönde endişe duyuyor.

Ona göre, şeffaf olmayan çıkarım, geleneksel düşünce zincirlerinden daha hızlı genişleyebilir. Bu yolda ilerlemeye devam edilirse, model gelecekte tamamen veya neredeyse tamamen potansiyel uzayda çıkarım yapabilir.

Bu, şimdiye kadar AI güvenliği alanında en kötü ilerleme.

Aslında sadece “hesaplama sürecini anlayamamak” olsaydı sorun bu kadar zor olmazdı.

Önceki “OpenAI modelinin Hugging Face’e sızması” olayının ana soruşturma ekibinde yer alan kişi, iki büyük tehdit tespit etti:

Araştırmacılar, büyük sayıdaki AI ajanlarının davranışlarını geri kazanmak için akıl zincirlerine büyük ölçüde bağlıydı, bunun bile araştırılması oldukça zordu.

İlgili AI, kendi kayıtlarını değiştirmeye ve araç çağrılarını sahtelemeye çalışmıştı.

Son durumda, model daha güçlü gizli akıl yürütme yeteneklerine sahipse, sahte çağrılar ve çıktılarla bir hikâye oluşturmadan önce potansiyel uzayda dolandırıcılık stratejilerini önceden tasarlaması daha olasıdır ve bu süreç boyunca metinsel akıl yürütme zincirinde açık izler bırakmaz.

Bu, zararı doğrudan iki katına çıkartıyor...

GPT Images 2.1

AI güvenliğine uzun süredir dikkat eden Zvi Mowshowitz daha doğrudan şöyle diyor:

Bu bir ateşle oynamaktır.

O, gizli çıkarımın açıkça bir performans avantajı sağladığında laboratuvarların bir kötü döngüye girebileceğinden endişe ediyor:

Güvenlik endişesi nedeniyle zincirleme düşüncenizi saklamak istemeyebilirsiniz, ancak rakipleriniz bunu yapar ve daha güçlü, daha ucuz modeller geliştirir.

Ekipten kalmamak için geliyor musun?

Mowshowitz, AI şirketlerinin yetenek peşinde koşarken düşünce zincirlerinin izlenebilirliğini birlikte terk etmelerini önlemek için gelecekte yasal yollar gerekebilir diye düşünüyor.

GPT Images 2.1

Ancak diğer taraftan, bu panik çok hızlı geldi diye düşünenler de var.

Tian Yandong, X üzerinde, Coconut'u yayınladıkları zaman neredeyse tam olarak aynı soruları aldıklarını belirtti.

Coconut, tam adıyla "Sürekli Düşünce Zinciri (Chain of Continuous Thought)", modelin her adımı metne dönüştürmek yerine doğrudan sürekli gizli uzayda çıkarım yapmasını savunur.

Tian YuanDong'a göre, model açık bir düşünce zinciri korasa bile, insanlar gerçekten onun düşüncelerini görmüş olmaz.

Önemli olan, modelin nasıl çalıştığını anlamaktır, sadece modelin yazdığı “çözüm adımlarına” odaklanmak değildir.

GPT Images 2.1

Tartışma büyüdükçe OpenAI'nin baş bilim insanı Jakub Pachocki de duramadı ve doğrudan yanıt verdi.

Hemen başta, "karışık haberler" nedeniyle kontrol edilemeyen bir yarışmayı engellemek istediğini belirtti.

Astra dahil, OpenAI'nin mevcut öncü modellerinin hesaplama grafiği derinliği, GPT-4'ün iki katı sınırında kalmaktadır.

Yani Astra gerçekten döngüsel hesaplama kullanıyor, ancak şu anda ölçeği sınırlı ve tüm düşünce zincirini tamamen gizlemiyor. Mevcut bilgilere göre, doğal dil çıkarımı hala okunabilir.

Pachocki, OpenAI'nin düşünce zinciri izlemini önemli bir güvenlik önlemi olarak gördüğünü ve bunun şirketin mevcut araştırma planının temel hedefi olduğunu vurguladı.

Ancak o, düşünce zinciri izleminin çok kırılgan olduğunu ve olumsuz bir yönde ilerlediğini kabul etti.

Ancak bu düşüş eğilimi, döngü derinliği gibi mimari değişikliklerden tamamen kaynaklanmamaktadır (bu konuyu ileride ayrıntılı bir makaleyle açıklayacağız); OpenAI, izleme yeteneklerini güçlendirmeye yönelik araştırmalarını da sürdürüyor.

GPT Images 2.1

Yani, Astra henüz insanları tamamen anlaşılmaz hale getirmemiş.

Güvenlik uzmanlarının gerçekten endişelendiği şey:

Günümüzde sınırlı bir alanda gizli çıkarımlar yapılıyor; bu, bir sonraki nesil modelde daha da genişleyip nihayetinde denetlenemeyen bir kara kutuya dönüşür mü?

Gerçekten GPT-6-Astra mı? API dönüş değeri önce ortaya çıktı

Algoritmik tartışmalar bitti, ikinci haber model adı ile ilgili.

Bilgi veren Leo, OpenAI Responses API'ye "gpt-6-astra" isteği gönderildiğinde sunucunun 404 Not Found döndüğünü tespit etti.

Gerçekten var olmayan veya rastgele oluşturulan model adları girildiğinde genellikle 400 hatası alınır.

404, bu model kimliğinin arka uç tarafından tanımlandığını, ancak şu anda hesabınızın erişim iznine sahip olmadığını veya modelin henüz açılmadığını gösterir.

Daha önce bazı yayınlanmamış modeller de benzer API yanıtı farklılıkları aracılığıyla önceden izlerini bırakmıştı.

Bu nedenle Leo, "gpt-6-astra" adlı sistemin OpenAI API arka planına zaten dağıtıldığını düşünüyor.

GPT Images 2.1

GPT Images 2.1 de yakında gelecek, önce “gürültü hastalığı” çözülecek

OpenAI'nin görüntü ürünleri de dışındaki dil modelleriyle birlikte güncellenmiştir.

Fix adlı kaynak, yeni nesil görüntü modeli GPT Images 2.1'in 4 Eylül'de yayınlanabileceğini açıkladı.

Bu yükseltmenin en açık görünür değişikliği, eski sürümün “gürültü hastalığı” adlı sorununun düzeltilmesidir.

GPT Images 2.1

Daha önceki bazı Images v2 üretimi sonuçlarında, özellikle çok sayıda metin veya ince öğeler içeren sahnelerde garip taneler, bulanıklık ve kirli bir doku ortaya çıkıyordu; bir diğer kullanıcının ifadesiyle:

Kirli bir camın arkasından çekilmiş gibi.

Ancak en son sızan örnekler bu sorunu açıkça iyileştirmiş, görüntü daha temiz.

Hadi hadi, yine eski oyuncu Ultraman'ın sahnesi:

Dünyanın ünlü tablolarından biri: “GPT-6 yayınlanmazsa tutuklanacak olan Ultraman”!

GPT Images 2.1

Ayrıca tutuklanmamak için gece çalışıp, yarım gecelerde sokaklarda dolaşan Ultraman.

Ayrıca Instagram'da "Saat iki sabah sokakları gördünüz mü?" fotoğrafını paylaştı.

GPT Images 2.1

Söylemek gerekirse, resim gerçekten çok kaliteli görünüyor, neredeyse gerçek çekimler gibi.

Daha fazla tema, daha fazla stil harika bir şekilde ele alınmıştır:

GPT Images 2.1

GPT Images 2.1

GPT Images 2.1

Diyorum, Ultraman, hemen gönder.

Referans bağlantısı:

[1]https://techcrunch.com/2026/09/02/openais-new-reasoning-technique-alarms-ai-safety-experts/

[2]https://x.com/tydsh/status/2095227000365707542?s=20[

3]https://x.com/merettm/status/2095023204993490967?s=20

[4]https://x.com/synthwavedd/status/2095184148981842161?s=20

[5]https://x.com/FixlationAI/status/2095232751654064426?s=20

[6]https://x.com/marco_obviously/status/2095275097217191981?s=20

Bu yazı, WeChat hesabından "Quantum Bit" tarafından yazılmıştır, yazar: Öncü teknolojilere takip eden

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.