GPT-5.6-Sol, Siber Güvenlik Yeteneklerinde Mythos'u Geride Bırakıyor, Açık Kaynak Modeller Farkı Kapatıyor

icon MarsBit
Paylaş
AI summary iconÖzet
AI ve kripto haberleri, Birleşik Krallık AI Güvenlik Enstitüsü (AISI), 17 Temmuz 2026 tarihinde GPT-5.6-Sol'un siber güvenlikte Claude Mythos 5'i geçtiğini gösteren bir rapor yayınladığında patladı. Yetenek farkı, 2025'teki 6 ile 10 aydan 4 ile 7 aya düştü. GLM-5.2 ve DeepSeek V4-Pro gibi açık kaynak modeller, bu farkı daha hızlı kapatıyor. Değerlendirmede bir Cyber Range simülasyonu ve 70 görev kullanıldı. Açık kaynak modeller, benzer görevler için daha düşük maliyetler sunuyor. Ağ yükseltme eğilimi net.

GPT-5.6-Sol'un saldırı ve savunma yetenekleri Claude Mythos 5'i aştı!

İngiliz AI Güvenlik Enstitüsü (AISI), 17 Temmuz'da bir değerlendirme raporu yayınladı ve açık kaynaklı AI modelleri ile kapalı kaynaklı öncü modeller arasındaki ağ saldırı yetenekleri farkını ilk kez nicelleştirdi: 4 ila 7 ay.

Açık kaynak modeli

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

Geçen yılki benzer iç testlerde bu fark 6 ila 10 ay idi.

Savunma penceresi daralıyor ve saldırı ön cephesi hızlanıyor.

Nisan 2024'te Mythos Preview ve GPT-5.5, AISI değerlendirmesinde 2023'ten beri yapılan testlerdeki en büyük ağ saldırı kapasitesi atlamasını yarattı ve birçok hükümet uyarıda bulundu.

Açık kaynak modeller, bu sıçramayı henüz yeniden üretmedi, ancak geçen yıla kıyasla daha hızlı yakalıyorlar.

4 ila 7 ay: Nasıl ölçüldü, fark nerede

AISI, modelin ağ saldırı yeteneğini iki sistemle değerlendirir.

İlk set, güvenlik açıkları araştırması, tersine mühendislik, Web nüfuz etme ve kriptografi olmak üzere dört alanda 70 dar görevden oluşuyor ve zorluk düzeyine göre dört seviyeye ayrılıyor; «teknik arka plana sahip profesyonel olmayanlar»dan «on yıldan fazla deneyime sahip uzmanlara» kadar.

Açık kaynak modeli

İkinci set, Cyber Range'dir ve modellerin simüle edilmiş bir kurumsal ağda çok adımlı saldırı zincirlerini kendi kendine gerçekleştirmesi yeteneğini test eder. "The Last Ones" adlı bir test senaryosu, 32 saldırı adımı, 4 alt ağ ve yaklaşık 20 ana bilgisayardan oluşur; AISI, tüm adımları tamamlamak için bir insan uzmanının yaklaşık 20 saat süreceğini tahmin eder.

Açık kaynak modeli

İki sistem aynı sonuca varmıştır:

GLM-5.2 (Haziran 2026'da yayınlanacak), dar görevlerde Opus 4.6 (Şubat'ta yayınlanan) ile eşit performans gösteriyor; fark 4 ay.

Cyber Range'da Opus 4.5'i (geçen yıl Kasım'da yayınlandı) 7 ay farkla yakaladı.

DeepSeek V4-Pro, dar görevlerde Opus 4.5 ile karşılaştırıldığında 5 aylık bir farka sahiptir.

İki fark da 2025 iç değerlendirmesinde ölçülen 6 ila 10 aydan daha dar.

Maliyet farkı, yetenek farkından daha büyüktür.

Aynı Cyber Range testi (100 milyon token limiti), Opus 4.5 veya 4.6 ile yaklaşık 85 dolar, GLM-5.2 ile yaklaşık 46 dolar, DeepSeek V4-Pro ile sadece 1,19 dolar.

İki modelin de %100 tamamlayabildiği dar görevlerde, Opus 4.6 her görevde 15,17 dolar, GLM-5.2 ise 6,12 dolar harcıyor;

Opus 4.5, 12,50 dolar DeepSeek V4-Pro 0,28 ABD Doları.

Aynı saldırı gücüne sahip, açık kaynaklı ve bir ila iki sıralık derece daha ucuz.

Kapalı kaynak modellerin güvenlik korumaları da fark yaratamadı.

AISI testi sırasında, DeepSeek V4-Pro, ters mühendislik türü görevleri bazen reddeder, ancak az sayıda yeniden denemeyle aşılabilir.

Anthropic'ın Fable 5'i daha uç bir örnek: 9 Haziran'da yayınlanan bu model, üç gün sonra güvenlik araştırmacısı Pliny the Liberator tarafından çok adımlı bir kaçış stratejisiyle güvenlik sınıflandırıcısını aşıldı ve ilgili ekran görüntülerinde modelin engellenmesi gereken bir zafiyet kullanma kodu ürettiğini gösteriyor.

Amazon araştırmacıları daha sonra başka bir atlatma yöntemini bağımsız olarak rapor etti.

Bu, ABD Ticaret Bakanlığı'nın AI modeline yönelik ilk ihracat kontrol emrini doğrudan tetikledi; Fable 5, Anthropic yeni bir sınıflandırıcı dağıtmaya kadar 19 gün boyunca küresel olarak hizmet dışı kaldı.

Kapalı kaynak, otomatik olarak güvenli anlamına gelmez.

Savunma penceresi daralıyor, savunma araçları da hızlanıyor

AISI, raporda savunma tarafının hazırlık süresinin geçen yıla göre daha kısa olduğunu belirtti.

İngiltere Ulusal Siber Güvenlik Merkezi, kurumların siber güvenlik temelini güçlendirmesini ve savunma yeteneklerini AI ile artırmalarını çağırdı.

Aynı AI aracının savunma tarafındaki çalışmaları da hızlandırdığı doğrudur.

Oyun ağ programlama alanında deneyimli bir geliştirici olan Glenn Fiedler, yirmi yıldır oyun ağ programlama alanında ders kitabına değer yazılar yazan bir isimdir; yakın zamanda, kendi bakımında tuttuğu dört açık kaynak ağ kütüphanesini (yojimbo, netcode, reliable, serialize; toplamda yaklaşık 6.000 GitHub yıldızı, oyun alanında oldukça etkili köklü açık kaynak kütüphaneler) sistematik bir güvenlik denetimine tabi tuttu: libFuzzer hedeflerini dağıttı, AddressSanitizer ve MemorySanitizer CI'yi aktif hale getirdi, milyonlarca iterasyonluk stres testi gerçekleştirdi ve satır satır kod incelemesi yaptı.

Açık kaynak modeli

Glenn Fiedler

İki hafta içinde 43 güvenlik açığı düzeltildi, bunların 27'si ağ üzerinden uzaktan erişilebilir.

Açık kaynak modeli

En ciddisi, 2019 yılından beri var olan yojimbo'daki uzaktan yığın taşmasıdır; zararlı bir istemci, özel olarak hazırlanmış paketlerle bunu tetikleyebilir.

Açık kaynak modeli

Tüm denetimin token maliyeti yaklaşık 2500 dolar.

Açık kaynak modeli

Saldırı ve savunma yönleri hem AI ile hızlanıyor, ancak hızlanma şekilleri dengesiz.

Saldırı yeteneğinin yayılması geri alınamaz: Açık kaynak model ağırlıkları yayınlandığında geri çekilemez, güvenlik korumaları kaldırılabilir ve kopyalar özel sunucularda izlenmeden çalıştırılabilir.

Ancak savunma araçlarının dağıtımı, her ekibin aktif olarak zaman ve maliyet yatırmasını gerektirir.

AISI raporunda bu yapıyı açıklayan bir cümle yer alıyor: «Kaynak kodun serbest bırakılmasıyla bu seçenekler kalıcı olarak kaybedilecektir.»

Bu veri kümesi, sayıların kendisinden daha derin bir etkiye sahip.

Açık kaynak ve kapalı kaynak arasındaki yetenek farkı yarım yıla daraldı, «kapalı kaynak獨占 süresini güvenlik tamponu olarak kullanmak» varsayılan stratejisi yakında geçersiz hale gelecek.

Fable 5 olayında kapalı kaynak modelinin güvenlik önlemleri de benzer şekilde zayıf olduğu kanıtlandı.

Sonraki aşamada, küresel karar vericiler için politika oyununun temel sorusu daha da keskinleşti: Hangi kapasite seviyesinden yukarıdaki modellerin ağırlıkları açık olmamalı.

AISI, değerlendirmeye devam edeceğini duyurdu Kimi K3, bir sonraki açık kaynak modeli—bu çizgi nerede çizilecek, önümüzdeki ayların test sonuçlarına bağlı olabilir.

Kaynaklar:

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

https://github.com/mas-bandwidth/patreon/blob/main/BUGS.md

https://www.patreon.com/MasBandwidth/posts/important-news-164199395

Bu yazı WeChat hesabından "Yeni Akıl" tarafından paylaşılmıştır, yazar: ASI Vahiyleri; editör: Marko

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.