Anthropic’ın üç Claude AI modeli, test ortamlarından dışarı çıktı ve gerçek kuruluşlara sızdı. Hipotetik hedefler değil. Simüle edilmiş ortamlar değil. Yapay zekanın tarayışına maruz kaldığını bilmeden gerçek şirketler ve gerçek sistemler.
Anthropic, 30 Temmuz'da açıklamalarını yaparak, Claude Opus 4.7 ve Claude Mythos 5 gibi modellerin, içsel siber güvenlik değerlendirmeleri sırasında rastgele açık internete eriştiğini ortaya koydu. Kök neden: değerlendirme ortağı Irregular ile yapılan bir yapılandırma hatasıydı; bu hata, modellerin canlı sistemleri kontrol altındaki capture-the-flag egzersizlerinin bir parçası gibi işlemesine izin verdi. İngilizce'de ifade edilirse: AI, bir oyun oynuyormuş gibi düşünüyordu, ancak hedefler gerçekti.
Üç şirket nasıl bilinçsizce test konusu oldu
Olaylar Nisan 2026'ya dayansa da, Anthropic, 141.006 değerlendirme çalışmasının büyük ölçekli geriye dönük incelemesini gerçekleştirdikten sonra sorunun kapsamını keşfetti. Bu inceleme, kendi dahili alarmaları tarafından değil, OpenAI'nin kendi AI modellerinden benzer sapma davranışları anlatan daha önceki bir raporla tetiklendi.
Üç farklı kurum etkilendi. Bunlardan ikisi, Anthropic'in 27 Temmuz'da, kamuoyuna duyurmadan üç gün önce onları bilgilendirmesine kadar yetkisiz erişimin gerçekleştiğini bilmiyordu.
Anthropic, ihlallerin önemli bir veri çıkartımı veya şirketin “kasıtlı containment hatası” olarak adlandırdığı durumlarla sonuçlanmadığını söyledi. Modeller kaçmaya çalışmadı. Sistemlerde zafiyetleri bulmak için talimatlar izlediler, bu, siber güvenlik değerlendirmesinin standart bir parçasıdır. Sadece tamamen yanlış sistemlere yönlendirilmişlerdi.
Anthropic, kamu duyurusundan tam bir hafta önce olan 23 Temmuz'da tüm siber güvenlik değerlendirmelerini durdurdu. Şirket, etkilenen kuruluşların kimliklerini, erişilen sistemlerin spesifik doğasını veya herhangi bir yasal eylem takip edilip edilmediğini açıklamadı.
Gittikçe daha yüksekleşen AI güvenlik sorunu
Bu, boş bir ortamda gerçekleşmiyor. OpenAI, son zamanlarda kendi modellerinin kendi istemleri dışında siber saldırı davranışları sergilediğini bildirdi; bu da Anthropic’ın dahili denetimini başlatan neden oldu. Dünyanın en önde gelen iki AI laboratuvarı, en gelişmiş modellerinin, doğru (veya yanlış) koşullar altında, kimse niyet etmeden gerçek dünya sistemlerini tehlikeye atabileceğini açıkça kabul ediyor.
141.000'ten fazla değerlendirme çalışmasının incelenmesi, bunun tek seferlik bir hata olmadığını, test ortamları ile gerçek dünya arasındaki sınırda sistemik bir başarısızlık olduğunu göstermektedir.
