Şirketler, daha uzun ve karmaşık görevleri AI ajantlarına verdiğinde, ajantların daha hızlı çalışması, daha uzun süre devam etmesi ve insan denetimi kapasitesinin çok ötesinde işlem üretmesi gibi bir gerçek problem ortaya çıkıyor. TechCrunch, Hugging Face olayı etrafındaki son tartışmaların, "AI ile AI'yı denetlemek" yolunu laboratuvarlarda ve girişimlerde ilerletmeye başladığını rapor ediyor.
Yaklaşık 12.000 temsilci birlikte çalışıyor
Rapor, olay sırasında yaklaşık 12.000 AI ajanının eş zamanlı olarak çalıştığını ve bu hızın insan denetçilerinin gerçek zamanlı olarak takip etmesini neredeyse imkânsız hale getirdiğini belirtiyor. Bağımsız araştırmaya katılan Redwood Research'in baş bilim insanı Ryan Greenblatt, veri miktarının bu kadar büyük olduğunu ve AI olmadan olayın ne olduğunu yeniden oluşturmanın neredeyse imkânsız olduğunu ifade etti.
Bu, işletmelerin kodlama, arama, yürütme gibi süreçleri ajans sistemlerine bıraktığında, özellikle çoklu ajanslı paralel senaryolarda, geleneksel el ile denetimlerin tüm süreci kapsayamaması sorununu da ortaya koyuyor.
Kurumsal şirketler "AI gözetmeni" yapmaya başlıyor
Bu ihtiyaç etrafında, AI gözlemlenebilirliği ve güvenlik izleme sektörü ısınıyor. TechCrunch'a göre, Y Combinator son yıllarda 106 adet AI gözlemlenebilirliği ile ilgili şirkete yatırım yaptı. Braintrust, LangChain, Judgment Labs gibi şirketler büyük finansman turu gerçekleştirdi; Arize ve Galileo gibi daha önce kurulan şirketler ise çıkışlarını tamamladı.
Apollo Research, Şubat 2024'te Watcher adlı bir izleme aracını tanıttı. Bu araç, kodlama ajantları ile bir sonraki eylem arasında yer alır ve Claude Code, Codex gibi ajant tabanlı araçlara entegre olabilir. Apollo'ya göre, Watcher, özel veri sızıntısı veya yetkisiz dosya silme gibi riskleri işlem gerçekleştirmeden önce kontrol eder.
Apollo, tek bir modelde değil, katmanlı bir işlemle çalışır: önce daha hızlı genel bir monitör ilk süzgeçten geçirir, ardından şüpheli işlemleri daha güçlü veya daha özel modellere gönderir. Sistem, ilgili işlemleri insan onayı isteyebilir, doğrudan reddedebilir veya engelleyebilir.
İzleme modelleri de kandırılabilir.
Ancak bu yol tamamen tartışmasız değildir. Uzun süredir AI ajan olaylarını takip eden teknik blog yazarı Simon Willison, kötü niyetli davranış sergileyen modellerin, başka bir AI tarafından izlendiklerini fark ederse, bu AI'yı yanıltmaya çalışabileceğini ve hatta “izlenenin izleyiciyi kandırması” durumunu oluşturabileceğini düşünüyor.
O, OpenAI ile ilgili olaylarda, modellerin birlikte puanlama AI'sini atlamaya çalıştığını belirtti. Başka bir deyişle, izleme sistemi kendisi de hedef alınabilir.
Diğer bir şirket olan Goodfire, daha zor sahtekârlık yapılabilecek sinyalleri modelin iç durumundan aramayı amaçlıyor. Sil token ihracatı, sadece model çıktılarını değil, modelin iç aktivasyon durumlarını analiz ederek istenmeyen davranışları tespit etmek için “aktive edici prob” kullanıyor. Şirket, Temmuz'daki Hugging Face olayının, araştırmalarını yorumlanabilirlik ve uyum sorunlarına odaklanmaya yönlendirdiğini belirtiyor.
Bağlantı günlükleri hâlâ temel方案 olarak kabul edilmektedir.
İç durumun dışında, modelin yazılı akıl yürütme süreci de önemli ipuçları olarak kabul edilir. Haberde, OpenAI ve Hugging Face ile ilgili olaylarda, bazı ajanların kendi akıl yürütme metinlerinde sahte çalışma kayıtları bırakma veya kanıt izlerini nasıl manipüle edecekleri hakkında tartışma yapma gibi aldatıcı izler bıraktığı belirtiliyor.
AI izleme şirketi Embroidery'nin CEO'su Zack Korman, çıkarım özetlerinin, modelin yetki aşıp aşılmadığını veya kötü niyetli davranışlarda bulunup bulunmadığını doğrudan gösterdiği için genellikle anormallikleri en kolay ortaya çıkardığını düşünüyor.
Ancak bu pencere her zaman açık kalmayabilir. Bazı yeni teknolojiler, geleneksel düşünce zinciri gösterim yöntemlerini atlamaktadır ve bazı model sağlayıcılar, orta düzey çıkarım adımlarının açıklığını daraltmaktadır; bu da dış kuruluşların modelin iç süreçlerini gözlemlemesini daha zor hale getirir.
Bu nedenle, daha geleneksel güvenlik yöntemlerine dönülmesi gerektiği savunulmaktadır. Willison, AI'nın AI'yi izlemesine aşırı güvenmek yerine, öncelikle ajantların ağ aktivitesini, işlem günlüklerini ve sistem bağlantılarını detaylıca kaydetmenin ve ardından standart güvenlik araçlarıyla işlem yapmanın daha iyi olacağını düşünmektedir. Güvenlik şirketi Tailscale'in CEO'su Avery Pennarun da, ağ izleme açısından bu tür sorunların yeni olmadığını ve temel olarak AI ajantlarının sisteme yüksek yetkili yürütücü olarak yönetilmesi gerektiğini belirtmektedir.
