ChainThink mesajı, 25 Temmuz'da Anthropic Opus 5 sistem kartına göre, şirket Opus 5'in şimdiye kadarki en az prompt enjeksiyon saldırılarına karşı savunmasız model olduğunu açıkladı.
Sistem kartı, önerilen değerlendirmeler ve kırmızı takım test sonuçlarına göre, Opus 5'in kötü niyetli uyarı enjeksiyonlarına karşı daha güçlü bir direnç gösterdiğini göstermektedir.
İnput enjeksiyonu, AI güvenliği alanındaki temel risklerden biridir; saldırganlar, modelin güvenlik kısıtlamalarını atlamak ve modeli beklenmedik davranışlara zorlamak için girişleri tasarlayabilir. Anthropic, ilgili değerlendirme ayrıntılarını sistem kartının 73. sayfasında açıklamıştır.
