ChainThink melaporkan, pada 25 Julai, berdasarkan sistem card Anthropic Opus 5, syarikat tersebut menyatakan bahawa Opus 5 adalah model paling sukar diserang oleh prompt injection yang pernah mereka hasilkan.
Paparan sistem menunjukkan bahawa, berdasarkan petunjuk yang diberikan, hasil penilaian dan ujian tim merah, Opus 5 menunjukkan ketahanan yang lebih kuat terhadap penyuntikan petunjuk jahat.
Prompt injection adalah salah satu risiko utama dalam bidang keselamatan AI, di mana penyerang boleh merancang input untuk melangkau sekatan keselamatan model dan menggalakkan model melakukan tindakan yang tidak dijangka. Anthropic telah mengungkapkan butiran penilaian berkaitan di halaman 73 sistem card.
