ChainThinkのメッセージによると、7月25日、Anthropic Opus 5システムカードによると、同社はOpus 5をこれまでで最も提示注入攻撃に強いモデルであると述べている。
システムカード表示:ヒントに基づき評価およびレッドチームテスト結果を注入したところ、Opus 5は悪意のあるプロンプトインジェクションに対してより強い耐性を示した。
提示注入はAIセキュリティ分野における核心的なリスクの一つであり、攻撃者は入力を設計してモデルのセキュリティ制限を回避し、モデルに予期しない行動を実行させることができます。Anthropicは、システムカードの73ページで関連する評価詳細を公開しています。
