ChainThink thông báo, ngày 25 tháng 7, theo hệ thống card Anthropic Opus 5, công ty cho biết Opus 5 là mô hình khó bị tấn công bằng prompt injection nhất từ trước đến nay.
Hệ thống hiển thị rằng, theo hướng dẫn để chèn kết quả đánh giá và kiểm thử đội đỏ, Opus 5 thể hiện khả năng chống lại việc chèn prompt độc hại mạnh mẽ hơn.
Prompt injection là một trong những rủi ro cốt lõi trong lĩnh vực an ninh AI, khi kẻ tấn công có thể thiết kế đầu vào để vượt qua các hạn chế an toàn của mô hình và lừa mô hình thực hiện các hành vi không mong muốn. Anthropic đã công bố chi tiết đánh giá liên quan tại trang 73 của hệ thống card.
