ChainThink, le 25 juillet, selon la carte système Anthropic Opus 5, l'entreprise affirme que Opus 5 est son modèle le plus résistant aux attaques par injection de prompts à ce jour.
Le système affiche que, selon les instructions, les résultats de l'évaluation et des tests de red teaming montrent qu'Opus 5 présente une meilleure résistance aux injections de prompts malveillants.
L'injection de prompt est l'un des risques centraux dans le domaine de la sécurité de l'IA ; les attaquants peuvent concevoir des entrées pour contourner les restrictions de sécurité du modèle et induire le modèle à exécuter des comportements non prévus. Anthropic a divulgué les détails de l'évaluation correspondante à la page 73 de la carte système.
