ChainThink mensaje, 25 de julio, según la tarjeta del sistema Anthropic Opus 5, la empresa afirma que Opus 5 es su modelo más resistente hasta la fecha a los ataques de inyección de indicaciones.
La evaluación del sistema muestra que, según las indicaciones, al inyectar resultados de evaluación y pruebas de red team, Opus 5 demuestra una mayor resistencia frente a la inyección de prompts maliciosos.
La inyección de indicaciones es uno de los riesgos centrales en el campo de la seguridad de la IA; los atacantes pueden diseñar entradas para eludir las restricciones de seguridad del modelo e inducirlo a realizar comportamientos no previstos. Anthropic ha revelado los detalles de la evaluación correspondiente en la página 73 de la tarjeta del sistema.
