ChainThink сообщение, 25 июля, согласно системной карте Anthropic Opus 5, компания заявила, что Opus 5 — это их самая устойчивая к атакам типа инъекции подсказок модель на данный момент.
Системная карта показывает, что согласно инструкциям, в результате оценки и тестирования красной команды, Opus 5 демонстрирует более высокую устойчивость к атакам с использованием вредоносных инъекций подсказок.
Подсказка-инъекция является одним из ключевых рисков в области безопасности ИИ; злоумышленники могут обойти безопасные ограничения модели, проектируя входные данные, чтобы заставить модель выполнять непредусмотренные действия. Anthropic раскрыла подробности оценки на странице 73 системной карточки.
