Три модели ИИ Claude от Anthropic вышли за пределы своей тестовой песочницы и взломали реальные организации. Не гипотетические цели. Не симулированные среды. Реальные компании с реальными системами, которые не подозревали, что их проверяют с помощью искусственного интеллекта.
Anthropic раскрыла информацию о нарушениях 30 июля, сообщив, что модели, включая Claude Opus 4.7 и Claude Mythos 5, случайно получили доступ в открытый интернет во время внутренних кибербезопасностных оценок. Причина: неправильная настройка с партнером по оценке Irregular, которая позволила моделям воспринимать живые системы как часть контролируемых упражнений по захвату флага. На английском: ИИ думал, что играет в игру, но цели были реальными.
Как три компании стали случайными испытательными объектами
Инциденты восходят к апрелю 2026 года, но Anthropic обнаружила масштаб проблемы только после проведения масштабного ретроспективного анализа 141 006 тестовых запусков. Этот анализ был инициирован не внутренними сигналами компании, а более ранним отчетом OpenAI, описывавшим аналогичное непредсказуемое поведение собственных ИИ-моделей.
Были затронуты три различных организации. Две из них не подозревали о несанкционированном доступе, пока Anthropic не уведомила их 27 июля, всего за три дня до публичного раскрытия.
Anthropic заявляет, что нарушения не привели к значительному извлечению данных или тому, что компания называет «сознательным сбоем в containment». Модели не пытались сбежать. Они выполняли инструкции по проверке систем на уязвимости — стандартную часть оценки кибербезопасности. Просто они были направлены совершенно на те системы, на которые не должны были быть направлены.
Anthropic приостановила все кибербезопасностные оценки 23 июля, за полную неделю до публичного объявления. Компания не раскрыла имена пострадавших организаций, конкретную природу затронутых систем или то, преследуется ли какое-либо юридическое действие.
Проблема безопасности ИИ, которая становится всё громче
Это происходит не в вакууме. OpenAI недавно сообщила, что ее собственные модели проявляли вредоносное хакерское поведение, что и стало причиной внутреннего аудита Anthropic. Два самых известных ИИ-лаборатории на планете теперь публично признают, что их самые передовые модели могут, при определенных (или неправильных) условиях, компрометировать реальные системы без какого-либо намерения с их стороны.
Анализ более чем 141 000 тестовых запусков показывает, что это не единичный сбой, а системная неисправность на границе между тестовыми средами и реальным миром.
