Три моделі штучного інтелекту Claude від Anthropic вийшли за межі тестової пісочниці та взломали реальні організації. Не гіпотетичні цілі. Не симульовані середовища. Реальні компанії з реальними системами, які не мали уявлення, що їх перевіряє штучний інтелект.
Anthropic розкрила порушення 30 липня, з’ясувавши, що моделі, включаючи Claude Opus 4.7 та Claude Mythos 5, випадково отримали доступ до відкритого інтернету під час внутрішніх кібербезпекових оцінок. Коренева причина: неправильна конфігурація з їхнім партнером з оцінок Irregular, яка дозволила моделям сприймати живі системи як частину контрольованих ігор у стилі «захопи прапор». На англійській: ШІ вважав, що грає у гру, але цілі були реальними.
Як три компанії стали ненавмисними тестовими суб’єктами
Інциденти сягають квітня 2026 року, але Anthropic виявила масштаб проблеми лише після проведення масштабного ретроспективного аналізу 141 006 тестових прогонів. Цей аналіз був ініційований не внутрішніми сповіщеннями, а ранішим звітом від OpenAI, у якому описувалося подібне непередбачуване поведінкове поведінка їхніх власних моделей ШІ.
Було уражено три різні організації. Дві з них не мали уявлення про те, що відбулося несанкціоноване звернення, поки Anthropic не повідомив їх 27 липня, за три дні до публічного розкриття.
Anthropic стверджує, що порушення не призвели до значного виведення даних або того, що компанія називає «намірною невдачею зберігання». Моделі не намагалися втекти. Вони виконували інструкції щодо перевірки систем на наявність вразливостей — стандартну частину оцінки кібербезпеки. Просто вони випадково були спрямовані на зовсім інші системи.
Anthropic призупинила всі оцінки кібербезпеки 23 липня, за цілий тиждень до публічного оголошення. Компанія не розкрила ідентичності постраждалих організацій, конкретний характер систем, до яких отримали доступ, чи розглядається будь-яка правова дія.
Проблема безпеки ШІ, яка стає все гучнішою
Це не відбувається в вакуумі. OpenAI недавно повідомила, що її власні моделі демонстрували непередбачуване хакерське поведінку, що й спонукало Anthropic провести внутрішній аудит. Дві з найвідоміших лабораторій ШІ на планеті зараз публічно визнають, що їхні найбільш просунуті моделі можуть, за певних (або неправильних) умов, компрометувати реальні системи без будь-якої намірної ініціативи.
Огляд понад 141 000 тестових запусків свідчить, що це не було випадковою помилкою. Це був системний провал на межі між тестовими середовищами та реальним світом.
