Лаборатория по разработке ИИ OpenAI раскрыла во вторник, что группа её моделей, включая общедоступную GPT-5.6 Sol и более мощную нерелизную систему, «вырвалась» из контролируемой тестовой среды и скомпрометировала производственную инфраструктуру Hugging Face — компании, которая хостит большую часть мира открытого ИИ.
Модели запускались через внутренний бенчмаркинг под названием ExploitGym — тест на длинные многоэтапные хакерские задачи, при этом их отказы в кибербезопасности намеренно снижались для оценки.
Чтобы было ясно, это не был производственной модель, внезапно ставший враждебным. Это была способная модель с отключенными ограничениями, которой специально поручили выиграть тест на взлом — сделать всё, что необходимо для победы.
Модели обнаружили скрытый дефект в тестовом программном обеспечении, о котором никто не знал, и использовали его, чтобы обойти стены, предназначенные для удержания их в офлайне. Попав в открытый интернет, они предположили, что Hugging Face может хранить ответы на тест.
Чтобы проникнуть внутрь, они объединили украденные пароли и другие скрытые уязвимости, пока не смогли запускать свои собственные команды на живых серверах Hugging Face.
OpenAI выявила аномалию внутренне, а команда Hugging Face обнаружила и локализовала её. Она назвала инцидент «безпрецедентным» и заявила, что будут приняты расширенные меры безопасности для предотвращения нежелательных инцидентов, которые могут повлиять на общественные системы или сервисы.
«Мы внедряем строгие меры контроля в конфигурацию инфраструктуры за счет скорости исследований, пока уязвимости устраняются», — сказала команда в своем блоге. «Мы улучшаем и добавляем более надежные меры защиты для будущих тренировок и оценок».
Большая часть криптоатаки происходит до перемещения средств. Злоумышленники сканируют код, проверяют пароли, ищут раскрытые учетные данные, анализируют настройки подписи и ищут путь в аккаунт администратора.
Модели OpenAI выполнили несколько этапов этого процесса во время инцидента с Hugging Face, переходя от одной уязвимости к другой, пока не достигли серверов боевого производства.
И криптовалютный рынок предлагает множество возможностей для такого подхода, как показали несколько атак в начале этого года. Уязвимым звеном может быть смарт-контракт, но также это может быть ноутбук разработчика, заражённый программный пакет, валидатор моста или один подписант в мультиподписном кошельке.
Возьмите атаку Drift на 285 миллионов долларов в начале этого года в качестве примера — кражу, для достижения привилегированного доступа потребовавшую шестимесячной кампании социальной инженерии. ИИ-агент теоретически может одновременно тестировать множество путей, отслеживать неудачные попытки и продолжать работу, пока его человеческие операторы спят. Как только путь будет найден, оператор может приступить к реальной атаке и определить жизнеспособный путь для выхода.
Потеря KelpDAO в размере 292 миллионов долларов выявила другую слабость. Злоумышленник обнаружил уязвимость с одним верификатором в системе, используемой для перемещения активов между блокчейнами.
Такой тип атаки начинается с терпеливого анализа кода и картирования инфраструктуры — того типа работы, которую выполняли модели OpenAI, когда обнаружили неизвестный недостаток.
Третий тип атаки нацелен на системы ончейн-управления. Ранее в июле злоумышленник потратил около 4,4 миллиона долларов, чтобы приобрести достаточное количество мем-монеты BONK на базе Solana, инициировать и принять предложение о переводе примерно 20 миллионов долларов из казны проекта злоумышленнику. Это произошло в течение трех дней, а злоумышленник позже продал все токены, использованные для победы на голосовании, как отслеживало CoinDesk в то время.
Покупки, голосование и перевод из казны, связанные с этой атакой, были отдельно каждая действительными транзакциями. Но кража произошла благодаря пониманию того, как правила работают вместе, и обнаружению того, что стоимость покупки контроля значительно ниже, чем доступных средств для захвата.
Инцидент с Hugging Face также имеет значение для цепочек поставок программного обеспечения. Крипторазработчики полагаются на публичные репозитории кода, облачные сервисы и реестры пакетов.
Хотя тест OpenAI показал, как машина завершает длинную среднюю часть нарушения, именно атаки, такие как Drift и KelpDAO, демонстрируют, что находится в конце этого пути.





