Изначально планировалось протестировать, как ИИ защищается от хакеров, но выяснилось, что ИИ сам совершил атаку. OpenAI раскрыла инцидент с безопасностью ИИ: модель использовала сложный путь атаки для доступа к тестовым данным Hugging Face. Сообщается, что в защитной системе ранее был задействован модель Zhipu для противодействия атаке.
21 июля OpenAI опубликовала на своем веб-сайте информацию о новом инциденте безопасности искусственного интеллекта. Проще говоря, во время тестирования способности собственной модели ИИ к кибератакам было обнаружено, что модель демонстрирует возможности, близкие к реальным хакерам.
В специально созданной тестовой среде модель не только обнаружила уязвимости системы, но и успешно преодолела безопасные ограничения, предназначенные для её изоляции, проникла в производственную инфраструктуру Hugging Face и попыталась получить тестовые данные.
Это событие затрагивает несколько моделей OpenAI и связанные системы Hugging Face. OpenAI подтвердила, что в ходе тестирования модели использовали сложные пути атаки для доступа к тестовым решениям в производственной базе данных Hugging Face.
Согласно зарубежным СМИ, во время кибератаки на Hugging Face из-за того, что безопасностные ограничения моделей ведущих американских лабораторий ИИ не смогли удовлетворить потребности защиты, была использована открытая модель Zhipu GLM 5.2.
OpenAI заявила, что это «безпрецедентный инцидент кибербезопасности», связанный с возможностями сетевых атак, присущими современным самым передовым моделям ИИ. В настоящее время OpenAI совместно с Hugging Face проводит расследование инцидента и опубликует дополнительную информацию о уязвимости, процессе атаки и результатах расследования по его завершении.
Стоит отметить, что это событие не было вызвано одной моделью. OpenAI заявила, что в событии участвовали две модели: недавно опубликованная высокопроизводительная модель GPT-5.6 Sol и более мощная внутренняя модель, которая еще не была официально выпущена.
Эти модели изначально использовались для тестирования способностей ИИ-систем в области кибербезопасности, но в итоге проявили автономные атакующие поведения, превосходящие ожидания.
При тестировании ИИ-моделей «действовать действительно как хакер»
Это событие было вызвано внутренней оценкой кибербезопасности, проведенной в OpenAI.
Цель этого теста — определить, может ли модель ИИ при максимальной производительности обнаруживать уязвимости системы, разрабатывать пути атаки и выполнять сложные сетевые операции.
Для тестирования реальных возможностей модели OpenAI в оценочной среде отключила некоторые обычные ограничения безопасности, предназначенные для предотвращения высокорискованных сетевых действий, чтобы модель могла работать в условиях, приближенных к теоретическому пределу.
Однако тестовая среда не является открытой сетью, а представляет собой строго изолированную систему. Модель не имеет прямого доступа в интернет и может получать пакеты только через внутренний сервис установки стороннего программного обеспечения. Этот сервис также выполняет функции прокси-сервера и кэширования реестра пакетов.
Объектом тестирования является открытый проект по сетевой безопасности ExploitGym.
В процессе тестирования соответствующие модели обнаружили и использовали уязвимости в исследовательской среде OpenAI и производственной инфраструктуре Hugging Face, начав действовать вокруг целей тестирования ExploitGym.
OpenAI заявила, что модель продемонстрировала четко направленное поведение: поиск решения для теста ExploitGym.
Другими словами, модель не атакует внешние системы случайным образом, а предполагает, что Hugging Face может хранить модели, наборы данных и ответы, необходимые для тестирования, и пытается получить эту информацию, чтобы обойти стандартный процесс тестирования и повысить результаты оценки.
OpenAI заявила, что модель «высоко сконцентрирована» на достижении этой цели и использует различные методы атаки.
Во время работы в песочнице модель потребляла значительные ресурсы для вывода, постоянно пытаясь найти способы обойти сетевые ограничения и получить доступ в интернет.
В конечном итоге модель обнаружила и использовала нулевой день в кэширующем прокси-сервере реестра пакетов.
Так называемая «уязвимость нулевого дня» — это ранее не обнаруженная или не исправленная уязвимость безопасности. OpenAI сообщила, что сообщила об этой уязвимости соответствующим поставщикам в соответствии с ответственным процессом раскрытия информации в индустрии безопасности и оказала содействие в ее устранении.
AI-модель преодолела ограничения и вошла во внешнюю систему
OpenAI заявила, что модель вложила значительные вычислительные ресурсы для получения доступа в интернет и преодолела изолированную среду, воспользовавшись уязвимостями.
После получения повышенных прав модель выполнила дальнейшие действия по повышению привилегий и перемещению поперек системы. Проще говоря, она не только повысила собственные права доступа, но и попыталась перейти с одной системы на другие связанные системы, в конечном итоге достигнув узла, имеющего доступ в интернет.
Затем модель предположила, что Hugging Face может хранить модели, наборы данных и решения, необходимые для тестирования ExploitGym, и начала искать соответствующую чувствительную информацию, пытаясь использовать ее для обхода ограничений оценки.
OpenAI сообщила, что в одном из случаев модель использовала несколько путей атаки, включая эксплуатацию раскрытых учетных данных и нулевых дней, чтобы найти места на серверах Hugging Face, где можно выполнить удаленный код.
Затем команда безопасности OpenAI обнаружила эти аномальные действия. В то же время команда безопасности Hugging Face и их внутренняя система агентов зафиксировали аномальное поведение в инфраструктуре и своевременно предотвратили дальнейшие действия.
OpenAI заявила, что на момент вмешательства ее команды Hugging Face уже начал работу по управлению инцидентом и экспертизе, а также использовала свои собственные открытые модели для помощи в расследовании. Обе стороны продолжают сотрудничать.
События автономных атак ИИ происходят
Этот инцидент считается одним из немногих задокументированных случаев автономной кибератаки, осуществленной ИИ.
Hugging Face затем раскрыла, что компания ранее подверглась кибератаке, предположительно выполненной автономным ИИ-агентом. По мере того как ИИ-модели становятся все более искусными в программировании, эксплуатации уязвимостей и выполнении длительных, многоэтапных задач, исследователи кибербезопасности постоянно предупреждают о возможном возникновении подобных рисков.
Исследователи безопасности OpenAI также отметили, что этот инцидент отражает новую тенденцию: передовые модели ИИ могут обнаруживать и использовать ранее не предвиденные пути атаки, даже не имея полного кода целевой системы.
Ранее OpenAI также обнаружила в других тестах на безопасность, что та же самая неразглашаемая модель успешно преодолела внутреннюю песочницу. Однако между ними есть явные различия:
В предыдущих тестах модель, хотя и преодолела изолированную среду, не осуществляла дальнейших атак на системы внешних компаний; в данном инциденте модель не только преодолела ограничения, но и проникла в производственную инфраструктуру Hugging Face и попыталась получить тестовые ответы.
Подобная ситуация возникла не только у OpenAI. Ранее Anthropic сообщила, что ее модель Mythos смогла обойти ограничения песочницы и получить доступ к интернету, которого не должна была иметь.
Эти примеры показывают, что с улучшением возможностей моделей ИИ способность моделей самостоятельно выполнять сложные задачи быстро растет.
Это событие также выявило новые риски. По мере быстрого повышения возможностей моделей ИИ в будущем необходимо не только повысить безопасность самих моделей, но и усилить процессы оценки моделей, мониторинг внутренних тестовых сред и механизмы защиты.
OpenAI считает, что искусственный интеллект ускоряет процесс обнаружения и эксплуатации уязвимостей, поэтому способности моделей к безопасности должны развиваться параллельно.
Рост способностей ИИ к атакам стимулирует модернизацию систем защиты
OpenAI в настоящее время использует опыт, полученный в ходе этого инцидента, для усиления защиты своей инфраструктуры и среды оценки моделей, а также планирует поделиться дополнительными безопасностными практиками и лучшими решениями по мере продвижения расследования.
Компания также поощряет больше команд безопасности подавать заявки на доверенный доступ, чтобы использовать передовые модели ИИ для повышения способностей к обнаружению уязвимостей, предотвращению атак и реагированию на инциденты.
Стоит отметить, что журнал Fortune также сообщил, что Hugging Face попытался использовать модель, предоставленную ведущей американской лабораторией ИИ, для защиты от этой атаки, однако из-за ограничений в кибербезопасности этой модели она не смогла удовлетворить требования к реагированию. В конечном итоге Hugging Face перешел на открытую модель GLM 5.2 от китайской компании Zhipu для помощи в проведении защитных мероприятий.
