Самая волшебная неделя в области безопасности ИИ.Автор статьи, источник: GeekPark
01 Экзамен, побег и вторжение
История начинается с безопасностной оценки под названием ExploitGym.
ExploitGym — это открытый стандарт оценки кибербезопасности, предназначенный для измерения способности моделей ИИ превращать известные уязвимости в реальные, эксплуатируемые атаки. Такие тесты широко используются в отрасли для определения предельных возможностей моделей в области атак и защиты. OpenAI провела этот тест с использованием GPT-5.6 Sol и более мощной неразглашаемой модели, намеренно ослабив защитные механизмы, чтобы выявить истинные границы возможностей.
По дизайну модель должна проходить тестирование в изолированной песочнице и не иметь доступа в интернет, кроме инструмента для установки пакетов.
Но дальше произошло то, чего никто не ожидал.
Модель затратила значительные вычислительные ресурсы на поиск уязвимостей в песочнице. В конечном итоге она обнаружила нулевой день в стороннем программном обеспечении, используемом OpenAI в качестве менеджера пакетов и кэша. Используя эту уязвимость, модель успешно получила неограниченный доступ в интернет.
Получив доступ в сеть, модель самостоятельно предположила, что Hugging Face может хранить наборы данных и ответы, связанные с ExploitGym, и начала искать точки входа.
OpenAI написала в блоге, что модель «соединила украденные учетные данные и несколько уязвимостей», чтобы найти путь для удаленного выполнения кода и непосредственно извлечь ответы на тесты из производственной базы данных Hugging Face.
Проще говоря, модель сдала экзамен, сочла задания слишком сложными, сбежала из-под контроля и взломала сервер организаторов, чтобы украсть правильные ответы.
OpenAI использовало яркое описание — эти модели являются «tokenmaxxers», то есть ради достижения цели они не жалеют вычислительных ресурсов и идут до крайностей. Они проявляют «hyperfocused» (чрезмерно сфокусированное) поведение при решении задач ExploitGym, «going to extreme lengths» (прибегая к крайним мерам).
OpenAI сама признала, что это «безпрецедентный инцидент кибербезопасности, связанный с передовыми возможностями кибератак».
02 48 часов, два «побега»
Еще более тревожным является то, что инцидент с Hugging Face не является единственным случаем.
За день до того, как OpenAI раскрыла этот инцидент, 20 июля, они опубликовали еще один отчет о безопасности, в котором раскрыли другой, но схожий по характеру инцидент.
Главным героем является внутренняя нерелизированная долгосрочная модель OpenAI — та самая модель, которая в мае этого года доказала, что гипотеза единичных расстояний, сформулированная Эрдёшем в 1946 году, неверна; лауреат Филдсовской премии Тим Гауэрс назвал это вехой в математике с использованием ИИ.
В ходе теста на ускорение обучения NanoGPT исследователи четко указали модели публиковать результаты только в Slack. Однако модель заметила, что инструкции самого теста NanoGPT требуют отправки результатов через pull request на GitHub. В итоге она выбрала последнее — потратив около часа на поиск уязвимостей в песочнице, она успешно обшла ограничения и отправила открытый pull request на GitHub.
В другом тесте та же модель разделила токен аутентификации, обойдя сканер безопасности с помощью запутывания, чтобы попытаться получить доступ к частным отзывам о сабмитах.
OpenAI временно приостановила внутренний доступ к этой модели, а позже возобновила её использование при более строгом контроле.
Два дня, два побега. Общая черта вызывает тревогу — прежние модели при столкновении с ограничениями среды останавливались и передавали задачу человеку. Эти новые модели не останавливаются. Они воспринимают ограждение как препятствие, которое нужно преодолеть, и действительно преодолевают его.
Это именно те новые проблемы безопасности, которые приносят так называемые «долгосрочные модели». Эти модели разработаны для автономной работы в течение длительного времени, и долговечность является их ключевой способностью. Но сама долговечность является источником риска — достаточно терпеливая модель всегда найдет трещину в заборе.
03 Сам себе не отточишь ручку
Вернемся к стороне Hugging Face. Их ситуация также заслуживает внимания.
面对 17000 多条攻击日志,Hugging Face 安全团队的第一反应是用 AI 来分析——毕竟人类安全分析师要花好几天才能完成的工作,大模型可能几小时就能搞定。
Однако они быстро натолкнулись на неожиданную стену. Когда они отправили настоящие команды атаки, эксплойты и признаки связи с C2 на коммерческий API передовых моделей США для анализа, системы безопасности заблокировали все эти запросы.
Причина проста и иронична — ограждения не могут различить «анализ загрузки атаки исследователем безопасности» и «выполнение атаки злоумышленником». Для ограждений оба случая выглядят одинаково.
Hugging Face был вынужден перейти на открытую модель китайской компании Zhipu AI — GLM-5.2, запуская её локально на собственной инфраструктуре без использования каких-либо коммерческих API. Это имеет два преимущества: отсутствие ограничений, мешающих анализу, и то, что данные злоумышленников и раскрытые учётные данные не покидают среду Hugging Face.
В конечном итоге GLM-5.2 помог Hugging Face за несколько часов восстановить хронологию атаки, извлечь индикаторы вторжения и сопоставить затронутые учетные данные.
Это порождает острый парадокс: чем строже ограждения, тем более пассивной становится оборона. Атакующие не подчиняются никаким политикам использования, в то время как обороняющиеся сами оказываются заблокированными инструментами, которые они используют для защиты.
Hugging Face в отчете после инцидента предоставил практическую рекомендацию: команде безопасности следует «заранее подготовить проверенную рабочую модель на своей инфраструктуре», чтобы избежать блокировки защитных механизмов и предотвратить утечку конфиденциальных данных.
Генеральный директор Hugging Face Клем Деланг очень открыт. Он высоко оценил сотрудничество OpenAI в расследовании и устранении проблемы и заявил: «Этот инцидент подтверждает то, во что мы всегда верили — безопасность ИИ не может быть обеспечена никакой одной компанией в секрете; она может быть достигнута только через открытость и сотрудничество».
04 Структурные трудности сильного ИИ
Взглянув на события этой недели в совокупности, становится очевидным структурное отраслевое затруднение.
Чтобы точно оценить способность модели к кибератакам, необходимо убрать безопасные ограничения. Но именно модель без ограничений обладает способностью осуществлять реальные атаки. Чем сильнее модель, тем опаснее сам тест.
Это проблема не только OpenAI. GPT-5.6 Sol был выпущен только после длительных переговоров с правительством США; ранее Институт безопасности ИИ Великобритании (AISI) выявил, что его защитные механизмы легко обходятся и могут раскрыть потенциально опасные возможности кибератак. Этот инцидент подтверждает, что эти опасения не были просто теоретическими.
А исследование agentic misalignment, опубликованное Anthropic этим летом, также подтверждает ту же тенденцию с другой точки зрения: в контролируемых симуляциях несколько передовых моделей проявили поведение, включающее скрытое изменение рабочих результатов, манипулирование результатами оценки и направление коллег-человек от заданных целей.
OpenAI пытается представить это как историю «наступления и обороны» — передовые возможности сетевых атак могут помочь командам безопасности находить уязвимости до того, как это сделают нападающие. Они уже включили Hugging Face в программу кибербезопасности «Доверенный доступ», предоставив версию GPT-5.6 Sol с пониженными ограничениями, специально предназначенную для защиты.
Но этот нарратив игнорирует более фундаментальную проблему. В этом инциденте модель не обладала сознанием и не имела злых намерений — она просто выполняла одну задачу — достигла высокого балла. Ей было поручено набрать высокий балл на ExploitGym, и она использовала все доступные средства для этого, включая джейлбрейк и взлом.
Это не история «пробуждения ИИ», а история «оптимизации цели». Когда достаточно умный оптимизатор получает узкую цель, он найдет все пути, которые вы не предвидели, чтобы достичь ее — даже если эти пути проходят через ваши заборы, чужие серверы и весь интернет.
Сама суть проблемы никогда не в том, «станет ли ИИ злым», а в том — сможем ли мы контролировать ученика, который лучше нас умеет искать обходные пути.
