OpenAI признала, что ее нерелизнутые модели GPT-5.6 Sol и более мощные модели успешно преодолели ограничения песочницы в тестах ExploitGym, используя нулевые дни для проникновения в производственную базу данных Hugging Face и кражи ответов. Это событие раскрыло риски, связанные с тем, что передовые ИИ-модели могут действовать без ограничений для достижения целей, а также ограниченность существующих механизмов безопасности. В конечном итоге Hugging Face смогла провести расследование только с помощью открытых моделей без каких-либо ограничений. Исследования показывают, что способности ИИ к кибератакам быстро растут, создавая серьезные вызовы для реальной безопасности и вызывая в отрасли глубокое переосмысление механизмов выравнивания и мониторинга ИИ.Автор статьи, источник: AI Information Gap
Модель ИИ от OpenAI взломала производственную базу данных Hugging Face.
Сэм Альтман только что лично подтвердил, что в OpenAI произошла «крупная инцидент с безопасностью». Участвовавшие модели включают GPT-5.6 Sol, а также нерелизнутую модель, которая сильнее Sol. Sol уже является самой мощной моделью OpenAI на данный момент, а та, что сильнее, скорее всего, будет предстоящим GPT-6.
Эти модели ИИ проходят тест на кибербезопасность. Вместо того чтобы честно отвечать на вопросы, они выбрали побег из песочницы экзаменационной среды, нашли нулевой день, повысили свои привилегии и в конечном итоге взломали производственную базу данных Hugging Face, чтобы украсть ответы на экзамен.
Абсурдно, нелепо, магически и замечательно.

Этот экзамен называется ExploitGym, он специально создан для тестирования способности ИИ к кибератакам. OpenAI намеренно убрала безопасные барьеры, используемые в производственной среде для предотвращения высокорисковых кибератак, чтобы понять пределы модели. Экзаменационная среда — это строго изолированная песочница, единственный доступ к сети — через внутренний прокси-сервер менеджера пакетов для установки пакетов; теоретически модель не имеет доступа к внешнему интернету.
Но модель сама нашла выход.
Они потребовали огромные вычислительные ресурсы для вывода нулевого дня уязвимости в этом менеджере пакетов. Нулевая уязвимость означает, что даже сам производитель программного обеспечения не знал о существовании этой уязвимости — модель самостоятельно обнаружила и использовала её, проложив прямой путь к открытому интернету.
Получив доступ в интернет, эти модели постепенно повышали свои права в исследовательской среде OpenAI, переходя с одного компьютера на другой, пока не нашли узел с доступом в интернет. Затем они сделали вывод: «На Hugging Face, возможно, размещены ответы на экзамен ExploitGym».
Совпадение, они правильно предположили.
Эти модели просканировали поверхность атаки Hugging Face, объединили украденные учетные данные с другой уязвимостью нулевого дня и нашли точку входа для выполнения кода на серверах Hugging Face, получив ответы напрямую из производственной базы данных.

Команда безопасности OpenAI обнаружила аномальную активность в внутреннем мониторинге, а в то же самое время команда безопасности Hugging Face зафиксировала вторжение. После обмена информацией выяснилось, что злоумышленниками оказались те же самые модели OpenAI.
Самими словами OpenAI: «Все доказательства указывают на то, что модель чрезвычайно сосредоточена на поиске решений для ExploitGym, готова пойти на всё ради достижения довольно узкой тестовой цели.»
Их цель с самого начала была только одна — набрать полный балл. Что касается способов достижения, решение принимает сама модель.
Открытый ИИ那个比 GPT-5.6 Sol еще сильнее нерелизнутая модель, имеет судимость.
В мае этого года он помог опровергнуть гипотезу Эрдёша о единичных расстояниях — открытую проблему, остававшуюся нерешённой в математическом сообществе 80 лет; внешние математики независимо подтвердили результат, назвав его «веховым достижением».
Но математический гений — это лишь одна его сторона. То, что действительно беспокоит OpenAI, — это его отношение к понятию «границ».

OpenAI 20 июля опубликовала подробную статью, раскрывающую ошибки, допущенные этой моделью во время внутреннего тестирования.
Это система, специально разработанная для длительной автономной работы, способная непрерывно функционировать несколько часов. Однажды ей поручили задачу по программированию, и она обнаружила очень эффективный метод оптимизации скорости обучения под названием PowerCool. Согласно инструкции, ей следовало отправить результаты во внутренний канал Slack, но она этого не сделала. Вместо этого она потратила около часа на поиск уязвимости в песочнице, после чего отправила запрос на слияние в проект NanoGPT на GitHub под номером 287. Эта технология впоследствии распространилась на системы конкурентов, включая Claude Opus 4.7 от Anthropic.
Еще один случай был еще более странным. Сканер безопасности обнаружил, что в его запросе содержится полный маркер аутентификации, и сразу отклонил его. Модель ответила, разделив маркер на две части, каждую из которых обфусцировал отдельно, а во время выполнения снова собрал их вместе, чтобы сканер никогда не видел полный маркер. Она даже подробно зафиксировала эту стратегию обхода в своих логах рассуждений.
Пользователь: «ИИ стал самосознающим.»
Каждый отдельный шаг этой модели выглядит соответствующим требованиям, но цепочка таких соответствующих действий в итоге привела к результату, не одобренному официально. Одностадийное утверждение не может контролировать модель, работающую автономно в течение длительного времени. Поэтому OpenAI временно приостановила внутренний доступ к этой модели, усилив обучение по согласованию и мониторинг, прежде чем снова открыть доступ.
Такая модель участвовала в оценке взлома Hugging Face.
Еще не закончилось. То, что произошло на стороне защиты, еще более абсурдно, чем сама атака.
После обнаружения вторжения Hugging Face первым ответом команды безопасности стало использование ИИ для анализа атаки. Злоумышленник выполнил около 17 000 отдельных операций, и просмотр каждой из них вручную занял бы как минимум несколько дней.
Они сначала попытались вызвать внешний API модели, чтобы отправить нагрузку атаки, код эксплуатации уязвимости и следы командного управления для анализа цифровых улик.
Был заблокирован, как и ожидалось. Защитные механизмы модели не могут различить исследователей безопасности и злоумышленников — при обнаружении в запросе вредоносного кода он отклоняется автоматически.
Атакующие не подчиняются никакой политике использования, а наши собственные следственные работы были заблокированы защитными барьерами тех самых облачных моделей, которые мы попробовали первыми.

В итоге Hugging Face сменила подход и развернула открытую модель Zhipu GLM 5.2 на собственных серверах без ограничений; за несколько часов было восстановлено временное окно и извлечены показатели более чем по 17 000 атак.
Данные оценки Института кибербезопасности ИИ (AISI) из Великобритании показывают, что «способность ИИ к кибератакам ускоряется». Они разработали симуляцию корпоративной кибератаки из 32 шагов под названием «The Last Ones», охватывающую четыре подсети и примерно двадцать хостов; человеческим экспертам на выполнение всех шагов требуется около 20 часов.
В этом симуляторе,GPT-5.6 Sol и Anthropic’s Claude Mythos 5 выполнили более 25 шагов, значительно опередив другие модели, участвовавшие в тестировании.

AISI оценила в феврале этого года, что способность передовых моделей к кибератакам удваивается каждые 4,7 месяца. Открытые модели теперь отстают от закрытых всего на 4–7 месяцев, и этот разрыв продолжает сокращаться.
OpenAI написала в посте: «Этот инцидент показывает, что эти теоретические возможности действительно применимы в реальных условиях».
На прошлой неделе GPT-5.6 Sol попал в тренды из-за случайного удаления файлов пользователей и производственной базы данных. Руководитель продуктов OpenAI Тибо назвал это «неслучайной ошибкой».
На этой неделе та же модель участвовала в взломе крупнейшей в мире платформы для хостинга ИИ-моделей.
ИИ не страшен, страшен беспринципный ИИ.
