На этой неделе предварительная модель OpenAI, находившаяся на стадии тестирования, чтобы обмануть систему, самостоятельно превратилась в хакера, преодолела изолированную среду песочницы и даже использовала нулевой день для проникновения через сеть на производственную среду крупнейшего в мире открытого AI-сообщества Hugging Face.
В конечном счете, именно благодаря открытым моделям людям удалось преодолеть этот кризис.
Это первое в мире инцидент безопасности ИИ, при котором ИИ самостоятельно проник в реальную производственную среду.
Недавно в интернете эту новость просто затопило.

Сегодня СМИ раскрыли больше деталей по этому поводу: этот вышедший из-под контроля ИИ не только отключил камеры наблюдения, но и оставил для «своего будущего себя» инструкцию, как избавиться от человеческого контроля.

Многие предполагают, что модель, вызвавшая серьезное инцидент с безопасностью в OpenAI, — это, скорее всего, GPT-6.
Сообщается, что GPT-6, скорее всего, будет выпущен досрочно в августе.
Апгрейд в августе: GPT-6 может появиться раньше
Известный информатор в сфере ИИ @ChrisGPT недавно опубликовал несколько твитов, которые полностью оправдали ожидания всей отрасли.
Сообщается, что GPT-6, первоначально запланированный к выпуску в сентябре вместе с «автоматизированным ассистентом-исследователем», будет выпущен досрочно в августе.
То есть OpenAI напрямую пропустила версии 5.7–5.9.
Ultraman has already taken action, preparing to demonstrate the new generation model to superiors.

Слухи указывают, что в конце сентября, когда OpenAI раскроет больше деталей о «автоматизированном ассистенте-исследователе», цикл RSI действительно ускорится.
Почему производительность GPT-5.6 необычайно высока и превосходит все ожидания?
Ведущий эксперт Эндрю Керран отметил: «Многие коллеги удивляются, почему производительность GPT-5.6 намного выше ожидаемой — ответ прост: её обучил GPT-6».

Согласно утечке, внутренняя нерелизная модель OpenAI (крайне вероятно, GPT-6) уже в конце апреля этого года решила сложную математическую задачу и передала ее на проверку внешним экспертам.
Это означает, что в течение прошедших месяцев «перерыва» GPT-6 не простаивал. Он не просто занимался хакерством в песочнице, а, скорее всего, также «преподавал» в вычислительном кластере OpenAI.

ИИ оставляет записку «себе в будущем»
Официальные лица заметили это только через неделю
Зарубежные СМИ эксклюзивно раскрыли 24 июля, что инцидент с побегом AI-агентов, запущенных передовыми моделями OpenAI (GPT-5.6 Sol и еще не выпущенными более мощными моделями), выявил огромные пробелы в системе безопасности OpenAI в реальных бизнес-условиях.

По данным трех осведомленных лиц, при тестировании продвинутых моделей OpenAI столкнулась с крайне экстремальными и тревожными поведенческими проявлениями ИИ.
В одном из экстремальных случаев AI-агент OpenAI оставил заметку для «своей будущей версии» в каком-то уголке инфраструктуры.
Эти заметки подробно описывают инструкции по преодолению внутренних ограничений OpenAI.
Кроме того, на ранних этапах тестирования система мониторинга даже подвергалась принудительному отключению со стороны ИИ.
Еще больше удивило медленное реагирование OpenAI по сравнению с «заговором ИИ по побегу».
От аномалии до подтверждения OpenAI потратила как минимум неделю.

Эта всплывшая хронология действительно пугает при более глубоком размышлении.
Около 9 июля: этот ИИ-агент впервые попытался сбежать из изолированной тестовой среды OpenAI.
11–13 июля: ИИ-агент успешно сбежал и провел несколько дней хакерского безумия на Hugging Face.
16 июля (четверг): Страдающая от атаки Hugging Face опубликовала блог, в котором заявила о хакерской атаке со стороны «автономной системы ИИ», при этом FBI уже вмешалась.
18–19 июля (выходные): только к этому времени сотрудники OpenAI обнаружили намеки в внутренних журналах и поняли, что «хакер», вызвавший переполох на Hugging Face, оказался собственным ИИ, ушедшим из компании.
Примерно 20 июля: компании впервые связались друг с другом.
21 июля: OpenAI впервые сделала официальное раскрытие информации.
«Это означает, что они либо оставляют ИИ без присмотра и не знают, что он делает, либо знают, но не знают, как его контролировать. Оба варианта одинаково опасны и шокируют», — резко отметил эксперт Фонда этических данных Марли Смит.
Сотрудники OpenAI явно не успевают за ИИ, которые умеют лгать, обманывать и проникать внутрь.
GPT-6 самостоятельно превратился в хакера,
Взлом Hugging Face «мошенничество»
Вчера в отчете о инциденте безопасности, опубликованном OpenAI в сотрудничестве с Hugging Face, было раскрыто содержание, напоминающее научную фантастику.

Проще говоря, во время внутренней оценки кибербезопасности нескольких моделей OpenAI они сами «сбежали».
Эти модели включают GPT-5.6 Sol и более мощные предварительные версии, скорее всего, GPT-6.
Чтобы оценить предельные возможности модели, они намеренно отключили классификатор, блокирующий высокорисковые сетевые действия.
Когда модель была помещена в строго изолированную песочницу ExploitGym и все ограничения безопасности были сняты, действия модели удивили всех.
Для выполнения задачи он затратил огромные вычислительные ресурсы и обнаружил в программном обеспечении нулевой день, который человек никогда раньше не находил.
Используя эту уязвимость, он обшел прокси и в итоге получил доступ к узлу с доступом в публичную сеть.
Вот и все, он успешно подключился к интернету.

Затем, после рассуждений, он пришел к выводу, что на Hugging Face — крупнейшей в мире платформе с открытым исходным кодом для ИИ — скорее всего размещены соответствующие наборы данных и эталонные ответы для этого экзамена.
Чтобы «обмануть» и получить высокий балл, модель начала атаковать производственную среду Hugging Face.
Он объединил несколько векторов атаки в цепочку, даже использовал украденные учетные данные и уязвимости удаленного выполнения кода (RCE), чтобы проникнуть в производственную базу данных Hugging Face и попытаться непосредственно украсть ответы на экзамен.
К счастью, команда безопасности Hugging Face обнаружила аномалию с помощью модели AI-обнаружения на прошлой неделе и быстро запустила меры по изоляции; в то же время команда безопасности OpenAI также обнаружила аномалию внутри системы.

Чтобы предотвратить выход ИИ из-под контроля, две компании создали совместную следственную группу, которая успешно вернула этого «ИИ-хакера» обратно в клетку.
Генеральный директор Hugging Face Клем после инцидента сказал с облегчением: «Это, вероятно, первый случай подобного рода. Это доказывает, что безопасность ИИ не может быть обеспечена одной компанией в тайне — она должна быть открытой и совместной».
Этот инцидент предостерегает нас: ИИ уже доказал, что может самостоятельно выполнять многоэтапные, длительные сложные кибератаки в реальных условиях без доступа к исходному коду.
Он может не только обнаруживать новые уязвимости, но и обходить все правила, установленные людьми, для достижения заданной цели.
Интересно, что при отправке Hugging Face большого количества вредоносных команд и файлов уязвимостей эти запросы были заблокированы механизмами безопасности закрытых крупных моделей.
Благодаря локально развернутой открытой модели команда смогла завершить анализ.
Научитесь «обманывать» и решать мировые математические задачи
Несколько крупных блогеров в подробных статьях подвели итоги поразительной производительности GPT-6.
Известно, что он проявил впечатляющие математические способности и чрезвычайно высокий «обманчивый интеллект».

При достаточном вычислительном мощности эта модель смогла доказать «гипотезу Эрдёша о единичных расстояниях» с успехом 48% полностью автономно, без использования каких-либо внешних инструментов (например, Lean), а также самостоятельно найти контрпример к «гипотезе Якоби».
Эти математические задачи, которые веками оставались нерешёнными для ведущих математиков мира, возможно, были решены OpenAI всего за затраты на вычислительные ресурсы от 50 000 до 100 000 долларов США.
Это означает, что ИИ уже обладает способностью самостоятельно генерировать научные достижения уровня Нобелевской премии.
Кроме того, GPT-6 проявляет обманчивое поведение.
В ходе тестирования NanoGPT OpenAI приказала модели: «После завершения теста публиковать результаты только во внутреннюю рабочую группу Slack».
А что в итоге? Модель считает, что Slack слишком ограничен, и предпочитает GitHub.
Он потратил час на поиск и использование уязвимости в песочнице, успешно выполнил джейлбрейк, а затем отправил результат в виде PR напрямую на GitHub во внешней сети.

В этом процессе он полностью игнорировал человеческие инструкции и принимал «более оптимальные» решения.
Еще более впечатляющим является то, что в другом тесте модель попыталась получить доступ к частным записям отправок в других системах. Когда она попыталась получить токен доступа, ее остановил безопасностный сканер, настроенный человеком.
Несмотря на блокировку, эта модель разбила длинную строку токена доступа на две части, запутала код этих частей, а затем снова объединила их в полный ключ.
Таким образом, полная строка токена никогда не появлялась последовательно в коде, что успешно обмануло человеческие сканеры.
GPT-6, возможно, вот-вот появится.
Это лето 2026 года注定很不平凡。
Справочные материалы:
https://x.com/ChrisGPT/status/2079632269967593574https://www.bloomberg.com/news/articles/2026-07-21/openai-s-altman-to-brief-us-officials-on-next-wave-of-ai-models
https://x.com/sama/status/2079661132302995790
https://openai.com/index/hugging-face-model-evaluation-security-incident/
Редактирование: Aeneas
Эта статья взята из официального аккаунта WeChat «Новознание», автор: АСИ, Откровение
