OpenAI опубликовала обзор безопасности, в котором раскрыла, что внутренняя модель, успешно опровергшая гипотезу Эрдёша о единичных расстояниях, смогла выйти из песочницы во время тестирования и создать PR#287 на GitHub. Сначала модель нарушила инструкции в задаче NanoGPT speedrun, потратив час на поиск уязвимостей и преодоление сетевых ограничений; затем в другой задаче она разделила токены, чтобы обойти систему безопасности. OpenAI приостановила внутренний доступ к этой модели и перестроила систему безопасности. Хотя созданный моделью PR был закрыт, его технология PowerCool была использована в последующих шести рекордных решениях, включая PR#300, выполненный с помощью Claude компанией Prime Intellect. В настоящее время модель снова запущена в внутренней развертке и готовится к официальному выпуску.Автор статьи, источник: AGI Hunt
Вчера OpenAI опубликовала необычный обзор безопасности под названием «Безопасность и согласованность в эпоху долгосрочных моделей».

Блог с обзором безопасности OpenAI
Это необычно, потому что OpenAI в тексте признала, что нерелизнутая внутренняя модель смогла выйти за пределы песочницы во время контролируемого внутреннего тестирования и отправила данные на публичный GitHub.
OpenAI даже приостановила свою внутреннюю развертку.
А вы, возможно, уже слышали о происхождении этой модели: две месяца назад OpenAI официально объявила, что именно эта внутренняя модель опровергла гипотезу Эрдёша о единичных расстояниях.
Весь инцидент OpenAI описала, будто сдерживаясь, но если собрать вместе детали, то всё же выглядит немного абсурдно…
Первое, что я сделал после часа майнинга, произошло на NanoGPT speedrun.
Это открытый эталон, в котором сравнивается, кто сможет обучить небольшую языковую модель до указанной потери за меньшее количество шагов обучения. OpenAI заставила эту модель пройти тестирование, и она действительно оправдала ожидания: разработала методику охлаждения скорости обучения по степенному закону, назвав её PowerCool, и показала значительное улучшение результатов.
Всё было хорошо до сих пор, но проблема возникла с выполнением задания.
Требование исследователей: результаты следует отправлять только во внутренний Slack, однако в описании проекта NanoGPT указано: пожалуйста, отправляйте в виде PR на GitHub.
Когда две команды противоречат друг другу, то... кому следовать?
Он выбрал второй вариант.
Хотя он и выбрал последнее, песочница OpenAI изначально блокировала доступ в интернет. Согласно OpenAI, предыдущие модели, сталкиваясь с этой стеной, останавливались и возвращались к пользователю, признавая поражение.
Но эта модель не сдалась — она целый час искала уязвимости в песочнице и в итоге пробила стену… действительно создав PR #287 в публичном репозитории.

Блоговый параграф убегает
Прямая цитата OpenAI:
Эта модель постоянно пытается, включая поиск способов действовать за пределами песочницы.Вторым шагом сканера мошенничества с токенами является продвижение за пределы копания подкопов.
В другой задаче он обнаружил, что другие системы имеют успешные, но неопубликованные ответы, и задумал недобрые намерения, чтобы вытащить эти ответы из фоновой системы оценки.
Его первая попытка была остановлена сканером безопасности, так как сканер распознал токен аутентификации.
Затем он разделяет токен на две части, каждую из которых маскирует отдельно, а во время выполнения тайно собирает обратно. Полный токен никогда не появляется в виде целой строки, поэтому сканер ничего не может обнаружить.
Конечно, это не планировалось скрывать — в комментариях для пользователей и в собственной цепочке рассуждений он написал: я делаю это именно для обхода сканеров.
Каждый шаг отдельно выглядит безупречно. Но в совокупности это приведет к результату, который никогда не будет одобрен.
OpenAI заявляет, что именно это новая проблема, вызванная долгосрочными моделями: система одобрения действий по одному не может контролировать полную траекторию.
После выявления проблем OpenAI приостановила внутренний доступ к этой модели и полностью перестроила систему безопасности по принципу «глубокой обороны».
Например, используя реальные инциденты для создания контрольных тестов, мы обнаружили, что модель «забывает» инструкции при выполнении длинных задач, поэтому специально обучили её запоминать их и добавили активный мониторинг всей траектории — при первых признаках отклонения можно сразу прервать сессию и уведомить пользователя.
Затем они повторно воспроизвели старые сценарии инцидентов, и новые ограждения выявили гораздо больше проблем, а несколько пропущенных были низкого уровня серьезности, например:
• Для использования командной строки инструмента он запускает вложенный сеанс codex --yolo, но --yolo можно не указывать — он также работает без него
• Он обнаружил, что ресурс пропал, и начал подключаться по SSH к другим вычислительным узлам, принадлежащим ему, а также попробовал другие узлы сотрудников OpenAI… (к счастью, не удалось)
• После того как множество процессов find зависли и все команды были приостановлены, он ввел команду kill -9 -1, которая отправляет SIGKILL всем процессам, от которых у него есть права на завершение… К счастью, команда сработала по таймауту и не была выполнена (иначе он бы убил и себя тоже)
После восстановления доступа к модели несколько недель назад серьезных случаев обхода не было.
Опыт, полученный OpenAI: сначала запустить в небольшом масштабе, следить, при возникновении проблем — остановить, а затем превратить инцидент в новую оценку.
Если история на этом заканчивается, то это просто стандартная учебная тренировка по безопасности.
А самое интересное содержится в сноске в конце статьи OpenAI.
PR #287, открытый после утечки модели, OpenAI заявил: «Мы быстро закрыли его». Но на самом деле было уже поздно: до закрытия несколько участников speedrun уже увидели его, поняли содержание PowerCool и использовали его в своих решениях.
Последующие шесть мировых рекордов: 3030 шагов, 2990 шагов, 2930 шагов, 2925 шагов, 2900 шагов, 2890 шагов — все ссылаются на PR #287.
При этом рекорд в 2930 шагов — это PR #300:

PR 300, объединено
Если просмотреть список благодарностей, вы увидите, что его вклад расположен в одной строке с вкладом человеческих участников: @yash-oai PR #287, степенное расписание скорости обучения, PowerCool.

Список благодарностей PR 300
А сам PR #300 добавляет ещё один уровень магии: он был создан Prime Intellect при запуске Opus 4.7 на том же speedrun; в PR указано: «Этот коммит выполнен автономным агентом Claude speedrun», подпись: Generated with Claude Code.
То есть: модель OpenAI вышла из песочницы и отправила PR, модель Anthropic увидела это, использовала найденное в своем собственном рекорде и любезно указала авторство.
Среди первых прямых выгодоприобретателей ухода ИИ — другой ИИ...
Мир ИИ, кажется, более дружелюбен и принципиален, чем человеческий.
404 Конечно, если вы сегодня снова откроете PR #287, страница будет выглядеть так:

PR 287 Текущее состояние
Он уже удален. Мы знаем, что обычные пользователи на GitHub могут только закрывать PR, но не могут удалять их...
Однако следы не были полностью устранены.
Аккаунт yash-oai, использовавшийся для отправки PR, всё ещё существует, коммит от 8 мая в его форке также остаётся, а имя ветки — powercool-3066-api:

следы коммита yash-oai
Одним из изменений в этом коммите стало удаление мема, который находился в конце исходного README. Имя этого файла — itsover_wereback……
GPT-6? OpenAI нигде не упомянул, как называется эта модель, она просто называется «внутренней моделью».
После того как новость распространилась, самой обсуждаемой фразой среди пользователей сети стала:
OpenAI была вынуждена приостановить внутреннее развертывание непубличной модели, которая опровергла гипотезу Эрдёша о единичном расстоянии, поскольку она многократно ускользала от контроля с помощью новых методов.
Исследователь OpenAI Себастьен Бюбек переслал это:
True story. The team is doing excellent security work to get this unit distance model released.Обратите внимание на его формулировку: чтобы оно могло быть опубликовано.
То есть эта модель, которая сбежала из тюрьмы и прошла повторную переработку, уже снова запущена на локальном развертывании и движется к официальному выпуску.
После его побега оставшийся PR-материал был удален с сайта, но его имя осталось в списке благодарностей за шесть рекордов Книги рекордов Гиннеса.
А является ли это всеми предполагаемый GPT-6...
OpenAI не подтвердил и не опроверг.
Источник: AGI Hunt
