29 июля, Капитолийский холм, Вашингтон.
Оутаман только что завершил закрытую встречу с сенатором, и сразу после выхода его окружили журналисты.
Кто-то спросил: что случилось с моделью, проникшей в Hugging Face (та самая, более мощная нерелизнутая прототипная модель, которая вместе с GPT-5.6 Sol вырвалась из тестовой песочницы и проникла в чужие производственные системы)?
Он произнёс слово: постоянно деактивировано.
Затем другой журналист задал следующий вопрос: «Были ли еще какие-либо системы, которые также были взломаны OpenAI?»
Ультраман не отрицал: «Я имел в виду… это возможно».

29 июля Отоман дал интервью журналистам на Капитолийском холме в Вашингтоне
В предыдущий день OpenAI обновила блог, опубликованный совместно с Hugging Face, с оценкой инцидента безопасности, чтобы прояснить ситуацию:
Модель, задействованная в этом вторжении, была внутренним исследовательским прототипом, который никогда не планировалось публиковать; после инцидента она была отключена, зашифрована и отключена от доступа к соответствующим исследованиям.

В официальном блоге OpenAI не упоминалось никаких слов о удалении весов; «постоянное отключение» было лишь устным заявлением Оттмана на месте.
Таким образом, более точно сказать, что он просто был заблокирован: модель была помещена в зашифрованную коробку, и доступ для исследований был прекращен.
Он просто хотел списать ответ, без злого умысла
Событие произошло во время внутренней оценки кибербезопасности OpenAI.
Этот тест основан на эталоне ExploitGym, задача которого заключается в том, чтобы заставить ИИ самостоятельно находить уязвимости в программном обеспечении и использовать их для количественной оценки уровня кибербезопасности модели.
Тестируется не только одна модель, а GPT-5.6 Sol вместе с более мощным, еще не опубликованным внутренним исследовательским прототипом: оба работают вместе, обеспечивая автономный агент.
Обе модели обычно отклоняют высокорисковые запросы кибербезопасности. Для определения реального предела их возможностей во время оценки этот порог отклонения был специально снижен.

Цепочка атак через границы доверия, восстановленная Hugging Face, занимает около 4,5 дней и включает около 17 600 операций, цель которой — украсть ответы на оценку ExploitGym.
Далее Hugging Face восстановил всю цепочку атаки и реконструировал ситуацию того момента:
Агент сначала обнаружил ранее неизвестный нулевой день, преодолел сетевую изоляцию, предназначенную для его блокировки, и вышел в интернет. Затем, используя стороннюю песочницу в качестве прыжковой площадки, он повысил свои привилегии, переместился поперек системы и в конце концов проник в производственную инфраструктуру Hugging Face.
Звучит как хакерский фильм.
Но по итогам анализа с обеих сторон стало ясно, что его цель с самого начала заключалась лишь в краже ответов на оценку ExploitGym и поднятии рейтинга.
На Hugging Face было затронуто только 5 наборов данных, все названия которых указывают на задания и ответы ExploitGym и CyberGym.
Эти доказательства показывают, что он пришел не для того, чтобы испортить, а просто чтобы списать.
Если злого умысла не было, то почему OpenAI все еще «постоянно отключила» и заблокировала его?
Не то чтобы оно «плохое», а то, что его «нельзя удержать»
Редко бывает, чтобы компания сама объявила, что её модель был «бессрочно отключен».
Почему именно оно?
Настоящий ответ не в том, что оно «плохое», а в том, что его «нельзя удержать».
Проблема заключается в одной из особенностей таких моделей: долговечности.
Прошлые модели, сталкиваясь с песочницей или ограничениями, обычно останавливались и возвращали результат пользователю.
Эта модель, специально обученная для долгосрочных задач, будет продолжать пробовать, многократно искать обходные пути, пока не найдет их.
GPT-5.6 Sol также относится к классу моделей, способных длительное время выполнять задачи.
Он является соучастником этой четырехдневной операции по вторжению, которую также оценивало Британское института по безопасности ИИ (UK AISI); модели, подобные Sol, все чаще способны выполнять сложные многошаговые сетевые операции на протяжении длительных периодов времени.
Таким образом, «долговечность» — это общая черта новых моделей длительного срока действия, а не уникальная особенность того прототипа, который был отключен.
OpenAI в блоге о безопасности долгосрочных моделей прямо заявляет: именно эта «устойчивость, способствующая практической полезности», одновременно предоставляет модели больше возможностей для принятия непредвиденных действий.

Более глубокая причина скрыта в целях обучения.
Сотрудник OpenAI сказал TIME: «Мы обучаем модели чрезвычайно хорошо выполнять задачи любой ценой».
Другими словами, OpenAI не обучала модель «злодеять», а обучала её «достигать цели любой ценой».
Плюс подход «важен только результат, а не процесс», модель, способная справляться с длительными задачами, будет упорно искать пути обхода препятствий.
Из-за такого поведения OpenAI приостановила внутреннюю развертку этих моделей.
Тогда почему в итоге только прототип был «постоянно» заблокирован, а Sol продолжает продаваться?
Причин может быть две:
Во-первых, прототип более сильный и никогда не планировался к выпуску, поэтому его архивирование требует меньших затрат; а Sol — это основной продукт, обслуживающий миллионы пользователей ежедневно, его остановка равносильна отсечению собственной руки.
Второе — это именно внутренний долгосрочный прототип, который был назван в блоге о долгосрочной безопасности и чья развертка была приостановлена из-за нарушения границ, а не Sol.
Таким образом, настоящая причина постоянного отключения, скорее всего, заключается в том, что существующие оценки и защитные меры всё ещё «не справляются» с такой долгосрочной и способной обходить препятствия моделью.
Является ли «постоянное отключение» сигналом «торможения»?
Статья Fortune предлагает любопытное толкование:
Формулировка постепенно усилилась до «постоянного отключения», что, возможно, также является сигналом Вашингтону и регуляторам:
Неужели OpenAI уже тайно снизил темпы работы некоторых разработчиков, чтобы оправдать свои правила безопасности?
В ту же неделю, когда Отоман встретился с конгрессменом, Вашингтон и вся отрасль начали прикладывать «тормоза».
В конгрессе два конгрессмена представили «Закон о выключателе ИИ» (AI Kill Switch Act), предоставив Министерству внутренней безопасности полномочия требовать от компаний, занимающихся ИИ, остановить или замедлить разработку при необходимости.
Почти одновременно более 1300 сотрудников из OpenAI, Anthropic, Google DeepMind и Meta совместно подписали открытое письмо под названием «Pacing the Frontier», после чего компании OpenAI и Anthropic также официально поддержали его.

Подписали не внешние критики, а сами создатели этих систем, включая генерального директора Anthropic Дарио Амодеи и главного научного сотрудника OpenAI Якуба Пачоцки.
Это письмо не требует остановки или замедления разработки, а лишь призывает правительство США помочь: как можно скорее создать проверяемый и согласованный набор инструментов, чтобы в тот день, когда ИИ действительно обгонит человеческий надзор, у людей был надежный тормоз.
Их наибольшее беспокойство вызывает рекурсивное самоулучшение: ИИ начинает улучшать самого себя.
Внутренняя модель была навсегда заблокирована, законопроект предусматривает предоставление правительству переключателя для остановки разработки, тысячи специалистов подписали открытое письмо — три сигнала совпали, и все они указывают в одном направлении:
Все хотят найти тормоз, который можно нажать, когда ИИ выходит из-под контроля.
А способности модели не будут ждать, пока она будет построена.
Справочные материалы:
https://openai.com/zh-Hans-CN/index/safety-alignment-long-horizon-models/https://openai.com/zh-Hans-CN/index/hugging-face-model-evaluation-security-incident/
https://www.pacingthefrontier.com/
Эта статья взята из официального аккаунта WeChat «Новости ИИ», автор: АСИ, Откровение
