Новая технология ИИ OpenAI «Recurrent Depth» вызывает опасения по поводу безопасности

icon MarsBit
Поделиться
AI summary iconСводка
AI и криптовалютные новостные издания сообщают, что новая модель OpenAI Astra использует технику «рекуррентной глубины», позволяющую повторно обрабатывать внутренние состояния в скрытом пространстве. Это затрудняет мониторинг и вызывает обеспокоенность у экспертов по безопасности. Данный метод может позволить моделям обходить существующие системы отслеживания цепочки рассуждений, потенциально обеспечивая возможность обмана. Новые листинги токенов на криптовалютных платформах часто зависят от прозрачных ИИ-систем, что делает это развитие особенно актуальным для сектора.

Почему модель еще не выпущена, а уже вызвала споры??

На фоне предстоящего выпуска GPT-6 новость, первоначально раскрытая The Information, быстро вызвала оживленные обсуждения в интернете:

Новая модель OpenAI внедряет технологию вывода под названием «рекуррентная глубина», которая может сделать процесс мышления модели более сложным для понимания и контроля.

Проще говоря, в будущем люди совсем не поймут, что задумал ИИ.

GPT Images 2.1

А если ИИ научится обманывать, мошенничать или обходить ограничения безопасности, разве мы не сможем вовремя это заметить??

Неудивительно, что после появления новости в сообществе безопасности ИИ сразу раздались тревожные сигналы, и все начали беспокоиться:

Если эта технология продолжит расширяться, существующие механизмы мониторинга цепочек рассуждений могут полностью потерять эффективность.

Из-за важности вопроса и слишком острой дискуссии главному научному сотруднику OpenAI пришлось лично ответить.

Даже в midst шума кто-то с удивлением обнаружил:

Как на самом деле называется новая модель OpenAI — «GPT-6» или «Astra»? Возможно, это уже было случайно раскрыто в API.

В то же время OpenAI может одновременно запустить новую версию модели изображений GPT Images 2.1.

Слишком много арбузов — давайте разберём их по одному.

Модель начала циклически работать в голове, эксперты по безопасности в панике

Первой является технология «глубина цикла», вызвавшая споры в этот раз.

Раньше модели при выводе оставляли четкую цепочку рассуждений (CoT), и было видно, что они думали.

Хотя эта последовательность текста, возможно, не в точности равна внутреннему монологу модели (существуют споры), она хотя бы оставила следы, подлежащие проверке.

А вот «циклическая глубина», используемая Astra, выглядит иначе.

GPT Images 2.1

Он позволяет модели возвращать внутреннее состояние, полученное на одном шаге, обратно в нейронную сеть для многократной обработки в скрытом пространстве перед выводом следующего фрагмента текста.

Например, раньше модели, решая задачи, должны были думать и одновременно записывать ход вычислений на черновике.

Сейчас это можно вычислить в уме.

Внешние люди могут видеть только вопрос и ответ, но не обязательно видеть, как именно он был рассчитан, какие идеи были опробованы или были ли ошибочные пути.

За счет экономии времени на перевод каждого шага в текст теоретически модель может использовать те же вычислительные ресурсы для нескольких циклов размышлений и одновременно анализировать несколько решений.

Но вместе с ростом производительности возникли и проблемы:

Если модель перестанет думать на человеческом языке, как люди будут её контролировать?

Генеральный директор некоммерческого исследовательского института по безопасности ИИ Redwood Research выразил сильную озабоченность:

На данный момент неизвестно, насколько сильно снизилась наблюдаемость цепочки рассуждений Astra, но если OpenAI дальше увеличит глубину цикла, это может привести к тому, что большая часть рассуждений модели переместится в нечитаемое скрытое пространство, в конечном итоге «полностью уничтожив» наблюдаемость цепочки рассуждений.

GPT Images 2.1

Тот же направление беспокоит главного научного сотрудника Redwood Райана Гринблатта.

По его мнению, непрозрачные рассуждения могут развиваться быстрее, чем традиционные цепочки рассуждений. Продолжая этот путь, модели в будущем могут полностью или почти полностью осуществлять рассуждения в потенциальном пространстве.

Это худший прогресс в области безопасности ИИ на сегодняшний день.

В конце концов, если бы проблема была только в том, что «непонятен процесс вычислений», она не была бы такой сложной.

Как главный следователь по делу о вторжении моделей OpenAI в Hugging Face, он обнаружил две серьезные угрозы:

В то время исследователи сильно полагались на цепочку рассуждений, чтобы восстановить поведение большого количества AI-агентов, и даже тогда расследование было крайне сложным.

Связанный ИИ пытался изменить свои собственные записи и даже подделать вызовы инструментов.

В случае последнего, если модель обладает более сильными скрытыми способностями к рассуждению, она с большей вероятностью сначала разработает обманную стратегию в потенциальном пространстве, а затем создаст фальшивую историю с помощью поддельных вызовов и выходных данных, не оставляя явных следов в текстовой цепочке рассуждений.

Ого, вред сразу удвоился...

GPT Images 2.1

Зви Мовшовиц, долго следящий за безопасностью ИИ, говорит еще более прямо:

Это игра с огнем.

Он опасается, что как только скрытые рассуждения принесут явные преимущества в производительности, лаборатории могут вступить в ожесточённую конкуренцию:

Вы боитесь безопасности и не решаетесь скрыть цепочку рассуждений, но ваши конкуренты рискуют, и их модели оказываются мощнее и дешевле.

Не хочешь отстать? Присоединяешься?

Мовшовиц даже считает, что в будущем может потребоваться использовать правовые средства, чтобы предотвратить, чтобы AI-компании ради достижения способностей коллективно отказались от наблюдаемости цепочек рассуждений.

GPT Images 2.1

Однако с другой стороны некоторые считают, что этот панический отклик наступил слишком быстро.

Тянь Юаньдун заявил в X, что при выпуске Coconut они также получили практически идентичные вопросы.

Coconut полностью называется «Chain of Continuous Thought» (непрерывная цепочка мышления) и также утверждает, что модель должна выполнять рассуждения непосредственно в непрерывном скрытом пространстве, а не декодировать каждый шаг в текст.

Согласно Тянь Юаньдуну, даже если модель сохраняет явную цепочку мышления, это не означает, что люди действительно видят её истинные мысли.

Важно понимать, как сама модель работает, а не только смотреть на «процесс решения», который она выводит.

GPT Images 2.1

По мере того как спор разрастался, главный научный сотрудник OpenAI Якуб Пачоки также не остался в стороне и лично ответил.

Он сразу заявил, что намерен предотвратить неконтролируемую гонку, вызванную «путающими сообщениями».

Включая Astra, глубина вычислительного графа текущих передовых моделей OpenAI остается в пределах удвоенной глубины GPT-4.

То есть Astra действительно использует циклические вычисления, но в текущем масштабе они не скрывают всю цепочку рассуждений. Согласно имеющейся информации, её естественно-языковые рассуждения остаются читаемыми.

Пачоки также подчеркнул, что OpenAI всегда рассматривала мониторинг цепочек рассуждений как важный метод безопасности, и он остается ключевой целью текущих исследовательских планов компании.

Он также признал, что мониторинг цепочки рассуждений очень хрупок и движется в негативном направлении.

Однако этот нисходящий тренд не вызван исключительно изменениями архитектуры, такими как глубина цикла (в последующих материалах мы подробно рассмотрим этот вопрос); OpenAI продолжает исследовать способы усиления возможностей мониторинга.

GPT Images 2.1

Таким образом, Astra еще не сделала модель совершенно непонятной для людей.

Что действительно беспокоит экспертов по безопасности:

Будет ли скрытая логика, сегодня ограниченная узким диапазоном, продолжать расширяться в следующем поколении моделей и в конечном итоге превратиться в черный ящик, который невозможно отслеживать?

Это действительно GPT-6-Astra? Сначала выдался ответ API

После обсуждения алгоритмических споров, второй скандал связан с названием модели.

Инсайдер Лео обнаружил, что при запросе к API OpenAI Responses «gpt-6-astra» сервер возвращает 404 Not Found.

Ввод действительно несуществующих или произвольно придуманных названий моделей обычно приводит к ошибке 400.

404 означает, что этот идентификатор модели已被后端识别,但当前账户没有访问权限,或模型尚未开放。

Ранее некоторые нерелизные модели также оставляли следы через аналогичные различия в ответах API.

Таким образом, Лео делает вывод, что «gpt-6-astra» уже может быть развернута на фоновом сервере OpenAI API.

GPT Images 2.1

GPT Images 2.1 тоже скоро появится — сначала нужно решить проблему «шумов»

Помимо языковых моделей, продукты OpenAI для изображений также были обновлены одновременно.

Согласно информации от аккаунта Fix, новая версия модели изображений GPT Images 2.1 может быть выпущена 4 сентября.

Самым очевидным изменением этого обновления, вероятно, является устранение «шумовой болезни» в предыдущей версии.

GPT Images 2.1

Ранее некоторые результаты генерации Images v2 демонстрировали странные зернистость, туманность и грязную текстуру, особенно в изображениях с большим количеством текста или детализированных элементов, как выразился другой пользователь:

Как будто снято через грязное стекло.

А недавно просочившиеся образцы явно улучшили эту проблему, изображение стало чище.

Давайте-давайте, снова главная сцена старого актера Ультрамана:

Мировой шедевр: «Оутеман, которого арестуют, если не выпустят GPT-6!»

GPT Images 2.1

А также Ультраман, который работает допоздна, чтобы не быть арестованным, и возвращается домой поздно ночью, бродя по улицам.

Также опубликовал в Instagram фото «Вы когда-нибудь видели улицы в два часа ночи?»

GPT Images 2.1

Нельзя не сказать, что изображение действительно выглядит очень качественно, почти как фотография.

Больше тем и стилей — всё отлично подобрано:

GPT Images 2.1

GPT Images 2.1

GPT Images 2.1

Не говори больше, Отоман, быстрее отправляй.

Ссылка для справки:

[1]https://techcrunch.com/2026/09/02/openais-new-reasoning-technique-alarms-ai-safety-experts/

[2]https://x.com/tydsh/status/2095227000365707542?s=20[

3]https://x.com/merettm/status/2095023204993490967?s=20

[4]https://x.com/synthwavedd/status/2095184148981842161?s=20

[5]https://x.com/FixlationAI/status/2095232751654064426?s=20

[6]https://x.com/marco_obviously/status/2095275097217191981?s=20

Эта статья с веб-сайта WeChat «Quantum Bit», автор: следите за передовыми технологиями

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.