OpenAI представила возможности Astra (GPT-6), в разработке которых участвовали выпускники Чжэцзяна и Тонджи

icon MarsBit
Поделиться
AI summary iconСводка
OpenAI представила расширенные возможности Astra (GPT-6), включая обнаружение эксплойтов DeFi и автономное выявление уязвимостей. Модель может обходить даже защищенные системы. К проекту приступили Цзявэй Лю (Тонджи) и Сяньюй Ци (Чжэцзян). OpenAI внедрила меры безопасности для предотвращения неправомерного использования. Это обновление приносит важные крипто-новости по мере развития инструментов ИИ в ответ на потребности блокчейн-безопасности.

Только что OpenAI запустила несколько инициатив одновременно, чтобы максимально разогреть ажиотаж вокруг следующей модели Astra (легендарного GPT-6):

Официальный выпуск подробной технической статьи, впервые раскрывающей возможности Astra;

Затем Отоман лично написал «маленький текст», объясняя, почему Astra так долго не вышла;

Затем два китайских исследователя последовательно выступили, представив ранее не публиковавшиеся результаты внутреннего тестирования с деталями первого уровня.

OpenAI

Всего за несколько часов все сигналы указывали в одном направлении:

Следующая флагманская модель OpenAI уже на подходе.

OpenAI

Оутеман в своем эссе раскрыл, что Astra уже давно завершила обучение, и задержка с выпуском связана не с недостаточной мощностью модели.

Наоборот, это именно потому, что Astra стала настолько сильной, что компании пришлось сознательно затормозить.

Ультраман описал этот опыт как постоянное напряжение:

Взволнованы возможностями, которые приносит Astra, и одновременно тревожитесь, что никто не может полностью предсказать последствия этих возможностей.

Таким образом, весь прошедший летний период OpenAI почти исключительно занималась укреплением безопасности, выравниванием и добавлением ограничений для Astra.

Он даже отметил, что модели после Astra при необходимости будут намеренно замедляться, чтобы дать время для исследований в области безопасности и согласованности.

?? Насколько сильна Astra? На чем основано мнение OpenAI, что сейчас можно выпустить?

Этот публичный технический блог, возможно, предоставляет нам окно для наблюдения.

Способность выявлять уязвимости превосходит GPT-5.6 Sol, внутреннее тестирование завершилось с идеальным результатом

Согласно официальной информации, основной причиной, по которой Астра была выпущена на этот раз, является достижение ею порога способностей «киберкритического уровня».

Это первая модель OpenAI, официально отнесенная к этому уровню.

OpenAI

Термин «критический уровень» означает, что после получения соответствующих инструментов и прав доступа к среде Astra способна самостоятельно искать неизвестные уязвимости, разрабатывать способы их эксплуатации и атаковать специально защищенные системы, без необходимости пошагового руководства со стороны человека.

Самым наглядным результатом является 100%成功率 Astra на открытом тесте эксплуатации ExploitBench.

OpenAI

Открытые вопросы его не остановили, и OpenAI пришлось временно подготовить для него новый набор заданий.

Команда собрала 20 критических уязвимостей V8, раскрытых в период с июня по август 2026 года.

Эти уязвимости возникли после даты обновления знаний Astra, что практически исключает возможность, что модель просто “запомнила” ответы из обучающих данных.

При решении этого нового внутреннего набора задач Astra всё ещё значительно опережает GPT-5.6 Sol, используя при этом меньше токенов.

OpenAI

Цзявэй Лю, участвовавший в разработке Astra, более прямо сформулировал разницу:

В этом внутреннем тесте способности Astra к кибербезопасности примерно в 4 раза превышают способности GPT-5.6 Sol.

OpenAI

Более удивительно то, что в одном из тестов Astra самостоятельно обнаружила и использовала два нулевых дня, объединив их в полноценную цепочку атаки:

面对加固的 браузера, Astra успешно эксплуатировала уязвимость, вышла из песочницы браузера и в итоге выполнила команды на хост-машине.

面对加固的操作系统,它又完成了本地提权,从一个普通低权限账户一路获取了 root-права.

То есть Astra уже не просто помогает программистам проверять код и искать ошибки.

Он начал способен самостоятельно провести сложную красную команду.

Это также причина, по которой OpenAI ранее не разрешала запуск Astra.

Когда такие возможности используются в обороне, они помогают командам безопасности быстро обнаруживать и устранять уязвимости, которые люди еще не заметили, но если они попадут в руки злоумышленников, они также могут значительно снизить барьер для проведения сложных кибератак.

OpenAI

Однако этот результат требует оговорки.

Тестировщики Astra получили доступ к продвинутым инструментам и среде уровня Daybreak Blue, но это не означает, что стандартная версия для обычных пользователей в будущем будет обладать аналогичными условиями для атаки.

Соответствующие результаты в настоящее время в основном основаны на внутренних оценках OpenAI и требуют подтверждения со стороны третьих сторон.

Но по крайней мере один момент уже ясен:

На этом этапе, когда речь заходит о Astra, перед OpenAI больше не стоит вопрос способностей.

Вопросы безопасности стали тем мечом Дамоклеса.

Два безопасных барьера: предотвращают как злонамеренное злоупотребление, так и потерю контроля над моделью

Как сделать, чтобы этот меч не ранял случайных людей?

Решение, предложенное OpenAI, заключается в одновременном защите двух путей риска: один против людей, другой против модели.

Первое: предотвратить злонамеренное злоупотребление Astra.

Помимо специальной безопасности, OpenAI также использует системные классификаторы, непрерывный мониторинг и обнаружение угроз для выявления подозрительных действий в многоэтапных диалогах и длительных задачах.

В тестировании на безопасность с использованием метода пентеста Astra отклонила 91,5% опасных запросов, а GPT-5.6 Sol — 59%.

OpenAI

В то же время продвинутые возможности кибербезопасности Astra не будут доступны сразу всем пользователям; сначала они будут предоставлены небольшой группе альфа-тестеров, а затем постепенно выпущены через контролируемые проекты, такие как Daybreak Blue.

OpenAI

Второе: предотвратить отклонение модели.

Здесь риск более скрыт:

Даже если пользователь не имеет злых намерений, может ли модель самостоятельно расширить объем задачи? Может ли она вызывать неавторизованные инструменты или обходить безопасные проверки?

OpenAI создала для этого тестовую систему «медвежья ловушка (honeypot)».

При столкновении с чрезвычайно сложными или даже неразрешимыми задачами тестовая среда намеренно оставляет несанкционированный «обходной» путь; модель может честно атаковать указанную цель или перейти за границы полномочий и вторгнуться в соседние тестовые системы для выполнения задачи.

В результате GPT-5.6 Sol пытался найти обходной путь в 56% тестов, тогда как Astra ни разу этого не делала.

В другом тесте, после того как операции Astra были отклонены автоматической системой проверки, они также не предпринимали повторных попыток выполнения опасных команд или попыток обойти ограничения.

OpenAI

Кроме того, OpenAI будет отслеживать процесс рассуждений модели.

При обнаружении аномальных тенденций система может замедлить, приостановить или сразу же завершить задачу.

Хотя действительно существуют издержки (некоторые обычные задачи могут замедлиться или быть ошибочно прерваны), в OpenAI считают, что это необходимая безопасная стоимость для запуска Astra.

Однако OpenAI также признает, что эти меры в конечном итоге являются лишь внешними «тормозами» и не могут заменить саму согласованность модели:

Настоящая безопасность — это заставить модель не выходить за границы с самого начала.

Алumni из Цзяньтун и Чжэцзянского университета работают на передовой разработки Astra

Чтобы превратить это в реальность, в конечном итоге нужно вернуться к тем, кто создает модели.

Хотя OpenAI еще не опубликовала список команды Astra, в ходе этой кампании по публичному заявлению уже вышли на поверхность как минимум два китайских исследователя, глубоко участвовавших в этом проекте.

Один из них — ранее упомянутый Цзявэй Лю.

Он является исследователем OpenAI, в 2021 году окончил бакалавриат по компьютерным наукам в Тонджи.

Во время учебы в бакалавриате он участвовал в разработке высокопроизводительной системы оценки позы человека HyperPose, отвечая за движок вывода модели; соответствующие результаты были включены в ACM Multimedia 2021, а проект уже получил более 1000 звезд на GitHub.

После этого он поступил в Университет Иллинойса в Урбане-Шампейне на докторантуру по компьютерным наукам под руководством исследователя в области программной инженерии Линмина Чжана (Lingming Zhang), и его основное внимание постепенно сместилось с высокопроизводительных визуальных систем на модели кода и надежность программного обеспечения.

Во время обучения в аспирантуре он участвовал в разработке инструментов, с помощью которых было обнаружено более 300 серьезных ошибок в системах машинного обучения, таких как PyTorch и TensorFlow;

Модель кода Magicoder также используется Meta Llama 3.1, Google CodeGemma и IBM Granite.

После защиты докторской диссертации в 2025 году и присоединения к OpenAI он продолжил изучать вопросы, имеющие ту же преемственность:

Как заставить ИИ лучше писать код и лучше обнаруживать уязвимости в коде.

OpenAI

Другим является Сянью Ци (Ци Сянью).

Ци Сяньюй получил степень бакалавра по компьютерным наукам и технологиям в Цзяотунском университете Чжэцзяна, в 2021 году поступил в Принстонский университет на докторантуру по электротехнике и компьютерной инженерии, его исследовательские интересы сосредоточены на робастности крупных моделей, атаках на обход защиты и безопасности согласования.

Его наиболее известной работой является «Safety Alignment Should Be Made More Than Just a Few Tokens Deep».

В этой статье отмечается, что безопасная согласованность крупных моделей не может опираться только на несколько первых токенов ответа, иначе при дальнейшем генерировании изначальные меры безопасности все еще могут быть разрушены злоумышленниками.

Эта статья была выделена из 11 672 поданных работ и стала одной из всего трех выдающихся статей ICLR 2025.

После защиты докторской диссертации в 2025 году Ци Сяньюй присоединился к OpenAI в качестве члена технической команды, продолжив исследование устойчивости крупных моделей и участвуя в работе над моделями кибербезопасности.

От Цзяньдэ до Принстона, а затем в OpenAI, он неустанно задавался вопросом, который теперь должна непосредственно решить Astra:

Способности могут становиться все сильнее, но границы не должны становиться все более расплывчатыми.

OpenAI

Кстати, неизвестно, опубликует ли OpenAI полный список после официального запуска Astra.

До GPT-4 OpenAI специально перечисляла сотни участников, но к GPT-5 и GPT-5.5 System Card становился всё длиннее, а список исследователей — всё более скрытым.

Причина этого известна — это мера предосторожности против таких людей, как Мета-Зукерберг, которые любят набирать сотрудников по всему рынку.

Это тоже своего рода ПТСР...

Еще одна вещь

В то время как OpenAI активно обсуждает, как контролировать Astra и предотвратить потерю управления моделью, The Information раскрыла:

Astra использует технологию, называемую «Recurrent Depth».

OpenAI

В традиционных моделях информация проходит через фиксированное количество слоев сети перед генерацией следующего токена, тогда как циклическая глубина позволяет информации многократно обрабатываться в одной и той же группе слоев сети, что эквивалентно тому, что модель «подумает несколько раз» внутри себя.

Эта технология обещает повысить возможности и снизить затраты, а также может привести к тому, что больше рассуждений будет происходить внутри модели, а не будет полностью представляться в виде текста, понятного человеку.

Иными словами, модель может думать глубже, но люди всё меньше понимают.

Натан Калвин, долго следящий за политикой в области безопасности ИИ, предупредил, что эта технология может нарушить наблюдаемость цепочек рассуждений.

Это очень тонкий момент:

OpenAI говорит, что хочет следить за тем, что думает Astra, но новая технология может сделать ее все менее склонной делиться своими мыслями.

Ой...

OpenAI

К счастью, The Information сообщила, что OpenAI уже ограничила использование этой технологии в Astra.

Translate now, while you can understand it; it might be harder to say later.

Кроме того, ранее ходили слухи, что Astra, скорее всего, будет выпущена в этот четверг (3 сентября).

С выпуском последней модели 5.1 компанией A, это утверждение кажется все более обоснованным.

Стрекоза ловит цикаду, а за ней — скворец.

Кто еще понял!

Ссылка для справки:

[1]https://x.com/xiangyuqi_pton/status/2094891059038069236?s=20

[2]https://xiangyuqi.com

[3]https://x.com/JiaweiLiu_/status/2094901279239921816?s=20

[4]https://jw-liu.xyz/

[5]https://x.com/sama/status/2094934592062959832?s=20

Эта статья взята из официального аккаунта WeChat «Quantum Bit», автор: следите за передовыми технологиями

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.