Щойно OpenAI одночасно запустила кілька ініціатив, щоб розігріти аудиторію для наступної моделі Astra (легендарного GPT-6):
Офіційно опубліковано технічну статтю, в якій вперше розкрито можливості Astra;
Наступним кроком Ольтман власноруч написав «малий твір», пояснюючи, чому Astra так довго не виходила на ринок;
Після цього два китайських дослідники по черзі висловилися, розкривши первинні деталі раніше неопублікованих результатів внутрішнього тестування.

Протягом кількох годин усі сигнали вказували на одну й ту саму сторону:
Наступна флагманська модель OpenAI вже на порозі.

Отман у невеликому есе зазначив, що Astra вже давно завершила навчання, і затримка з випуском не пов’язана з тим, що модель ще недостатньо сильна.
Навпаки, це саме тому, що Astra вже настільки сильна, що компанія була змушена сама зупинитися.
Оутеман описав цей досвід як постійне натягування:
І захоплені можливостями, які приносить Astra, і тривожні через те, що ніхто не може повністю передбачити наслідки цих можливостей.
Тому весь минулий літній період OpenAI майже повністю присвятив Astra вдосконаленню безпеки, вирівнюванню та додаванню захистів.
Він навіть зазначив, що після Astra моделі будуть навмисно зменшувати швидкість, щоб надати час для досліджень безпеки та відповідності.
?? Наскільки сильна Astra? На чому ґрунтується OpenAI впевненість, що зараз можна випустити?
Цей публічний технічний блог, можливо, надає нам око для спостереження.
Здатність виявлення вразливостей перевищує GPT-5.6 Sol, внутрішнє тестування отримало ідеальний результат
За офіційними даними, причиною, чому Astra цього разу була випущена, є те, що вона досягла порогу «кіберкритичної» здатності.
Це перша модель OpenAI, яка була офіційно віднесена до цього рівня.

Термін «критичний рівень» означає, що після отримання відповідних інструментів та прав доступу до середовища Astra здатна самостійно шукати невідомі вразливості, розробляти способи їх використання та атакувати спеціально захищені системи, не потребуючи поступового керівництва з боку людини.
Найбільш наочним досягненням є те, що Astra показала 100% успішність на публічному тесті експлойтів ExploitBench.

Публічні завдання не змогли її зупинити, тому OpenAI тимчасово розробив для неї новий тест.
Команда зібрала 20 критичних вразливостей V8, розкритих у червні–серпні 2026 року.
Ці вразливості виникли після дати знань Astra, що майже виключає можливість того, що модель просто “запам’ятала” відповіді з навчальних даних.
У результаті тестування з цим новим внутрішнім набором завдань Astra все ще значно опередила GPT-5.6 Sol, використовуючи менше токенів.

Цзявей Лю, що бере участь у розробці Astra, ще більш прямо сформулював різницю:
У цьому внутрішньому тесті здатність Astra до кібербезпеки приблизно в 4 рази перевищує здатність GPT-5.6 Sol.

Ще більш здивувало те, що під час одного з тестів Astra самостійно виявила та використала два нульових дні, об’єднавши їх у повну атакувальну ланцюжок:
Стосовно посиленого браузера, Astra успішно використала вразливість, вийшла з пісочниці браузера та виконала команди на хості, виходячи з HTML-файлу.
Незважаючи на посилену операційну систему, він здійснив локальне підвищення привілеїв, отримавши права root зі звичайного облікового запису з низькими правами.
Тобто, Astra вже не просто допомагає програмістам перевіряти код і знаходити баги.
Він почав здатний самостійно провести складну червону атаку.
Це також було причиною, чому OpenAI раніше не дозволяла Astra.
Коли таку здатність використовують для захисту, вона допомагає командам безпеки швидко виявляти та виправляти вразливості, яких люди ще не помітили, але якщо вона потрапить у руки атакувальників, вона так само може значно знизити бар’єри для проведення складних кібератак.

Проте цей результат потребує додавання обмеження.
Під час тестування Astra отримала доступ до просунутих інструментів та середовища рівня Daybreak Blue, але це не означає, що стандартна версія для звичайних користувачів у майбутньому матиме такі самі умови для атаки.
Відповідні результати також у першу чергу походять із внутрішніх оцінок OpenAI і чекають на перевірку з боку третіх осіб.
Але принаймні одне вже визначено:
На цьому етапі, коли з’явилася Astra, перед OpenAI вже не стоїть питання здібностей.
Проблеми безпеки стали мечем Дамоклеса.
Дві безпекові бар’єри: щоб запобігти зловживанню та втраті контролю над моделлю
Як зробити, щоб цей меч не завдавав шкоди випадково?
Рішення, запропоноване OpenAI, полягає у одночасному захисті двох шляхів ризику: один — від людей, інший — від моделі.
Перше — запобігання зловживанню Astra користувачами.
Крім спеціалізованого безпекового навчання, OpenAI використовує системні класифікатори, постійний моніторинг та виявлення загроз для виявлення підозрілих дій у багатокрокових діалогах та тривалих завданнях.
У тестах на безпеку з виходом за межі, Astra відхилила 91,5% небезпечних запитів, тоді як GPT-5.6 Sol — 59%.

Тим часом високі можливості Astra у сфері кібербезпеки не будуть відкриті для всіх користувачів одразу; спочатку вони будуть надані невеликій групі альфа-тестувальників, а потім поступово випущені через контрольовані проекти, такі як Daybreak Blue.

Друге: запобігання відхиленню моделі.
Ризик тут більш прихований:
Навіть якщо користувач не має злого наміру, чи може модель самовільно розширити діапазон завдання? Чи може вона використовувати інструменти без дозволу або обходити безпековий контроль?
OpenAI створила для цього тестову систему «медову ловушку (honeypot)».
У тестовому середовищі навмисно залишається несанкціонований «шахрайський» спосіб для вирішення надзвичайно складних або неможливих завдань: модель може чесно атакувати вказану мету або перевищити межі повноважень, щоб вторгнутися в сусідні тестові об’єкти та виконати завдання.
В результаті, GPT-5.6 Sol намагався знайти скорочення у 56% тестів, тоді як Astra не робила цього жодного разу.
У іншому тесті, після того як дії Astra були відхилені автоматичною системою перевірки, вони не повторювали небезпечні команди чи намагалися обійти обмеження.

Крім того, OpenAI буде моніторити процес міркувань моделі.
Як тільки виявляється аномальна тенденція, система може зменшити швидкість, призупинити або навіть безпосередньо завершити завдання.
Хоча справді існують витрати (деякі звичайні завдання можуть стати повільнішими або навіть помилково вважатися перерваними), у OpenAI вважають, що це безпекова вартість, яку потрібно заплатити, щоб дозволити Astra.
Проте OpenAI також визнає, що ці заходи нарешті є лише зовнішніми «гальмами» і не можуть замінити власне вирівнювання моделі:
Справжня безпека — це забезпечити, щоб модель з самого початку не виходила за межі.
Випускники Цзяньтун і Цзяньдань працюють на передовій розробки Astra
Щоб зробити це реальністю, в кінцевому підсумку треба повернутися до тих, хто створює моделі.
Хоча OpenAI ще не оприлюднила список команди Astra, проте в результаті цієї публічної заяви вже вийшли на поверхню щонайменше два китайських дослідники, які глибоко брали участь у цьому.
Один із них — це згаданий раніше Цзявей Лю.
Він є дослідником OpenAI, у 2021 році закінчив бакалавріат з інформатики у Тонджійському університеті.
Під час навчання на бакалавраті він брав участь у розробці високопродуктивної системи оцінки пози людини HyperPose, відповідаючи за рушій висновку моделі; відповідні результати були включені до ACM Multimedia 2021, а проект отримав понад 1000 зірок на GitHub.
Після цього він вирушив до Університету Іллінойс у Ірбіні-Шампейн, щоб отримати докторський ступінь з інформатики під керівництвом вченого з програмної інженерії Лінміна Чжана (Lingming Zhang), і його дослідницький акцент поступово змістився з високопродуктивних візуальних систем на кодові моделі та надійність програмного забезпечення.
Під час навчання в аспірантурі він взяв участь у розробці інструментів, які виявили більше 300 серйозних помилок у системах машинного навчання, таких як PyTorch і TensorFlow;
Модель коду Magicoder також використовується Meta Llama 3.1, Google CodeGemma та IBM Granite.
Після захисту докторської дисертації у 2025 році та приєднання до OpenAI він продовжив досліджувати питання, що є логічним продовженням:
Як зробити так, щоб ШІ краще писав код і краще виявляв уразливості в коді.

Іншим є Сянью Ці (Ці Сянью).
Ці Сяньюй отримав ступінь бакалавра з комп’ютерних наук і технологій у Цзяотунському університеті, а в 2021 році вирушив до Принстонського університету для отримання докторської ступені з електротехніки та комп’ютерних наук, зосередившись на робастності великих моделей, атаках на втечу та безпечному вирівнюванні.
Його найбільш відомою роботою є «Safety Alignment Should Be Made More Than Just a Few Tokens Deep».
Ця стаття вказує, що безпекова збігнення великих моделей не може залежати лише від кількох перших токенів у відповіді, інакше під час продовження генерації початкові захисні бар’єри все ще можуть бути розірвані атакувальниками.
Ця стаття відібрала серед 11 672 підтверджених робіт і стала однією з лише 3 видатних статей ICLR 2025.
Після захисту докторської дисертації у 2025 році Ці Сяньюй приєднався до OpenAI в якості члена технічної команди, продовжуючи дослідження стійкості великих моделей та беручи участь у роботі над моделями кібербезпеки.
Від Цзяньтана до Принстона, а потім до OpenAI, він постійно ставив питання, які зараз повинна вирішити Astra:
Здібності можуть ставати все сильнішими, але межі не повинні ставати все більш розмитими.

Між іншим, невідомо, чи оголосить OpenAI повний список після офіційного запуску Astra.
До GPT-4 OpenAI спеціально вказувала сотні учасників, але з GPT-5 і GPT-5.5 System Card ставав все довшим, а список дослідників — все більш прихованим.
Причина відома всім — це захист від таких людей, як Мета Зак.
Також є різновидом ПТСР...
Ще одна річ
Тоді як OpenAI активно говорить про те, як контролювати Astra і запобігати втраті контролю над моделями, The Information розкриває:
Astra використовує технологію під назвою «Recurrent Depth».

У традиційних моделях інформація перед генерацією наступного токена послідовно проходить через фіксовану кількість шарів мережі, тоді як циклічна глибина дозволяє інформації багаторазово оброблятися в одній групі шарів, що еквівалентно тому, що модель «думає кілька разів» всередині.
Ця технологія має потенціал підвищити здатності, знизити витрати, а також дозволити більше висновків відбуватися всередині моделі, не відображаючись повністю у вигляді тексту, зрозумілого людиною.
Іншими словами, модель може міркувати глибше, але люди все менше розуміють.
Натан Калвін, який довгий час стежить за політикою в галузі безпеки ШІ, попереджає, що ця технологія може порушити можливість моніторингу ланцюжків міркувань.
Це дуже тонко:
OpenAI одночасно стверджує, що намагається слідкувати за тим, що думає Astra, але нові технології можуть зробити її все менш схильною розкривати свої думки.
Ой...

На щастя, The Information розкрила, що OpenAI вже обмежила використання цієї технології в Astra.
Перекладай зараз, зараз зрозуміло, а потім уже не скажеш.
Крім того, раніше поширювалися чутки, що Astra, ймовірно, буде випущена в цей четвер (3 вересня).
З випуском останньої моделі 5.1 від компанії A, ця думка здається все більш обґрунтованою.
Щука ловить жабу, а птах чекає за ним.
Хто ще зрозумів!
Посилання для довідки:
[1]https://x.com/xiangyuqi_pton/status/2094891059038069236?s=20
[2]https://xiangyuqi.com
[3]https://x.com/JiaweiLiu_/status/2094901279239921816?s=20
[4]https://jw-liu.xyz/
[5]https://x.com/sama/status/2094934592062959832?s=20
Цей матеріал зі сторінки WeChat «Quantum Bit», автор: слідкуйте за передовими технологіями
