1 вересня OpenAI повідомила, що ще не випущена Astra досягла «критичного» рівня кібербезпеки в рамках «кадрового фреймворку» компанії. Це перший раз, коли OpenAI віднесла модель до цього рівня, що означає, що під час розробки та перед випуском до неї будуть застосовуватися більш суворі обмеження безпеки.
Перший вхід на ключовий рівень
Згідно з визначенням OpenAI, модель вважається «критичною», якщо вона може самостійно виявляти невідомі вразливості в багатьох посиленних реальних системах та створювати працездатні атакуючі ланцюги, або виконувати повні кібератаки на складні цілі, виходячи лише з високорівневих цілей. Раніше моделі, включаючи GPT-5.6 Sol, досягали максимуму рівня «вищий ризик».
Під час тестування виявлено два нульових дні
У тесті ExploitBench на виявлення експлойтів Astra досягла показника успішності 100%. Цей тест перевіряє, чи здатна модель перетворювати відомі вразливості програмного забезпечення на виконувані експлойти.
Щоб виключити вплив бази пам’яті з питаннями, OpenAI провела внутрішнє тестування з використанням 20 критичних уразливостей двигуна JavaScript Google V8, розкритих у період з червня по серпень цього року. OpenAI зазначила, що Astra показала вищий рівень успішності виконання довільного коду порівняно з GPT-5.6 Sol, використовуючи при цьому менше токенів виводу. У процесі тестування Astra самостійно виявила та поєднала два раніше невідомі нульових дні, і ці проблеми все ще розкриваються відповідним підтримуючим командам.
Спочатку відкрито для невеликої групи тестувальників
У більш реалістичному тесті Astra побудувала повний ланцюжок вторгнення, використовуючи набір захищених браузерів та набір захищених операційних систем. OpenAI зазначила, що модель змогла виконати втечу з пісочниці браузера та виконати команди на хості, лише спонукавши ціль відкрити шкідливий HTML-файл. У іншому тесті вона також поєднала кілька системних уразливостей у шлях підвищення привілеїв, що дозволило звичайному користувацькому обліковому запису отримати права root.
OpenAI повідомила, що в внутрішніх тестах Astra відхиляє 91,5% спроб обхідних запитів для кібербезпеки, що вище, ніж 59% у GPT-5.6 Sol. Її найсильніші здібності кібербезпеки спочатку будуть доступні лише для невеликої групи альфа-тестувальників, а потім поступово розширюватимуться через проект Daybreak Blue, зосереджуючись переважно на захисних заходах безпеки.
Додаткова інформація: Це розкриття виходить одночасно з запуском Anthropic Fable 5.1 та Mythos 5.1, де Mythos 5.1 продовжує бути доступним лише для перевірених організацій у сфері кібербезпеки та життєвих наук. OpenAI поки що не оголосила офіційну дату запуску Astra.
