OpenAI 於 9 月 1 日表示,尚未發布的 Astra 已達到公司「準備框架」中的「關鍵級」網路安全門檻。這是 OpenAI 首次將模型列入此一等級,亦意味著其在開發與發布前將適用更嚴格的安全限制。
首次進入關鍵級
根據 OpenAI 的定義,若模型能在多種加固後的真實系統中獨立發現未知漏洞並構造可用攻擊鏈,或僅憑高層目標完成針對高難度目標的完整網路攻擊,就會被歸入「關鍵級」。此前包括 GPT-5.6 Sol 在內的模型,最高只到「高風險」等級。
在測試中發現兩個零日漏洞
在漏洞利用測試 ExploitBench 中,Astra 的通過率達到 100%。這項測試主要考察模型能否把已知軟體漏洞轉化為可執行的利用代碼。
為排除記憶題庫的影響,OpenAI 又選取今年 6 月至 8 月披露的 20 個 Google V8 JavaScript 引擎高危漏洞進行內部測試。OpenAI 表示,Astra 在任意代碼執行成功率上超過 GPT-5.6 Sol,且使用的輸出 token 更少。測試過程中,Astra 還自行發現並串聯了兩個此前未知的零日漏洞,相關問題仍在向受影響的維護方披露。
先向少量測試者開放
在更接近實戰的測試中,Astra 建立了完整的入侵鏈,針對一套加固瀏覽器和一套加固作業系統。OpenAI 表示,模型僅透過誘導目標開啟惡意 HTML 檔案,就完成了瀏覽器沙箱逃逸,並在主機上執行命令。在另一項測試中,它還將多個系統漏洞串聯為提權路徑,使普通使用者帳戶最終獲得 root 權限。
OpenAI 表示,Astra 在內部測試中對網路安全越獄提示的拒絕率達到 91.5%,高於 GPT-5.6 Sol 的 59%。其最強的網路安全能力將先提供給少量 alpha 測試者,之後再透過 Daybreak Blue 項目逐步擴大,主要面向防禦性安全工作。
補充資訊:此披露發布之際,Anthropic 同日推出 Fable 5.1 和 Mythos 5.1,其中 Mythos 5.1 僅繼續向經過審核的網路安全和生命科學機構開放。OpenAI 目前尚未公布 Astra 的正式上線日期。
