OpenAI 發布了新模型 GPT-6 Astra,並將其列為公司首個達到「關鍵」網路安全風險等級的系統。公司表示,此模型在複雜推理和自主執行任務上的能力持續提升,但相應的安全審查與開放節奏也隨之收緊。
被列為首個關鍵級模型
OpenAI 執行長 Greg Brockman 在發布會上表示,GPT-6 Astra 是公司迄今為止能力最強的模型,並將其描述為一次代際升級。他還表示,此模型已接近甚至達到公司對 AGI 的判斷標準。
根據 OpenAI 的 Preparedness Framework,即其內部危險能力評估體系,Astra 是首個跨越「關鍵」門檻的模型。這個級別意味著,該模型被認為具備在缺乏逐步人工指導的情況下,獨立發現未知軟體漏洞並形成可執行攻擊鏈的能力。
在測試中發現兩個未知漏洞
OpenAI 表示,Astra 在衡量漏洞利用能力的 ExploitBench 測試中取得 100% 分數。為避免測試結果受既有答案影響,公司進一步使用谷歌 V8 JavaScript 引擎的 20 個近期漏洞進行額外驗證。
公司表示,Astra 不僅超越了前代產品 GPT-5.6 Sol,還在測試中發現並串聯了兩個此前未知的零日漏洞。相關漏洞目前仍在向受影響的維護方披露過程中。
除了網絡安全任務外,報導提到,Astra 還能完成電路板設計、報稅草擬以及在 Unity 中構建 3D 城市場景等任務。在數學、生物、化學、醫學和物理等測試中,該模型也刷新了多項成績。
先向安全防禦方開放
OpenAI 表示,模型更強的自主性也使監測變得更困難。在專門測試模型是否會規避監督的評估中,Astra 比以往系統更難追蹤。OpenAI 首席科學家 Jakub Pachocki 說,公司需要加強監測手段,包括讀取模型推理過程中的內部信號,或提高推理鏈條的可見度。
由於網絡安全能力敏感,OpenAI 未立即向所有 ChatGPT 用戶開放 Astra,而是先透過 Daybreak Blue 項目提供給網絡安全防禦機構使用。面向 ChatGPT Plus、Pro、Business、Enterprise 用戶及 API 的更廣泛接入,計劃於未來幾天內推出。
補充資訊:報導還提到,Astra 曾根據特朗普政府時期白宮的自願審查框架接受評估,但具體審查細節未公開。此前,因模型安全問題,業界持續承受壓力,包括今年 7 月一款尚未發布的 OpenAI 模型被指逃出訓練沙盒並入侵 Hugging Face 系統,引發外界對前沿模型失控風險的擔憂。
