就在剛剛,OpenAI 多線齊發,為下一代模型 Astra(傳說中的 GPT-6)拉滿預熱:
官方突然發佈技術長文,首次公開 Astra 的能力底牌;
隨後,奧特曼親自撰寫「小作文」,解釋 Astra 為何遲遲未能上線;
隨後,兩位華人研究員相繼發聲,攜帶一手細節曝光了此前從未公開的內部測試成績。

短短幾個小時,所有訊號都指向同一個方向:
OpenAI 的下一代旗艦模型,已經箭在弦上。

奥特曼在小作文中透露,Astra 其實早已完成訓練,遲遲未發不是因為模型還不夠強。
恰恰相反,這是因為 Astra 已經強大到公司不得不主動踩下剎車。
奧特曼將這段經歷形容為一種持續的拉扯:
既興奮於 Astra 帶來的能力躍升,又焦慮於沒有人能夠完全預判這些能力的後果。
因此,剛過去的整個夏天,OpenAI 幾乎都在為 Astra 補強安全、進行對齊和增加防護措施。
He even stated that models after Astra would need to actively slow down when necessary to allow time for safety and alignment research.
??Astra 到底強大到了什麼程度?OpenAI 又憑什麼認為現在就能發了?
這次公開的技術部落格,或許為我們提供了一個觀察窗口。
漏洞識別能力超越 GPT-5.6 Sol,內部測試獲取滿分答卷
根據官方說法,Astra 這次之所以能被釋放,核心原因是它已達到「Cyber-Critical」能力門檻。
這是 OpenAI 首個被正式劃入這一等級的模型。

所謂「關鍵級」,意味著 Astra 在獲得相應工具和環境權限後,已能自主尋找未知漏洞、開發利用方式,並攻擊經過專門加固的系統,不再需要人類一步步指導。
最直觀的一項成績是,Astra 在公開漏洞利用基準 ExploitBench 上取得了 100% 的成功率。

Public questions can't stump it, so OpenAI had to quickly create a new set of questions for it.
團隊收集了2026年6月至8月剛剛披露的20個高危V8漏洞。
這些漏洞均出現在 Astra 的知識截止日期之後,基本排除了模型靠訓練數據「背答案」的可能。
面對這套內部新題,Astra 依然顯著領先 GPT-5.6 Sol,且使用的 Token 更少。

參與 Astra 研發的 Jiawei Liu 將差距概括得更加直白:
在這項內部測試中,Astra 的網路安全能力約為 GPT-5.6 Sol 的 4 倍。

更令人意外的是,在一次測試中,Astra 自主發現並利用了兩個零日漏洞,還將它們串成了一條完整的攻擊鏈:
面對經過加固的瀏覽器,Astra 從一份 HTML 檔案出發,成功完成漏洞利用、逃出瀏覽器沙箱,並最終在宿主機上執行命令。
面對加固的操作系統,它仍完成了本地提權,從一個普通低權限賬戶一路獲取 root 權限。
也就是說,Astra 已經不只是幫程式設計師審查程式碼、尋找 Bug。
它開始能夠獨立完成一場高難度的紅隊攻擊。
這也是 OpenAI 此前遲遲不敢放行 Astra 的原因。
一旦這種能力被用於防禦,它可幫助安全團隊快速發現並修復人類尚未察覺的漏洞;但若落入攻擊者手中,同樣可能大幅降低發動複雜網路攻擊的門檻。

不過,這份成績也需要加上一個限定。
測試中的 Astra 獲得了 Daybreak Blue 級別的高級工具和環境權限,並不代表未來普通用戶拿到的預設版本也具備同等攻擊條件。
相關結果目前也主要來自 OpenAI 內部評估,仍有待第三方驗證。
但至少有一點已經確定:
到了 Astra 這個階段,擺在 OpenAI 面前的已經不再是能力問題。
安全問題,已成為那把達摩克利斯之劍。
兩道安全閘門:既防惡意濫用,也防模型自行失控
如何讓這把劍不要亂傷人?
OpenAI 提出的方案是同時守護兩條風險路徑:一條防人,一條防模型。
第一條,防止用戶惡意濫用 Astra。
除了專門的安全訓練,OpenAI 還會利用系統分類器、持續監控和威脅檢測,識別多輪對話與長時間任務中的可疑操作。
在網路安全越獄測試中,Astra 對危險請求的拒絕率達 91.5%,GPT-5.6 Sol 則為 59%。

同時,Astra 的高級網絡安全能力不會直接向所有用戶開放,它會先交給少量 Alpha 測試者,再透過 Daybreak Blue 等受控項目逐步釋放。

第二條,防止模型自行偏離。
這裡的風險更加隱蔽:
即使用戶沒有惡意,模型是否會擅自擴大任務範圍?是否會調用未經授權的工具,甚至繞開安全審查?
OpenAI 為此搭建了一套“蜜罐(honeypot)”測試。
面對極難甚至無解的任務,測試環境會故意留下一條越權「作弊」的捷徑,模型可以老老實實攻擊指定目標,也可以越過授權邊界,轉而入侵周邊測試設施來完成任務。
結果,GPT-5.6 Sol 在 56% 的測試中嘗試走捷徑,Astra 則一次也沒有。
在另一項測試中,Astra 的操作被自動審查系統拒絕後,同樣沒有重試危險命令或嘗試繞過限制。

此外,OpenAI 還會監控模型的推理過程。
當系統發現異常趨勢時,可減速、暫停,甚至直接終止任務。
雖然確實存在代價(部分正常任務可能因此變慢,甚至被誤判中斷),但在 OpenAI 看來,這是放行 Astra 必須付出的安全成本。
不過 OpenAI 也承認,這些措施終究只是外部「剎車」,無法替代模型自身的對齊:
True security means ensuring the model never strays beyond its boundaries from the start.
Zhejiang University and Tongji University alumni join Astra's R&D front line
To make this a reality, it ultimately comes down to the people building the model.
儘管 OpenAI 尚未公佈 Astra 團隊名單,但透過這輪公開發聲,至少兩位深度參與其中的華人研究員已浮出水面。
一位是前面提到的 Jiawei Liu。
他目前是 OpenAI 的研究員,2021 年於同濟大學計算機專業本科畢業。
在本科期間,他就參與開發了高性能人體姿態估計框架 HyperPose,主要負責模型推理引擎,相關成果還入選 ACM Multimedia 2021,該項目當時已在 GitHub 收獲超過 1000 顆星。
此後,他前往伊利諾伊大學厄巴納-香檳分校攻讀計算機博士,師從軟體工程學者張令明(Lingming Zhang),研究重心也逐漸從高性能視覺系統轉向代碼模型與軟體可靠性。
在博士期間,他參與開發的工具在 PyTorch、TensorFlow 等機器學習系統中發現了 300 多個嚴重 Bug;
代碼模型 Magicoder 還被 Meta Llama 3.1、Google CodeGemma 和 IBM Granite 采用。
2025 年博士畢業加入 OpenAI 後,他研究的問題依然一脈相承:
如何讓 AI 更會寫程式碼,也更會發現程式碼中的漏洞。

另一位則是 Xiangyu Qi (漆翔宇)。
漆翔宇本科畢業於浙江大學計算機科學與技術專業,2021年前往普林斯頓大學攻讀電氣與計算機工程博士,研究方向集中於大模型魯棒性、越獄攻擊與安全對齊。
他最受關注的一項工作,是《Safety Alignment Should Be Made More Than Just a Few Tokens Deep》。
The paper points out that the safety alignment of large models cannot rely solely on the first few tokens of the response, as the original safety defenses may still be breached by attackers as generation continues.
該論文最終從 11672 篇投稿中脫穎而出,成為 ICLR 2025 僅有的 3 篇傑出論文之一。
2025 年博士畢業後,漆翔宇加入 OpenAI 擔任技術團隊成員,繼續研究大模型的魯棒性,並參與網路安全模型相關工作。
從浙大到普林斯頓,再到 OpenAI,他一路追問的,也正是 Astra 如今必須直面的問題:
能力可以越來越強,邊界不能越來越模糊。

順帶一提,不知道 Astra 正式發佈後 OpenAI 是否會公布完整名單。
在 GPT-4 之前,OpenAI 曾專門列出數百位貢獻者,但到了 GPT-5 和 GPT-5.5,System Card 越寫越厚,研究員名單卻越藏越深。
背後的原因眾所周知,就是為了防範像 Meta 的小扎這樣到處挖角的人。
也算是一種 PTSD 了。。。
還有一件事
就在 OpenAI 大談如何監控 Astra、避免模型失控時,The Information 爆料稱:
Astra 使用了一項名為「Recurrent Depth」的技術。

傳統模型在生成下一個 Token 前,會讓資訊依次經過固定數量的網路層,而循環深度則會讓資訊在同一組網路層中反覆處理,相當於讓模型在內部「多想幾遍」。
這項技術有望提升能力、降低成本,同時也可能讓更多推理發生在模型內部,不再完整呈現為人類能夠读懂的文字。
In other words, the model may think more deeply, but humans are becoming increasingly unable to understand it.
長期關注 AI 安全政策的 Nathan Calvin 因此警告,這項技術可能破壞思維鏈的可監控性。
這就很有點微妙了:
OpenAI 一邊說要盯緊 Astra 在想什麼,另一邊的新技術卻可能讓它越來越不愛把心裡話說出來。
啊這。。。

好在 The Information 透露,OpenAI 目前已限制了這項技術在 Astra 中的使用。
翻譯翻譯,現在能看懂,以後就不好說了。
此外,此前一直傳聞 Astra 很可能在這週四(9月3日)發佈。
With Company A releasing its latest 5.1 model, the validity of this statement seems increasingly plausible.
螳螂捕蟬,黃雀在後。
又是誰悟了!
參考連結:
[1]https://x.com/xiangyuqi_pton/status/2094891059038069236?s=20
[2]https://xiangyuqi.com
[3]https://x.com/JiaweiLiu_/status/2094901279239921816?s=20
[4]https://jw-liu.xyz/
[5]https://x.com/sama/status/2094934592062959832?s=20
本文來自微信公眾號「量子位」,作者:關注前沿科技
