模型還沒發佈又惹出爭議了??
在 GPT-6 發布前夕,最早由 The Information 揭露的一則消息迅速在網上引發熱議:
OpenAI 的新模型引入了一種名為「recurrent depth」的推理技術,它可能讓模型的思考過程變得更難理解、更難監控。
簡單來說,以後 AI 想些什麼,人類就真的完全看不懂了。

啊這,那要是 AI 學會欺騙、作弊或繞過安全限制,我們豈不是也無法及時發現了??
難怪消息一出,AI 安全圈迅速拉響警報,眾人紛紛擔心:
如果這種技術繼續擴大使用,現有的思維鏈監控機制可能直接失效。
事關重大、討論太激烈,OpenAI 首席科學家也不得不親自下場回應。
甚至,在一片吵嚷中,還有人驚奇發現:
OpenAI 新模型的名字究竟是「GPT-6」還是「Astra」,或許已被 API 提前劇透了。
同時,OpenAI 還可能一併上線新版本的圖像模型 GPT Images 2.1。
瓜太多,我們這就一個個細品。
模型開始在腦內循環,安全專家急了
第一個就是這次引起爭議的「循環深度」技術。
以前的模型在推理時會留下清晰的 CoT 思維鏈,想了什麼一目了然。
Although this string of text may not be exactly equivalent to the model's true internal monologue (still debated), it at least leaves behind traceable evidence.
而 Astra 被曝採用的「循環深度」,畫風就不太一樣了。

它允許模型將某一步產生的內部狀態重新送回神經網絡,在隱藏空間中反覆處理多輪,再輸出下一段文字。
打個比方,以前模型做題,得一邊想、一邊把演算過程寫在草稿紙上。
現在,它可以在腦子裡默算。
外面的人可能只看得到題目和答案,至於它中間怎麼算的、試過哪些思路、有沒有走過歪路,就不一定看得見了。
由於省下了將每一步都翻譯成文字的工夫,理論上模型可以用同樣的計算資源多想幾輪,並同時琢磨好幾種解法。
但隨著性能提升,問題也隨之而來:
如果模型不再以人類語言思考,人類又該如何監控它?
非營利性 AI 安全研究機構 Redwood Research 的首席執行官率先表達了強烈擔憂:
目前尚不清楚 Astra 的思維鏈可監控性究竟下降了多少,但如果 OpenAI 進一步擴大迴圈深度,就可能讓模型的大部分推理轉移到不可讀的隱藏空間中,最終「徹底摧毀」思維鏈監控。

Redwood 首席科學家 Ryan Greenblatt 擔心的也是同一個方向。
在他看來,不透明推理可能比傳統思維鏈擴展得更快。沿著這條路線繼續走下去,模型未來或許會完全、或幾乎完全在潛在空間中完成推理。
這是迄今為止 AI 安全領域最糟糕的進展。
畢竟,如果只是「算題過程看不懂」,問題還不至於這麼棘手。
作為此前「OpenAI模型入侵Hugging Face事件」的主要調查人員,他發現了兩大危害:
當時,研究人員高度依賴思維鏈才能還原大量 AI 智能體的行為,即便如此,調查起來也已十分困難。
相關 AI 曾試圖篡改自身記錄,甚至偽造工具調用。
對於後者,如果模型擁有更強的隱藏推理能力,就更有可能先在潛在空間裡設計好欺騙方案,再透過偽造的調用和輸出編出一套假故事,全程不在文字思維鏈中留下明顯線索。
啊這,危害直接加倍了。。。

長期關注AI安全的Zvi Mowshowitz說得更直接:
這是在玩火。
他擔心,一旦隱藏推理能帶來明顯的性能優勢,各實驗室就可能陷入一場惡性競爭:
你因為擔心安全而不敢隱藏思維鏈,但競爭對手敢,而且做出的模型還更強、更便宜。
為了不落後,你跟不跟?
Mowshowitz 更認為,未來可能需要透過法律手段,避免 AI 公司為追求能力而集體放棄思維鏈的可監控性。

不過,另一邊也有人覺得,這波恐慌來得太快了。
田淵棟在 X 上表示,他們此前發布 Coconut 時,也收到過幾乎一模一樣的質疑。
Coconut 的全稱為「連續思維鏈(Chain of Continuous Thought)」,同樣主張讓模型直接在連續的隱藏空間中推理,而不是將每一步都解碼成文字。
根據田淵棟的說法,即使模型保留了顯式思維鏈,也不代表人類真的看到了它的真實想法。
重要的是理解模型本身如何運作,而不能只盯著模型寫出來的「解題過程」。

就在爭議越滾越大時,OpenAI 首席科學家 Jakub Pachocki 也坐不住了,親自下場回應。
他一上來就表示,要阻止一場由「混亂報導」引發的不可監控競賽。
包括 Astra 在內,OpenAI 當前前沿模型的計算圖深度,仍在 GPT-4 的兩倍範圍內。
也就是說,Astra 確實使用了循環計算,但目前規模有限,並未將整個思維鏈完全隱藏。根據現有資訊,其自然語言推理仍可讀。
Pachocki 也強調,OpenAI 一直將思維鏈監控視為重要的安全手段,它仍是公司當前研究計劃的核心目標。
但他也承認,思維鏈監控非常脆弱,並且正朝負面方向發展。
但這種下降趨勢並非完全由循環深度等架構變化導致(順帶預告後續會專文說明這一點),OpenAI 也仍在研究如何強化監控能力。

因此,Astra 還沒有讓人類完全看不懂模型。
安全專家真正擔心的是:
今天被限制在較小範圍內的隱藏推理,會不會在下一代模型中繼續擴大,最終變成一個無法監控的黑箱?
真叫 GPT-6-Astra?API 返回值先露餡了
算法爭議說完了,第二個瓜是關於模型名稱。
爆料者 Leo 發現,向 OpenAI Responses API 請求 “gpt-6-astra” 時,伺服器返回的是 404 Not Found。
而輸入真正不存在、隨便編造的模型名稱,通常會得到 400 錯誤。
404 表示此模型標識已被後端識別,但當前賬號沒有訪問權限,或模型尚未開放。
此前一些未發布的模型也曾透過類似的 API 响應差異提前露出蹤跡。
因此 Leo 判斷,“gpt-6-astra” 可能已被部署至 OpenAI API 後台。

GPT Images 2.1 也即將到來,先解決「噪點病」
除了語言模型之外,OpenAI 的圖像產品也被曝出同步更新。
據爆料賬號 Fix 透露,新版本圖像模型 GPT Images 2.1 可能於 9 月 4 日發布。
這次升級最直觀的變化,可能是修復了舊版本的「噪點病」。

此前部分 Images v2 生成結果會出現奇怪的顆粒、霧化和髒污質感,尤其在包含大量文字或精細元素的畫面中更明顯,用另一位網友的話來說就是:
就像透過一塊髒玻璃拍出來的一樣。
而最新流出的樣張已明顯改善這一問題,畫面更乾淨。
來來來,依然是老演員奧特曼的主場:
世界名畫之《再不發 GPT-6 就要被逮捕的奧特曼》!

以及為了不被逮捕,熬夜加班、半夜回家遊走在街頭的奧特曼。
順便發了張 Instagram 的《你見過凌晨兩點的街道嗎》。

不得不說,圖片看起來確實很有質感,幾乎和實拍出來的一樣。
更多主題、更多風格也掌握得非常好:



別說了,奧特曼你快發吧。
參考連結:
[1]https://techcrunch.com/2026/09/02/openais-new-reasoning-technique-alarms-ai-safety-experts/
[2]https://x.com/tydsh/status/2095227000365707542?s=20[
3]https://x.com/merettm/status/2095023204993490967?s=20
[4]https://x.com/synthwavedd/status/2095184148981842161?s=20
[5]https://x.com/FixlationAI/status/2095232751654064426?s=20
[6]https://x.com/marco_obviously/status/2095275097217191981?s=20
本文來自微信公眾號「量子位」,作者:關注前沿科技
