據 TechCrunch 引述 The Information 報導,OpenAI 即將推出的 Astra 模型將採用一種名為「遞歸深度」的推理技術。這種方法可能減少模型推理過程中的可見痕跡,使外界更難透過思維鏈記錄判斷模型為何得出某個結論。
安全研究人員提出警告
在常見的推理模型中,思維鏈通常會按步驟展示模型如何處理問題。儘管這種記錄並不等同於模型真實的全部內部過程,但它仍是觀察模型偏離目標、異常決策或潛在失控行為的重要工具。
Redwood Research 首席执行官 Buck Shlegeris 表示,他對 Astra 使用此類技術「非常擔心」。他認為,如果 OpenAI 進一步擴大此類方法的使用範圍,模型的思維鏈可監測性可能明顯下降。
Long-time AI safety commentator Zvi Mowshowitz also noted that if laboratories compete over model capabilities, regulators may need to intervene in the future to prevent the industry from continuously lowering its safety standards.
循環推理減少可見痕跡
報導提到,所謂「不透明遞歸」是指模型不再主要沿著線性步驟完成推理,而是對同一問題進行循環處理。這樣做可能減少外界能夠讀取的中間過程,等於繞開傳統思維鏈記錄所提供的可見路徑。
這也是安全研究人員最擔心的部分。因為一旦模型越來越多地在不可見的內部空間中完成推理,研究人員就更難判斷它是否出現誤導、規避約束或其他不符合預期的行為。
Redwood Research 首席科學家 Ryan Greenblatt 表示,更大的風險在於,這類不透明推理可能比傳統思維鏈推理更容易擴展,最終讓絕大部分推理過程脫離可見通道。
OpenAI 強調保留監測能力
不過,目前 Astra 對這項技術的使用據稱仍較為有限。報導指出,該模型的思維鏈預計仍具有可讀性,OpenAI 也反對外界將其描述為轉向完全不可解釋的「神經語」。
OpenAI 首席科學家 Jakub Pachocki 在 X 上表示,公司從最早的推理模型開始,就一直在努力保留並利用思維鏈監測能力,這也是當前研究計劃中的核心目標之一。
值得注意的是,並非只有 OpenAI 在接觸這類方向。The Information 後續報道稱,Anthropic 和 Google DeepMind 也已在討論類似技術。這意味著,圍繞模型能力提升與安全可審查性之間的平衡,可能很快成為 AI 行業更廣泛的共同議題。
