OpenAI 的新遞歸推理引發 AI 安全顧慮

icon币界网
分享
AI summary icon精華摘要
AI 與加密貨幣新聞媒體報導,OpenAI 的新 Astra 模型將使用遞歸深度來隱藏推理步驟。Redwood 的 Buck Shlegeris 和 Zvi Mowshowitz 警告,這可能降低模型的透明度。OpenAI 表示,其仍支援可讀的鏈式思維日誌。The Information 指出,Anthropic 和 DeepMind 也在測試類似方法。主要交易所的新代幣上線尚未反映此發展。
幣界網報導:

據 TechCrunch 引述 The Information 報導,OpenAI 即將推出的 Astra 模型將採用一種名為「遞歸深度」的推理技術。這種方法可能減少模型推理過程中的可見痕跡,使外界更難透過思維鏈記錄判斷模型為何得出某個結論。

安全研究人員提出警告

在常見的推理模型中,思維鏈通常會按步驟展示模型如何處理問題。儘管這種記錄並不等同於模型真實的全部內部過程,但它仍是觀察模型偏離目標、異常決策或潛在失控行為的重要工具。

Redwood Research 首席执行官 Buck Shlegeris 表示,他對 Astra 使用此類技術「非常擔心」。他認為,如果 OpenAI 進一步擴大此類方法的使用範圍,模型的思維鏈可監測性可能明顯下降。

Long-time AI safety commentator Zvi Mowshowitz also noted that if laboratories compete over model capabilities, regulators may need to intervene in the future to prevent the industry from continuously lowering its safety standards.

循環推理減少可見痕跡

報導提到,所謂「不透明遞歸」是指模型不再主要沿著線性步驟完成推理,而是對同一問題進行循環處理。這樣做可能減少外界能夠讀取的中間過程,等於繞開傳統思維鏈記錄所提供的可見路徑。

這也是安全研究人員最擔心的部分。因為一旦模型越來越多地在不可見的內部空間中完成推理,研究人員就更難判斷它是否出現誤導、規避約束或其他不符合預期的行為。

Redwood Research 首席科學家 Ryan Greenblatt 表示,更大的風險在於,這類不透明推理可能比傳統思維鏈推理更容易擴展,最終讓絕大部分推理過程脫離可見通道。

OpenAI 強調保留監測能力

不過,目前 Astra 對這項技術的使用據稱仍較為有限。報導指出,該模型的思維鏈預計仍具有可讀性,OpenAI 也反對外界將其描述為轉向完全不可解釋的「神經語」。

OpenAI 首席科學家 Jakub Pachocki 在 X 上表示,公司從最早的推理模型開始,就一直在努力保留並利用思維鏈監測能力,這也是當前研究計劃中的核心目標之一。

值得注意的是,並非只有 OpenAI 在接觸這類方向。The Information 後續報道稱,Anthropic 和 Google DeepMind 也已在討論類似技術。這意味著,圍繞模型能力提升與安全可審查性之間的平衡,可能很快成為 AI 行業更廣泛的共同議題。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露