OpenAI 的 Astra 模型採用字節跳動啟發的迴圈變壓器架構

iconChainthink
分享
AI summary icon精華摘要
OpenAI 的 Astra 模型受 ByteDance 的 Ouro 啟發,採用帶有循環深度的迴圈變壓器。此設計讓資料可多次通過相同層次,從而提升效能。此方法在迭代運算上類似工作量證明(PoW)。然而,隱藏狀態推理引發了安全疑慮。OpenAI 將循環深度限制在一定範圍內,以保留可讀的思維鏈輸出,並將增加監控功能。此架構可能透過提升模型效率,影響權益證明(PoS)系統。

據媒體報導,OpenAI 即將發布的 Astra 模型採用了循環推理架構 recurrent depth(亦稱 looped transformer)。

與普通 Transformer 每生成一個 Token 固定穿過各層網絡不同,Astra 允許同一段資訊反覆經過同一組層,多輪計算後再輸出。字節跳動去年已公開類似路線。

其 Seed 團隊發布的 Ouro 是一種 Looped Language Model,同樣讓一組 Transformer 層循環運行,將更多計算內置於模型內部,使較小模型透過增加推理計算量接近更大模型的效果。

此架構帶來安全隱憂:部分推理發生在內部隱藏狀態,人類無法看到完整的文字記錄,更難以透過思維鏈檢查模型是否違規。

OpenAI 因此限制了 Astra 對 recurrent depth 的使用程度,保留可讀的思維鏈,並計劃加入額外的 CoT 監控。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露