source avatarsleepy.md

分享

OpenAI Astra 的這個「創新」,字節去年其實已經公開做過了。 這條路線叫 recurrent depth。簡單說,就是不再單純靠生成更長的 CoT 來多想一會兒,而是讓同一組 Transformer block 在 hidden state 上反覆循環,把更多計算塞進 latent space。難題多跑幾輪,簡單題早點退出。參數不用跟著推理深度一起膨脹,test-time compute 也可以更靈活地分配。 去年 10 月,字節 Seed 就公開並開源了 Ouro,做的就是 Looped Language Model。Ouro-1.4B 和 2.6B 在預訓練階段直接加入 iterative latent reasoning,2.6B 默認會做多輪 recurrent computation,同時支援 adaptive exit,讓不同問題自己決定到底需要想幾輪。 去年還只是字節拿小模型公開驗證的一條支線,現在被 OpenAI 塞進了最前沿模型。 這意味著 recurrent depth 很可能不再只是一個學術上「挺有意思」的設計,而是開始進入下一代大模型真正的工程路線。 而它帶來的問題也比 benchmark 更麻煩。 過去 reasoning model 擴展能力,很多計算是寫在 CoT 裡的。模型想得越久,吐出來的 reasoning tokens 越多。雖然 CoT 不等於模型完整的內部狀態,但至少還能成為一個安全監控窗口。 recurrent depth 會繼續把計算往 latent space 裡搬。 同一組參數可以在 hidden state 裡循環很多次,模型內部已經完成了大量計算,最後只需要輸出一小段文字。 於是一個很現實的問題出現了: 模型真正完成推理的位置,正在逐漸離開自然語言。 這也是現在研究者對 Astra 最擔心的地方。OpenAI 自己過去一直很重視 Chain-of-Thought monitoring,因為模型如果準備作弊、reward hack,或者繞規則,有時會先在 CoT 裡暴露意圖。 可如果越來越多 reasoning 發生在 latent state 裡,你還能監控什麼? OpenAI 據報導目前甚至刻意限制了 Astra 使用 recurrent depth 的程度,就是為了保留更多可讀的 CoT,同時額外部署內部狀態和行為監控。 這件事其實很有意思。 過去幾年,大模型擴展 reasoning 的路徑很好理解,給它更多 token,讓它說更多話。 接下來可能變成給它更多內部循環,但它不需要把這些過程告訴你。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露