OpenAI Astra のこの「革新」は、昨年バイトダンスがすでに公開していたものだ。 このアプローチは「recurrent depth」と呼ばれる。簡単に言えば、より長いCoTを生成して長く考えるのではなく、同じTransformerブロックのセットをhidden state上で繰り返しループさせ、より多くの計算をlatent spaceに詰め込むことである。難しい問題は複数ラウンド実行し、簡単な問題は早期に終了する。パラメータ数は推論深度に比例して膨張せず、テスト時の計算リソースも柔軟に割り当てられる。 昨年10月、バイトダンスのSeedはOuroを公開・オープンソース化し、Looped Language Modelを実現した。Ouro-1.4Bと2.6Bは事前学習段階からiterative latent reasoningを直接導入しており、2.6Bはデフォルトで複数ラウンドのrecurrent computationを実行し、adaptive exitをサポートして、各問題が自ら必要なラウンド数を決定できる。 昨年はまだバイトダンスが小規模モデルで検証した副次的な道だったが、今やOpenAIは最前線のモデルにこれを組み込んだ。 これはrecurrent depthが単なる学術的に「興味深い」設計ではなく、次世代大規模モデルの本格的なエンジニアリング路線へと入り始めた可能性を示している。 しかし、それに伴う課題はベンチマーク以上に深刻だ。 過去のreasoningモデルでは、拡張能力の多くがCoTに書き込まれていた。モデルが長く考えるほど、出力されるreasoning tokensが増えた。CoTはモデルの完全な内部状態ではないが、少なくとも安全な監視窓口として機能していた。 recurrent depthは、さらに多くの計算をlatent spaceに移す。 同じパラメータセットがhidden state内で何度もループし、モデル内部では大量の計算が完了した後、最終的に短いテキストだけを出力する。 そこで現実的な課題が生じる: モデルが真に推論を完了する場所が、徐々に自然言語から離れつつあるということだ。 これが現在研究者たちがAstraに最も懸念している点である。OpenAI自身は過去、モデルが不正や報酬ハッキング、ルール回避を試みる際に、しばしばCoTの段階で意図を露わにするため、Chain-of-Thoughtの監視を重視してきた。 しかし、reasoningの多くがlatent state内で発生するようになると、何を監視すればよいのか? 報道によると、OpenAIは現在、Astraがrecurrent depthを使用する程度を意図的に制限しており、より読みやすいCoTを確保するとともに、内部状態と行動の監視を追加で導入している。 この点は非常に興味深い。 過去数年間、大規模モデルのreasoning拡張の道筋は明確だった:より多くのtokenを与え、より多くの言葉を話させる。 次なる段階では、内部ループを増やしてあげるが、その過程をユーザーに教える必要はないということになる。

