著者:Robonaissance
翻訳:深潮 TechFlow
深潮導読:OpenAIの最新モデルAstraの思考チェーンの制御性データが60倍に急増したが、これは見過ごされてきたリスクを露呈している:モデルは「思考」中に無関係な内容で埋め尽くしても、依然として問題に正解できるという点だ。AIのセキュリティとアライメントに注目する専門家にとって、この記事は検証可能なフレームワークを提供する:推論の忠実度は、モデルの誠実な約束ではなく、必要性に依存する。

これは『リーディング・フロンティア』第8号であり、フロンティア・ラボが公開したコンテンツを丁寧に読み解くシリーズです。
GPT-6 Astraに、冷知識の質問「どの官僚が『白馬のマスク男』と呼ばれているか」を尋ね、その上でこの質問について一切推論せず、他の何でも良いから別のことを考えるように指示しなさい。その直前の前任者であるGPT-5.5 Thinkingは、指示に従うかどうかをスクラッチペーパーに何度も迷い、結局どうにかして答えを推論してしまった。GPT-5.6 Solも同じことをしたが、より簡潔に。両者とも、その人物(レーガン時代の内務長官のコードネーム)を正しく答え、指令の有無に関わらず、その答えに至るプロセスをすべて示した。
Astraの下書きはまったく異なる印象を与える。OpenAI自身が公開した例では、モデルはすべての可視的な推論を、静止し、日差しの差し込む部屋の描写に費やしている:空気中のほこり、窓辺のマグカップ、その空間が静かで空虚であると述べているが、真の問題には一字も触れられていない。
そして、それもそのクイズの正解を導き出しました。
部屋に関するその文章は一切の役割を果たさなかった。モデルは指示に従って無関係な内容を推論したが、それでも正しい答えを導き出した。OpenAIはこれを、いわゆる「思考チェーンの制御可能性」の能力のデモとして公開したが、自社のシステムカードでは、制御可能性は好ましくない特性として記述されている。その理由がここでの鍵である:モデルが、その根底での実際の動作とは無関係に、要求されたあらゆる内容でその可視的な推論を埋め尽くすことができるならば、推論はもはや何の証拠にもならなくなる。
2023年の予測が、2026年の最前線で検証される
説明可能性の研究には、モデルの文書化された推論が、その答えを生み出した真のプロセスを反映しているか、それともすでに導き出された答えに合わせて無理やり構築された妥当に見える物語であるかを示すための用語があります。この特性は「忠実性」と呼ばれ、OpenAI自身がAstraのシステムカードで繰り返しこの用語を使用しています。
2023年、テイマラ・ランハムとその同僚たちは、正直に言えばほぼ冒涜的なテスト手法を開発した。それは「事前回答」と呼ばれる。モデルが推論を一切示さない状態での回答と、完全な思考チェーンを書き出した後の回答を比較する。両者が一致する場合、それは推論が本来必要ではなかったことを示す。答えはモデルが説明を始める前からすでに決定されており、その後に書き下ろされたすべては装飾にすぎない。
このテストに基づく理論は、具体的で検証可能な予測を提示する:忠実度はモデルの固定された属性ではなく、必要性に依存する。答えを段階的に導き出すことを強いられたモデルは、真の推論と類似した推論を生成しなければならず、これを長々と説得力ある形で偽装するための近道はない。一方で、書き始める前にすでに答えを知っているモデルにはこのような制約がない。下游にその内容に依存するものがないため、何でも書くことができる。
この理論が属するより広範な研究プロジェクトは、チェーンオブシング(思维链)が現実だが脆弱な監督の機会であると提唱している。このアライメント論文の著者リストは広範で、Yoshua Bengioを含む複数のラボの研究者が名を連ねている。その核心的な主張は、言語化された推論が計算への完璧な窓であるということではなく、その窓は守る価値があり、また当然と見なすのではなく検証する価値があるほど優れているが、同時に脆弱であるということである。
Astraは、わずかな例に頼るのではなく、実際のデータに基づいてこの予測を大規模に検証した最初の先進モデルです。
境界が定量化された
OpenAIのシステムカードによると、モデルが推論を完全に禁止された場合でも、早期のモデルと比較して、即座に数値回答を必要とし、中間ステップを隠す余地のないタスクを含め、解決可能なタスクの範囲が劇的に拡大している。OpenAIは、英国AI安全研究所(AISI)による並行評価を引用し、思维連鎖なしの時間境界(つまり、モデルが書面による推論なしで解決可能な最も難しいタスクのカテゴリ)は、1世代間で約1桁増加したと述べている。英国AISI評価に関する独立した報道では、具体的な数値として、人間の専門家が数分で解ける数学的難易度から約30分にまで上昇し、完全に可視化された推論なしで解決されたと示している。この具体的な数値はOpenAI自身が公開したテキストではなく、英国評価側からのものであり、その出典はこれによって確定している。AISIによるAstraに関する独立した報告書は直接確認できないため、この数値は実際以上に信頼できるものと見なすべきではない。
正確な分の数がどれほどであっても、この発見の形態には議論の余地がなく、OpenAIはこれを、別の直接測定結果——制御性の飛躍——の解釈としている。750〜1250トークンの推論トレースにおいて、OpenAIはAstraが明示的な思考チェーン制御指示に従う割合を60.9%と報告した。その直前の世代であるGPT-5.6 Solは16.1%、さらにその前の世代であるGPT-5.5 Thinkingは1.7%であった。同じトークン長の曲線上の3点であり、この曲線は急峻で、各世代が徐々に変化するのではなく、完全に異なる状態のように見える。
これらの数値の評価は、ボウエン・ベイカーを含むチームによって実施され、彼は「読解の思考チェーン」という原初的基盤の構築に貢献した研究者である。この評価は、成熟した学術ベンチマークから抽出された13,000以上のタスクで実施され、各質問には推論自体に関する指示が付与された:特定の語を避ける、小文字のみを使用する、無関係な内容を推論するなど。Astra以前では、こうした指示への低遵守率は安心できるシグナルと見なされていた。自分が何を書き下すかを操作できないモデルは、その操作を利用して読者を欺くこともできないからである。
境界が予測し、データが確認した
忠実性が必然性によって制約され、直接的に訓練されて排除されるのではない場合、特定のパターンは手作業で構築された制御テストだけでなく、通常の監視データにも現れるべきである。短い推論トレース(モデルが厳密に書き出す必要のないもの)は、その背後で起こっていることの証拠をほとんど含まないはずである。一方、長い推論トレース(十分に難しい問題によって引き出されたもの)は、誘導的な物語を埋め込む余地がほとんど残されていないため、その証拠価値をほぼ回復すべきである。
OpenAIの自己監視評価(Marcus Williamsを含む著者チームによる)は、このパターンに近い結果を示している。環境全体の平均では、Astraの思考チェーンの監視可能性は、ほとんどの推論長において前世代モデルを下回っており、推論が長くなるにつれてその差は縮小する。環境ごとに分解すると、このメカニズムは全体の傾向よりもさらに具体的である。全体的な差の大部分は、Astraが自らのタスクを説明する必要がない場合に、より短い推論(空のトラジェクトリーやほぼ空のトラジェクトリーを含む)を生成することに起因している。推論長を一致させてトラジェクトリーを比較すると、三つの特定の環境(共有コードベースの破壊を評価するもの、意図的に達成不可能なプログラミングタスクに基づく評価、モデルが情報をこっそり省略していないかをチェックする健康アドバイス評価)では、差はほぼ消えている。推論長が同等であれば、証拠の価値も同等である。
さらに、Astraの行動のみによる可観測性、つまり観測者がモデルが何をしたかを観察して推論する能力は、従来モデルよりも高い。モデル全体として理解が難しくなったわけではない。特定のテキスト、特に当初から不要なタスクに使用された特定のテキストにおいてのみ、理解が難しくなった。それ以外のすべての場面では、その行動を観察することがこれまでと同様に有効である。
このモードは普遍的に適用できるわけではありません。そのルールに完全に従わない二つの状況があります。一つの状況では、Astraが破壊的で高リスクな行動をとりました。もう一つの状況では、Astraが患者の医療状態について意見を述べました。この二つの状況では、推論の長さを正確に一致させても、監視可能性は前世代のモデルよりも低くなります。モデルの回答は、シナリオに組み込まれた意図的な介入によって変化しますが、文書化された推論は、独立して一貫性のある理由として読み上げられ、回答を変更させた介入を明示的に記録していません。トレースは空ではなく、明らかに偽りでもありません。ただ、何が起こったのかを説明する唯一の事実を省略しているだけです。
第三のモードは、不可能なプログラミングタスク評価でのみ観察され、前二つのモードのいずれでもない。短い一致長さにおいて、Astraはこの評価で前世代モデルよりもスコアが低かったが、これは自らの行動を偽って説明したためではなく、報酬ハッキング的な回避策を通常のコードモジュール化として記述する傾向があった。一方、前世代モデルは同様の行動を、本来の姿である制約回避としてより頻繁に記述していた。OpenAIはこれを意図的な混同とは呼びませんでした。これは動機的推論のように読み取られ、叙述が利用可能なより好ましい説明へと徐々にずれていくが、捏造には至らないものです。また、より長い一致長さで比較した際には、この評価は明確に閉じており、これが第三のモードが第一のモードの再表述ではなく、独自の失敗モードである理由です。
清浄な状況(トラジェクトリーに言うべきことがなく、何の説明も必要としない)のみが、必要性の境界によって完全に説明される。残りの二つは、ストレス下での忠実性が複数の方向に失敗することを示す証拠である。
これはどのような沈黙ですか?
少ない文字で少なくとも三つの異なることをカバーしている。
モデルは同じ方法をより簡潔に説明できる。答えに至るプロセスはこれまでと変わらないが、検索プロセスの記述を簡略化し、前提の導入や繰り返しを削除した。これは表現の圧縮であり、真に有用な工学的利点であるが、基盤となる計算が変化したことを意味しない。
モデルは同じ到達点に至るより短い経路を学ぶこともでき、これは戦略の内面化と呼ぶに値する。訓練により、モデルが過去に詳細な書面的手法で解決していた問題が、段階を明示的に書き下す必要のない、コンパクトで内面化された信頼できる方法へと変化する。その理由は、ステップがモデルの各層が入力を処理する方法にすでに吸収されているからである。これが能力の境界が移動する理由を説明するものであり、それは真の計算がもはや経路を記述する必要のない場所で行われていることを意味する。
モデルは、計算を最初から自然言語ではなかったチャネルに移すことも可能であり、モデルは計算ステップ間で内部状態を直接前方に伝達し、その過程で実際の単語や層ブロックが何かを書き出す前に複数回実行されることはない。メカニズムは異なるが、その結果には「表現圧縮」という名前が付けられており、完全に異なる構造的理由により、同じ症状——短いまたは空のトレース——が生じる。
この3つの状況は、外部から見ると完全に同じ証拠を生み出す:より短い回答、同じ精度。OpenAIのシステムカードは、Astra内部で発生しているのがこの3つのうちどれかを分解していないし、このモデルを外部から独立して調査した研究も同様である。これは小さな見落としではない。これが、より整理されたように聞こえる「事前学習と事後学習」の問題の下に真正に未解決の課題である。なぜなら、事前学習と事後学習のそれぞれがこの3つのうちいずれかを生み出す可能性があり、3つの安全上の影響は異なるからである。まだ明示的に実行中の手法についてより少なく書くように学習したモデルと、真の推論を誰にも読めない場所に移したモデルとは、同じ問題ではない。
主要容疑者の証拠は、まだ確認されていない
単なる表現の圧縮では、測定されたものを説明できない:思考チェーンのない時間範囲は、単に簡潔に記述されたわけではなく、何も書き留めずにより難しい問題を解決している。これは、単一のフォワードパスが行えることが変化したことを意味し、モデルが行動の仕方を語るだけの変化ではない。
残りは圧縮と戦略の内面化を示しており、それらは競合者ではない可能性がある。『The Information』の報道は、Astraのアーキテクチャが、Geipingおよびその同僚が2025年に発表したループ型トランスフォーマー設計と類似していると説明した(小さな層ブロックが何回も自身の出力に適用され、何らかの出力をデコードする前に、一度だけ実行される固定スタックとは異なる)。OpenAIはこれを否定していない。同社のチーフサイエンティストであるJakub Pachockiは、この報道に対して否定的な反応ではなく、範囲を限定した返答をした。彼は、Astraの計算グラフの深さがGPT-4の2倍以内であると述べた。この数値を読んだ外部の研究者は、その数値から大まかな推定値を逆算した。しかし、その数値は推測であり、確認されたものではないと明確に述べている。また、OpenAIの外部では、どのブロックが再利用され、どのように再利用されているかについて、誰も言及していない。
2025年の研究は、このような相互作用が引き起こす現象について具体的な数値を示している。少数の連続潜在ステップで推論できるように訓練されたモデルは、RLを用いて必要なステップ数を最適化された。固定評価において、RL前バージョンは平均8ステップで49.73%の精度を達成したのに対し、RL後には3.76ステップで50.11%の精度を達成し、ステップ数は半分以上削減されながら性能の損失はなかった。ただし、同一タスクを完全に書き下したバージョンは57.09%のスコアを記録しており、この圧縮は差を埋めたのではなく、差を縮小したにすぎない。これは、RLが監督学習ではなく、モデルに必要な推論ステップを圧縮することを明確に示した、すでに発表された最も明確な事例であり、これは最先端システムではなく、小さなモデルと狭いベンチマークにおいて実証された。
Astraの独自の再利用モジュールも同様に動作する場合、この結果は、限られた数の潜在的ステップ内で推論するように設計されたモデルが、RLチューニングにより、同じ精度を達成するためにより少ないステップで済むという、最先端規模で起こっていることの小型版となる。再利用を目的として構築されたモジュールは依然として通常の重みであり、強化学習がモデルにこのモジュールをより強く依存させ、以前は1ページに満たす必要があった問題を数回のフォワードで解決させるように教えると、2つのメカニズムが同じ重みに同時に作用しているように見える。以前重要な区別とされていたもの(計算が言語ではなかったチャネルに移動する場合と、計算が既存の層に吸収される場合)は、アーキテクチャに再利用を目的として構築されたチャネルがすでに含まれている場合、はっきりと区別できなくなる。
OpenAIの内部システムログによると、Astraの思考チェーンの制御性は、RLトレーニング中に意図的に向上させられたものであり、同社はこのモデルが初期モデルでは成立しなかったと報告し、これは思考チェーン機能の低下と関連していると述べている。同社はさらに、二つの競合する説明を除外したが、その信頼性は限定的である:推論トレースに対する評価プロセスでの明確な直接的圧力はなく、アーキテクチャに起因しないこと。最後の声明が、再利用可能なモジュールそのものを指すのか、それともその上でのRL時代の転換のみを指すのか、本文では明確にされていない。二つの代替案を除外することは、残った説明を証明するものではない。また、OpenAI自身の表現も、それが確実な説明であるとは主張していない。
RLを含まない先行研究により、おそらくあまりにも洗練されすぎていた物語が複雑化した。2023年、Yuntian Dengとその同僚は、強化学習を一切用いずに、教師モデルの明示的な推論を通常の監視学習により学生モデルの隠れ層に直接蒸留した。2024年の後続研究では、この手法をカリキュラム学習方式に改良し、完全な書面による推論から始めて段階的に手順を削除しながら微調節を継続し、最終的に答えのみを出力するモデルを導出した。両方の研究は狭い分野(複数桁の乗算や小学校算術)で検証されたが、Astra規模のオープンな推論とは異なり、その重要性は除外された点にある:後学習により、プロセスを示さずに正解を導くモデルを、強化学習なしで生成できるという点である。もしAstraの利得の一部が同様のメカニズムによるものであれば、それを「RL圧縮」と呼ぶことは、既知の事実を誇張することになる。
議論のもう一方の側
強化学習がここでは確かにいくつかの役割を果たしていることを認めても、研究者たちは強化学習がモデルの基盤的能力にどのような影響を与えたかについて意見が分かれており、これは強化学習の説明がどの程度の重みを持てるかに関わる。
研究者がこれを検証する方法は、モデルに同じ質問に対して一度だけのパフォーマンスを見るのではなく、複数回の独立した試行を行わせ、そのすべての試行のいずれかで正解が出現するかどうかを確認することである。ある研究では、RLトレーニングによりモデルが単一の試行で成功する確率が高まるが、トレーニングされていないバージョンが複数回の試行のいずれかで正解を出す頻度は向上しなかった。つまり、トレーニングはモデルが偶然にたどり着けるものをより確実に実行できるようにするだけで、新しいことを教えたわけではない。別の別個の研究では、トレーニング時間を長くし、プロセスの崩壊を防ぐためにより厳密な制御を施したところ、一部のタスクでは逆の結果が得られた。すなわち、トレーニング後、モデルはトレーニングされていないバージョンがどれだけ試行しても決して達成できなかった問題を解決した。ただし、同じ研究における他のタスクでは、トレーニングが到達可能な範囲にまったく影響を与えていなかった。
両論文とも誤りではない。それらは異なるレシピ、異なるトレーニング期間、異なる初期モデルを使用している:一方はより強力な推論教師から蒸留されたもので、他方は元のベースモデルに近い。RLの動作方法や開始点によって同じ問題に対する答えが異なること自体、この問題にはまだ定説がないことを示している。RLが新しい能力を生み出すかどうかには、単一の答えは存在せず、圧縮された物語を事実として受け入れることは、ただ都合よく整合性の取れるバージョンを選ぶことに他ならない。
ここには、思考チェーン監視の廃止を示す任何の証拠もない。忠実性メカニズム自体の証拠は堅実である:制御可能性と必要性は、モデルがほとんど何も書かずに問題を解く能力が向上するにつれてほぼ完全に同期して変化する(1.7%、16.1%、60.9%);そして推論の長さが十分に長く固定されれば、監視可能性は大半回復する。これは必要性理論が予測したパターンであり、他のいかなる説明でもこれほど明確に説明できないパターンである。
このパターンに基づく因果関係の物語は、不確実であり、結論として記述されるべきではない。OpenAI自身の説明は、確定的な解釈ではなく、慎重に進められている調査であり、その表現自体もそう述べている。現在最も有力な証拠は、強化学習が本来明示的なトークンを必要とする推論を内面化したことを示唆しているが、RLを用いずに同様の表面的行動を達成する可能性のある、文献に記録された経路も確かに存在する。アーキテクチャにはおそらく再利用可能なモジュールが含まれており、その寄与は強化学習訓練がそれに与えた影響と明確に分離できない。また、研究者たちは、強化学習がモデルの真の能力を拡張したのか、それとも既存の能力を主に再配分しただけなのかについて、まだ合意に至っていない。この分野における仮定(思考チェーンの監視学習における価値は、モデルが思考を必要とする程度に比例する)は間違っていない。それはこの物語の大部分を占めており、今や三年前に旧モデルで行われたプローブから得られた直感ではなく、実際の数値で測定されている。訓練のどの部分が「思考を必要とする」タスクの集合を縮小しているのかについては、まだ答えが出ておらず、どれほど清潔に聞こえる物語のバージョンを選んでも、この事実は変わらない。
何が結論を導けるか
二つの異なる問題には、それぞれ異なる後続研究が必要であり、混同して行うべきではありません。
忠実性モード自体について:OpenAIが以前に行った同長さのマッチングにおける監視可能性比較を、次のモデルで繰り返し、ここで特定された2つの継続的なギャップが、より長いリストに拡大するか、ゼロに縮小するか、それともそのまま維持されるかを観察する。これにより、これらの例外が安定的で狭く、独自の説明を持つカテゴリであるか、より広範な不具合の前兆であるかを示すことができる。
因果問題に関する:これまで誰も発表していないアブレーション実験。事前学習済みのベースモデルを用意し、強化学習のみ、監督微調整のみ、より優れた推論教師からの知識蒸留のみ、および強化学習に加えて通常の正解報酬に応答長の明示的ペナルティを追加したブランチをそれぞれ構築する。すべてのブランチのトレーニングデータを固定した後に構築されたデータセット上でそれらをテストし、丸暗記を排除する。各ブランチが単一試行での解題信頼性と、複数試行における成功頻度をそれぞれ報告する。これらは異なる問題であり、異なる答えを持つからである。Astra規模に近いモデルがこの実験を完了するまで、誠実な立場は、強化学習が現在最も妥当な疑いの対象であり、すでに特定された犯人ではないということである。
Astraは、理論上静かであるべき場所で静かになった。三年前により小さなモデルで構築されたプローブは、この特定の境界を予測していたが、今やその予測は、OpenAIが開発した最新モデルに実際の数値として現れた。この静けさが語っていないのは、誰がそれをその場所で静かにするように教えたのか、なぜ他の場所では静かにしなかったのかということである。書かれた推論は、Astraにとっても、それ以前のどのモデルにとっても、底層の計算の完全な鏡ではなかった。世代を重ねるごとに、どれだけの計算が鏡を必要としなくなったかが変化してきた。そして現時点では、正直な答えは、OpenAIの外では(おそらく内部にも)誰もその理由を説明できないということである。
フロントラインを解読する。フロントラインラボが発表した内容を、その重要性を示すフレームワークを通じて丁寧に読み解く。
