TechCrunchがThe Informationの報道を引用したところによると、OpenAIが間もなくリリースするAstraモデルは、「再帰的深層」と呼ばれる推論技術を採用する。この手法は、モデルの推論プロセスにおける可視的な痕跡を減らし、外部が思考チェーンの記録を通じてモデルが特定の結論に至った理由を判断することを難しくする可能性がある。
セキュリティ研究者が警告を発しました
一般的推論モデルでは、チェーン・オブ・シース(CoT)は、モデルが問題を処理するプロセスをステップごとに示します。この記録は、モデルの実際のすべての内部プロセスを完全に反映しているわけではありませんが、モデルが目標から逸脱したり、異常な決定を下したり、潜在的な制御不能な行動を示したりするのを観察するための重要なツールです。
Redwood ResearchのCEOであるBuck Shlegerisは、Astraがこのような技術を使用することに「非常に懸念している」と述べた。彼は、OpenAIがこのような手法の使用範囲をさらに拡大した場合、モデルの思考チェーンの監視可能性が顕著に低下する可能性があると考えている。
AIのセキュリティに長年注目してきたコメンテーター、ズヴィ・モウショウィッツも、各ラボがモデルの能力を巡って競争を繰り広げれば、規制当局は今後、業界がセキュリティ基準を継続的に引き下げることを防ぐために介入する必要がある可能性があると述べた。
循環論法で可視的な痕跡を削減
報道によると、「不透明な再帰」とは、モデルが線形ステップに従って推論を行うのではなく、同じ問題を繰り返し処理することを指す。これにより、外部から読み取れる中間プロセスが減少し、従来の思考チェーン記録が提供する可視的なパスを回避することになる。
これはセキュリティ研究者が最も懸念する部分でもあります。モデルがますます見えない内部空間で推論を完了するようになると、研究者はそのモデルが誤解を招く行動や制約の回避、その他の予期しない行動を示しているかどうかを判断するのが難しくなるからです。
Redwood Researchの首席科学者であるRyan Greenblattは、このような不透明な推論が従来の思考チェーン推論よりも拡張しやすく、最終的に大部分の推論プロセスを可視チャネルから外してしまうほうがより大きなリスクであると述べた。
OpenAIは監視機能の維持を強調
しかし、現在の段階では、Astra がこの技術を使用している範囲は依然として限定的であるとされている。報道によると、このモデルの思考チェーンは依然として読みやすいと予想されており、OpenAI も、これを完全に説明不可能な「ニューラル・ランゲージ」と呼ぶ動きに反対している。
OpenAIのチーフサイエンティストであるJakub Pachockiは、X上で、同社は最も初期の推論モデルから、思考チェーン監視機能を維持し活用することに取り組んできたと述べ、これは現在の研究計画における中心的な目標の一つであると語った。
注目すべきは、OpenAI だけがこの方向に取り組んでいるわけではないということです。The Information の後続報道によると、Anthropic と Google DeepMind も同様の技術について議論しています。これは、モデルの能力向上と安全で監査可能な性質とのバランスを巡る課題が、AI業界全体に広がる可能性があることを示しています。
