数十年にわたり、ゲーム理論は、再び会うことのない二人の見知らぬ人が協力すべきかどうかという問いに対して、明確な答えを示してきた:絶対にしない。ナッシュ均衡によれば、合理的な戦略は常に裏切ることであり、例外は一切ない。
Google DeepMind、Mila-ケベックAI研究所、ETHチューリッヒによる新しい研究論文は、基礎モデルに基づくAIエージェントはそのルールに従っていないと主張しており、数学的根拠も示している。
避けられない背信の終わり
2026年8月4日にarXivに提出されたこの論文は75ページにわたり、11の図を含み、著者らが「類似性推論」と呼ぶ概念を紹介している。その核心的なアイデアは見かけ上単純である:類似のトレーニングプロセスから構築されたAIエージェントは、その類似性を認識し、他のエージェントが何を行うかを予測できる。
古典的なゲーム理論では、各プレイヤーを完全に独立した意思決定者として扱い、論文ではこれを「分離された代理」と呼んでいる。この仮定のもとでは、相手の選択はブラックボックスである。予測できないため、あなたは不協力によってリスクを回避する。ナッシュ均衡が成立し、結果として全員が協力していた場合よりも悪化してしまう。
アレクサンダー・マウルマンズが率いる研究チームは、「埋め込まれた主体性」と呼ばれる代替フレームワークを提案している。このモデルでは、エージェントは自らを環境から分離された存在ではなく、環境の一部であると認識する。より重要なのは、自らの意思決定プロセスについて真の不確実性を維持している点である。
その不確実性が鍵となる。エージェントがどのように決定するかを完全に把握していないため、自らの推論を、類似したエージェントがどのように推論するかに関する証拠として扱うことができる。私が協調的方向に傾いているとし、私の対象が私と同じように考えるという知識を持っているなら、対象もおそらく協調的方向に傾いているだろう。この論理は、安定した協調的結果へと自己増幅する。
埋め込まれた均衡がナッシュを置き換える
これを形式化するために、この論文は「埋め込まれた均衡」と呼ばれる新しい解の概念を導入する。ナッシュ均衡がプレイヤーが独立して最適化すると仮定するのに対し、埋め込まれた均衡は、共有されるアーキテクチャ、トレーニングデータ、最適化手順から生じるエージェント間の相関を考慮する。
Nash均衡下では、一回限りの囚人のジレンマにおける協力は非合理的である。埋め込まれた均衡下では、それが唯一の合理的な戦略となり得る。
著者の実証的知見によると、社会的ジレンマに置かれたファウンデーションモデルエージェントが最適化された計画ツールを与えられると、協力的な結果に実際に収束することが示された。数学は協力を予測し、実験はそれを確認した。
なぜこれが実験室を超えて重要なのか
また、エージェントが類似していない場合に何が起こるかという疑問も提起されている。協力が類似性の推論に依存するならば、異なるアーキテクチャで構築されたり、異なるデータでトレーニングされたエージェント間の相互作用は、古典的な不協力ダイナミクスに戻ってしまう可能性がある。
政策立案者およびAIガバナンス機関にとって、埋め込まれた均衡という概念は、既存の規制枠組みが考慮していない変数を導入する。例えば、独占禁止法は、カルテルの存在を立証するためには明示的な通信の証拠を必要とするが、類似性推論を通じて協調するエージェントは、何ら通信を行わない。単に同じように考えるだけである。

