生成回答已成为AI的基本能力,而推演现实世界才是下一阶段更难的课题。
真の意思決定は、静的な質問と回答ではありません。それは、継続的に変化し、複数の主体が同時に行動し、情報が不完全で不確実性に満ちた世界で発生します。
たとえば、新しいオープンソースモデルが突然コストを大幅に引き下げた場合、トップモデル企業は値下げに追随するだろうか?クラウドプロバイダーや開発者、アプリケーション企業はどのように再配置するだろうか?このような意思決定では、一方の行動が他の側の次の選択肢を変化させ、新たな反応がさらに状況を書き換える。まるですべてのプレイヤーが同時に駒を置くチェスのように、駒を一つ置くたびに盤面が変化する。
このような背景のもと、中科聞歌の意思決定機 Decitron(略称:意思決定機)のリリース後、複数の主要なテクノロジーメディアによって「世界初の汎用意思決定大モデル」と称されました。この呼称が強調するのは、世界モデル、マルチエージェント、またはゲーム理論の解決などの特定技術が初めて登場したという点ではなく、意思決定機がこれらの機能を初めてオープンワールド向けの意思決定フレームワークに統合し、継続的なモデリング、シミュレーション、解決、および調整の完全な閉ループを実現した点です。
「汎用」とは、異なる分野の複雑な意思決定問題を、世界の状態、参加主体、行動空間、制約関係、複数回の相互作用、不確実な結果という共通の構造に抽象化し、同じフレームワーク内で継続的に推論と解決を試みることを意味する。

技術レポートのアドレス:https://chinaxiv.org/abs/202608.00064
8月3日、決定機Decitronの完全な技術レポートが正式に公開され、初めてその3つの核心技術貢献が体系的に発表されました。
第一は、多源情報を構造化・永続化・計算可能な世界状態とその因果モデルに整理する明示的ワールドモデル「MetaWorld」を提案することである。第二は、State–Action–Outcome(SAO)という形式化表現を採用し、複雑な意思決定を計算可能で推論可能な形式に変換することである。第三は、マルチエージェントシミュレーション、ゲーム理論的推論、形式最適化を統合したハイブリッド推論アーキテクチャ「AutoABM」を構築し、マルチエージェント意思決定推論システムに基づいてゲーム均衡、戦略計画、制約充足などの複雑な意思決定問題を解決することである。これら三つは、AIシステムの単発的な判断を、世界の変化に応じて継続的に更新される計算と推論プロセスに変えるための技術的基盤を構成する。
AIが実際の意思決定に参加するには、どのようなアーキテクチャが必要ですか?
現在、「意思決定のシミュレーション」をめぐって、AIに必要ないくつかの重要な能力(世界モデル、マルチエージェント、ゲーム理論的推論、確率的予測など)は次々と登場しています。真の難点は、AIが閉じたタスクからオープンな現実世界へ移行した際に、これらの能力が同じ一貫した更新された世界状態を中心に協調して動作しなければならず、単一のプロンプト内で互いに独立した分析を提供するだけでは不十分であることです。
まず世界モデルを見てみよう。World Modelというと、Sora、World Labs、V-JEPAなど、視覚、空間、物理、またはロボット環境に主に焦点を当てた物理的世界モデルを思い浮かべがちである。一方、決定機が提唱するMetaWorldは、より複雑な意思決定シナリオに焦点を当てている:経済、政策、企業競争、地政学など、オープンシステムである。これらのシステムモデリングには、主体、変数、関係、制約がより多様かつ複雑である。
MetaWorldは、世界モデルを社会システムへと拡張したものであり、三つの難しい課題に対処する必要がある:ルールの差異、反射性(因果関係における双方向の相互作用と循環的影響)、そして完全に排除できない不確実性。これにより、直接的な疑問が生じる:現在の世界に対する判断にずれが生じた場合、その後の推論もずれてしまうのではないか?
社会システムに進入した後、環境状態を維持するだけでは不十分であり、AIは他の参加者がどのように行動するかを判断しなければならない。MetaのCICEROや北京大学などのチームが提唱したRichelieuは、限られた情報下での複数エージェント間の相互作用とゲーム理論的戦略を既に示している。一方、オープンワールドにおける現実の意思決定では、各参加者の行動をシミュレートした後、戦略が実行可能かどうか、ゲームがどの均衡点に収束する可能性があるか、そして異なる未来が発生する確率とその条件をさらに判断する必要がある。
意思は、その決定機が持つハイブリッド推論アーキテクチャ「AutoABM」が、LLMの意味理解、SAO構造化表現、マルチエージェントモデリングとシミュレーション、戦略的推論と最適化を一つの実装フローに統合し、「世界の理解—シミュレーションと推演—解決策の導出—未来の評価」という4段階をつなぎ合わせることにあります。
事実から未来へ、決定機はどのように複雑な推論を実行するのか?
意思決定機は、入力とタスク、データと知識、モデリングと形式化、シミュレーションと推論、予測とキャリブレーション、レポートと説明の6つの階層で構成され、現実の情報から意思決定の出力までの完全な連鎖を形成する。

次に、「今後半年で、ある複雑な貿易対立がどのように展開するか?」というケースを例に、意思決定機が現実の情報から出発し、現在の世界状況を構築し、各当事者の行動をシミュレーションし、将来起こり得る異なる経路を推演し、それらの経路がどのような条件で発生するかを確認します。
ステップ1:未来を急いで推測するのではなく、まず「現在何が起きているか」を明確にし、どの事実を信じるべきかを確認しましょう。
現実世界の情報は雑多であり、重複していたり矛盾していたり、既に古くなっている可能性があります。意思決定機は、まずユーザーの質問を構造化されたタスクに変換し、何を回答する必要があるか、どの主体が関与しているか、どの程度の期間を観察するか、そしてどのような制約があるかを明確にします。このケースでは、システムはまずこの対立に関与する主要な当事者、時間範囲、および現在の争点を特定し、関税、サプライチェーン、産業政策、企業行動など、情勢の変化に影響を与える可能性のある要素を整理した後、これらの要素を中心にニュース記事、ソーシャルメディア、研究レポートなどの異なる情報源から情報を収集します。

図2:データ処理フローチャート
収集された情報は、重複除去、クラスタリング、イベント抽出を経て、イベントタイムラインとより細分化された証拠ユニットに整理されます。その後、システムはEvidence Quality Score (EQS) を用いて、各情報の品質を個別に評価します。評価項目には、現在の質問との関連性、情報源の信頼性、内容の新規性と完全性、異なる情報源間の一貫性が含まれます。また、証拠の信頼度に応じてその取り扱いを決定し、信頼度が高いものは直接後続の推論プロセスに進みます。
既存の証拠が不十分である場合、または複数の情報源間に矛盾がある場合、システムはReActに基づく推論と検索を繰り返し実行し、現在不足している情報をもとに次回の検索を調整して、新たに取得した情報を既存のタイムラインに追加します。

図3:ReActに基づく推論と検索の交互メカニズムを採用
第二ステップでは、フィルタリングされた事実を継続的に更新される「世界の状態」に変換します。事実はシステムに何が発生したかを伝えますが、次にさらに判断する必要があります。これらの変化が重なり合った結果、現在の世界はどのような状態にあるのか。
意思決定機は、State–Action–Outcome(SAO)表記を用いてこのプロセスを形式化する。ここで、Stateは現在の世界状態を記述し、Actionは各エージェントが現在の状態下で取った行動を記録し、Outcomeは行動によって生じる収益、損失、コスト、リスクなどの結果を記録する。注目すべきは、Stateがマクロな状態とより細かい定量的な状態を区別することである。ケースにおいて、摩擦のエスカレーションはマクロな状態となり、関税レベル、商品価格、サプライチェーンへの影響度などはより細かい状態記録に含まれる。
また、システムは政策の急変、環境の変化、またはエージェントが制御できないその他のイベントなどの外部衝撃を別途考慮します。行動と外部イベントが発生した後、世界状態は更新されます。更新された状態は、次の行動の出発点となります。このサイクルが繰り返されることで、連続的なSAOトラジェクトリーが形成されます。

図4:SAOの実行プロセス
これらの状態を実際に維持するのはMetaWorldであり、それは計算および更新可能な構造化された世界状態を出力します。状態は三つの層に分解できます:Environment Layerは、勢力段階やリソース価格などのすべての参加者が共有する全体的な環境を記録します。Agent Metrics Layerは、各エージェントのリソース、能力、目標の進捗を記録します。Relationship Matrix Layerは、異なるエージェント間の関係の変化を記録します。
MetaWorldは、因果DAG(因果有向非巡回グラフ)を使用して、状態の変化を制約します。変数間の可能性のある影響は、モデリング段階で因果グラフに組み込まれます。推論プロセス中、システムはノードの状態と因果エッジの重みを更新しますが、毎ラウンドごとに新しい因果グラフを生成することはありません。
これは長期的なシナリオ予測にとって重要です。前の関税変更が価格に影響を与え、価格が企業の選択や他の参加者の反応を変化させ、これらの変化はその後の計算を継続するために保持される必要があります。MetaWorld は、この継続的な更新を行う「世界の帳簿」を担っています。
第三ステップでは、世界状態が整った後、各エージェントが行動を開始します。従来のエージェントベースモデリング(ABM)では、参加者、行動ルール、環境変数、相互作用メカニズムを専門家が事前に定義する必要があります。問題を変えるたびに、モデルを再構築する必要がありました。決定機が提案するAutoABMは、このプロセスを自動化します。自然言語の質問に対して、システムは外部の証拠を統合し、参加者、目標と制約、行動空間、環境変数、因果関係を抽出して、その情報を基にマルチエージェントシミュレーション環境を構築します。
貿易紛争には、政府、企業、業界団体、消費者など、さまざまなエージェントが同時に存在し、それぞれが独自の目標、リソース、リスク許容度、そして超えてはならないレッドラインを持っています。これらのエージェントは神の視点を持たず、自らが掌握している局所的な情報に基づいて行動します。
具体的行動サイクルでは、エージェントは過去のやり取りと履歴を呼び出し、現在の状況における機会、リスク、制約を判断した上で、複数の選択肢となる戦略を生成し、その中から選択を行います。また、各サイクルでは単一の方向性にのみ焦点を当てるのではなく、システムは同時に複数の異なる世界状態を展開します。これらには、比較的安定した均衡経路、楽観的または悲観的な進化方向、そして発生確率は低いが発生すれば状況を大きく変える高影響ブランチが含まれます。その後、これらの経路を精査・検証し、世界状態を更新して次のサイクルへ進みます。各関係者が行動を続けるにつれ、一部の経路は成立条件を失い、他の経路はより可能性が高くなります。

図5:エージェントの行動パラダイム
マルチエージェントシミュレーション以外に、複雑な意思決定には「数学的審判者」が必要である。マルチエージェントは多数の妥当に見える将来の経路を展開できるが、思いつくことと実行可能であることとは異なる。現実の意思決定は、予算、リソース、時間、政策のレッドライン、関係者間のバランスなどの硬直的制約を受ける。
決定機は、古典的ゲーム、リソース配分と最適化、経路計画とスケジューリング、不確実性下の確率的推論、制約充足の5つのカテゴリを含む形式的ソルバー機能を統合しています。たとえば、予算が限られている場合のリソース配分、複数参加者間のゲームでどのような均衡が形成されるか、ある戦略が既定のレッドラインを超えるかどうかといった問題は、この層で計算されます。ゲーム問題において、システムは囚人のジレンマ、シカ狩りゲーム、臆病者ゲーム、ゼロサムゲームなど9種類の古典的な原子ゲームを内蔵しており、144種類のRobinson–Goforth 2×2ゲームトポロジーをカバーし、さまざまなゲーム構造を識別・解決します。
この層の重点は、マルチエージェントが生成した候補戦略を、計算可能なゲーム、制約、最適化のフレームワークに戻すことにより、「意味的に妥当」であることをさらに「形式的に検証可能」にすることである。
TMGBenchベンチマークにおいて、意思決定機の均衡精度は99.4%、トポロジー認識精度は100%、平均解決時間は0.8秒、説明性スコアは4.3/5.0です。

表2:主な5つの解法問題タイプ
マルチエージェントシミュレーションと形式的解法の役割分担は明確です。前者は可能性のある経路を展開し、後者はこれらの経路が制約とゲーム構造の下で成り立つかを検証します。
推論の最終段階に差し掛かり、まだ一つの重要な課題が残っています:これまで展開された複数の将来の道筋は、それぞれどの程度の確率で実現するのでしょうか?そのため、意思決定機は予測と補正のプロセス(Forecasting & Calibration)を設定しました。
前の段階で得られた候補パスを基に、この段階では不確実性をさらに処理します。システムはモデルの推論結果と外部の補正シグナルを統合し、各結果に確率を割り当てます。その後、予測市場の情報、過去の予測パフォーマンス、および確率スコアリングルールを用いてこれらの確率を補正します。意思決定機が提供するのは、「何が起こりうるか」というシナリオの列ではなく、各パスに付随する確率的判断です。これらの確率は、新たな証拠や推論結果に応じて継続的に更新されます。
これは動的に変化する「未来の地図」と捉えることができます。貿易摩擦がさらにエスカレートする、両者が一時的に和解する、または新たな突発的要因が生じるなど、それぞれが異なる分岐点となります。システムは、各経路が発生する可能性を判断し、どの変化が特定の経路をより可能性の高いものにするかを分析します。

図6:確率予測モジュール
これで、意思決定機が一連の完全な意思決定シミュレーションをつなぎ合わせました。
実証検証:この意思決定フレームワークは有効ですか?
報告では、意思決定機の推論システムを検証するために複数の実験が行われましたが、その中でも「イベント推論と確率予測」の結果が最も注目に値します。
まず、自社で構築したイベント予測データセットを確認し、構造化された推論がイベント予測の精度を向上させるかどうかを観察する。チームは、74のイベントと370の二値判断問題を含むデータセットを構築し、複数の高不確実性イベントカテゴリをカバーするとともに、異なる予測期間を評価に組み込んだ。チームの評価設定において、決定機の全体的な結果は78.41%であった。
また、LLM-NEWS設定において、3〜30日短期グループでは、決定機の結果は72.80%、GPT-5.5およびClaude-4.7はそれぞれ35.43%および44.62%であった。中期および長期に移行すると、この差は徐々に縮小する。つまり、構造化された推論は、状況が急速に変化し、過去のパターンを適用しづらい短期のシナリオにおいて、相対的な優位性がより顕著である。

その後、公開予測市場ベンチマークであるPolyBenchでの追加実験。
決策機のFFA(最終予測精度)は81.20%、EVPA(期待ボラティリティ予測精度)は73.40%、MSE(平均二乗誤差)は0.822であり、これらの3つの指標はGemini-3-Flash、MiMo-V2-Flash、Grok-4.1-Fastを上回っています。これは、決策機が市場確率変化の方向をより正確に捉え、確率誤差をより効果的に制御していることを示しています。

決定AIは、大規模モデルの競争単位を変えており、
生成型AIはトークンを基本的な計算単位として、「次にどのような内容を生成するか」を解決する。一方、意思決定AIは世界の状態の変化を基本的な計算対象として、「ある行動が次に世界にどのような変化をもたらすか」を解決する。前者は答えが妥当かどうかに注目するが、後者は因果関係、現実の制約、相手の反応、確率の変化も処理しなければならない。両者は単なる能力の積み重ねではなく、計算パラダイムの変化である。
決定AIは、パラメータ規模を大きくしたり言語能力を強化したりするだけでは、自然に発現するのは難しい。オープンワールドに入ると、基礎モデルは依然として重要だが、その役割は単一のモデルから、決定システムの構成要素へと変化し始めている。AI競争の単位も、単一モデルから完全なシステムへと移行している。
意思決定機の技術的意義は、過去に分散していた能力を一つの共通の意思決定構造に統合することにある。「汎用」とは、あらゆる分野の未来を予測できることを意味するのではなく、異なる分野の問題を状態、行動、結果、制約、不確実性に変換し、同じ推論・解決フレームワークに取り込むことができることを意味する。
この観点から見ると、「世界初の汎用意思決定大モデル」の真の価値は、「最初」の座を巡る競争にとどまらず、『汎用意思決定大モデル』に比較的完成された技術的枠組みを提供することにあります。つまり、明示的な状態で世界を記述し、複数エージェントによって行動を展開し、ゲーム理論と最適化によって戦略を検証し、確率を用いて異なる将来の経路を調整するのです。これに伴い、AIの評価基準も変化し始めています。回答の正確性だけでなく、状態の一貫性、推論の検証可能性、確率の信頼性、そして新たな情報が得られた際の即時更新能力が求められるようになっています。
結局、听起来正确的答案并不等于经得起现实变化的决策。
本文は微信公众号「機械の心」(ID:almosthuman2014)より、著者:意思決定AIに注目
