生成答案正成為 AI 的基礎能力,而推演現實世界,才是下一階段更難的命題。
真實決策不是一道靜態問答。它發生在一個持續變化、多主體同時行動、資訊不完備且充滿不確定性的世界裡。
例如,一個新開源模型突然將成本大幅降低,頭部模型公司是否會跟進降價?雲端廠商、開發者和應用公司又將如何重新站隊?在這類決策中,一方的行動會改變其他方下一階段所面對的條件,而新的反應又會持續改寫局勢。這就像一盤所有棋手同時落子的棋局,每落下一子,棋局便隨之改變。
正因如此,中科聞歌決策機 Decitron(簡稱決策機)發布後,被多家主流科技媒體譽為「全球首個通用決策大模型」。此稱謂所強調的,並非世界模型、多智能體或博弈求解等單一技術的首次出現,而是決策機首次將這些能力統一至一套面向開放世界的決策框架中,形成持續建模、推演、求解和校準的完整閉環。
所謂「通用」,是指其試圖將不同領域的複雜決策問題抽象為一套共同結構——世界狀態、參與主體、行動空間、約束關係、多輪互動和不確定結果,並在同一套框架中持續推演與求解。

技術報告地址:https://chinaxiv.org/abs/202608.00064
8 月 3 日,決策機 Decitron 完整技術報告正式發布,首次系統公開其三項核心技術貢獻:
一是提出顯式世界模型 MetaWorld,將多源資訊整理為結構化、持久化和可計算的世界狀態及其因果建模;二是採用 State–Action–Outcome (SAO) 形式化表示,將複雜決策轉化為可計算的表達與推理形式;三是構建融合多智能體模擬、博弈推理和形式化優化的混合推理架構 AutoABM,基於多智能體決策推演系統求解博弈均衡、策略規劃與約束滿足等複雜決策問題。三者共同構成決策機的技術底座,目標是將 AI 系統的一次性判斷,轉變為一個隨世界變化持續更新的計算與推演過程。
如何構建一套架構,讓 AI 參與真實決策?
目前,圍繞「決策推演」,AI 所需的幾項關鍵能力(如世界模型、多智能體、博弈推理、概率預測)其實已陸續出現。真正的難點在於:當 AI 從封閉任務進入開放的現實世界時,這些能力必須圍繞同一個持續更新的世界狀態協同工作,而不能僅在一次 Prompt 中提供彼此獨立的分析。
先看世界模型。提到 World Model,人們很容易想到 Sora、World Labs、V-JEPA 等主要面向視覺、空間、物理或機器人環境的物理世界模型。而決策機提出的 MetaWorld 關注的則是更為複雜的決策場景:經濟、政策、企業競爭、地緣等開放系統,系統建模涉及的主體、變量、關係和約束更加繁雜。
MetaWorld 可視為世界模型向社會系統的一次延伸,需要處理三類棘手的問題:規則差異、反身性(因果之間的雙向互動、循環影響)和無法徹底消除的不確定性。這也帶來了一個直接問題:如果對當前世界的判斷出現偏差,後續的推演是否會跟著偏離?
一旦進入社會系統,僅維護環境狀態已不夠,AI 還需判斷其他參與者如何行動。Meta 的 CICERO、北大等團隊提出的 Richelieu 已展示多個 Agent 在有限資訊下進行互動與博弈的能力;而對於開放世界中的真實決策,在模擬各方行動後,還需進一步判斷策略是否可行、博弈可能落在哪些均衡上,以及不同未來發生的可能性與條件。
The significance of the Decision Engine lies herein: its hybrid reasoning architecture, AutoABM, unifies LLM semantic understanding, SAO structured representation, multi-agent modeling and simulation, and strategic reasoning and optimization onto a single implementation pipeline, connecting the four steps of “understanding the world — simulating scenarios — deriving decisions — evaluating future outcomes”.
從事實到未來,決策機如何完成一次複雜推演?
決策機由輸入與任務、數據與知識、建模與形式化、模擬與推理、預測與校準、報告與解釋六個層級組成,形成從現實資訊到決策輸出的完整鏈路。

接下來,我們以「未來半年,某場複雜貿易衝突可能如何演化?」為案例,看決策機如何從現實資訊出發,一步步建立當前世界狀態、模擬各方行動、推演未來可能出現的不同路徑,以及這些路徑會在什麼條件下發生。
第一步:先別急著推演未來,首先弄清「現在發生了什麼」,以及哪些事實值得相信。
現實世界的資訊雜亂,可能重複、相互衝突,或已過時。決策機首先將用戶的問題轉化為結構化任務,明確需回答的內容、涉及的主體、觀察時長及各項限制。以本案例而言,系統會先鎖定衝突的主要參與方、時間範圍與當前爭議焦點,梳理可能影響局勢變化的因素,如關稅、供應鏈、產業政策與企業行為,並圍繞這些要素從新聞報導、社群媒體、研究報告等不同來源蒐集資訊。

圖 2:數據處理流程圖
收集到的資訊會先經過去重、聚類和事件抽取,整理成事件時間線及一組更細緻的證據單元。隨後,系統透過 Evidence Quality Score (EQS) 逐條評估資訊品質,包括與當前問題的相關性、來源可信度、內容的時效性與完整性,以及不同信源之間的一致性。同時,根據證據的不同置信度決定其去向,其中置信度高的證據將直接進入後續推演。
如果現有證據不足或不同來源出現衝突,系統將繼續執行基於 ReAct 的交替推理與檢索,根據當前缺失的信息調整下一轮搜索,並將新找到的信息補充至已有時間線。

圖 3:採用基於 ReAct 的推理與檢索交替機制
第二步,將篩選後的事實轉化為一個持續更新的「世界狀態」。事實告訴系統發生了什麼,接下來還需進一步判斷:這些變化疊加在一起,現在的世界究竟處於什麼狀態。
決策機採用 State–Action–Outcome (SAO) 表示來將此過程形式化,其中 State 描述當前世界狀態,Action 記錄各個 Agent 在當前狀態下採取的行動,Outcome 記錄行動帶來的收益、損失、成本和風險等結果。值得注意的是,State 區分宏觀狀態和更細緻的可量化狀態。在案例中,摩擦升級可作為宏觀狀態,關稅水平、商品價格、供應鏈受影響程度等則可納入更細緻的狀態記錄。
此外,系統還單獨考慮外部衝擊,例如政策突變、環境變化或其他不由 Agent 控制的事件。一次行動和外部事件發生後,世界狀態隨之更新。更新後的狀態再成為下一轮行動的起點。如此循環往復,形成了一條連續的 SAO 軌跡。

圖 4:SAO 運行過程
負責真正維護這些狀態的是 MetaWorld,它輸出的是一套可計算與更新的結構化世界狀態。狀態可進一步拆分為三個層次:Environment Layer 記錄所有參與者共享的整體環境,例如局勢階段、資源價格等;Agent Metrics Layer 記錄每個 Agent 的資源、能力與目標進展;Relationship Matrix Layer 記錄不同 Agent 之間的關係變化。
MetaWorld 也使用因果 DAG(Causal Directed Acyclic Graph)來約束狀態如何變化:變數之間可能的影響,在建模階段便被組織進因果關係圖中。在推演過程中,系統會更新節點狀態和因果邊的權重,但不會每輪重新生成一張因果圖。
這對長期推演至關重要。上一輪關稅變動影響價格,價格又改變企業的選擇和其他參與者的回應,這些變動都必須被保留,才能繼續往後計算。MetaWorld 承擔的就是這份持續更新的「世界帳本」。
第三步,有了世界狀態,各個 Agent 開始行動。傳統的 Agent-Based Modeling (ABM) 通常需要專家提前定義好參與者、行為規則、環境變量和互動機制。換一個問題,很多東西就要重新建模。決策機提出的 AutoABM 將這一步自動化:面對自然語言問題,系統會結合外部證據,提取參與者、目標和約束、行動空間、環境變量以及因果關係,再據此構建多智能體推演環境。
一場貿易衝突可能同時存在政府、企業、行業組織、消費者等不同 Agent,每一方都有自己的目標、資源、風險偏好和不能突破的紅線。這些 Agent 沒有上帝視角,只能根據自己掌握的局部資訊行動。
在每輪行動中,Agent 會先調取過往的互動與歷史軌跡,再評估當前局勢中的機會、風險與限制,生成多種可選策略並作出選擇。同時,系統不會僅朝單一方向推進,而是並行展開多種不同的世界狀態,包括相對穩定的均衡路徑、較樂觀或悲觀的演化方向,以及發生機率較低但一旦發生便會顯著改變局勢的高影響分支。隨後,系統會篩選並驗證這些路徑,更新世界狀態,進入下一輪。隨著各方持續行動,部分路徑將失去成立條件,而其他路徑則變得更有可能。

圖 5:Agent 行為範式
除了多智能體模擬之外,複雜決策還需要一位「數學裁判」。多智能體可以推演許多看似合理的未來路徑,但能想到不等於能做到,現實決策還受到預算、資源、時間、政策紅線、各方均衡關係等硬性約束。
決策機接入了一套形式化求解(Solver)能力,包括經典博弈、資源配置與優化、路徑規劃與調度、不確定條件下的概率推斷以及約束滿足等五類問題。例如,在預算有限的情況下如何分配資源、多方博弈可能形成何種均衡、一項策略是否突破既定紅線,這些都可以進入這一層計算。在博弈問題上,系統內置了囚徒困境、獵鹿博弈、膽小鬼博弈、零和博弈等 9 類經典原子博弈,涵蓋 144 種 Robinson–Goforth 2×2 博弈拓撲,用以識別和求解不同的博弈結構。
The focus of this tier is to feed the candidate strategies generated by multi-agent systems back into computable game-theoretic, constraint, and optimization frameworks, transforming "semantically reasonable" into "formally verifiable".
在測試多智能體博弈能力的 TMGBench 基準上,決策機均衡準確率達 99.4%,拓撲識別準確率為 100%,平均求解時間為 0.8 秒,可解釋性評分為 4.3/5.0。

表 2:五種主要的求解問題類型
多智能體模擬和形式化求解的分工很清晰:前者負責將可能發生的路徑展開;後者負責檢查這些路徑在約束和博弈結構下是否站得住。
到了推演的最後一環,還剩下一个關鍵問題:前面展開的多條未來路徑,各有多大可能發生?為此,決策機設置了預測與校準環節(Forecasting & Calibration)。
在先前獲得的候選路徑基礎上,這一層繼續處理其中的不確定性:系統結合模型推理結果與外部校準信號,為不同結果分配概率,並利用預測市場資訊、歷史預測表現和概率評分規則對這些概率進行校準。決策機所輸出的不再僅是一串「可能發生什麼」的情境描述,各條路徑還會附帶相應的概率判斷,並隨著新證據與推演結果持續更新。
我們可以將其理解為一張動態變化的「未來地圖」:貿易摩擦持續升級、雙方暫時緩和,或出現新的突發變數,都可能成為不同的分支。系統會判斷每條路徑發生的可能性,以及哪些變化會讓某一條路變得更有可能。

圖 6:概率預測模組
至此,決策機將一輪完整的決策推演串聯起來。
Experimental validation: Is this decision framework effective?
The report used several sets of experiments to test the decision engine's inference system, with the most noteworthy being the results of "event inference and probability prediction".
先來看自建事件預測集,觀察結構化推演能否改善事件預測。團隊自建了一個包含 74 個事件、370 個二元判斷問題的數據集,覆蓋多個高不穩定性事件類別,並將不同預測跨度納入評測。在團隊的評測設置下,決策機整體結果為 78.41%。
此外,在 LLM-NEWS 設置中,針對 3-30 天短期組,決策機結果為 72.80%,GPT-5.5 和 Claude-4.7 分別為 35.43% 和 44.62%;進入中期和長期後,差距逐漸縮小。也就是說,結構化推演在局勢快速變化、歷史規律較難沿用的短期場景中,相對優勢更明顯。

然後是在公開預測市場基準 PolyBench 上的補充實驗。
決策機的 FFA(最終預測準確率)為 81.20%、EVPA(預期波動率預測準確率)為 73.40%、MSE(均方誤差)為 0.822,三項指標均優於 Gemini-3-Flash、MiMo-V2-Flash 和 Grok-4.1-Fast。這表明,決策機對市場概率變化方向的捕捉和概率誤差控制取得了更好的表現。

決策 AI 正在改變大模型的競爭單位
生成式 AI 以 Token 為基本計算單位,解決的是「下一段內容如何生成」;決策 AI 則以世界狀態的變化為基本計算對象,解決的是「一次行動將如何改變接下來的世界」。前者關心答案是否合理,後者還必須處理因果關係、現實約束、對手反應和概率變化。兩者之間並非簡單的能力疊加,而是計算範式的變化。
決策 AI 很難僅靠更大的參數規模和更強的語言能力自然湧現。進入開放世界後,基礎模型仍然重要,但它開始從整個系統本身,轉變為決策系統的組成部分。AI 競爭的單位,也由單一模型轉向完整系統。
決策機的技術意義在於,它將過去分散的能力組織成一套共同的決策架構。所謂「通用」,並非意味著預知所有領域的未來,而是不同領域的問題,都可以被轉譯為狀態、行動、結果、約束和不確定性,並進入同一套推演與求解框架。
從這個角度看,「全球首個通用決策大模型」的真正價值,不僅在於爭奪一個「第一」,更在於讓「通用決策大模型」有了較為完整的技术輪廓:用顯式狀態描述世界,用多智能體展開行動,用博弈與優化檢驗策略,再用概率校準不同的未來路徑。相應地,AI 的評估標準也開始發生變化——不僅要看回答是否準確,還要看狀態能否保持一致、推演能否被檢驗、概率是否可靠,以及新資訊出現後能否及時更新。
畢竟,一個聽起來正確的答案,並不等於一個經得起現實變化的事實決策。
本文來自微信公眾號「機器之心」(ID:almosthuman2014),作者:關注決策AI的
