數十年來,博弈論對於「兩個從此不再相見的陌生人是否應該合作」這個問題,一直有個明確的答案:絕對不應該。根據納什均衡,理性的選擇是始終背叛,每次都是,毫無例外。
來自 Google DeepMind、Mila-魁北克 AI 研究所和蘇黎世聯邦理工學院的一篇新研究論文指出,基於基礎模型構建的 AI 個體並未遵守這些規則,且他們有數學依據支持這一觀點。
必然背叛的終結
該論文於 2026 年 8 月 4 日提交至 arXiv,共 75 頁,包含 11 個圖表,並提出作者稱為「相似性推斷」的概念。其核心理念看似簡單:透過類似訓練過程建構的 AI 個體,能夠辨識這種相似性,並用以預測其他個體的行為。
古典博弈論將每位玩家視為完全獨立的決策者,這篇論文稱之為「解耦代理」。在該假設下,對手的選擇是一個黑箱。你無法預測它,因此選擇背叛以對沖風險。納什均衡成立,結果每個人的狀況都比合作時更糟。
由亞歷山大·莫勒曼斯領導的研究團隊提出了一種稱為「嵌入式代理」的替代框架。在這個模型中,代理將自身視為環境的一部分,而非與之分離。更重要的是,它們對自身的決策過程保持真正的不確定性。
這種不確定性是關鍵要素。由於代理無法完全確定自己將如何決策,它可以將自己的推理視為關於類似代理如何推理的證據。如果我傾向於合作,且我知道對手與我思考方式相似,那麼對手也很可能傾向於合作。這種邏輯會自我強化,進而形成穩定的合作結果。
嵌入式均衡取代納什
為此,該論文提出了一種稱為「嵌入式均衡」的新解決方案概念。納什均衡假設玩家獨立優化,而嵌入式均衡則考慮了因共享架構、訓練資料和優化程序而產生的代理之間的相關性。
在納什均衡下,單次囚徒困境中的合作是不理性的。在嵌入式均衡下,它可能是唯一理性的策略。
作者的實證發現顯示,置於社會困境中並配備優化規劃工具的基礎模型代理,確實會趨向於合作結果。數學預測了合作,而實驗也證實了這一點。
為何這不僅限於實驗室範疇
該論文也提出了問題:當代理之間並不相似時,會發生什麼情況?如果合作依賴於相似性推斷,那麼基於不同架構或在不同數據上訓練的代理之間的互動,可能會回歸到經典的背叛動態。
對於政策制定者和 AI 治理機構而言,嵌入式均衡概念引入了一個現有監管框架未考慮的變數。例如,反壟斷法通常需要明確溝通的證據來認定共謀,而透過相似性推斷進行合作的代理者並未進行任何溝通,它們只是想法相似。

