過去一年,「世界模型」已成為 AI 行業最被濫用的詞彙之一。 能生成連續影片,就叫世界模型;能讓玩家在畫面中走幾步,也叫世界模型;機器人、影片生成、3D、具身智能這幾條完全不同的路線,都在往自己身上貼這個標籤。這個詞聽起來越來越宏大,含義卻越來越模糊。 World Labs 之前做了一件有點冒犯同行的事:他們先為「世界模型」劃了一條標準。僅僅能生成你下一眼看到的內容還不夠;一個系統至少得知道物體在哪裡、彼此之間是什麼關係、狀態如何變化,才算開始接近模擬一個世界。 這也正是我寫這篇文章的原因。 世界模型下一階段的分水嶺,可能不在畫面生成得多逼真,而在於模型是否具備一個機器能夠讀取、測量和操作的內部世界。Atlas 還遠未解決這個問題,但它至少把問題擺對了。 而今天許多被稱為世界模型的東西,回頭看,最終可能只是更先進的影片生成器。

