自變量機器人發布首個下一尺度自迴歸世界模型 WALL-SS,旨在解決機器人世界模型中動作與結果因果不一致的難題。該模型透過由粗到細的分層預測機制,讓不同動作真正對應不同結果,並實現最長 60 秒連續推演。測試顯示,WALL-SS 動作跟隨得分達 0.29,遠超 Cosmos3-Nano 的 0.044。自變量完成 600 組虛實配對實驗,任務成功率相關係數達 0.926,表明世界模型可幫助機器人在虛擬環境中提前驗證策略。文章作者、來源:極客公園
下一場機器人世界模型的競爭,可能不是畫質,而是架構。
作者|Li Yuan
編輯|鄭玄
機械臂的夾爪明明沒有夾住杯子,杯子卻像被磁鐵吸住一樣,跟著夾爪升了起來。這個看似荒謬的問題,正在困擾機器人世界模型,業界甚至將其稱為「磁鐵式抓取」。
視頻生成模型只需讓畫面看起來合理,就算完成任務;但世界模型不能只追求「像真的」。機器人訓練數據大多來自成功示範,模型容易走捷徑:與其理解動作的細微差別,不如根據畫面直接生成最可能的結果。
在現實世界中,夾爪位置偏移幾毫米,就可能讓結果從抓起變成碰倒杯子甚至抓空。世界模型真正需要理解的,是動作與結果之間的因果關係。
於 8 月 27 日,自變量機器人發布下一尺度自迴歸世界模型 WALL-SS,試圖讓世界模型從「能用」走向「好用」。WALL-SS 不是一次性生成整個畫面,而是透過由粗到細的方式描繪未來,讓不同動作真正對應不同結果;同時結合長時記憶機制,實現最長 60 秒連續推演。
測試顯示,WALL-SS 在連續推演 60 秒後,畫面和運動軌跡仍更接近真實影片,動作跟隨得分達到 0.29,而 Cosmos3-Nano 為 0.044,其他測試模型則直接為 0。可以說,WALL-SS 是少數畫面預測會跟隨動作指令的模型。
自變量同時宣布發佈 WALL-SS。對於尚未形成統一技術路線的機器人世界模型而言,發佈的意義不僅是開放一個模型,更是讓行業共同驗證:世界模型是否在按照動作做預測,虛擬推演能否真正服務於真實機器人。
「當技術範式尚未收斂時,持續探索本身就是競爭力。」具身智能所需的不只是快速落地的硬體,也需要持續挑戰既有路線、開拓核心技術邊界的公司。
世界模型,成為具身智能的主賽道
在 2026 年,世界模型正成為機器人領域最受關注的技術方向之一。
NVIDIA 持續迭代 Cosmos,並開始將視頻世界模型應用於機器人控制與規劃;Meta 的 V-JEPA 2 嘗試讓機器人透過預測物理世界的變化,在陌生環境中完成抓取。越來越多研究也開始探索以世界模型取代部分實機測試,讓機器人在「動手」之前,先在虛擬世界中預測不同策略的結果。
理解這股熱潮並不複雜。大語言模型透過預測下一個詞來學習語言規律,而世界模型預測的則是下一刻的世界:機器人向左移動,杯子會不會被碰倒;夾爪再收緊一點,物體能不能被抓起;一個動作持續執行十秒,場景最終會變成什麼樣。
這對具身智能尤其重要。過去幾年,行業主要解決的是機器人「怎麼做」的問題,VLA 可以根據視覺和語言指令直接輸出動作。但隨著機器人能力提升,一個新的問題變得越來越突出:如何判斷一套策略到底好不好?
如果每次模型迭代都依賴真機測試,成本高、週期長,很容易成為訓練和迭代的瓶頸。傳統模擬雖然可以承擔部分測試,但需要人工建模物體材質、摩擦、變形和接觸關係,很難覆蓋真實世界的複雜性。世界模型則試圖從真實影片和機器人交互數據中學習世界如何變化,讓機器人可以在虛擬環境中反覆預測和驗證策略。
它甚至可以進一步參與機器人的決策。VLA 在看到杯子後直接決定「伸手去抓」,而世界模型則可先預測不同動作的後果,再協助機器人選擇更合適的策略——從「直接行動」走向「先想像,再行動」。

但要真正成為具身智能的基礎設施,今天的世界模型仍面臨三個關鍵門檻。
第一是動作與結果的因果一致性。模型不能只生成符合預期的畫面,而必須準確反映動作帶來的結果,否則一個實際上抓不住杯子的策略,也可能在虛擬世界裡被判定為成功。
第二是長時推演能力。機器人任務通常持續數十秒甚至更久,模型需要不斷將自己的預測作為下一刻的輸入,任何微小誤差都可能在持續推演中累積。
第三是虛擬預測與真機實操的一致性。生成得再逼真、推演得再長,也不意味著模型真的能夠評估機器人策略。只有虛擬世界中的表現能夠與真機結果建立穩定對應,世界模型才真正具備替代部分真實試錯的價值。
這三道門檻,也正在成為下一階段世界模型競爭的核心。
WALL-SS,從架構底層改進世界模型
WALL-SS 正是針對這些問題的一次新嘗試。按照論文介紹,它是首個採用下一尺度自迴歸架構的世界模型。
此前,不少世界模型沿用視頻 Diffusion 的思路:輸入歷史畫面和動作,通過多輪去噪生成未來視頻。動作雖然是生成條件,但沒有被明確寫進「動作→結果」的生成鏈條裡,因此模型很容易依賴視覺先驗,直接預測一個「大概率成功」的未來——即使夾爪實際上沒有夾住杯子,也可能生成杯子被成功拿起的畫面。
WALL-SS 將觀察與動作組織成「觀察—動作—新觀察」的因果序列,讓動作真正參與未來狀態的生成。簡單來說,就是先確定世界如何變化,再逐層補足細節:粗尺度確定機械臂和物體的大致狀態,細尺度進一步還原運動和接觸。再配合失敗、接管和糾偏數據,讓模型學會「動作不同,結果也不同」。
此能力已在指標上得到驗證。WALL-SS 的動作跟隨得分達到 0.29,軌跡準確率達到 0.539;相比之下,Cosmos3-Nano 的動作跟隨得分僅為 0.044。其他模型的得分則為 0。
另一個關鍵問題是,世界模型能否「記住足夠長的時間」。WALL-SS 透過多尺度長期記憶保留近期細節、壓縮遠期歷史,並讓模型在訓練時基於自身的預測繼續推演,從而減少誤差不斷累積的問題。這使得模型能夠連續推演 60 秒,而其他模型的極限僅為 20-30 秒。
更重要的是,這些能力最終接受了真實機器人的檢驗。自變量讓同一套策略分別在 WALL-SS 和真實機器人上執行,完成 600 組虛實配對實驗。結果顯示,兩者任務成功率的相關係數達到 0.926,對不同策略強弱的排序準確率達到 89%。
這意味著世界模型開始具備一個更重要的價值:不僅僅是生成「看起來真實」的未來,而是能夠幫助機器人判斷不同動作會帶來什麼結果,並在虛擬世界中提前驗證策略。
當然,WALL-SS 目前仍有邊界。其動作輸入主要包括機械臂末端位置、朝向和夾爪開合,不包含完整關節狀態、力和力矩,因此對精細接觸和多指靈巧手的支持仍有待進一步驗證。
在路線尚未收斂時,持續進行架構創新
WALL-SS 不是突然追逐世界模型熱潮的結果。過去一年,自變量一直在探索同一個問題:如何讓機器人對世界的理解、對動作的預測與真實執行真正連接起來。
WALL-OSS 透過大規模多模態預訓練,將視覺、語言和機器人動作納入同一個具身基礎模型;WALL-OSS-0.5 進一步推動預訓練能力向真實機器人遷移;隨後,WALL-WM 開始聯合建模世界變化與機器人動作,X-Tokenizer 則探索不同機器人、不同動作如何進入統一模型。到了 WALL-SS,這條路線進一步指向一個核心問題:執行一個動作之後,世界究竟會發生什麼。
貫穿這一系列探索的,是自變量對「世界-動作」統一建模的長期投入。機器人不僅要能夠行動,還要能夠預判行動的後果,並根據結果不斷修正自己的行為。隨著模型、數據、本體和真機經驗不斷累積,這些探索也逐漸形成相互反饋的技術閉環。
而具身智能的基礎架構,遠未收斂。在這個階段,真正重要的是並非每次嘗試都能押中最終答案,而是能否持續提出新的架構假設,透過數據和實機驗證,再根據結果不斷調整路線。
此次宣布發布 WALL-SS,也是這一思路的延續。發布的不僅僅是一個模型,更是一套可由行業共同驗證的技術路線:下一尺度的自迴歸是否更適合機器人,動作與結果能否真正對應,虛擬測試能否反映真實機器人的表現。研究者可基於此繼續探索,機器人公司也可直接驗證其是否能納入自身的訓練與評測體系。
這也是發布對於早期具身智能產業更重要的意義:降低行業探索成本,並讓不同路線在真實應用中接受檢驗。
過去幾年,國內具身智能的競爭更多集中在本體、數據和產品落地。但一個尚未定型的行業,不能只等著成熟架構出現後再追趕,也需要有人進入世界模型、動作表徵和學習範式這些更底層的位置,持續尋找下一種可能。
WALL-SS 當然不是最終答案,但它代表了一種變化:國內公司開始不再只是跟隨現有路線,而是提出自己的架構假設,並將其開放以接受行業檢驗。
當技術路線真正發生切換時,決定一家公司的不只是它有沒有跟上上一代,而是它是否始終保留著探索下一代的能力。

