Self-Variable、WALL-SSワールドモデルをリリースし、主要なロボットシミュレーション課題に対応

iconMetaEra
共有
AI summary icon概要
Self-Variableは、ロボットシミュレーションの精度向上を目的とした次世代の自己回帰的世界モデル「WALL-SS」をリリースしました。このモデルは、粗から細への階層的メカニズムを採用し、60秒間の連続シミュレーションと0.29のアクションフォローアスコアを実現(Cosmos3-Nanoの0.044を大幅に上回ります)。600回の仮想-現実ペア実験により、タスク成功率为0.926と確認され、デプロイ前テストにおける価値が証明されました。AIの不適切利用に対する世界的な規制強化が進む中、WALL-SSのようなモデルは、自動化システムにおける予測不可能な結果を削減することで、CFTへの支援が期待されます。
自变量ロボットは、ロボット世界モデルにおける行動と結果の因果不一致の課題を解決することを目的とした、最初の次スケール自己回帰世界モデルWALL-SSをリリースしました。このモデルは、粗から細への階層的予測メカニズムを採用し、異なる行動が真正に異なる結果に対応し、最長60秒の連続推論を実現します。テスト結果では、WALL-SSの行動追従スコアは0.29と、Cosmos3-Nanoの0.044を大幅に上回りました。自变量は600組の仮想と現実のペア実験を完了し、タスク成功率の相関係数は0.926に達し、この世界モデルがロボットに仮想環境で戦略を事前検証するのを支援できることを示しています。

記事執筆者、出典:ゲークパーカー

ロボットの世界モデルにおける次なる競争は、解像度ではなくアーキテクチャになるかもしれない。

著者|Li Yuan

編集|鄭玄

機械アームのグリッパーがコップを挟んでいないにもかかわらず、コップがマグネットに吸い寄せられたようにグリッパーと共に持ち上がってしまう。この見かけ上不合理な問題は、ロボット世界モデルを悩ませており、業界ではこれを「マグネット式グリッピング」と呼んでいる。

ビデオ生成モデルは、映像が合理的に見えるだけでタスクを達成できるが、世界モデルは「本物のように見える」ことだけを追求してはいけない。ロボットの訓練データは主に成功したデモから得られるため、モデルは動作の細かい違いを理解するよりも、映像に従って最も可能性の高い結果を直接生成する傾向がある。

現実世界では、グリッパーの位置が数ミリずれるだけで、結果が掴むからカップを倒したり、掴み損ねたりしてしまう可能性があります。世界モデルが真正に理解すべきは、行動と結果との間の因果関係です。

8月27日、自变量ロボットは次世代の自己回帰世界モデル「WALL-SS」をリリースし、世界モデルを「使える」から「使いやすい」へと進化させようとしています。WALL-SSは一度に全体の画像を生成するのではなく、粗から細へと段階的に未来を描き出し、異なるアクションが真正に異なる結果に対応するようにします。また、長期記憶メカニズムを組み合わせることで、最大60秒間の連続推論を実現します。

テスト結果によると、WALL-SSは60秒間連続推論を行っても、画面上の動きの軌跡が実際の動画に最も近く、動作追従スコアは0.29を達成しました。一方、Cosmos3-Nanoは0.044であり、他のテストモデルはいずれも0でした。つまり、WALL-SSは動作指示に従って画面上の予測を追従できる数少ないモデルの一つです。

自変数は同時にWALL-SSをリリースしました。統一された技術路線を確立していないロボット世界モデルにおいて、このリリースの意義は単に1つのモデルをオープンにすることだけでなく、業界全体で検証することを促すものです。つまり、世界モデルが行動に基づいて予測を行っているのか、仮想シミュレーションが実際のロボットに真に役立つのかを確認する機会となります。

技術パラダイムが収束していない段階では、継続的な探求自体が競争力である。エムボディードAIには迅速な実装を可能にするハードウェアだけでなく、既存の路線に挑戦し、コア技術の境界を広げ続ける企業も必要である。

世界モデルがエMBODIED INTELLIGENCEの主要な分野となる

2026年、ワールドモデルはロボット分野で最も注目されている技術の1つとなっている。

NVIDIAはCosmosを継続的に進化させ、動画世界モデルをロボットの制御と計画に適用し始めている。MetaのV-JEPA 2は、ロボットが物理世界の変化を予測することで、未知の環境で物を掴むことを試みている。さらに、多くの研究が世界モデルを用いて実機テストの一部を置き換え、ロボットが「実際に行動する」前に仮想世界で異なる戦略の結果を予測することを探索している。

この熱潮を理解することは複雑ではない。大規模言語モデルは次の単語を予測することで言語の規則を学習するのに対し、世界モデルは次の瞬間の世界を予測する。ロボットが左に移動したとき、コップは倒れるか?グリッパーをもう少し強く閉じれば、物体はつかめるか?ある動作を10秒間継続した場合、シーンは最終的にどうなるか?

これはエMBODIED INTELLIGENCEにとって特に重要です。過去数年間、業界はロボットの「どのように実行するか」という問題に主に取り組んできましたが、VLAは視覚と言語の指示に基づいて直接動作を出力できます。しかし、ロボットの能力が向上するにつれて、新たな課題がますます顕著になっています:ある戦略が本当に優れているかどうかをどう判断するか。

各モデルのイテレーションごとに実機テストを依存すると、コストが高く、サイクルが長くなり、学習とイテレーションのボトルネックになりやすい。従来のシミュレーションは一部のテストを担えるが、物体の材質、摩擦、変形、接触関係を人為的にモデリングする必要があり、現実世界の複雑さをカバーするのは難しい。一方、ワールドモデルは、実際の動画やロボットのインタラクションデータから世界の変化を学習し、ロボットが仮想環境で戦略を繰り返し予測・検証できるようにすることを目指している。

それはさらにロボットの意思決定に参加することさえできます。VLAはコップを見た直後に「手を伸ばしてつかむ」と決定しますが、世界モデルは異なる行動の結果をまず予測し、ロボットがより適切な戦略を選択するのを支援します——「直接行動」から「まず想像し、その後行動」へと進化します。

画像

しかし、真正のエムボディードインテリジェンスのインフラストラクチャーとなるためには、今日のワールドモデルはまだ3つの重要なハードルを乗り越える必要がある。

第一は行動と結果の因果的一致性である。モデルは期待される映像を生成するだけでなく、行動がもたらす結果を正確に反映しなければならない。そうでなければ、実際にはコップを掴めない戦略でも、仮想世界では成功と判定されてしまう可能性がある。

第二に、長期予測能力です。ロボットのタスクは数十秒、あるいはそれ以上続くことが多く、モデルは自分の予測を次時の入力として継続的に使用する必要があります。微小な誤差でも、長期的な予測の過程で蓄積する可能性があります。

第三に、仮想予測と実機運用の一貫性です。たとえ生成されたシナリオがいかにリアルで、シミュレーションがいかに長くても、モデルがロボット戦略を真正に評価できるとは限りません。仮想世界におけるパフォーマンスが実機の結果と安定した対応関係を築くとき、世界モデルはようやく現実の試行錯誤の一部を代替する価値を有します。

この3つの障壁は、次段階の世界モデル競争の核心となっている。

WALL-SS、アーキテクチャの基盤から世界モデルを改善

WALL-SSは、これらの課題に対する新たな試みです。論文によると、これは次スケール自己回帰アーキテクチャを採用した初のワールドモデルです。

以前、多くの世界モデルはビデオDiffusionのアプローチを採用していた:過去の映像と動作を入力し、複数回のノイズ除去を通じて未来のビデオを生成する。動作は生成条件ではあるが、「動作→結果」の生成チェーンに明確に組み込まれていなかったため、モデルは視覚的先行知識に頼りやすく、実際にグリッパーがコップを掴んでいなくても、コップが成功裏に持ち上げられる映像を予測してしまうことが多かった。

WALL-SSは、観測と行動を「観測—行動—新規観測」という因果的系列として整理し、行動が未来の状態生成に真正に参加するようにします。簡単に言えば、まず世界の変化を大まかに決定し、その後段階的に詳細を補完します。粗いスケールでロボットアームと物体の概要な状態を決定し、細かいスケールで運動や接触をさらに再現します。これに失敗、接管、修正データを組み合わせることで、モデルは「行動が異なれば結果も異なる」ことを学びます。

この能力は指標によって検証されています。WALL-SSのアクションフォロースコアは0.29、トレジャリーアキュラシーは0.539に達しました。一方、Cosmos3-Nanoのアクションフォロースコアは0.044にすぎません。他のモデルはいずれも0点でした。

もう一つの重要な課題は、世界モデルが「十分長く記憶できるか」です。WALL-SSは、多スケールの長期記憶を用いて最近の詳細を保持し、遠い過去の履歴を圧縮することで、モデルが訓練中に自身の予測を継続して推論できるようにし、誤差の蓄積を削減します。これにより、モデルは60秒間連続して推論できますが、他のモデルでは20〜30秒が限界です。

さらに重要なのは、これらの能力が実機で検証されたことです。自変数により、同じ戦略をWALL-SSと実際のロボットにそれぞれ実行させ、600組の仮想・実機対応実験を完了しました。その結果、両者のタスク成功率の相関係数は0.926に達し、異なる戦略の強弱順位の正確な予測率は89%でした。

これは、世界モデルがより重要な価値、すなわち「見た目がリアル」な未来を生成するだけでなく、ロボットが異なる行動がどのような結果をもたらすかを判断し、仮想世界で戦略を事前に検証できるようになることを意味します。

もちろん、WALL-SS には現在も制限があります。その動作入力はロボットアームの端末位置、方向、およびグリッパーの開閉を主に含み、完全な関節状態、力、トルクは含まれていないため、微細な接触や多指デキストロスハンドのサポートについてはさらなる検証が必要です。

ルートが収束する前に、アーキテクチャの革新を継続してください

WALL-SSは、突然世界モデルのブームを追いかける結果ではない。過去1年間、自変数は同じ課題、すなわちロボットの世界理解と行動予測を現実の実行と真正に結びつける方法を探求してきた。

WALL-OSSは大規模なマルチモーダル事前学習を通じて、視覚、言語、ロボット動作を同じエムボディード基礎モデルに統合する。WALL-OSS-0.5は、事前学習能力を実機への移行さらに推進する。その後、WALL-WMは世界の変化とロボット動作の連携モデリングを開始し、X-Tokenizerは異なるロボットや異なる動作をどのように統一モデルに取り込むかを探索する。そしてWALL-SSに至って、この路線は核心的な問いへと導かれる:ある動作を実行した後、世界は実際にどう変化するのか。

この一連の探求を貫いているのは、自変数が「世界-行動」の統一モデルへの長期的な投資である。ロボットは行動できるだけでなく、行動の結果を予測し、その結果に基づいて自らの行動を継続的に修正できる必要がある。モデル、データ、本体、実機経験が蓄積するにつれて、これらの探求は徐々に相互にフィードバックする技術的閉ループを形成している。

エMBODIED INTELLIGENCEの基盤アーキテクチャは、まだ収束していません。この段階で重要なのは、毎回の試行が最終的な正解を的中させることではなく、新しいアーキテクチャの仮説を継続的に提起し、データと実機で検証し、その結果に基づいて路線を継続的に調整できるかどうかです。

今回の自変数によるWALL-SSの発表は、この考えの継続でもあります。単に1つのモデルを発表するだけでなく、業界全体で検証可能な技術路線を提示しました。次世代の自己回帰モデルはロボットに適しているのか、動作と結果は本当に一致するのか、仮想テストは実機のパフォーマンスを反映できるのか。研究者はこれを基にさらに探求でき、ロボット企業は直接、この技術を自社のトレーニングおよび評価システムに組み込めるかどうかを検証できます。

これは、初期のエンボディードAI産業にとってより重要な意味を持ちます:業界の探索コストを削減し、異なるアプローチを実際のアプリケーションで検証可能にします。

過去数年、国内のエンボディード・インテリジェンスの競争は、本体、データ、製品の実装に集中していた。しかし、まだ形になっていない業界は、成熟したアーキテクチャが現れるのを待つだけでは不十分であり、世界モデル、アクション表現、学習パラダイムといったより基礎的な分野に進出し、次なる可能性を継続的に探求する人も必要である。

WALL-SSは当然最終的な答えではないが、国内企業が既存の路線に従うだけでなく、自らのアーキテクチャ仮説を提示し、業界の検証に晒し始めており、その変化を示している。

技術路線が実際に切り替わるとき、企業を決めるのは、それが前世代に追いついたかどうかではなく、常に次世代を探究する能力を維持しているかどうかである。

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。