Самостоятельная робототехническая система выпустила первую в своем классе авторегрессивную мировую модель WALL-SS, предназначенную для решения проблемы несоответствия между действиями и результатами в мировых моделях роботов. Модель использует иерархический механизм предсказания от грубого к детальному, обеспечивая точное соответствие между различными действиями и их результатами, а также позволяя осуществлять непрерывное моделирование до 60 секунд. Тесты показали, что показатель следования действиям WALL-SS достиг 0,29, что значительно превышает показатель 0,044 у Cosmos3-Nano. Самостоятельная робототехническая система провела 600 экспериментов с виртуально-реальными парами, коэффициент корреляции успешности выполнения задач составил 0,926, что свидетельствует о том, что мировая модель может помочь роботам заранее проверять стратегии в виртуальной среде.Автор и источник статьи: GeekPark
Следующее соревнование в мире моделей роботов может быть не в качестве изображения, а в архитектуре.
Автор | Ли Юань
Редактировал: Чжэн Сюань
Захват механической руки явно не схватил стакан, но стакан поднялся вместе с захватом, как будто его притягивает магнит. Эта кажущаяся абсурдной проблема беспокоит модели роботов, и в отрасли её даже называют «магнитным захватом».
Видео-генеративные модели выполняют свою задачу, если изображение выглядит правдоподобно; однако модели мира не могут ограничиваться лишь «похожестью на реальное». Данные для обучения роботов в основном поступают из успешных демонстраций, из-за чего модели склонны искать пути наименьшего сопротивления: вместо того чтобы понимать тонкости действий, они просто генерируют наиболее вероятный результат на основе изображения.
В реальном мире смещение захвата на несколько миллиметров может привести к тому, что вместо захвата будет опрокинут стакан или захват вообще не состоится. То, что действительно необходимо понять модели мира, — это причинно-следственная связь между действиями и результатами.
27 августа автономный робот опубликовал следующую версию авторегрессивной мировой модели WALL-SS, стремясь перевести мировые модели от «пригодных для использования» к «удобным в применении». WALL-SS не генерирует всю сцену сразу, а постепенно прорисовывает будущее от общего к детальному, обеспечивая соответствие между различными действиями и их результатами; одновременно модель использует механизм долгосрочной памяти, позволяя осуществлять непрерывное прогнозирование до 60 секунд.
Тесты показали, что после 60-секундной последовательной симуляции WALL-SS сохраняет изображение и траекторию движения, более близкие к реальному видео, с оценкой следования движениям 0,29, в то время как Cosmos3-Nano показал 0,044, а другие тестовые модели получили 0. Можно сказать, что WALL-SS — это одна из немногих моделей, способных предсказывать изображение в соответствии с командами движения.
Самостоятельно объявлено о выпуске WALL-SS. Для мировых моделей роботов, которые еще не сформировали единую техническую линию, выпуск имеет значение не только в открытии модели, но и в том, чтобы отрасль совместно проверила: действительно ли мировые модели делают прогнозы на основе действий и могут ли виртуальные симуляции действительно служить реальным роботам.
Когда технологическая парадигма еще не стабилизировалась, постоянное исследование само по себе является конкурентным преимуществом. Компаниям, занимающимся встраиваемым интеллектом, нужны не только быстрые аппаратные решения, но и компании, которые постоянно ставят под сомнение существующие подходы и расширяют границы ключевых технологий.
Модели мира — главный маршрут к эмбоди-интеллекту
В 2026 году мировые модели становятся одним из самых интересных направлений в робототехнике.
NVIDIA продолжает развивать Cosmos и начинает применять видео-модели мира для управления и планирования роботов; V-JEPA 2 от Meta пытается научить роботов выполнять захват в незнакомых средах, предсказывая изменения в физическом мире. Все больше исследований также исследуют возможность замены части реальных тестов моделями мира, позволяя роботам предсказывать результаты различных стратегий в виртуальном мире до того, как приступить к действиям.
Понять эту волну несложно. Большие языковые модели учатся предсказывать следующее слово, а модели мира предсказывают следующее состояние мира: сдвинется ли робот влево и опрокинется ли чашка; сможет ли захват плотнее сжаться и поднять объект; как изменится сцена, если действие будет повторяться десять секунд.
Это особенно важно для встроенных интеллектуальных систем. В последние годы отрасль в основном решала вопрос «как» роботы должны действовать, и VLA может напрямую генерировать действия на основе визуальных и языковых команд. Однако по мере повышения способностей роботов все более актуальным становится новый вопрос: как определить, насколько хороша та или иная стратегия?
Если каждая итерация модели зависит от тестирования на реальном оборудовании, это приводит к высоким затратам и длительному циклу, что легко становится узким местом для обучения и итераций. Традиционное моделирование может частично взять на себя тестирование, но требует ручного моделирования материалов объектов, трения, деформации и контактных взаимодействий, что сложно сделать в полной мере для воспроизведения сложности реального мира. Модели мира стремятся учиться на реальных видео и данных взаимодействия роботов, чтобы понять, как меняется мир, позволяя роботам многократно предсказывать и проверять стратегии в виртуальной среде.
Он даже может участвовать в принятии решений роботом. После того как VLA увидела чашку, она сразу решила «потянуться и схватить», тогда как модель мира может сначала предсказать последствия различных действий и помочь роботу выбрать более подходящую стратегию — перейдя от «прямых действий» к «сначала представить, потом действовать».

Но для того чтобы стать инфраструктурой для встраиваемого интеллекта, современные модели мира все еще сталкиваются с тремя ключевыми барьерами.
Первое — это причинно-следственная согласованность между действием и результатом. Модель не может просто генерировать изображения, соответствующие ожиданиям; она должна точно отражать результаты, вызванные действиями, иначе стратегия, которая на самом деле не может ухватить чашку, может быть ошибочно признана успешной в виртуальной среде.
Во-вторых, это способность к долгосрочному прогнозированию. Задачи роботов часто длятся десятки секунд и даже дольше, и модель должна постоянно использовать свои прогнозы в качестве входных данных для следующего момента, при этом любая незначительная ошибка может накапливаться в процессе длительного прогнозирования.
Третье — это согласованность между виртуальным прогнозированием и реальными операциями. Даже если модель генерирует максимально реалистичные сценарии и проводит длительные моделирования, это не означает, что она действительно способна оценивать стратегии роботов. Только когда результаты в виртуальной среде стабильно коррелируют с реальными результатами, модель мира действительно приобретает ценность как замена части реальных экспериментов с ошибками.
Эти три барьера также становятся центральными в конкуренции мировых моделей на следующем этапе.
WALL-SS, улучшение мировой модели снизу, с архитектурной точки зрения
WALL-SS — это новая попытка решить именно эти проблемы. Согласно описанию в статье, это первая мировая модель, использующая архитектуру следующего масштаба с авторегрессией.
Ранее многие мировые модели использовали подход видео Diffusion: на вход подавались исторические кадры и действия, а будущее видео генерировалось через несколько итераций шумоподавления. Хотя действия служили условием генерации, они не были явно включены в генерационную цепочку «действие → результат», из-за чего модель легко полагалась на визуальные предпосылки и напрямую предсказывала «наиболее вероятно успешный» исход — даже если захват не удерживал чашку, модель могла сгенерировать изображение, на котором чашка успешно поднята.
WALL-SS организует наблюдения и действия в причинно-следственную последовательность «наблюдение — действие — новое наблюдение», позволяя действиям действительно участвовать в формировании будущего состояния. Проще говоря, сначала определяется, как изменяется мир, а затем постепенно дополняются детали: на крупном масштабе определяется примерное состояние манипулятора и объекта, а на мелком масштабе воссоздаются движение и контакт. В сочетании с данными об ошибках, перехвате и коррекции модель учится, что «разные действия приводят к разным результатам».
Эта способность подтверждена показателями: показатель следования действиям WALL-SS достиг 0,29, точность траектории — 0,539; в то время как показатель следования действиям Cosmos3-Nano составил всего 0,044. Другие модели получили оценку 0.
Еще один ключевой вопрос — способна ли мировая модель «помнить достаточно долго». WALL-SS сохраняет недавние детали с помощью многомасштабной долгосрочной памяти, сжимает дальнюю историю и позволяет модели продолжать прогнозирование на основе собственных предсказаний во время обучения, уменьшая накопление ошибок. Это позволяет модели непрерывно прогнозировать в течение 60 секунд, тогда как для других моделей пределом уже является 20–30 секунд.
Важнее всего то, что эти способности в итоге прошли проверку на реальных устройствах. Переменные позволили запустить одну и ту же стратегию как на WALL-SS, так и на реальных роботах, проведя 600 парных экспериментов виртуального и реального режимов. Результаты показали, что коэффициент корреляции между успешностью задач на обоих платформах достиг 0,926, а точность ранжирования по силе различных стратегий составила 89%.
Это означает, что мировая модель начинает обладать более важной ценностью: не просто генерировать «выглядящие реальными» сценарии будущего, а помогать роботам определять, какие результаты принесут различные действия, и заранее проверять стратегии в виртуальной среде.
Конечно, у WALL-SS пока есть ограничения. Его входные данные включают в себя положение, ориентацию и открытие/закрытие захвата конца манипулятора, но не содержат полной информации о состоянии суставов, силах и моментах, поэтому поддержка тонкого взаимодействия и многопальцевых ловких рук требует дальнейшей проверки.
Продолжайте внедрять инновации в архитектуре, пока маршрут не стабилизируется.
WALL-SS не является результатом внезапного стремления к популярности моделей мира. В течение последнего года Self-Variable исследовала ту же самую проблему: как действительно соединить понимание мира роботом, прогнозирование действий и их реальное выполнение.
WALL-OSS с помощью масштабного мультимодального предварительного обучения объединяет визуальные, языковые и робототехнические действия в единую эмбоди-базовую модель; WALL-OSS-0.5 дальнейшим образом расширяет возможности предварительного обучения для переноса на реальные устройства; затем WALL-WM начинает совместно моделировать изменения в мире и робототехнические действия, а X-Tokenizer исследует, как различные роботы и действия могут быть интегрированы в единую модель. На этапе WALL-SS этот подход дополнительно направляется на ключевой вопрос: что именно происходит в мире после выполнения действия?
В основе всей этой серии исследований лежит долгосрочная инвестиция в совместное моделирование «мира-действия». Роботы должны не только выполнять действия, но и предсказывать их последствия, а также постоянно корректировать свое поведение на основе результатов. По мере накопления моделей, данных, онтологий и опыта на реальных устройствах эти исследования постепенно формируют взаимно усиливающий технический цикл.
Базовая архитектура встраиваемого интеллекта пока далека от конвергенции. На этом этапе важно не то, что каждая попытка угадает окончательный ответ, а способность постоянно формулировать новые гипотезы архитектуры, проверять их с помощью данных и реальных устройств, а затем постоянно корректировать курс на основе результатов.
Объявление о выпуске WALL-SS является продолжением этой идеи. Выпускается не просто модель, а целая технологическая дорожная карта, которую отрасль может совместно проверить: подходит ли следующий масштаб авторегрессии для роботов, могут ли действия и результаты действительно соответствовать друг другу, и могут ли виртуальные тесты отражать реальную производительность роботов. Исследователи могут продолжить изучение на этой основе, а компании, занимающиеся робототехникой, могут напрямую проверить, можно ли внедрить её в свои системы обучения и оценки.
Это также имеет более важное значение для раннего этапа отрасли встраиваемого интеллекта: снижение затрат на исследование отрасли и проверка различных подходов в реальных приложениях.
В последние годы конкуренция в области встраиваемого интеллекта в стране сосредоточивалась в основном на теле, данных и внедрении продуктов. Однако в отрасли, которая еще не сформировалась, нельзя просто ждать появления зрелой архитектуры, прежде чем начинать догонять — нужны люди, которые войдут на более фундаментальные уровни, такие как мировые модели, представление действий и обучающие парадигмы, и постоянно ищут следующую возможность.
WALL-SS, конечно, не является окончательным ответом, но он символизирует изменение: китайские компании начинают не просто следовать уже существующим маршрутам, а предлагать собственные архитектурные гипотезы и открывать их для проверки отраслью.
Когда происходит настоящий переход на новую технологическую линию, решающим фактором для компании становится не то, успела ли она освоить предыдущее поколение, а сохраняет ли она способность исследовать следующее поколение.

