Lumunsad ang Self-Variable ng WALL-SS World Model, tinugon ang mga pangunahing hamon sa robot simulation

iconMetaEra
I-share
AI summary iconSummary
Kinilala ni Self-Variable ang WALL-SS, isang next-scale autoregressive world model na nakatuon sa pagpapabuti ng akurasyo ng robot simulation. Gumagamit ang model ng isang coarse-to-fine hierarchical mechanism, na nakakamit ng 60 segundo ng tuloy-tuloy na simulation at isang action-following score na 0.29—malayo sa 0.044 ng Cosmos3-Nano. Sa pamamagitan ng 600 virtual-real paired experiments, ipinakita ng model ang isang 0.926 task success rate, na nagpapatotoo sa kanyang halaga para sa pre-deployment testing. Habang lumalakas ang mga aksyon ng pagsasapilitan sa buong mundo laban sa pang-aabuso ng AI, maaaring suportahan ng mga model tulad ng WALL-SS ang CFT efforts sa pamamagitan ng pagbabawas ng hindi inaasahang resulta sa automated systems.
Ipinakilala ng Autonomous Robot ang unang self-regressive world model na WALL-SS, na naglalayong lutasin ang problema ng hindi pagkakaugnay ng aksyon at resulta sa robot world models. Sa pamamagitan ng hierarchical prediction mechanism na mula sa malawak hanggang sa detalyado, pinapahiwatig ng modelo na ang iba’t ibang aksyon ay may magkakaibang resulta, at nagpapahintulot sa pinakamahabang 60-segundo na continuous inference. Ang mga pagsusulit ay nagpakita na ang action-following score ng WALL-SS ay 0.29, na mas mataas nang malaki kumpara sa 0.044 ng Cosmos3-Nano. Nagtapos ang Autonomous Robot sa 600 pairs ng virtual-real experiments, na may correlation coefficient ng 0.926 sa task success rate, na nagpapakita na ang world model ay makakatulong sa robots na i-verify ang kanilang mga estratehiya sa virtual na kapaligiran bago isagawa.

May-akda ng artikulo, pinagkukunan: GeekPark

Ang susunod na laban sa mundo ng mga robot na modelo ay maaaring hindi ang kalidad ng imahe, kundi ang arkitektura.

May-akda | Li Yuan

Ipinagmamalaki ni郑玄

Ang panga ng isang robot arm ay hindi talaga nakakasakop sa baso, ngunit ang baso ay tulad na nakikinabang sa isang magnet at sumasama sa panga habang ito ay tataas. Ang tila absurd na problema na ito ay nagdudulot ng problema sa mga modelo ng robot, at tinatawag ito ng industriya bilang “magnetic grasp.”

Ang video generation model ay nakakatapos kung ang mga frame ay tila makatotohanan lamang; ngunit ang world model ay hindi maaaring mag-focus lamang sa “mukhang totoo.” Ang mga data para sa pagtatrabaho ng robot ay karamihan ay galing sa mga successful demonstration, kaya madaling bumuo ang model ng shortcut: sa halip na maunawaan ang mga subtil na pagkakaiba ng mga galaw, mas pipili ito na agad na mag-generate ng pinakamalaking posibilidad batay sa larawan.

Sa tunay na mundo, ang pagkilos ng ilang milymetro lamang ng posisyon ng clamps ay maaaring magdulot ng pagbabago mula sa paghawak sa pagkakalat o pagkawala ng baso. Ang tunay na kailangan ng world model ay ang pag-unawa sa ugnayan ng sanhi at epekto sa pagkilos at resulta.

Agosto 27, ang Autobot ay naglunsad ng susunod na antas ng autoregressive world model na WALL-SS, na naglalayong gawing “mga gamit” ang world model mula sa “mga magagamit.” Ang WALL-SS ay hindi nagbuo ng buong imahe nang isang beses, kundi naglalarawan ng hinaharap sa pamamagitan ng paraan mula sa malaki hanggang sa detalye, upang ang iba’t ibang aksyon ay makatugma sa iba’t ibang resulta; samantala, ito ay nagkakaisa sa mekanismo ng mahabang panahong memorya upang makamit ang pinakamahabang 60-sekondong tuloy-tuloy na pagpapalawak.

Ang mga pagsusulit ay nagpakita na, matapos ang 60-segundo na patuloy na pagpapalawak, ang larawan at galaw na track ng WALL-SS ay mas malapit sa totoong video, na nakakuha ng skor na 0.29 sa pagsubaybay sa galaw, habang ang Cosmos3-Nano ay 0.044, at ang iba pang mga modelo sa pagsusulit ay wala nang anumang skor. Maaaring sabihin na ang WALL-SS ay isa sa mga kaunting modelo na nakakasunod sa mga utos ng galaw sa paghula ng larawan.

Ang autonomic ay nagpahayag din ng paglalabas ng WALL-SS. Para sa mga robot world model na hindi pa nagkakaroon ng isang pinagsasamang teknikal na direksyon, ang paglalabas ay hindi lamang nagbubukas ng isang model, kundi nagpapatotoo rin sa industriya: kung ang world model ay nagpapalaya ng mga paghuhula batay sa mga aksyon, at kung ang virtual na simulasyon ay talagang makakatulong sa mga tunay na robot.

Habang ang teknikal na paradigma ay hindi pa nagkakaisa, ang patuloy na pag-aaral ay sariling kompetensya. Ang embodied intelligence ay nangangailangan hindi lamang ng mabilis na pagpapatupad ng hardware, kundi pati na rin ng mga kumpanya na patuloy na tinatapos ang umiiral na mga landas at pinapalawak ang mga hangganan ng pangunahing teknolohiya.

World Model, ang pangunahing track para sa embodied intelligence

Sa taon na 2026, ang world models ay nagsisiging isa sa pinakamalaking teknolohiyang pinag-uusapan sa larangan ng robotics.

Patuloy na ina-update ng NVIDIA ang Cosmos at nagsisimula nang gamitin ang video world model para sa pagkontrol at pagpaplano ng robot; sinubukan ng V-JEPA 2 ng Meta na pahintulutan ang mga robot na kumpletuhin ang paghawak sa mga bagong kapaligiran sa pamamagitan ng paghula sa pagbabago ng pisikal na mundo. Dumarami rin ang mga pag-aaral na nag-aaral kung paano gamitin ang world model upang palitan ang ilang mga pagsusulit sa totoong robot, upang mabigyan ng pagkakataon ang mga robot na hulaan ang resulta ng iba’t ibang estratehiya sa virtual na mundo bago sila mag-act.

Hindi komplikado ang pag-unawa sa pagtaas na ito. Ang mga malalaking modelo sa wika ay natututo ng mga pattern ng wika sa pamamagitan ng paghuhula sa susunod na salita, habang ang mga modelo sa mundo ay humuhula sa susunod na sandali ng mundo: magkakaroon ba ng paggalaw ang robot papaliwa, babagsak ba ang baso; mas higit pang pagsisigla ng paa, makakahawak ba ang bagay; kung isasagawa ang isang galaw nang sampung segundo, ano ang huling anyo ng paligid?

Mahalaga lalo na para sa embodied intelligence. Sa mga nakaraang taon, ang pangunahing problema na nalutas ng industriya ay ang “paano gawin” ng mga robot, kung saan ang VLA ay direktang naglalabas ng mga galaw batay sa mga visual at wika na utos. Ngunit habang tumataas ang kakayahan ng mga robot, lumalabas ang isang bagong problema: paano matukoy kung gaano kahusay ang isang estratehiya?

Kung bawat iterasyon ng model ay nakasalalay sa pagsubok sa totoong makina, mataas ang gastos at mahaba ang cycle, at madaling maging bottleneck sa pagtatrabaho at pag-itera. Bagaman maaaring magtanggol ang tradisyonal na simulation sa ilang pagsubok, kailangan ng tao na magbuo ng modelo ng materyales, siksik, pagbabago, at relasyon ng pagkakasalig, at mahirap masakop ang kumplikadong kalikasan ng totoong mundo. Ang world model naman ay nagtatangkang matutunan kung paano nagbabago ang mundo mula sa totoong video at data ng interaksyon ng robot, upang maaaring mag-predict at i-verify muli at muli ang mga estratehiya sa virtual na kapaligiran.

Maaari itong magkaroon ng mas malalim na pakikilahok sa desisyon ng robot. Pagkatapos makita ng VLA ang baso, agad itong desisyunan na “humawak,” samantalang ang world model ay maaaring unang mag-predict ng mga epekto ng iba’t ibang aksyon, at pagkatapos ay tumulong sa robot na piliin ang mas angkop na estratehiya—mula sa “direktang aksyon” patungo sa “unang isipin, pagkatapos ay gawin.”

Image

Ngunit upang maging tunay na imprastruktura para sa embodied intelligence, ang mga mundo ngayon ay nakakatagpo ng tatlong pangunahing hadlang.

Ang unang bagay ay ang konsistensya sa sanhi at epekto ng kilos. Hindi sapat na ang modelo ay gumawa ng mga imahe na sumasalungat sa inaasahan; kailangan itong maging akurat na ipakita ang epekto ng kilos, kung hindi, ang isang estratehiya na hindi talaga makakadakot ng baso ay maaaring ituring na tagumpay sa virtual na mundo.

Ikalawa ay ang kakayahan sa mahabang pagpapalawig. Ang mga gawain ng robot ay karaniwang tumatagal ng ilang sampung segundo o higit pa, at kailangan ng modelo na patuloy na gamitin ang sariling paghuhula bilang input para sa susunod na sandali, kung saan ang anumang maliit na pagkakamali ay maaaring mag-akumula sa patuloy na pagpapalawig.

Ang ikatlo ay ang pagkakasunod-sunod ng virtual na paghuhula at tunay na pagpapatupad. Kahit gaano pa katalino ang paggawa at pagpapalawak, hindi ito nangangahulugan na ang modelo ay talagang nakakapag-evaluate ng mga estratehiya ng robot. Tanging kapag ang pagganap sa virtual na mundo ay may matatag na ugnayan sa mga resulta sa tunay na mundo, ang mundo ng modelo ay may tunay na halaga bilang alternatibo sa ilang pagsubok at pagkakamali sa totoong buhay.

Ang mga hadlang na ito ay nagsisilbing pangunahang bahagi sa susunod na yugto ng kompetisyon sa mga mundo modelo.

WALL-SS, nagpapabuti sa modelo ng mundo mula sa paa ng arkitektura

Ang WALL-SS ay isang bagong pagsubok para sa mga problema na ito. Ayon sa pagsasalaysay ng papel, ito ang unang world model na gumagamit ng next-scale autoregressive architecture.

Kahit sa nakaraan, maraming mundo model ay gumamit ng ideya ng video Diffusion: pagsisimula sa nakaraang frame at galaw, at paggawa ng hinaharap na video sa pamamagitan ng maraming pagkakataon ng denoising. Bagaman ang galaw ay isang kondisyon para sa paggawa, hindi ito malinaw na isinusulat sa "galaw→resulta" na proseso, kaya madaling umasa ang modelo sa visual na prior, at direktang ipapredict ang isang "malaking posibilidad ng tagumpay" na hinaharap—kahit na ang grip ay hindi talaga nakakahawak sa baso, maaari pa ring mabuo ang larawan ng baso na matagumpay na inihawak.

Ang WALL-SS ay nag-uugnay ng pagmamasid at aksyon sa isang causal sequence na “pagmamasid–aksyon–bagong pagmamasid,” upang maging aktibo ang aksyon sa pagbuo ng hinaharap na estado. Sa simpleng salita, una munang tukuyin kung paano babago ang mundo, at pagkatapos ay idagdag ang mga detalye nang paulit-ulit: ang malalaking antas ay tinitiyak ang pangkalahatang estado ng robot arm at bagay, habang ang mas maliit na antas ay nagpapalawig sa galaw at pagkakapit. Kasama pa ang mga data tungkol sa pagkabigo, pagpapalit, at pagkorekta, natututo ang modelo na “iba ang aksyon, iba rin ang resulta.”

Napatunayan ang kakayahang ito sa mga indikador. Nakamit ng WALL-SS ang score ng action following na 0.29 at accuracy ng trajectory na 0.539; sa kabilang banda, ang score ng action following ng Cosmos3-Nano ay lamang 0.044. Ang iba pang mga modelo ay direktang nakakuha ng score na 0.

Isang iba pang mahalagang tanong ay kung kayang “tandaan” ng mundo model ang sapat na haba. Gumagamit ang WALL-SS ng maramihang iskala at mahabang-panahong memorya upang panatilihin ang mga detalye ng kamakailan, i-komprima ang nakaraang kasaysayan, at payagan ang modelo na magpatuloy sa pagpapalawak mula sa sariling paghuhula habang tinuturuan, upang mabawasan ang problema ng patuloy na pagkumpuni ng error. Nagpapahintulot ito sa modelo na magpatuloy na magpapalawak ng 60 segundo, habang ang iba pang mga modelo ay limitado sa 20-30 segundo na lamang.

Mas mahalaga pa, ang mga kakayahan na ito ay tinest ng totoong makina. Ang mga self-variable ay nagpapatupad ng iisang estratehiya sa WALL-SS at sa totoong robot, na nagtatapos ng 600 pares ng eksperimento sa virtual at totoo. Ang mga resulta ay nagpakita na ang koepisyenteng korelasyon ng tagumpay sa paggawa ng gawain ay 0.926, at ang tumpak na pagkakasunod-sunod ng lakas ng iba’t ibang estratehiya ay 89%.

Ito ay nangangahulugan na ang mga mundo model ay nagsisimula nang magkaroon ng mas mahalagang halaga: hindi lamang pagbuo ng "mukhang totoo" na hinaharap, kundi pagtulong sa mga robot na matukoy kung ano ang epekto ng iba't ibang aksyon, at masusubok ang mga estratehiya sa isang virtual na mundo.

Kasalukuyang may hangganan ang WALL-SS. Ang mga input ng galaw nito ay kabilang ang posisyon, direksyon, at pagbukas at pagsarado ng grip, ngunit hindi kabilang ang buong estado ng mga joint, puwersa, at torque, kaya ang suporta para sa detalyadong pagkakontak at maraming daliri ay kailangan pang patunayan.

Patuloy na gumawa ng mga inobasyon sa arkitektura habang ang ruta ay hindi pa nakakapag-ayos

Hindi resulta ng biglaang paghahabol ni WALL-SS sa takip ng pagkakaroon ng mundo. Noong nakaraang taon, patuloy na sinusuri ng self-variable ang parehong tanong: paano maiuugnay ang pag-unawa ng robot sa mundo, ang paghuhula sa mga galaw, at ang totoong pagsasagawa.

Ang WALL-OSS ay naglalayong isama ang paningin, wika, at mga galaw ng robot sa isang magkakasamang embodied base model sa pamamagitan ng malawakang multimodal pre-training; ang WALL-OSS-0.5 ay higit pang pinapalawak ang kakayahan ng pre-training patungo sa tunay na robot; pagkatapos, ang WALL-WM ay nagsisimula na magkakasamang modelin ang pagbabago sa mundo at mga galaw ng robot, habang ang X-Tokenizer ay tumatalakay kung paano isasama ang iba’t ibang robot at galaw sa isang iisang model. Sa WALL-SS, patuloy na tinutukoy ng ruta ito ang isang pangunahing tanong: Ano ang mangyayari sa mundo pagkatapos ipagawa ang isang galaw?

Sa buong serye ng pag-aaral, ang pangunahing pagkakatotoo ay ang matagal na pagsisikap na i-model ang pagkakasunod-sunod ng "daigdig-aksyon". Dapat hindi lamang makagalaw ang robot, kundi kailangan din nitong makapaghula ng mga epekto ng mga aksyon at patuloy na i-adjust ang sariling pagkilos batay sa mga resulta. Habang tumutubo ang mga modelo, data, ontologies, at mga karanasan sa tunay na mga makina, ang mga pag-aaral na ito ay unti-unting nabubuo bilang isang teknikal na loop ng pagtugon.

Ang basehan ng embodied intelligence ay malayo pa sa pagkakasundo. Sa panahong ito, ang tunay na mahalaga ay hindi ang bawat pagsubok na tama ang huling sagot, kundi ang kakayahang magpatuloy na magbigay ng mga bagong hipotesis sa arkitektura, pagsubokin ito gamit ang data at tunay na makina, at patuloy na i-adjust ang landas batay sa mga resulta.

Ang pagpapahayag ng self-variable tungkol sa paglalabas ng WALL-SS ay isang pagpapatuloy sa ideyang ito. Hindi lamang isang modelo ang ilalabas, kundi isang teknikal na landas na maaaring patunayan ng buong industriya: Kaya ba ng mas malaking antas ng autoregressive ang mas mainam para sa mga robot? Maaari ba talaga ang mga galaw at resulta na maging tugma? Maaari ba ang virtual na pagsubok na ipakita ang totoong performance ng machine? Maaaring patuloy ng mga mananaliksik ang pag-aaral batay dito, at maaari rin ng mga kumpanya ng robot na diretso ito ay patunayan kung maaari itong ma-include sa kanilang sariling sistema ng pagtuturo at pagtataya.

Ito ay nagtataglay ng mas malalim na kahalagahan para sa maagang industriya ng embodied intelligence: pagbaba ng gastos sa pag-aaral ng industriya, at pagpapahintulot sa iba’t ibang paraan na masubok sa totoong aplikasyon.

Sa mga nakalipas na taon, ang kompetisyon sa domestic embodied intelligence ay mas nakatuon sa katawan, data, at pagpapatupad ng produkto. Ngunit isang industriya na hindi pa nagkakaroon ng matatag na istruktura ay hindi maaaring maghintay lamang ng pagkakaroon ng matatag na arkitektura bago magsimula, kailangan din ng mga taong pumasok sa mas pangunahing aspeto tulad ng world models, action representations, at learning paradigms upang patuloy na hanapin ang susunod na posibilidad.

Hindi talaga ng wall-ss ang huling sagot, ngunit ito ay nagpapakita ng isang pagbabago: ang mga lokal na kumpanya ay nagsisimula na hindi lamang sumunod sa umiiral na landas, kundi magtataguyod ng kanilang sariling mga aksiyoma sa arkitektura at isasabuhay ito para sa pagsusuri ng industriya.

Kapag talagang mangyari ang pagbabago sa teknikal na direksyon, hindi lang ang pagkakaroon ng kasunod na henerasyon ang desisyon sa isang kumpanya, kundi kung patuloy ba itong nagpapanatili ng kakayahang mag-explore sa susunod na henerasyon.

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.