Robotik Zijidong melancarkan model dunia autoregresif skala seterusnya pertama, WALL-SS, yang bertujuan menyelesaikan masalah ketidakkonsistenan sebab-akibat antara tindakan dan hasil dalam model dunia robotik. Model ini menggunakan mekanisme ramalan bertingkat dari kasar ke halus, memastikan setiap tindakan benar-benar sepadan dengan hasil yang berbeza, serta mampu menjalankan simulasi berterusan sehingga 60 saat. Ujian menunjukkan skor pengikutan tindakan WALL-SS mencapai 0.29, jauh melebihi 0.044 milik Cosmos3-Nano. Zijidong menjalankan 600 eksperimen pasangan maya-nyata, dengan pekali korelasi kejayaan tugas mencapai 0.926, menunjukkan bahawa model dunia ini boleh membantu robot mengesahkan strategi terlebih dahulu dalam persekitaran maya.Penulis artikel, sumber: GeekPark
Pertandingan seterusnya dalam model dunia robot mungkin bukan kualiti gambar, tetapi arkaitekturnya.
Penulis | Li Yuan
Suntingan | Zheng Xuan
Cengkaman lengan mekanikal jelas-jelas tidak memegang cawan, tetapi cawan itu seolah-olah ditarik oleh magnet dan naik bersama cengkaman. Masalah yang kelihatan mustahil ini sedang mengganggu model robotik, dan industri bahkan menyebutnya sebagai "pengambilan magnetik".
Model penghasil video hanya perlu membuat gambar kelihatan masuk akal untuk dianggap berjaya; tetapi model dunia tidak boleh hanya mengejar “kelihatan seperti asli”. Data latihan robot kebanyakan berasal dari demonstrasi berjaya, menyebabkan model cenderung mengambil jalan pintas: alih-alih memahami perbezaan halus dalam tindakan, ia lebih suka menghasilkan hasil yang paling mungkin berdasarkan gambar.
Dalam dunia nyata, pergeseran beberapa milimeter pada posisi cengkeram boleh menyebabkan hasilnya berubah dari menangkap ke merobohkan cawan atau bahkan gagal menangkap. Model dunia benar-benar perlu memahami hubungan sebab-akibat antara tindakan dan hasil.
Pada 27 Ogos, AutoBot melancarkan model dunia autoregresif skala seterusnya, WALL-SS, yang bertujuan untuk membawa model dunia dari "boleh digunakan" kepada "mudah digunakan". WALL-SS tidak menghasilkan keseluruhan gambar sekaligus, tetapi menggambarkan masa depan secara perlahan-lahan dari kasar ke halus, memastikan tindakan yang berbeza menghasilkan hasil yang berbeza; sambil menggabungkan mekanisme ingatan jangka panjang untuk mencapai simulasi berterusan sehingga 60 saat.
Ujian menunjukkan bahawa WALL-SS selepas 60 saat pengulangan berterusan, gambar dan trajektori pergerakan masih lebih dekat dengan video sebenar, dengan skor pengikutan gerakan mencapai 0.29, manakala Cosmos3-Nano ialah 0.044, dan model ujian lain secara langsung mendapat 0. Boleh dikatakan, WALL-SS adalah salah satu daripada sedikit model yang ramalan gambarnya mengikuti arahan gerakan.
Autonomous juga mengumumkan pelancaran WALL-SS. Bagi model dunia robot yang belum membentuk jalan teknologi yang seragam, pelancaran ini bukan sekadar membuka satu model, tetapi juga membolehkan industri secara bersama-sama mengesahkan: adakah model dunia membuat ramalan berdasarkan tindakan, dan adakah simulasi maya benar-benar boleh membantu robot sebenar.
Ketika paradigma teknikal belum terkonsolidasi, eksplorasi berterusan itu sendiri adalah keunggulan kompetitif. Kecerdasan tubuhan memerlukan bukan sahaja peranti yang boleh dilaksanakan dengan cepat, tetapi juga syarikat yang terus mencabar jalan yang telah ada dan membuka sempadan teknologi inti.
Model dunia, menjadi lintasan utama untuk kecerdasan berbadan
Pada tahun 2026, model dunia sedang menjadi salah satu arah teknologi paling diperhatikan dalam bidang robotik.
NVIDIA terus mengembangkan Cosmos dan mulai menggunakan model dunia video untuk pengawasan dan perancangan robot; V-JEPA 2 daripada Meta cuba membolehkan robot menyelesaikan pengambilan di persekitaran asing dengan meramal perubahan dunia fizikal. Semakin banyak penyelidikan juga mula mengkaji penggantian sebahagian ujian mesin sebenar dengan model dunia, membolehkan robot meramal kesan strategi berbeza di dunia maya sebelum bertindak.
Memahami gelombang ini tidaklah rumit. Model bahasa besar belajar pola bahasa dengan meramalkan perkataan seterusnya, manakala model dunia meramalkan keadaan dunia pada saat seterusnya: robot bergerak ke kiri, apakah cawan akan terjatuh; cengkaman ditegangkan sedikit lagi, adakah objek itu boleh diangkat; satu tindakan diteruskan selama sepuluh saat, apakah akhirnya pemandangan akan berubah menjadi apa.
Ini sangat penting untuk kecerdasan berbadan. Dalam beberapa tahun terakhir, industri terutama menyelesaikan masalah "bagaimana" robot melakukan tindakan, di mana VLA boleh menghasilkan tindakan secara langsung berdasarkan arahan visual dan bahasa. Namun, seiring peningkatan kemampuan robot, satu masalah baru menjadi semakin menonjol: bagaimana menilai sama ada satu strategi itu baik atau tidak?
Jika setiap iterasi model bergantung pada pengujian peranti asli, kosnya tinggi dan tempohnya panjang, mudah menjadi halangan dalam pelatihan dan iterasi. Simulasi tradisional walaupun boleh menanggung sebahagian pengujian, memerlukan pemodelan manual bahan objek, geseran, benjolan, dan hubungan sentuhan, sukar untuk merangkumi kompleksiti dunia nyata. Model dunia pula cuba mempelajari bagaimana dunia berubah daripada video dan data interaksi robot sebenar, membolehkan robot meramal dan mengesahkan strategi berulang kali dalam persekitaran maya.
Ia bahkan boleh terlibat lebih lanjut dalam pengambilan keputusan robot. Selepas VLA melihat cawan, ia terus memutuskan “mengulur tangan untuk mengambil”, manakala model dunia pula boleh meramalkan kesan tindakan yang berbeza terlebih dahulu, kemudian membantu robot memilih strategi yang lebih sesuai—beralih dari “bertindak secara langsung” kepada “berimajinasi dahulu, baru bertindak”.

Namun, untuk benar-benar menjadi infrastruktur bagi kecerdasan terwujud, model dunia hari ini masih menghadapi tiga batas utama.
Pertama ialah konsistensi sebab-akibat antara tindakan dan hasil. Model tidak boleh hanya menghasilkan gambar yang sesuai dengan jangkaan, tetapi mesti mencerminkan dengan tepat hasil yang dibawa oleh tindakan; jika tidak, strategi yang sebenarnya tidak mampu menangkap cawan mungkin masih dianggap berjaya dalam dunia maya.
Kedua ialah kemampuan simulasi jangka panjang. Tugasan robot sering berterusan selama puluhan saat atau lebih lama, di mana model perlu terus menggunakan ramalannya sebagai input untuk saat seterusnya; sebarang kesilapan kecil boleh terkumpul semasa simulasi berterusan.
Ketiga ialah konsistensi antara simulasi maya dan operasi sebenar. Walaupun generasi itu sangat realistik dan penghuraian dilakukan dalam jangka masa panjang, ia tidak bermakna model benar-benar mampu menilai strategi robot. Hanya apabila prestasi dalam dunia maya dapat membina hubungan stabil dengan hasil sebenar, model dunia baru benar-benar memiliki nilai pengganti sebahagian percubaan dan kesilapan sebenar.
Tiga penghalang ini juga sedang menjadi inti persaingan model dunia pada peringkat seterusnya.
WALL-SS, meningkatkan model dunia dari aras arsitektur asas
WALL-SS merupakan percubaan baharu bagi menangani masalah-masalah ini. Menurut perincian kertas kerja, ia merupakan model dunia pertama yang menggunakan arsitektur autoregresif skala seterusnya.
Sebelum ini, banyak model dunia mengikuti pendekatan Diffusion video: memasukkan gambar sejarah dan tindakan, lalu menghasilkan video masa depan melalui beberapa langkah pengurangan bunyi. Walaupun tindakan merupakan syarat penghasilan, ia tidak ditulis secara jelas dalam rantai penghasilan «tindakan → hasil», oleh itu model mudah bergantung pada pra-pengetahuan visual dan secara langsung meramal masa depan yang «berkesan dengan kebarangkalian tinggi»—walaupun cengkam sebenarnya tidak memegang cawan, ia masih mungkin menghasilkan gambar cawan yang berjaya diangkat.
WALL-SS mengatur pemerhatian dan tindakan sebagai urutan sebab-akibat "pemerhatian—tindakan—pemerhatian baru", memastikan tindakan benar-benar menyertai penghasilan keadaan masa depan. Dengan kata mudah, pertama-tama tentukan bagaimana dunia berubah, kemudian tambah butiran secara bertahap: skala kasar menentukan keadaan kasar lengan mekanikal dan objek, skala halus seterusnya mengembalikan pergerakan dan sentuhan. Dikombinasikan dengan data kegagalan, pengambilalihan, dan penyesuaian, model ini belajar bahawa "tindakan berbeza, hasil juga berbeza".
Kemampuan ini telah diverifikasi melalui indikator. Skor pengikutan tindakan WALL-SS mencapai 0.29, dengan ketepatan trajektori sebanyak 0.539; sebaliknya, skor pengikutan tindakan Cosmos3-Nano hanya 0.044. Model lainnya mendapat skor 0.
Masalah penting lain ialah sama ada model dunia mampu “mengingat cukup lama”. WALL-SS menggunakan ingatan jangka panjang berskala pelbagai untuk mengekalkan butiran terkini, memampatkan sejarah jangka panjang, dan membenarkan model meneruskan simulasi berdasarkan ramalannya sendiri semasa latihan, mengurangkan masalah akumulasi ralat berterusan. Ini membolehkan model melakukan simulasi berterusan selama 60 saat, manakala model lain sudah mencapai had 20-30 saat.
Lebih penting lagi, kemampuan-kemampuan ini akhirnya diuji secara nyata. Pemboleh ubah bebas menjalankan strategi yang sama secara berasingan di WALL-SS dan robot sebenar, menyelesaikan 600 ujian pasangan maya-dan-nyata. Keputusan menunjukkan pekali korelasi kejayaan tugas antara keduanya mencapai 0.926, dengan ketepatan pengurutan kekuatan strategi yang berbeza sebanyak 89%.
Ini bermakna model dunia mulai memiliki nilai yang lebih penting: bukan sahaja menghasilkan masa depan yang "kelihatan nyata", tetapi juga mampu membantu robot menilai hasil yang berbeza daripada tindakan yang berbeza, serta mengesahkan strategi terlebih dahulu di dunia maya.
Tentu, WALL-SS masih mempunyai batasan. Input tindakannya terutama termasuk kedudukan, arah, dan buka-tutup cengkaman pada hujung lengan mekanikal, tanpa menyertakan keadaan sendi penuh, daya, dan tork, oleh itu sokongan terhadap sentuhan halus dan tangan cekap berjari banyak masih perlu diverifikasi lebih lanjut.
Teruskan inovasi arsitektur sebelum laluan mula menumpu
WALL-SS bukan hasil tiba-tiba mengejar tren model dunia. Dalam setahun terakhir, Zìxiàngliàng telah terus menjelajahi masalah yang sama: bagaimana menghubungkan pemahaman robot terhadap dunia, ramalan tindakan, dan pelaksanaan sebenarnya.
WALL-OSS melalui latihan pra-berbilang besar, menggabungkan penglihatan, bahasa, dan tindakan robot ke dalam satu model asas tubuh; WALL-OSS-0.5 meneruskan kemampuan latihan pra-latihan ke mesin sebenar; kemudian, WALL-WM mula memodelkan secara bersama perubahan dunia dan tindakan robot, sementara X-Tokenizer mengkaji bagaimana robot yang berbeza dan tindakan yang berbeza boleh dimasukkan ke dalam model seragam. Pada WALL-SS, jalan ini semakin menunjuk kepada satu soalan utama: Apakah yang berlaku kepada dunia selepas melaksanakan satu tindakan?
Menerusi rangkaian penjelajahan ini adalah komitmen jangka panjang terhadap pemodelan seragam «dunia-tindakan» sebagai pemboleh ubah bebas. Robot tidak hanya perlu mampu bertindak, tetapi juga mampu meramalkan kesan tindakan tersebut dan memperbaiki perilakunya secara berterusan berdasarkan hasilnya. Seiring dengan akumulasi model, data, ontologi, dan pengalaman mesin sebenar, penjelajahan ini perlahan-lahan membentuk gelung teknikal yang saling membalas.
Infrastruktur untuk kecerdasan tubuh masih jauh dari keseragaman. Pada peringkat ini, yang benar-benar penting bukanlah setiap percubaan dapat menebak jawapan akhir, tetapi sama ada mampu terus mengemukakan hipotesis infrastruktur baru, menguji dengan data dan mesin sebenar, serta terus menyesuaikan arah berdasarkan hasil.
Pengumuman pelancaran WALL-SS kali ini juga merupakan kelanjutan daripada pendekatan ini. Yang dilancarkan bukan sekadar satu model, tetapi satu jalan teknikal yang boleh disahkan bersama oleh industri: adakah auto-regresif pada skala seterusnya lebih sesuai untuk robot, adakah tindakan dan hasilnya benar-benar sepadan, dan adakah ujian maya mampu mencerminkan prestasi mesin sebenar. Para penyelidik boleh meneruskan penyelidikan berdasarkan ini, sementara syarikat robotik boleh secara langsung mengesahkan sama ada ia boleh dimasukkan ke dalam sistem latihan dan penilaian mereka.
Ini juga memberikan makna yang lebih penting kepada industri kecerdasan badani awal: mengurangkan kos penggalian industri, serta membolehkan pelbagai pendekatan diuji dalam aplikasi sebenar.
Dalam beberapa tahun terakhir, persaingan kecerdasan tubuh di dalam negara lebih banyak berfokus pada badan, data, dan pelaksanaan produk. Namun, sebuah industri yang belum terbentuk tidak boleh hanya menunggu arsitektur yang matang sebelum mengejar, tetapi juga memerlukan seseorang untuk memasuki posisi yang lebih mendasar seperti model dunia, representasi tindakan, dan paradigma pembelajaran, terus-menerus mencari kemungkinan berikutnya.
WALL-SS tentu bukan jawapan akhir, tetapi ia mewakili satu perubahan: syarikat tempatan mula tidak sekadar mengikuti laluan yang sudah ada, tetapi mengusulkan hipotesis struktur sendiri dan membukanya kepada ujian industri.
Apabila jalan teknologi benar-benar berubah, yang menentukan nasib sebuah syarikat bukanlah sama ada ia mengikuti generasi sebelumnya, tetapi sama ada ia terus mempertahankan kemampuan untuk mengeksplorasi generasi seterusnya.

