Huawei Noah's Ark Lab melancarkan sistem RoboHarness untuk koordinasi robot strategi pelbagai

iconMetaEra
Kongsi
AI summary iconRingkasan
Huawei Noah's Ark Lab melancarkan sistem RoboHarness, yang direka untuk mengkoordinasikan pelbagai strategi seperti VLA, WAM, RL, dan TAMP untuk tugas jangka panjang. Sistem ini menggabungkan pemahaman, memori, dan evolusi, dengan modul Memory Bridge yang meningkatkan peralihan strategi. Eksperimen menunjukkan kadar kejayaan 86%. Seiring dengan meningkatnya penggunaan TA dalam kripto, inovasi seperti ini mungkin mempengaruhi pelaburan nilai dalam strategi kripto.
Laboratorium Noah's Ark Huawei melancarkan sistem RoboHarness, yang mengkoordinasikan strategi heterogen seperti VLA, WAM, RL, dan TAMP melalui Coding Agent untuk menyelesaikan tugas jangka panjang tanpa sampel. Sistem ini mengandungi tiga jenis kemahiran: pemahaman, ingatan, dan evolusi; modul Memory Bridge menyelesaikan masalah ketidaksesuaian taburan status semasa pertukaran strategi, dengan kejayaan 86% dalam ujian. Karya ini mewakili perkembangan kecerdasan badani dari model tunggal ke arah pengaturan sistemik.

Penulis artikel, sumber: Leifengwang

Bayangkan tugas seperti ini: buka pintu almari, cari blok bangunan yang disembunyikan di dalamnya, kemudian susun menjadi satu jambatan.

Bagi manusia, ini adalah perkara yang sangat mudah, beberapa tindakan berlaku secara semula jadi, dan kanak-kanak tadika pun boleh menyelesaikannya dengan berjaya.

Namun, untuk robot, tugas ini merangkumi pelbagai kemampuan yang sangat berbeza: mencari blok, memerlukan pemahaman visual dan pengikutan arahan bahasa; membuka pintu almari, memerlukan interaksi kompleks dengan persekitaran; menyusun blok, memerlukan perancangan geometri dan pengendalian tepat serta meneroka perubahan persekitaran.

Lebih rumit lagi, kemampuan-kemampuan ini tergolong ke dalam beberapa model “sekte” yang berbeza—VLA (Visual-Language-Action Model), WAM (World-Action Model), RL Policy (Reinforcement Learning), dan TAMP (Task and Motion Planning). Setiap model mempunyai kekuatannya masing-masing, tetapi saling terpisah, dengan cara pelatihan, format input, dan ruang keadaan yang berbeza.

Hari ini di bidang robotik, kemampuan tidak kurang, tetapi kolaborasi tidak ada.

Laboratorium Noah's Ark Huawei baru-baru ini menerbitkan sebuah kertas kerja yang memperkenalkan sistem bernama RoboHarness, yang secara khusus menyelesaikan masalah ketidakmampuan strategi yang berbeza untuk bekerjasama. Mengenai kerja ini, penulis kertas kerja berbincang dengan kami (LeiFengNet).

Agen Bergerak Menuju Dunia Embodied: Dari Kecerdasan Bahasa kepada "Pemimpin Otak" Robot

Kertas kerja: https://arxiv.org/abs/2607.18060

Laman utama projek: https://www.robo-harness.com/

01 Jurang antara ilusi dan realiti model serba boleh

Pada musim panas ini, beberapa kajian berpusat pada Harness muncul secara padat dalam bidang penyelidikan robotik, semuanya menunjukkan satu pemahaman: menyelesaikan segala perkara dengan model yang lebih besar sementara ini tidak berkesan; robot memerlukan satu sistem organisasi pelaksanaan.

Pasukan Profesor Yu Chao dari Universiti Tsinghua mengumumkan Harness VLA pada bulan Julai, memperkenalkan Lapisan Harness yang digunakan secara meluas dalam kecerdasan digital ke dalam kecerdasan badani, membolehkan VLA yang dibekukan fokus pada pengendalian yang padat sentuhan, sambil menggunakan satu lapisan Harness untuk belajar kapan dan bagaimana memanggilnya, serta bagaimana menetapkan semula dan mencuba semula selepas kegagalan VLA. Dalam penilaian gangguan LIBERO-Pro, sistem ini meningkatkan kadar kejayaan dari 50% kepada 82.4%.

Secara konsep, Harness VLA menyelesaikan bagaimana satu model boleh berfungsi secara stabil di bawah gangguan luar taburan. Masalahnya ialah kestabilan strategi tunggal.

RoboHarness daripada Lab Huawei Noah's Ark menghadapi masalah lain: apa yang perlu dilakukan apabila tugas melampaui batas kemampuan mana-mana model?

Keduanya dipanggil Harness, kedua-duanya menggunakan Coding Agent sebagai lapisan organisasi, tetapi menyelesaikan cabaran pada dimensi yang berbeza. Yang pertama membuat seorang pakar menjadi lebih stabil, manakala yang kedua membolehkan sekumpulan pakar dengan keahlian berbeza bekerja sama. Seiring dengan peningkatan kerumitan tugas robot, masalah yang kedua ini menjadi semakin tidak boleh dielakkan.

Akar masalah ini perlu dibincangkan dari segi sempadan kemampuan pelbagai model.

Kelebihan model VLA ialah memahami arahan bahasa terbuka dan generalisasi dalam persekitaran baru, tetapi cara ia menghasilkan tindakan secara end-to-end sukar mengekalkan konsistensi dalam tugas jangka panjang; strategi pembelajaran penguatan mampu menghasilkan perilaku tertutup yang stabil dalam skenario latihan tertentu, tetapi kestabilan ini sangat bergantung pada taburan latihan, dan sedikit perubahan persekitaran boleh menyebabkannya gagal; TAMP unggul dalam penalaran simbolik dan sekatan geometri, tetapi memerlukan definisi awal primitif tindakan, dan perancang akan cepat kesukaran apabila menghadapi persekitaran terbuka dan matlamat kabur; WAM mampu membantu pengambilan keputusan jangka panjang melalui ramalan keadaan masa depan, tetapi mudah mengalami akumulasi ralat apabila jangka masa ramalan bertambah panjang.

Tugas nyata yang kompleks memerlukan pemahaman semantik, perancangan geometri, kawalan tertutup, penalaran jangka panjang, dan spekulasi perubahan persekitaran, di mana matlamat latihan untuk setiap kemampuan ini berbeza dan kadang-kadang saling bertentangan. Terdapat jurang yang belum benar-benar dilalui antara pencapaian terpisah dalam setiap kemampuan dengan model tunggal yang mampu mengekalkan semua kemampuan secara stabil dalam persekitaran terbuka dalam jangka masa panjang.

Titik berangkat RoboHarness ialah: alih-alih menunggu jurang ini diisi, lebih baik buat model-model yang sudah wujud dan mempunyai kekuatan masing-masing bekerja sama secara sebenarnya. Penulis berpendapat, sehingga satu model mampu menguasai sepenuhnya semua model lain dan menunjukkan keunggulan mutlak, struktur pengaturan seperti ini tetap sangat bermakna.

Kerja ini bukan muncul secara tiba-tiba. Penulis memberitahu kami (Lei Fengwang) bahawa bentuk awal RoboHarness lahir daripada pengalaman mereka menyertai BEHAVIOR Challenge, satu pertandingan robotik global tahun lepas. Tugas pertandingan itu panjang dan sukar, dan pasukan mendapati bahawa sama ada melatih VLA secara end-to-end atau menggunakan model seperti behaviour cloning, tidak mampu menangani kesukaran tugas itu sendiri. Kegagalan ini malah membantu pasukan memahami masalah sebenar.

02 Bagaimana otak pengendali menentukan siapa yang akan bertanding

Gagasan utama RoboHarness ialah mengemas sistem pengawasan yang dibangunkan secara berasingan seperti VLA, WAM, strategi RL, dan TAMP menjadi kemahiran agen yang boleh dijadualkan secara seragam, dengan Agen Pengekodan bertanggungjawab atas pengambilan keputusan peringkat tinggi.

Reka bentuk ini mempunyai satu anggapan penting: tidak mengubah atau melatih semula sebarang strategi asas. Setiap strategi mengekalkan implementasi asalnya sendiri, tanpa perlu berkongsi struktur model, ruang tindakan, atau data latihan. RoboHarness hanya menambahkan satu lapisan kemampuan pengurusan di atasnya.

Memilih strategi yang tepat tidak semudah itu.

Bagi sebuah Agen Pemrograman, sulit untuk menentukan dengan andal tugas ini patut dihantar kepada siapa semata-mata berdasarkan input imej mentah. Kerana keputusan ini menyembunyikan banyak soalan kuantitatif yang tidak dapat dijawab oleh kemampuan pemahaman semantik model bahasa. Ia boleh memahami meletakkan cawan ke atas piring, tetapi tidak dapat mengira kesamaan antara adegan semasa dengan taburan latihan strategi tertentu daripada imej RGB, apalagi menilai kebolehpercayaan data sensor pada masa ini.

Untuk menyelesaikan masalah ini, sistem direka dengan tiga jenis kemahiran bantuan yang khusus membantu Coding Agent mengekstrak maklumat yang diperlukan untuk penilaian.

Agen Bergerak Menuju Dunia Embodied: Dari Kecerdasan Bahasa kepada "Pemimpin Otak" Robot

Memahami Kemahiran, bertanggungjawab untuk mengubah input asal menjadi isyarat yang boleh diukur, seperti: kesamaan penyematan gambar dengan data latihan setiap strategi, kestabilan pose objek dalam jendela masa, serta sama ada pencahayaan dan kualiti gambar semasa memenuhi piawaian. Indikator-indikator ini merupakan asas sebenar untuk penghalaan strategi. Penulis berpendapat, esensi modul ini ialah mengukur setiap strategi dari pelbagai dimensi untuk menentukan sama ada ia sesuai dengan tugas semasa.

Kemahiran Memori, mengambil semula pengalaman pelaksanaan sebelumnya sebagai rujukan untuk memilih strategi, serta mengendalikan ketidaksepadanan taburan status antara strategi melalui Memory Bridge—ini adalah reka bentuk paling penting sistem, yang akan dibincangkan secara terperinci di bawah.

Evolution Skills, memperbaharui metadata dan logik pengaturan secara berterusan berdasarkan maklum balas dalam talian, membolehkan sistem belajar daripada setiap pelaksanaan, bukan bermula dari awal setiap kali menghadapi situasi baru.

Aliran maklumat tiga jenis kemahiran saling berinteraksi untuk membantu pengambilan keputusan oleh Coding Agent. Dalam pelaksanaan sebenar, mekanisme ini mempunyai dua fungsi utama: pertama, pemecahan tugas, iaitu memecah arahan panjang kepada tugas-tugas kecil yang sesuai untuk diterima oleh strategi yang berbeza; kedua, pertukaran dinamik, di mana apabila strategi semasa hampir mencapai sempadan kemampuannya, sistem akan bertukar dengan segera kepada strategi yang lebih sesuai, mencapai saling melengkapi kemampuan antara pelbagai strategi.

Kertas ini menggunakan satu set eksperimen ablasi untuk menjelaskan sumbangan masing-masing dua lapisan tersebut: hanya dengan menggunakan model bahasa untuk membantu pi0.5 memecah tugas dan menghantarnya semula, kejayaan sudah meningkat secara ketara; dengan menambahkan pelbagai strategi heterogen seterusnya, kejayaan meningkat lagi secara signifikan. Memecah dengan betul adalah langkah pertama, dan menghantar dengan tepat adalah langkah kedua—keduanya tidak boleh diabaikan.

Tetapi masih ada masalah ketiga, yang paling sukar, dan tidak dapat diselesaikan hanya dengan memilih strategi.

03 Keputusan kemenangan dalam perlumbaan estafet ditentukan pada saat pertukaran.

Dua strategi yang dilatih secara berasingan biasanya hidup dalam dunia data masing-masing. Format inputnya berbeza, dan pengalaman taburan keadaan robot juga berbeza. Posisi di mana operasi TAMP berhenti kemungkinan besar jatuh tepat di dalam ruang keadaan yang belum pernah dihadapi oleh VLA dan tidak boleh dihidupkan secara stabil.

Ini adalah masalah unik kepada pengaturan strategi heterogen.

Oleh itu, Memory Bridge yang bertanggungjawab untuk memastikan peralihan stabil antara dua strategi dinyatakan oleh penulis sebagai modul paling penting dalam RoboHarness. Beliau mengakui bahawa jika suatu model umum di masa depan mampu menutupi seluruh ruang keadaan dengan sempurna, Memory Bridge mungkin tidak diperlukan; tetapi dalam keadaan semasa, mana-mana model mudah jatuh di luar taburan kemampuan pada ketika peralihan.

Agen Bergerak Menuju Dunia Embodied: Dari Kecerdasan Bahasa kepada "Pemimpin Otak" Robot

Pekerjaan Memory Bridge dibahagikan kepada tiga langkah.

Cari: Berdasarkan sub-tugas seterusnya dan pengamatan semasa, cari Top-K jejak serupa yang pernah berjaya dilaksanakan oleh strategi sasaran dari memori multimodal berdasarkan kesamaan teks dan visual, kemudian ekstrak posisi end-effector, sudut sendi, dan keadaan robot lainnya.

Pemodelan: Memberikan isyarat pengawasan berdasarkan kemajuan relatif setiap status dalam trajektori, serta menyesuaikan secara maya julat status strategi sasaran yang "mengambil alih secara automatik".

Penghubung: Mengambil sampel dan menilai keadaan kandidat, mempertimbangkan keyakinan untuk memasuki zon selesa strategi sasaran dan kos pergerakan, untuk memilih objek penghubung paling sesuai dan menghasilkan trajektori peralihan; selepas robot sampai ke keadaan ini, kuasa kawalan akan dipindahkan kepada strategi seterusnya.

Mekanisme ini sepenuhnya bergantung pada pembelajaran maya dari data pelaksanaan sejarah, boleh digunakan secara plug-and-play untuk sebarang strategi, tanpa perlu mengubah implementasi asas atau memerlukan latihan bersama.

Dalam eksperimen ablasi, apabila Memory Bridge dikeluarkan, kemajuan tugas tidak menurun terlalu besar, menunjukkan bahawa pemilihan strategi masih pada dasarnya betul, tetapi kejayaan penuh turun drastik dari 86.0% kepada 60.4%. Banyak tugas sampai ke langkah terakhir tetapi gagal kerana status serah terima tidak kompatibel, yang membuktikan nilai Memory Bridge dari segi ini.

04 Dua garis teknikal, satu aliran yang berlaku secara perlahan-lahan

Dengan mengambil jarak dari kertas ini, kami lebih ingin menggambarkan peta teknologi tubuh yang lebih luas.

Pencipta RoboHarness memperhatikan bahawa, dalam konteks perkembangan pesat VLA selama tiga tahun terakhir, TAMP tradisional dan perancangan bertingkat pernah hilang dari perhatian komuniti kerana kemampuan generalisasi mereka dalam skenario terbuka jelas lebih lemah berbanding VLA end-to-end. Namun, dengan kemajuan pesat dalam sistem agen dan agen pengkodean tahun ini, arsitektur bertingkat telah mendapat semula kehidupan baharu: agen tingkat tinggi boleh menggunakan kemahiran yang boleh digabungkan untuk membahagikan tugas, memanggil alat, dan merancang secara dinamik, dengan begitu meningkatkan secara ketara kemampuan generalisasi dan kecekapan kaedah bertingkat tradisional. Oleh itu, komuniti akademik semula memperhatikan dan mula mengkaji bagaimana menggabungkan penalaran tingkat tinggi yang kuat secara generalisasi dengan strategi bawah yang heterogen.

Penulis artikel ini berasal daripada pelbagai universiti dan institut penyelidikan di timur Kanada. Penulis mengamati bahawa penyelidikan robotik di Amerika Utara telah lama mengikuti dua garis teknikal yang mempunyai asal-usul akademik yang jelas: Pantai Barat Amerika, yang diwakili oleh Stanford, Berkeley, dan sebagainya, lebih menekankan pembelajaran dan penskalaan, dengan fokus pada pembelajaran end-to-end, skala data, dan generalisasi model; manakala timur laut Amerika dan Kanada, yang diwakili oleh MIT, Universiti Toronto, MILA, dan sebagainya, telah lama lebih mengutamakan arsitektur berhierarki, penarikan simbolik, perancangan logik, dan pengambilan keputusan berstruktur.

Pencipta RoboHarness berada pada sambungan spektrum yang terakhir.

Pemisahan jalan teknologi telah meninggalkan jejak yang jelas dalam industri kecerdasan tubuh. Dalam beberapa tahun terakhir, pasukan yang berkembang pesat secara bertahap membentuk spektrum teknologi dari scaling model dasar hingga hierarki agen: satu kategori lebih menekankan model dasar tubuh universal, VLA, dan model dunia, terus memperluas batas generalisasi melalui peningkatan model seragam, skala data, dan kemampuan model; sementara kategori lain lebih menekankan kemahiran operasi yang boleh digunakan semula dan arsitektur bertingkat, menyelesaikan tugas kompleks melalui perancangan tugas, kombinasi kemahiran, dan koordinasi pengawasan bawah. Pasukan di dalam negara seperti Zhiyuan lebih mendekati kategori pertama, manakala Suduo Technology dan Magic Atom pula lebih menonjolkan kategori kedua; di luar negara, siri pi dari Physical Intelligence telah lama mewakili jalan scaling, manakala Gemini Robotics meneruskan tradisi bertingkat “penalaran dan perancangan tingkat tinggi + pelaksanaan kemahiran bawah”.

Yang menarik, perbezaan dalam spektrum teknologi ini bukanlah pertentangan statik, tetapi berkembang menjadi saling melengkapi. Dalam beberapa bulan terakhir, dua lintasan teknologi ini mulai menunjukkan tanda-tanda penggabungan yang jelas. Sebagai contoh, Physical Intelligence dalam pi0.7 meningkatkan kawalan dan kombinasi kemahiran ke kedudukan yang lebih utama; sambil itu, pasukan seperti NVIDIA terus memperkenalkan sistem robot agentic yang lebih berhierarki, menggabungkan kemampuan pemahaman dan penalaran model asas dengan VLA. Secara keseluruhan, penskalaan model asas dan hierarki agentic sedang berubah dari dua lintasan teknologi yang相对 berasingan kepada kemampuan saling melengkapi dalam sistem robot yang sama.

05 Dengan pengaturan sebagai jalan menuju kecerdasan yang lebih universal

RoboHarness mempunyai batasan yang jelas: ia hanya boleh menjadualkan strategi yang sudah ada, dan tidak dapat menyelesaikan perkara yang tidak boleh dilakukan oleh sebarang strategi. Kebolehpercayaan Memory Bridge bergantung kepada data pelaksanaan sejarah yang mencukupi; penilaian kemampuan strategi baharu dalam peringkat awal akan mempunyai ketidakpastian yang besar.

Argumen utama kertas ini bukanlah menafikan keperluan model besar yang terpadu.

Penulis menekankan bahawa pengaturan tugas jangka panjang bukan sahaja merupakan gabungan kemampuan yang ada, tetapi juga terus menghasilkan data pelaksanaan lintas kemampuan dan lintas skenario yang sukar diperoleh oleh model tunggal secara berasingan. Data semacam ini merekodkan proses peralihan, sambungan, pemulihan kegagalan, dan kerjasama antara pelbagai strategi, yang mungkin menjadi sumber penting untuk melatih model robot generasi seterusnya. Berdasarkan idea ini, pasukan RoboHarness juga sedang mengkaji penggunaan semula data yang dihasilkan semasa pengaturan strategi hibrid dan pelaksanaan untuk melatih semula strategi dasar, di mana pengalaman pelaksanaan pengaturan heterogen seterusnya memperkukuhkan peningkatan kemampuan asas model.

Dari mencari model terkuat hingga mengatur kemampuan yang paling sesuai, persaingan dalam kecerdasan berbadan sedang secara perlahan meluas ke tahap reka bentuk sistem. Pengaturan strategi heterogen dan model besar seragam ibarat dua pendakian di punggung gunung yang berbeza, tetapi kedua-duanya menunjuk ke arah yang sama: memberikan kecerdasan yang lebih universal dan lebih boleh dipercayai kepada robot.

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.