Hasil besar untuk kecerdasan berbadan akan datang!!!
Sejak Generalist memperkenalkan otak tubuh Gen 1.5 yang mampu belajar gerakan 3 hingga 12 saat minggu lalu~
Baru sahaja, permulaan badan Amerika Utara, Skild AI, mengumumkan model asas robot baru S1, yang secara langsung meningkatkan panjang tugas pembelajaran konteks robot kepada lebih daripada 10 minit.

S1 kali ini menekankan pembelajaran dalam konteks (in-context learning, ICL):
Tidak perlu belajar data operasi baru secara khusus dalam fasa pasca-pelatihan, cukup dengan menonton satu video contoh manusia, ia boleh “meniru”, dan secara langsung menyelesaikan satu proses operasi kompleks yang belum pernah dilihat sebelumnya.
Dalam demonstrasi rasmi, robot berjaya menyelesaikan tugas jangka panjang seperti membuat pancake, menyeduh kopi, menukar pot tanaman, dan pemasangan peralatan. Selain itu, pada tugas yang tidak pernah dilihat sebelumnya, kejayaannya mencapai 66%, jauh melebihi VLA berdasarkan petunjuk bahasa (hanya 9%).
Selain itu, walaupun mengikuti pendekatan penyesuaian selepas latihan tradisional, untuk mengejar kesan S1 yang hanya melihat satu demonstrasi, kira-kira diperlukan 380 demonstrasi tugas.
Sangat amazing!
Boleh dikatakan, gelombang terkini yang berfokus pada pembelajaran kontekstual telah menyemulakan harapan baru kepada ramai terhadap embodiment.
Seorang pengguna Twitter menyatakan bahawa robot generik mungkin akan muncul dalam dua tahun, bukan tujuh tahun.

Pengguna lain juga menyatakan bahawa dari Rhoda, ke Generalist minggu lepas, dan sekarang tugas 10 minit Skild S1, saat GPT sebenar robot kelihatan sedang muncul.

Kerana sekiranya kemampuan ini benar-benar digeneralisasi, pengembangan kemahiran robot mungkin akan menjadi sebegitu mudah seperti menulis Prompt untuk ChatGPT.

Adakah ia sehebat itu? Mari kita lihat bersama.
Dari era BERT, beralih ke era GPT
Untuk memahami bagaimana S1 belajar dalam konteks ini, kita perlu melihat bagaimana robot tradisional mempelajari kemahiran baru.
Dalam pipeline tradisional, pembelajaran robot sebenarnya hampir sama dengan model besar:
Latih terlebih dahulu pada data dalam jumlah besar untuk mempelajari kemampuan asas; kemudian, dalam konteks spesifik, kumpulkan data untuk tugas tertentu dan lakukan latihan lanjutan supaya robot dapat mempelajari kemahiran khusus.

Namun, masalahnya ialah walaupun proses robot dan model besar hampir sama, kos data benar-benar berbeza.
Data pra-pelatihan model besar sebahagian besar berasal dari internet; bahkan dalam skenario khusus seperti pengaturan program dan Agent, banyak data selepas pelatihan boleh diperoleh secara dalam talian, atau bahkan dihasilkan secara automatik.
Tetapi robot lebih malang. Data pra-latihan perlu dikumpulkan di dunia nyata, dan data pasca-latihan juga perlu dikumpulkan di dunia nyata.
Jadi, dalam blog teknikal, Skild AI terus terang berkata:
Jika model asas robot memerlukan puluhan hingga ratusan jam data mesin sebenar untuk setiap tugas baru yang dipelajari, kemudian perlu dilatih semula, saya ingin bertanya, di manakah letaknya “asas” model ini?
Mereka bahkan merujuk kepada kajian yang sudah ada yang menunjukkan bahawa jika data untuk tugas baru sudah mencukupi, model yang dilatih dari awal mungkin boleh mengejar ketinggalan model asas yang telah dilatih pra-sebelumnya dan disesuaikan.
Jadi, apakah maksud sebenar daripada pre-training berbadan?
Bagi ini, jawapan yang diberikan oleh Skild ialah: pembelajaran konteks.
Sebagai rujukan, Skild mengambil garis perkembangan model besar sebagai perbandingan.
BERT awal sudah sangat kuat, tetapi setiap kali menghadapi tugas baru, seringkali masih perlu menyediakan data semula dan melakukan penyesuaian halus sekali lagi.
Yang benar-benar mengubah permainan ialah kemampuan pembelajaran konteks yang perlahan-lahan muncul selepas GPT-3:
Tidak perlu mengubah berat model, hanya dengan memberikan beberapa contoh dalam Prompt, model boleh “belajar” sementara satu tugas baru.

Berdasarkan ini, Skild percaya bahawa robot sekarang sebenarnya masih terperangkap dalam era BERT yang serupa, dan apa yang mereka benar-benar inginkan ialah membolehkan robot melalui perubahan paradigma yang sama.
Dengan kata lain, nilai sebenar pra-pelatihan bukan sekadar mengurangkan jumlah data yang diperlukan untuk pelatihan seterusnya, tetapi membolehkan robot akhirnya memperoleh kemampuan “belajar secara langsung daripada konteks”.
Contextual Learning
Jadi, apa yang sebenarnya dipelajari S1 daripada konteks ini?
Skild percaya bahawa sebenarnya hanya ada dua dimensi yang boleh menguji kemampuan pembelajaran konteks robot:
Satu ialah, adakah ia mampu mempelajari kemahiran baru yang tidak pernah dilihat semasa latihan; yang lain ialah, adakah ia mampu menggabungkan semula kemahiran yang sudah ada untuk menyelesaikan tugas baru yang panjang dan sangat kompleks.
Sebagai contoh, robot hanya perlu menonton video membalikkan pancake untuk belajar membuat pancake—
Walaupun kemahiran ini sebelum ini tidak pernah muncul dalam data latihannya.
Sementara itu, berbanding dengan video berdurasi saat ini yang ditunjukkan oleh Gen-1.5 minggu lalu, S1 kali ini secara langsung meningkatkan pembelajaran konteks hingga 10 minit.
Dalam tugas-tugas seperti menukar tanaman, setiap tugas memerlukan pelaksanaan berterusan puluhan langkah operasi. Dalam demonstrasi tugas jangka panjang ini, robot tidak hanya perlu meniru, tetapi juga perlu tahu:
Saya sudah sampai ke tahap mana sekarang, apa yang perlu saya lakukan seterusnya, bagaimana cara menggabungkan kemahiran antara satu sama lain, dan apa yang perlu saya lakukan jika saya gagal di tengah jalan.
Dengan kata lain, robot perlu benar-benar memahami niat tindakan-tindakan dalam demonstrasi video, menyesuaikan diri secara fleksibel, dan bukan sekadar meniru perilaku semata.
Selain itu, dalam tugas menukar pot tanaman, hanya mengambil 11 minit dari permulaan rekaman demonstrasi hingga robot mula melakukannya sendiri, secara langsung mengalahkan kaedah latihan tradisional dari segi kecekapan.
Akhirnya, sepanjang proses ini, S1 tidak menggunakan fine-tuning atau post-training, dan berat model tetap tidak berubah; dengan menggunakan satu set berat yang sama, semua tugas yang ditunjukkan dalam blog telah selesai.
Telah selari secara asas peralihan model besar dari keperluan fine-tuning khusus konteks seperti BERT, hingga GPT-3 yang hanya perlu melihat contoh untuk menyelesaikan tugas OOD.
Satu-satunya perbezaan ialah, prompt yang digunakan bukan lagi bahasa, tetapi video tindakan yang boleh selari lebih baik dengan tugas bawahannya.

Eksperimen: Adakah ICL benar-benar lebih boleh dipertingkatkan?
Dalam bahagian eksperimen, Skild membandingkan ICL video Prompt dengan traditional language Prompt VLA pada tugas-tugas yang telah dilihat (data latihan) dan tugas-tugas yang tidak dilihat.

Keputusan ujian menunjukkan bahawa apabila data latihan hanya 1,000 jam, Prompt bahasa berkesan lebih baik, tetapi seiring dengan peningkatan skala data, ICL mula mendahului.
Pada 100,000 jam, tugas yang dilihat semasa latihan: ICL 96%, Language Prompt 89%.
Namun, dalam tugas OOD yang benar-benar krusial: ICL 66%, prompt bahasa hanya 9%, membuka jurang lebih dari 7 kali ganda.
Untuk menguji generalisasi S1, Skild juga melakukan pengujian dalam pelbagai kondisi eksperimen.

Hasil menunjukkan bahawa penurunan prestasi Prompt VLA bahasa boleh mencapai tiga kali ganda ICL.
Dengan kata lain, ICL tidak belajar mengulangi tindakan dalam skenario tetap, tetapi mampu merancang semula tindakan berdasarkan persekitaran semasa.
Akhirnya, dalam pembelajaran satu shot.
S1 tidak melakukan post-training sama sekali pada tugas baru, hanya dengan melihat satu demonstrasi video, kejayaan mencapai 66%.

Sebaliknya, VLA tradisional memerlukan sekitar 380 sesi latihan selepas demonstrasi untuk mencapai tahap yang sama.
Tentu, selepas terus mengumpul hingga 2000 demonstrasi, post-training tradisional akhirnya mampu mencapai 86%.
Jadi, kesimpulannya mungkin bukan “robot tidak perlu dilatih lagi di masa depan”, tetapi:
Dulu, satu kemahiran baru mungkin perlu diajar berulang-ulang ratusan kali, sekarang sekali tengok saja, sudah boleh lakukan hingga enam atau tujuh puluh peratus.
Ini juga merupakan hukum penskalaan ICL menurut Skild:
Semakin banyak data, model bukan hanya akan memiliki lebih banyak kemahiran, tetapi semakin mahir dalam "mempelajari kemahiran daripada demonstrasi".
Siapakah Skild AI?
Skild ditubuhkan pada tahun 2023, didukung oleh dua ahli robotik lama dari CMU: Deepak Pathak dan Abhinav Gupta.

Keduanya adalah profesor di Institut Robotik Carnegie Mellon, Deepak terutama meneliti pembelajaran robot, pembelajaran penguatan, dan penglihatan komputer, sementara Abhinav adalah pakar di bidang penglihatan komputer dan pembelajaran tanpa pengawasan.
Pada tahun 2022, kedua-duanya telah bekerjasama dalam WHIRL, membolehkan robot belajar imitasi one-shot dengan menonton video manusia; dengan kata lain, jalan S1 ini bukan muncul secara tiba-tiba dari celah batu.

Sebagai syarikat bintang dalam komuniti embodier North America, pada tahun 2024, Skild baru sahaja keluar dari mod tersembunyi dan memperoleh pendanaan Siri A sebanyak US$3 bilion dengan valuasi US$15 bilion;
Pada Januari tahun ini, pembiayaan Siri C sebanyak US$1.4 bilion telah selesai, dengan nilai penilaian terus meningkat melebihi US$14 bilion, dipimpin oleh SoftBank, dengan NVIDIA, Bezos, dan lain-lain terus menyertai. Dalam masa lebih daripada dua tahun, nilai penilaian hampir meningkat sepuluh kali ganda.
Dari perspektif perbandingan mendatar, Skild juga memiliki kedudukan yang cukup unik dalam kalangan komunitas tubuh di Amerika Utara.
Berbanding dengan PI yang lebih seperti sedang membangun "robot GPT", Generalist baru-baru ini menekankan one-shot learner, serta momentum penuh stack dari Genesis AI dan Sunday, sementara Skild terus menekankan satu kalimat: Any robot, any task, one brain.
Ia lebih menekankan silang embodiment, berharap Skild Brain yang sama boleh berjalan di atas lengan mekanikal, empat kaki, bentuk manusia, dan badan yang berbeza.
Dengan kata lain, ia ingin menjadi Android di era robot: satu lapisan pintar yang boleh dimasukkan ke dalam pelbagai jenis badan.
Ini juga menentukan strategi data Skild: semuanya.
Skild memandang data robot dari tiga dimensi: hardware proximity, diversity, dan scalability:
Pengendalian jauh peranti asli paling mendekati peranti keras, tetapi mahal; video manusia sudut pandang pertama paling mudah diskalakan, tetapi sangat berbeza dari badan robot; simulasi murah dan boleh dihasilkan dalam jumlah besar, tetapi terdapat jurang sim-to-real.

Jadi, mereka secara keseluruhan mengambil pendekatan untuk menggunakan semuanya dalam Robot Teleop, UMI, Video Egocentric, dan Simulasi.
Dan ICL S1 sebenarnya juga merupakan lanjutan semula jadi kepada jalan ini:

September 2025 LocoFormer → Februari 2026 ICL dalam domain pertama → Mei pertama kali membalikkan pancake → Ogos S1 dilancarkan, secara langsung membawa pembelajaran konteks hingga tugas jangka panjang OOD selama 10 minit.
Jadi, soal yang benar-benar perlu diperhatikan sekarang mungkin bukan lagi sama ada robot masih boleh belajar lebih banyak kemahiran, tetapi:
Bisakah kos untuk mengajar robot kemahiran baru benar-benar berubah dari “ajar ratusan kali” kepada “anda lakukan sekali, ia lihat sekali”?
Jika hukum penskalaan ini masih boleh berterusan, maka saat GPT bagi robot mungkin benar-benar bukan sekadar slogan pemasaran lagi.
Pautan rujukan: [1]https://www.skild.ai/blogs/s1
Artikel ini berasal daripada akaun微信公众号 "Quantum Bit", penulis: henry
