Skild AI запускає модель робота S1 з навчанням контексту за 10 хвилин

icon MarsBit
Поділитися
AI summary iconКороткий зміст
Новини про ШІ та криптовалюту з’явилися після запуску Skild AI моделі робота S1, яка використовує контекстне навчання для виконання складних завдань на основі однієї демонстрації. Модель досягла рівня успішності 66% на невиданих раніше завданнях, що значно перевищує традиційні методи VLA з показником 9%. S1 виключає необхідність у сотнях прикладів для навчання, різко скорочуючи час навчання. Нові лістинги токенів на біржах часто відображають технологічні досягнення, і цей розвиток може вплинути на майбутні проекти, пов’язані з ШІ, у криптовалютному просторі.

Великі результати ембоді-інтелекту вже наступають!!!

З того часу, як Generalist опублікував ембоді-мозок Gen 1.5, здатний вивчати рухи тривалістю від 3 до 12 секунд,~

Щойно північноамериканський стартап у сфері ембодієнту Skild AI анонсував нову базову модель робота S1, яка збільшила довжину завдань контекстного навчання роботів до 10 хвилин і більше.

Skild AI

Цей S1 зосереджений на навчанні в контексті (in-context learning, ICL):

Не потрібно спеціально навчатися новим діям на етапі після навчання — достатньо подивитися відео з людським прикладом, щоб «скопіювати» його і безпосередньо виконати цілу серію складних дій, які раніше не бачили.

У офіційному демонстраційному відео робот виконав довготривалі завдання, такі як приготування блинів, заварювання кави, пересадка рослин та збірка обладнання. Крім того, на невідомих раніше завданнях він досяг успішності 66%, що значно перевищує VLA на основі мовних підказок (лише 9%).

Крім того, навіть якщо ви вибираєте традиційний підхід до донастройки після навчання, щоб досягти ефекту S1, який базується лише на одній демонстрації, вам, ймовірно, доведеться надати близько 380 демонстрацій завдань.

Дуже дивовижно!

Можна сказати, що остання хвиля робіт, зосереджених на навчанні в контексті, знову піднесла надії багатьох на втілення.

Деякі користувачі Twitter вважають, що універсальні роботи з’являться через два роки, а не через сім.

Skild AI

Також користувачі зазначили, що від Rhoda, до Generalist на тиждень тому, і тепер 10-хвилинних завдань Skild S1, справжній GPT-момент робота, схоже, настає.

Skild AI

Оскільки, коли ця здатність справді узагальниться, розробка навичок роботів у майбутньому може стати справді подібною до написання підказок для ChatGPT.

Skild AI

Чи це справді так дивовижно? Давайте подивимося разом.

Від ери BERT до ери GPT

Щоб зрозуміти, як S1 навчається в цьому контексті, спочатку розглянемо, як традиційні роботи вивчають нові навички.

У традиційній пайплайні навчання роботів насправді схоже на велику модель:

Спочатку проводиться попереднє навчання на великих обсягах даних, щоб освоїти базові навички; потім у конкретних сценаріях збираються дані для певної задачі, і за допомогою подальшого навчання робот вчиться спеціалізованим навичкам.

Skild AI

Проблема лише в тому, що, хоча роботи та великі моделі мають схожі процеси, витрати на дані повністю відрізняються.

Попереднє навчання великих моделей здійснюється на великих обсягах даних з інтернету; навіть у спеціалізованих сценах, таких як програмування та агенти, багато даних для післянавчання можна швидко отримати онлайн або згенерувати автоматично.

Але роботам пощастило гірше. Дані для попереднього навчання потрібно збирати у реальному світі, і дані для подальшого навчання також потрібно збирати у реальному світі.

Отже, у технічному блозі Skild AI прямо висловився:

Якщо робот-базова модель для вивчення нової задачі все ще потребує десятків або сотень годин даних з реального пристрою, а потім повторного до навчання, то я хочу запитати: де ж тут «базовість» цієї моделі?

Вони наводять існуючі дослідження, які вказують, що якщо для нового завдання доступно достатньо даних, то модель, навчена з нуля, може навіть зрівнятися за продуктивністю з базовою моделлю, попередньо навченою і тонко налаштованою.

Тоже, у чому полягає значення ембоді-попереднього навчання?

На це Skild відповідає: навчання на контексті.

Як точку відліку, Skild привів розвиткову траєкторію великих моделей як порівняння.

Ранній BERT уже був дуже потужним, але при кожному новому завданні доводилося знову підготувати дані та знову доналаштовувати модель.

Речь йде про здатність до навчання в контексті, яка поступово проявилася після GPT-3:

Не потрібно змінювати ваги моделі — достатньо надати кілька прикладів у запиті, щоб модель тимчасово «навчилася» новій задачі.

Skild AI

На основі цього Скілд вважає, що роботи зараз все ще застрягли в подібній ері BERT, і їм справді потрібно здійснити таку ж саму зміну парадигми.

Тобто справжня цінність попереднього навчання полягає не лише в тому, щоб зменшити обсяг даних для подальшого навчання, а в тому, щоб робот у кінцевому підсумку отримав здатність «навчатися безпосередньо з контексту».

Навчання на контексті

Тоже саме, що S1 насправді вивчив з цього контексту?

Skild вважає, що справжнім тестом здатності роботів до навчання в контексті є лише два виміри:

Одне — чи можна навчитися новим навичкам, яких не було під час навчання; інше — чи можна перекомбінувати вже наявні навички, щоб виконати довгу та складну нову задачу.

Наприклад, роботу достатньо подивитися відео зі смаженням блинів, щоб навчитися їх готувати —

Навіть якщо цей навик раніше ніколи не з’являвся в його тренувальних даних.

Тим часом, на відміну від відео у секундах, представлених на Gen-1.5 тиждень тому, S1 прямо піднімає навчання на контексті до максимальної тривалості 10 хвилин.

У завданнях, таких як пересадка рослин, кожне завдання вимагає послідовного виконання десятків кроків. У демонстраціях цих довготривалих завдань роботу потрібно не лише копіювати дії, а й розуміти:

На якому етапі я зараз, що робити далі, як поєднувати навички між собою та як продовжити, якщо щось пішло не так.

Це означає, що роботу потрібно справді розуміти наміри завдань і дій у відео-демонстрації, реагувати на ситуації та адаптуватися, а не просто копіювати поведінку.

Крім того, у завданні пересадки рослин від початку запису демонстрації до того, як робот самостійно виконав завдання, пройшло лише 11 хвилин, що прямо перевершує традиційні методи після навчання за ефективністю.

Нарешті, протягом усього процесу S1 не використовував тонку настройку чи післятренування; ваги моделі залишилися повністю незмінними, і за допомогою однієї й тієї ж комплекту ваг було виконано всі завдання, показані у блозі.

Було досягнуто базове вирівнювання між необхідністю тонкої настройки великих моделей, як BERT, для конкретних сценаріїв, і здатністю GPT-3 виконувати завдання зовнішніх розподілів лише за прикладами.

Єдина відмінність полягає в тому, що замість мови використовується відео з діями, яке краще узгоджується з нижчими завданнями.

Skild AI

Експеримент: чи є ICL справді кращим для масштабування?

У експериментальній частині Skild порівняв ICL відео-промпти з традиційними мовними промптами VLA на завданнях, які були в тренувальних даних, та на нових завданнях.

Skild AI

Результати тестування показують, що при наявності навчальних даних лише 1000 годин ефективність мовного промпту вища, але зі збільшенням обсягу даних ICL починає перевершувати його.

До 100 000 годин навчання: ICL 96%, мовні запити 89%.

А на справжніх ключових завданнях OOD: ICL — 66%, мовні підказки — лише 9%, що створює розрив понад 7 разів.

Щоб перевірити узагальнення S1, Skild знову провів тестування за різних експериментальних умов.

Skild AI

Результати показують, що зниження продуктивності мовного Prompt VLA може досягати трьох разів більше, ніж у ICL.

Іншими словами, ICL вивчає не просто повторення дій у фіксованих сценаріях, а здатність переплановувати дії залежно від поточного середовища.

Нарешті, щодо one-shot learning.

S1 повністю не виконує післянавчання для нового завдання, а лише переглядає одну відео-демонстрацію, досягаючи успішності 66%.

Skild AI

Навпаки, традиційна VLA потребує приблизно 380 ітерацій післятренування, щоб досягти того ж рівня.

Звичайно, після накопичення до 2000 демонстрацій традиційний пост-навчання зможе досягти 86%.

Отже, висновок може бути не таким: «У майбутньому роботів не потрібно навчати», а:

Раніше для засвоєння нового навичку потрібно було навчати сотні разів, а зараз, просто подивившись один раз, можна відразу досягти шістдесяти-сімдесяти балів.

Це також те, що Skild називає законом масштабування ICL:

Чим більше даних, тим більше модель не просто набуває нових навичок, а все краще навчається «навичок із демонстрацій».

Хто такий Skild AI?

Skild заснована в 2023 році двома знайомими з робототехнічного середовища CMU: Deepak Pathak та Abhinav Gupta.

Skild AI

Обоє є професорами Інституту робототехніки Карнегі-Меллон, Діпак спеціалізується на навчанні роботів, підсиленому навчанні та комп’ютерному зорі, а Абхінав — експерт у галузі комп’ютерного зорю та самонавчання.

Ще у 2022 році вони співпрацювали над WHIRL, дозволяючи роботам вчитися одноразовій імітації шляхом перегляду відео людей; можна сказати, що цей напрямок S1 не з’явився раптово з нізвідки.

Skild AI

Як зіркова компанія відділу ембодіментів Північної Америки, у 2024 році Skild, вийшовши з режиму невидимості, здобула 300 мільйонів доларів США у серії A з оцінкою в 1,5 мільярда доларів США;

На січень цього року було завершено цикл фінансування серії C на 1,4 млрд доларів США, оцінка виростала понад 14 млрд доларів США, інвестиції очолив SoftBank, а NVIDIA, Безос та інші продовжили інвестувати. За два з половиною роки оцінка майже зросла в десять разів.

У поперечному порівнянні позиція Skild у сфері ембодіменту Північної Америки також досить унікальна.

На відміну від PI, що більше схоже на «робота GPT», Generalist останнім часом акцентує увагу на one-shot learner, а Genesis AI та Sunday — на своїй повній стековій енергії. Skild завжди підкреслював одне: будь-який робот, будь-яке завдання — один мозок.

Він більше зосереджений на крос-ембодименті, сподіваючись, що один і той самий Skild Brain зможе працювати на різних тілах — маніпуляторах, чотириногих роботах, людоподібних роботах тощо.

Простіше кажучи, він хоче стати Androidом епохи роботів — інтелектуальним рівнем, який можна вбудувати в різні тіла.

Це також визначає стратегію даних Skild: все одно.

Skild розглядає дані роботів у трьох вимірах: hardware proximity, diversity та scalability:

Керування реальним пристроєм на відстань найбільш наближене до апаратного забезпечення, але коштує дорого; відео з першої особи людини найлегше масштабувати, але сильно відрізняється від тіла робота; симуляція дешева та може швидко масштабуватися, але існує розрив між симуляцією та реальністю.

Skild AI

Тож вони для Robot Teleop, UMI, Egocentric Video, симуляції в основному використовують стратегію «всі».

А ICL S1 — це також природне продовження цього напрямку:

Skild AI

Серпень 2025 року — LocoFormer → Лютий 2026 року — перший In-Domain ICL → Травень — перший перевертання блинів → Серпень — випуск S1, що безпосередньо продовжив навчання з контекстом до 10 хвилин у довготривалих OOD завданнях.

Отже, справжнє питання, яке зараз варто розглянути, може бути не те, чи зможуть роботи навчитися ще більше навичок, а:

Чи можна справді зменшити вартість навчання робота новій навичці з «навчи сотні разів» на «ти робиш один раз, він дивиться один раз»?

Якщо цей закон масштабування зможе продовжувати діяти, то так званий GPT-момент роботів, можливо, справді не буде лише ще одним маркетинговим жартом.

Посилання для довідки: [1] https://www.skild.ai/blogs/s1

Цей текст з інтернет-журналу «Quantum Bit», автор: henry

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.