Skild AI запускает модель робота S1 с обучением контексту за 10 минут

icon MarsBit
Поделиться
AI summary iconСводка
Новости об ИИ и криптовалюте появились после запуска Skild AI модели робота S1, которая использует контекстное обучение для выполнения сложных задач на основе одного примера. Модель показала成功率 66% на невиданных ранее задачах, что значительно превышает традиционные методы VLA с показателем 9%. S1 устраняет необходимость в сотнях обучающих примеров, резко сокращая время обучения. Новые списания токенов на биржах часто отражают технологические достижения, и это развитие может повлиять на предстоящие проекты, связанные с ИИ, в криптовалютной сфере.

Большие результаты в области встраиваемого интеллекта уже на подходе!!!

С тех пор, как Generalist выпустил в прошлую неделю встроенную мозговую систему Gen 1.5, способную обучаться движениям длительностью от 3 до 12 секунд~

Сейчас североамериканская стартап-компания Skild AI выпустила новую базовую модель робота S1, которая сразу же увеличила длину задачи контекстного обучения робота до 10 минут и более.

Skild AI

Основной акцент в этом S1 сделан на обучении в контексте (in-context learning, ICL):

Не требуется специально обучать новые операции на этапе пост-обучения — достаточно посмотреть видеоролик с человеческим демонстрационным примером, чтобы сразу воспроизвести целый комплекс сложных операций, с которыми ранее не сталкивался.

В официальном демонстрационном видеоролике робот выполнил длительные задачи, такие как приготовление блинов, заваривание кофе, пересадка растений и сборка оборудования. Кроме того, на незнакомых задачах он достиг успеха в 66%, что значительно превышает результаты VLA на основе языковых подсказок (только 9%).

Кроме того, даже при использовании традиционного подхода дообучения после обучения, чтобы достичь эффективности S1, основанной на одном демонстрационном примере, потребуется примерно 380 демонстраций задач.

Очень amazing!

Можно сказать, что недавняя волна работ, сосредоточенных на обучении в контексте, снова пробудила у многих надежду на внедрение.

Некоторые пользователи Twitter заявили, что универсальные роботы могут появиться уже через два года, а не через семь.

Skild AI

Другие пользователи также отметили, что настоящий GPT-момент для роботов, похоже, наступает — от Rhoda, до Generalist на прошлой неделе, и теперь до 10-минутных заданий Skild S1.

Skild AI

Потому что, как только эта способность действительно станет универсальной, разработка навыков роботов может действительно стать похожей на написание промптов для ChatGPT.

Skild AI

Правда ли это так волшебно? Давайте посмотрим.

От эпохи BERT — к эпохе GPT

Чтобы понять, как S1 осваивает контекстное обучение в этот раз, сначала посмотрим, как традиционные роботы учатся новым навыкам.

В традиционной конвейерной системе обучение роботов на самом деле похоже на крупные модели:

Сначала проводится предварительное обучение на огромных объемах данных, чтобы освоить базовые навыки; затем, в конкретных сценариях, собираются данные для конкретной задачи и проводится дообучение, чтобы научить робота специализированным навыкам.

Skild AI

Проблема в том, что, хотя процессы роботов и больших моделей похожи, стоимость данных совершенно разная.

Предварительная обучающая выборка для крупных моделей в значительной степени поступает из интернета; даже в специализированных сценариях, таких как программирование и агенты, многие данные после обучения можно быстро получить онлайн или даже автоматически сгенерировать.

Но роботам повезло меньше. Данные для предварительной подготовки нужно собирать в реальном мире, и данные для последующей подготовки тоже нужно собирать в реальном мире.

Таким образом, в техническом блоге Skild AI сразу же открыла огонь:

Если базовая модель робота для изучения каждой новой задачи все еще требует десятки или сотни часов реальных данных и повторного дообучения, то, позвольте спросить, в чем заключается «базовость» этой модели?

Они даже ссылаются на существующие исследования, указывающие, что если данных для новой задачи достаточно много, то модель, обученная с нуля, может даже сравняться по производительности с базовой моделью, предварительно обученной и затем дообученной.

Так в чем же смысл предварительной подготовки на основе телесности?

На это Skild ответил: обучение в контексте.

Для справки Skild привел в качестве образца маршрут развития крупных моделей.

Ранние версии BERT уже были мощными, но для каждой новой задачи часто требовалось заново подготовить данные и снова дообучить модель.

Настоящим изменением правил игры стала способность к обучению в контексте, которая постепенно проявилась после GPT-3:

Не нужно изменять веса модели — достаточно дать несколько примеров в запросе, и модель временно «выучит» новую задачу.

Skild AI

На основе этого Скилд считает, что роботы сейчас всё ещё находятся в похожей эре BERT, и то, чего они действительно хотят, — это заставить роботов пройти через такой же смену парадигмы.

То есть истинная ценность предварительной подготовки должна заключаться не только в сокращении объема данных, необходимых для последующей подготовки, а в том, чтобы робот в конечном итоге приобрел способность «непосредственно учиться из контекста».

Обучение с контекстом

Так что же S1 на этот раз выучил из контекста?

Skild считает, что на самом деле способность роботов к обучению в контексте можно проверить только по двум измерениям:

Один вопрос — можно ли освоить новые навыки, которых не было в данных для обучения; другой — можно ли переиспользовать существующие навыки для выполнения длинной и сложной новой задачи.

Например, роботу достаточно посмотреть видео, как переворачивают блинчики, чтобы научиться их готовить—

Даже если эта навык ранее не встречался в его обучающих данных.

В то же время, в отличие от секундных видео, представленных на Gen-1.5 на прошлой неделе, S1 теперь напрямую увеличивает контекстное обучение до максимальной продолжительности 10 минут.

При таких задачах, как пересадка растений, каждая задача требует последовательного выполнения десятков операций. При демонстрации этих долгосрочных задач роботу необходимо не только имитировать действия, но и понимать:

На каком этапе я сейчас нахожусь? Что делать дальше? Как сочетать навыки между собой? Что делать, если что-то пошло не так?

То есть роботу необходимо действительно понимать намерения задач и действий в видео-демонстрации, гибко реагировать на ситуацию, а не просто копировать поведение.

Кроме того, в задаче по пересадке растений на демонстрацию от начала до того, как робот самостоятельно справился с задачей, ушло всего 11 минут, что напрямую превосходит традиционные методы после обучения по эффективности.

Наконец, на протяжении всего процесса S1 не использовал тонкую настройку и не применял пост-обучение; веса модели остались полностью неизменными, и с помощью одной и той же комплекта весов были выполнены все задачи, показанные в блоге.

Основной прогресс заключается в переходе от необходимости тонкой настройки больших моделей, таких как BERT, для конкретных сценариев, к способности GPT-3 выполнять задачи вне распределения (OOD) только на основе примеров.

Единственное отличие заключается в том, что вместо языка используется видеоролик с действиями, лучше соответствующий целевой задаче.

Skild AI

Эксперимент: действительно ли ICL лучше масштабируется?

В экспериментальной части Skild сравнил ICL видеопромпты с традиционными языковыми промптами VLA как на задачах, встречавшихся в обучающих данных, так и на новых задачах.

Skild AI

Результаты тестирования показывают, что при объеме обучающих данных всего 1000 часов эффект языкового промпта лучше, но по мере увеличения объема данных ICL начинает опережать.

К 100 000 часам обучения на задачах, с которыми модель сталкивалась во время обучения: ICL 96%, языковые промпты 89%.

А на действительно ключевых задачах OOD: ICL — 66%, языковые подсказки — всего 9%, разрыв превышает 7 раз.

Для проверки обобщаемости S1 Skild провел дополнительные тесты в различных экспериментальных условиях.

Skild AI

Результаты показывают, что снижение производительности языкового Prompt VLA может достигать трехкратного уровня ICL.

То есть ICL учится не просто повторять действия в фиксированных сценариях, а перепланировать действия в зависимости от текущей среды.

Наконец, в области однократного обучения.

S1 при выполнении новой задачи вообще не проводит пост-обучение, и при просмотре только одного видео-демонстрационного ролика достигает успеха в 66%.

Skild AI

В сравнении, традиционная VLA требует примерно 380 итераций дообучения после демонстраций, чтобы достичь того же уровня.

Конечно, после накопления до 2000 демонстраций традиционная пост-обучение в конечном итоге достигает 86%.

Таким образом, вывод может быть не таким: «В будущем роботов не нужно будет обучать», а:

Раньше для освоения нового навыка требовалось объяснить его сотни раз, теперь достаточно просто посмотреть один раз, чтобы сразу достичь шестидесяти или семидесяти баллов.

Это также так называемый закон масштабирования ICL от Skild:

Чем больше данных, тем больше модель не просто приобретает новые навыки, а все лучше учится навыкам на основе демонстраций.

Кто такой Skild AI?

Skild была основана в 2023 году двумя знакомыми из робототехнического сообщества CMU: Deepak Pathak и Abhinav Gupta.

Skild AI

Оба являются профессорами Института робототехники Карнеги-Меллон, Дипак в основном занимается обучением роботов, усиленным обучением и компьютерным зрением, а Абхинав — эксперт в области компьютерного зрения и самообучения.

Еще в 2022 году они сотрудничали над WHIRL, позволяя роботам обучаться однократному подражанию, наблюдая за видео людей; можно сказать, что этот путь S1 не появился внезапно из ниоткуда.

Skild AI

Как звездная компания в сфере робототехники Северной Америки, в 2024 году Skild, только выйдя из режима скрытности, привлекла 300 миллионов долларов США в серии A при оценке в 1,5 миллиарда долларов США;

К январю этого года была завершена серия C-финансирования на сумму 1,4 млрд долларов США, и оценка компании поднялась выше 14 млрд долларов США: SoftBank возглавила раунд, а NVIDIA, Безос и другие продолжили инвестировать. За два с лишним года оценка приблизилась к десятикратному росту.

В поперечном сравнении позиция Skild в экзистенциальном круге Северной Америки также довольно уникальна.

В отличие от PI, который больше похож на «робота GPT», Generalist недавно акцентировал внимание на one-shot learner, а также на полном стеке Genesis AI и Sunday, Skild постоянно подчеркивает одну фразу: Any robot, any task, one brain.

Он больше акцентирует внимание на кросс-воплощении, стремясь к тому, чтобы один и тот же Skild Brain мог работать на различных телах, таких как манипуляторы, четырехногие роботы и человеоподобные роботы.

Проще говоря, он хочет стать Android эпохи роботов — умным слоем, который можно встроить в разные тела.

Это также определяет стратегию данных Skild: всё.

Skild рассматривает данные роботов по трем измерениям: аппаратная близость, разнообразие и масштабируемость:

Управление реальным устройством на расстоянии наиболее близко к аппаратному обеспечению, но дорого; видео в первом лице от человека легче масштабировать, но сильно отличается от тела робота; симуляция дешева и позволяет быстро создавать много моделей, однако существует разрыв между симуляцией и реальностью.

Skild AI

Таким образом, они в основном применяют стратегию использования всех этих технологий: Robot Teleop, UMI, Egocentric Video и Simulation.

А ICL S1 — это также естественное продолжение этого подхода:

Skild AI

Сентябрь 2025 года — LocoFormer → Февраль 2026 года — первый In-Domain ICL → Май — первый переворот блинчика → Август — выпуск S1, сразу продвигающий контекстное обучение до самых длинных OOD-задач продолжительностью до 10 минут.

Так что теперь действительно важный вопрос, возможно, уже не в том, могут ли роботы освоить еще больше навыков, а в том:

Можно ли действительно снизить стоимость обучения робота новому навыку с «обучения сотнями повторений» до «ты делаешь один раз, он смотрит один раз»?

Если этот масштабный закон продолжит действовать, то так называемый GPT-момент роботов, возможно, действительно станет чем-то большим, чем просто еще один маркетинговый трюк.

Ссылка для справки: [1] https://www.skild.ai/blogs/s1

Эта статья взята из официального аккаунта WeChat «Quantum Bit», автор: henry

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.