具身智能の大きな成果が、まもなく到来します!!!
先週、Generalistが3〜12秒の動作を学習できるエムボディードブレインGen 1.5をリリースして以来~
先ほど、北米のエムボディードAIスタートアップであるSkild AIが、新規ロボット基礎モデルS1をリリースし、ロボットのコンテキスト学習タスクの長さを10分以上に引き上げました。

今回のS1はコンテキスト学習(in-context learning、ICL)を主軸にしています:
後学習段階で新しい操作データを特別に学習する必要はなく、人間のデモ動画を一度見ただけで、これまで見たことのない複雑な操作フローをそのまま模倣して完了できる。
公式デモでは、ロボットがパンケーキの調理、コーヒーの淹れ、植物の植え替え、および装置の組立などの長期タスクを完了しました。また、未経験のタスクにおいて、成功率を66%まで引き上げ、言語プロンプトに基づくVLA(9%)を大幅に上回りました。
また、従来の後学習微調整のアプローチを取ったとしても、S1の1回のデモと同等の効果を達成するには、約380回のタスクデモを提供する必要がある。
とても素晴らしい!
最近、コンテキスト学習に集中したこの一連の取り組みは、多くの人々にとって具現化への希望を再びかき立てたと言える。
あるツイッターのユーザーは、汎用ロボットは7年後ではなく、2年後に登場する可能性があると述べた。

また、ネットユーザーの中には、Rhodaから先週のGeneralist、そして現在のSkild S1の10分間タスクまで、ロボットの本格的なGPTの瞬間が訪れつつあると指摘しています。

この能力が本当に汎化された場合、今後ロボットのスキルを開発することは、ChatGPTにプロンプトを書くようなものになるかもしれない。

本当にそんなにすごいのでしょうか?一緒に見てみましょう。
BERT時代からGPT時代へ
S1が今回のコンテキスト学習をどのように行うのかを理解するには、従来のロボットが新しいスキルをどのように学習するかを確認する必要があります。
従来のパイプラインでは、ロボットの学習は大規模モデルとほぼ同じです:
まず大量のデータで事前学習を行い、基本的な能力を習得する。その後、具体的なシナリオにおいて特定のタスクに合わせてデータを収集し、後学習を通じてロボットに専門スキルを習得させる。

ただ、問題は、ボットと大規模モデルはプロセスが似ているものの、データコストはまったく異なるということです。
大規模モデルの事前学習データは、インターネットから大量に取得される。プログラミングやエージェントなどの専門分野においても、多くの後学習データはオンラインで迅速に取得、または自動生成できる。
しかし、ロボットはより悲惨です。事前学習データも現実世界から収集しなければならず、後学習データも現実世界から収集しなければなりません。
したがって、技術ブログでSkild AIはそのまま発言しました:
もしあるロボットのベースモデルが、新しいタスクを学ぶたびに数十時間、数百時間の実機データを必要とし、再学習を繰り返さなければならないのなら、この「ベースモデル」の「基礎」はどこにあるのでしょうか?
彼らは既存の研究を引用し、新しいタスクのデータが十分に多い場合、ゼロから訓練されたモデルが事前訓練後に微調整されたベースモデルにさえ追いつく可能性があると指摘している。
それでは、エンボディードプリトレーニングの意義とは何でしょうか?
これに対して、Skildの答えは:コンテキスト学習です。
参照のために、Skildは大規模モデルの発展路線を引き合わせました。
初期のBERTはすでに非常に強力でしたが、新しいタスクに遭遇するたびに、データを再準備して再微調整する必要がありました。
後にGPT-3以降に徐々に明らかになったコンテキスト学習能力が、ゲームのルールを真正に変えるものだった:
モデルの重みを変更する必要はなく、Promptにいくつかの例を提示するだけで、モデルは一時的に新しいタスクを「学習」できます。

これを踏まえて、Skildは、現在のロボットがまだ類似のBERT時代にとどまっていると考えており、ロボットにも同じようなパラダイムシフトを実現してほしいと願っている。
つまり、事前学習の真の価値は、後続の学習で必要なデータ量を減らすことではなく、ボットが最終的に「文脈から直接学習」する能力を獲得することにある。
コンテキスト学習
それでは、S1は今回、文脈から何を学んだのでしょうか?
Skildは、ロボットのコンテキスト学習能力を真正に試すのは、実は2つの次元だけであると考えている。
一つは、訓練中にまったく見なかった新しいスキルを習得できるかどうか、もう一つは、既存のスキルを再組み合わせて、長く複雑な新しいタスクを完了できるかどうかである。
例えば、ロボットはパンケーキを裏返す動画を観るだけでパンケーキの作り方を学べる——
たとえこのスキルがこれまでその学習データに含まれていなかったとしても。
一方で、前週のGen-1.5が示した秒単位の動画と比較して、S1はコンテキスト学習を最大10分まで拡張しました。
植物の鉢替えなどのタスクでは、各タスクに数十の連続した操作ステップが必要です。これらの長期タスクのデモにおいて、ロボットは単に真似をするだけでなく、以下を理解する必要があります:
今どのステップまで進んだか、次に何をすべきか、スキルどうしをどう組み合わせるか、途中で失敗した場合どう続ければいいか。
つまり、ロボットはビデオデモ内のタスクとアクションの意図を真正に理解し、単なる行動の複製を超えて状況に応じて柔軟に対応できる必要があるということです。
また、植物の植え替えタスクでは、デモの記録開始からロボットが自ら操作するまでにわずか11分しかかからず、効率面で従来の後学習を圧倒しました。
最後に、このプロセス全体でS1はファインチューニングもポストトレーニングも行わず、モデルの重みは一切変更せずに、同じ重みセットでブログに掲載されたすべてのタスクを完了しました。
基本完成了从Bert需要特定场景微调,到GPT-3仅通过演示即可完成OOD任务的跨越。
唯一の違いは、使用するプロンプトが言語ではなく、下流タスクにより適したアクション動画であることです。

実験:ICLは本当にスケールしやすいのか?
実験部分で、Skildは、(訓練データで见过した)タスクと未见过のタスクにおいて、ICLビデオプロンプトと従来の言語プロンプトVLAを比較した。

テスト結果によると、訓練データが1000時間のみの場合は言語プロンプトの効果が優れていますが、データ規模が増加するにつれてICLが逆転します。
10万時間に達した際、訓練中に见过たタスクでの性能:ICL 96%、言語プロンプト 89%。
一方、本質的なOODタスクでは:ICLが66%、言語プロンプトは9%で、7倍以上の差が開いている。
S1の汎用性を検証するため、Skildは異なる実験条件でテストを実施しました。

結果、言語Prompt VLAの性能低下は、ICLの最大3倍に達した。
つまり、ICLが学習するのは固定された状況での行動の繰り返しではなく、現在の環境に応じてどのように行動を再計画するかです。
最後に、ワンショット学習について。
S1は新しいタスクで事後トレーニングを一切行わず、1つの動画デモのみを見て、成功率66%を達成した。

一方、従来のVLAは、同レベルに達するまで約380回の後学習が必要です。
もちろん、2000回のデモを積み重ねた後、従来のポストトレーニングでは最終的に86%を達成できます。
したがって、結論は「今後ロボットは訓練不要」となるのではなく、
以前新しいスキルを身につけるには何百回も教える必要があったが、今は一度見ただけで、すぐに60〜70点分のレベルに到達できる。
これはSkildが言うICLスケーリング法則でもある:
データが増えるほど、モデルは単に多くのスキルを習得するだけでなく、ますます「デモからスキルを学ぶ」ようになります。
Skild AIとは誰ですか?
Skildは2023年に設立され、CMUのロボット分野の古くからの知人であるDeepak PathakとAbhinav Guptaが背後にいます。

両者ともカーネギーメロン大学ロボティクス研究所の教授で、Deepakはロボット学習、強化学習、コンピュータービジョンを主に研究しており、Abhinavはコンピュータービジョンと自己教師あり学習の分野の権威である。
2022年には、二人はWHIRLを共同で開発し、ロボットが人間の動画を観察することでone-shot imitationを実現していた。したがって、S1という道筋は、いきなり石の間から飛び出してきたわけではない。

北米のエムボディードAI分野の注目企業であるSkildは、2024年に隠れ家的な状態から脱却し、3億ドルのシリーズA資金を調達し、評価額は15億ドルとなった。
今年1月、さらに14億ドルのCラウンド資金調達を完了し、評価額は140億ドル以上に達した。SoftBankが主導し、NVIDIAやベゾスらも引き続き参加。2年余りで評価額は約10倍に増加した。
横断的に見ると、Skildは北米のエムボディード・コミュニティにおいても非常に特異な位置を占めています。
PIよりも「ロボットGPT」に近いという点で、Generalistは最近、one-shot learnerやGenesis AI、Sundayの最近のフルスタックな勢いを強調しているが、Skildは一貫して「Any robot, any task, one brain」と述べている。
それは、異なるボディ—ロボットアーム、四足、人型など—上で同じSkild Brainが動作することを重視しています。
簡単に言えば、ロボット時代のAndroidになりたい——あらゆる異なるボディに組み込める知能層です。
これにより、Skildのデータ戦略も「すべてを取得」に決定されました。
Skildは、ロボットデータをハードウェアの近接性、多様性、スケーラビリティの3つの次元で見ます:
実機のリモート操作はハードウェアに最も近いが高価;第一人称視点のヒトの動画はスケーリングが最も容易だが、ロボットの身体とは大きく異なる;シミュレーションは安価で大量生成可能だが、シミュレーションから現実へのギャップがある。

したがって、Robot Teleop、UMI、Egocentric Video、Simulationについては、基本的にすべて採用する方針です。
一方、S1のICLも、この路線の自然な延長線上にあります:

2025年9月 LocoFormer → 2026年2月 初のインドメインICL → 5月 初めての裏返しパンケーキ → 8月 S1リリース、コンテキスト学習を最長10分のOOD長期タスクまで推し進める
したがって、今まさに注目すべき問題は、ロボットがさらに多くのスキルを習得できるかどうかではなく、
ロボットが新しいスキルを習得するコストを、「何百回も教える」から、「あなたが一度行うだけで、ロボットが見れば学ぶ」に本当に変えられるのか?
もしこのスケーリング法則が今後も成り立つなら、ロボットのGPTマーメントは、単なるマーケティングの言葉ではなくなるかもしれない。
参照リンク:[1]https://www.skild.ai/blogs/s1
本文は微信公衆アカウント「量子位」より、著者:henry
