Skild AI 推出 S1 機器人模型,具備 10 分鐘上下文學習能力

icon MarsBit
分享
AI summary icon精華摘要
AI 與加密貨幣新聞爆出,Skild AI 推出了 S1 機器人模型,該模型利用情境學習,僅需單次示範即可執行複雜任務。該模型在未見過的任務中達成 66% 的成功率,遠高於傳統 VLA 方法的 9%。S1 消除了對數百個訓練樣本的需求,大幅縮短學習時間。交易所上線的新代幣通常反映技術進步,此項發展可能影響加密領域即將推出的 AI 相關項目。

具身智能的重大成果,即將來臨!!!

自上周 Generalist 發布能夠學習 3 到 12 秒動作的具身大腦 Gen 1.5 以來~

剛剛,北美具身初創公司 Skild AI 又發布了全新的機器人基礎模型 S1,直接將機器人上下文學習的任務長度推至 10 分鐘以上。

Skild AI

這次的 S1 主打上下文學習(in-context learning,ICL):

無需在後訓練階段專門學習新的操作數據,只需觀看一段人類示範影片,就能「照貓畫虎」,直接完成一整套從未見過的複雜操作流程。

在官方示範中,機器人完成了煎餅、沖泡咖啡、給植物換盆,以及設備組裝等長程任務。並且在未見過的任務上,將成功率提升至 66%,遠超基於語言提示的 VLA(僅 9%)。

此外,即使採用傳統的後訓練微調路線,要追上 S1 僅看一次演示的效果,大約也需要輸入約 380 次任務演示。

非常 amazing!

It can be said that this recent wave of work focused on in-context learning has reignited hope in embodied AI for many people.

有推特網友表示,通用機器人可能兩年後就會出現,而不是七年。

Skild AI

還有網友表示,從 Rhoda,到上週的 Generalist,再到現在 Skild S1 的 10 分鐘任務,機器人真正的 GPT 時刻似乎正在出現。

Skild AI

因為一旦這種能力真的泛化,以後開發機器人技能,可能真的會變得像給 ChatGPT 寫 Prompt 一樣。

Skild AI

真的有這麼神嗎?我們一起來看看。

從 BERT 時代,邁向 GPT 時代

要理解 S1 這次到底是如何進行上下文學習的,我們得先看看傳統機器人是如何學習一項新技能的。

在傳統的 pipeline 裡,機器人學習其實和大模型差不多:

先在海量數據上進行預訓練,學會一些基礎能力;然後在具體場景中,針對某個任務收集數據,通過後訓練,讓機器人學會專有技能。

Skild AI

但問題在於,機器人和大模型雖然流程相似,數據成本卻完全不一樣。

The pre-training data for large models is largely sourced from the internet; even in specialized scenarios such as programming and agents, much of the post-training data can be quickly obtained online or even auto-generated.

但機器人就比較慘了。預訓練數據得在現實世界裡採,後訓練數據還是得在現實世界裡採。

因此,在技術部落格中,Skild AI 直接開麥了:

如果一個機器人基礎模型,每學一個新任務仍需要幾十、幾百小時的實機數據,再重新進行後訓練,那我請問,這個「基礎模型」,基礎在哪儿?

他們甚至引用既有研究指出,如果針對一個新任務的數據已經足夠多,那麼從零訓練的模型甚至都可能追平經過預訓練再微調的基礎模型。

那麼,具身預訓練的意義到底是什麼?

Skild 的回應是:上下文學習。

為了有一個參考坐標,Skild 引入了大模型的發展路線作為對照。

The early BERT was already powerful, but for each new task, you often still had to reprepare the data and fine-tune again.

真正改變遊戲規則的,是後來 GPT-3 之後逐漸顯現出來的上下文學習能力:

無需修改模型權重,只需在提示中提供幾個範例,模型便能臨時「學會」一項新任務。

Skild AI

基於此,Skild 認為,機器人現在其實還困在類似的 BERT 時代,他們真正想要的是,讓機器人也完成同樣一次範式轉換。

In other words, the true value of pre-training should not merely be reducing the amount of data needed for fine-tuning, but enabling the bot to ultimately gain the ability to “learn directly from context”.

上下文學習

那麼,S1 這次到底從上下文裡學到了什麼?

Skild 認為,真正能檢驗機器人上下文學習能力的,其實就兩個維度:

一個是,能否學會訓練時根本沒見過的新技能;另一個是,能否將已有技能重新組合,完成一個很長、很複雜的新任務。

例如,機器人只需觀看一段翻煎餅的影片,就能學會如何製作煎餅——

即使這項技能此前從未出現於其訓練數據中。

與此同時,相較於上周 Gen-1.5 展示的秒級視頻,S1 這次直接將上下文學習延長至最長 10 分鐘。

在植物換盆等任務中,每個任務都需要連續完成幾十個操作步驟。在這些長程任務的演示中,機器人不僅需要做到照貓畫虎,還需要知道:

我現在做到哪一步了,下一步該幹嘛,技能之間怎麼組合,中間搞砸了又該怎麼繼續。

In other words, the robot needs to truly understand the intent behind tasks and actions in the video demonstration, respond flexibly to changing situations, rather than merely performing behavior cloning.

此外,在植物換盆任務中,從開始錄製示範到機器人自行操作,僅花了 11 分鐘,直接在效率上碾壓傳統的後訓練方法。

最後,在整個過程中,S1 沒有使用微調,也沒有進行後訓練,模型權重完全保持不變,僅憑同一套權重就完成了部落格中展示的所有任務。

基本實現了從 BERT 需要特定場景微調,到 GPT-3 僅通過示例即可完成 OOD 任務的跨越。

唯一的不同在於,使用的 prompt 不再是語言,而是採用了更能與下游任務對齊的動作視頻。

Skild AI

實驗:ICL 到底是不是更能 scale?

在實驗部分,Skild 先在(訓練數據)見過的任務和未見過的任務上,對比了 ICL 視頻 Prompt 和傳統的語言 Prompt VLA。

Skild AI

測試結果表明,當訓練數據只有 1000 小時時,語言 Prompt 效果更好,而隨著數據規模增加,ICL 開始反超。

到了 10 萬小時,訓練時見過的任務上:ICL 96%,語言 Prompt 89%。

而在真正關鍵的 OOD 任務上:ICL 66%,語言 Prompt 僅有 9%,拉開了 7 倍以上的差距。

為驗證 S1 的泛化性,Skild 又在不同的實驗條件下進行測試。

Skild AI

Results show that the performance degradation of language Prompt VLA can be up to 3 times that of ICL.

In other words, ICL does not learn to repeat actions in fixed scenarios, but rather to replan its actions based on the current environment.

最後,在 One shot learning 方面。

S1 在新任務上完全不進行後訓練,僅觀看一段影片示範,成功率便達到 66%。

Skild AI

相比之下,傳統的 VLA 則大約需要經過約 380 次演示的後訓練,才能達到同樣水平。

當然,繼續堆到 2000 次演示後,傳統的後訓練最終能達到 86%。

因此,結論可能不是「以後機器人不用訓練了」,而是:

以前一個新技能可能得教幾百遍,現在先看一遍,就能直接做到六七十分。

這也是 Skild 所謂的 ICL scaling law:

數據越多,模型不僅會學到更多技能,還會越來越擅長「從示範中學習技能」。

Who is Skild AI?

Skild 成立於 2023 年,背後是兩位 CMU 机器人圈的老熟人:Deepak Pathak 和 Abhinav Gupta。

Skild AI

兩人均為卡內基梅隆大學機器人研究所的教授,Deepak 主要研究機器人學習、強化學習和計算機視覺,Abhinav 則是計算機視覺和自監督學習領域的大神。

早在2022年,兩人就曾合作過 WHIRL,讓機器人透過觀看人類影片進行 one-shot imitation,可以說 S1 這條路線,也不是突然從石頭縫裡蹦出來的。

Skild AI

作為北美具身圈的明星企業,2024 年 Skild 剛走出隱身模式,就拿下 3 億美元 A 輪、估值 15 億美元;

到今年1月,又完成14億美元C輪融資,估值直接攀升至140億美元以上,由SoftBank領投,英偉達、貝索斯等繼續參投。兩年多時間,估值接近翻了10倍。

從橫向對比來看,Skild 在北美具身圈的定位也相當特殊。

與其說是 PI,不如說更像在搞「機器人 GPT」,Generalist 最近強調的是 one-shot learner,以及 Genesis AI 和 Sunday 最近的全棧勢頭,Skild 一直強調的一句話是:Any robot, any task, one brain。

它更強調跨實體,希望同一個 Skild Brain 能夠運行在機械臂、四足、人形等不同身體上。

簡單來說,就是想成為機器人時代的 Android:一個智能層,可以嵌入各種不同的身體中。

這也決定了 Skild 的數據策略:全都要。

Skild 將機器人數據視為 hardware proximity、diversity 和 scalability 三個維度:

實機遙控最接近硬體,但昂貴;第一人稱人類影片最容易規模化,但與機器人身體相差甚遠;模擬成本低且可大規模製造,卻存在模擬到現實的差距。

Skild AI

因此,他們對於 Robot Teleop、UMI、Egocentric Video、Simulation 基本上採取的都是使用的策略。

而 S1 的 ICL,其實也是這條路線自然的延伸:

Skild AI

2025年9月 LocoFormer → 2026年2月 首次 In-Domain ICL → 5月 第一次翻煎餅 → 8月 S1 發布,直接把上下文學習推到最長10分鐘的OOD長程任務。

所以現在真正值得關注的問題,可能已經不是機器人還能不能學會更多技能,而是:

機器人學習一項新技能的成本,能否真的從「教幾百遍」,變成「你做一遍,它看一遍」?

如果這個 scaling law 還能繼續成立,那所謂機器人的 GPT moment,可能真的不只是又一個行銷梗了。

參考連結:[1]https://www.skild.ai/blogs/s1

本文來自微信公眾號「量子位」,作者:henry

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露