Skild AI ra mắt mô hình robot S1 với khả năng học ngữ cảnh trong 10 phút

icon MarsBit
Chia sẻ
AI summary iconTóm tắt
Tin tức AI + tiền mã hóa bùng nổ khi Skild AI ra mắt mô hình robot S1, sử dụng học ngữ cảnh để thực hiện các tác vụ phức tạp chỉ từ một lần biểu diễn. Mô hình đạt tỷ lệ thành công 66% trên các tác vụ chưa từng thấy, cao xa so với các phương pháp VLA truyền thống ở mức 9%. S1 loại bỏ nhu cầu cần hàng trăm ví dụ đào tạo, giúp giảm đáng kể thời gian học. Việc niêm yết token mới trên các sàn giao dịch thường phản ánh những tiến bộ công nghệ, và sự phát triển này có thể ảnh hưởng đến các dự án liên quan đến AI sắp tới trong không gian tiền mã hóa.

Kết quả lớn của trí tuệ thể chất sắp đến!!!

Kể từ khi Generalist ra mắt bộ não thể chất Gen 1.5 có khả năng học các hành động từ 3 đến 12 giây vào tuần trước~

Vừa qua, công ty khởi nghiệp về robot tại Bắc Mỹ Skild AI đã ra mắt mô hình nền tảng robot mới S1, kéo dài độ dài nhiệm vụ học ngữ cảnh của robot lên hơn 10 phút.

Skild AI

Lần này, S1 tập trung vào học trong bối cảnh (in-context learning, ICL):

Không cần học riêng các dữ liệu thao tác mới trong giai đoạn sau huấn luyện, chỉ cần xem một đoạn video minh họa của con người là có thể “bắt chước”, hoàn thành ngay lập tức toàn bộ quy trình thao tác phức tạp mà chưa từng thấy trước đó.

Trong bản trình diễn chính thức, robot đã hoàn thành các nhiệm vụ dài hạn như làm bánh kếp, pha cà phê, thay chậu cho cây trồng và lắp ráp thiết bị. Đồng thời, trên các nhiệm vụ chưa từng thấy, robot đạt tỷ lệ thành công lên tới 66%, vượt xa các VLA dựa trên lời nhắc ngôn ngữ (chỉ có 9%).

Ngoài ra, ngay cả khi theo hướng tinh chỉnh sau huấn luyện truyền thống, để bắt kịp hiệu quả của S1 chỉ với một lần trình diễn, bạn có lẽ cần cung cấp khoảng 380 lần trình diễn nhiệm vụ.

Rất tuyệt vời!

Có thể nói, làn sóng công việc gần đây tập trung vào học ngữ cảnh đã thổi bùng lại hy vọng về sự thể hiện cho nhiều người.

Một người dùng Twitter cho biết, robot phổ quát có thể xuất hiện sau hai năm, chứ không phải bảy năm.

Skild AI

Một số người dùng mạng cũng cho rằng, từ Rhoda, đến Generalist tuần trước, và giờ là nhiệm vụ 10 phút của Skild S1, khoảnh khắc GPT thực sự của robot dường như đang đến.

Skild AI

Vì một khi khả năng này thực sự được áp dụng rộng rãi, việc phát triển kỹ năng cho robot sau này có thể thật sự trở nên giống như viết prompt cho ChatGPT.

Skild AI

Có thật sự kỳ diệu đến vậy không? Cùng xem nào.

Từ thời kỳ BERT tiến sang thời kỳ GPT

Để hiểu rõ S1 lần này học trong ngữ cảnh nào, chúng ta cần xem xét cách robot truyền thống học một kỹ năng mới.

Trong pipeline truyền thống, học máy thực chất cũng tương tự như mô hình lớn:

Trước tiên, huấn luyện trước trên lượng dữ liệu lớn để học các kỹ năng cơ bản; sau đó, trong các bối cảnh cụ thể, thu thập dữ liệu cho từng nhiệm vụ và huấn luyện thêm để giúp robot học các kỹ năng chuyên biệt.

Skild AI

Tuy nhiên, vấn đề nằm ở chỗ, dù quy trình của robot và mô hình lớn có vẻ tương tự nhau, nhưng chi phí dữ liệu lại hoàn toàn khác biệt.

Dữ liệu pre-training của các mô hình lớn chủ yếu đến từ internet; ngay cả trong các ngữ cảnh chuyên biệt như lập trình và Agent, nhiều dữ liệu sau đào tạo cũng có thể nhanh chóng thu thập trực tuyến hoặc tự động tạo ra.

Nhưng robot thì lại khá tệ hại. Dữ liệu tiền huấn luyện phải được thu thập trong thế giới thực, và dữ liệu sau huấn luyện cũng phải được thu thập trong thế giới thực.

Vì vậy, trong bài viết kỹ thuật, Skild AI đã trực tiếp lên tiếng:

Nếu một mô hình nền tảng robot, mỗi khi học một nhiệm vụ mới vẫn cần hàng chục, hàng trăm giờ dữ liệu thực tế, rồi phải huấn luyện lại từ đầu, thì tôi xin hỏi, cái “mô hình nền tảng” này nền tảng ở đâu?

Họ thậm chí còn trích dẫn các nghiên cứu trước đây chỉ ra rằng, nếu dữ liệu cho một nhiệm vụ mới đã đủ nhiều, thì mô hình được huấn luyện từ đầu thậm chí còn có thể theo kịp mô hình nền tảng đã được tiền huấn luyện và tinh chỉnh sau đó.

Vậy thì ý nghĩa của việc tiền huấn luyện thể chất là gì?

Đối với điều này, Skild đưa ra câu trả lời là: học ngữ cảnh.

Để có một điểm tham chiếu, Skild đã lấy lộ trình phát triển của các mô hình lớn làm chuẩn so sánh.

BERT từ sớm đã rất mạnh, nhưng mỗi khi gặp một nhiệm vụ mới, thường vẫn phải chuẩn bị lại dữ liệu và tinh chỉnh lại một lần nữa.

Điều thực sự thay đổi luật chơi là khả năng học ngữ cảnh dần xuất hiện sau GPT-3:

Không cần thay đổi trọng số mô hình, chỉ cần cung cấp vài ví dụ trong Prompt, mô hình có thể “học” tạm thời một nhiệm vụ mới.

Skild AI

Dựa trên điều này, Skild cho rằng các robot hiện tại thực sự vẫn đang bị kẹt trong thời kỳ tương tự BERT, và điều họ thực sự mong muốn là giúp các robot cũng thực hiện một cuộc chuyển đổi mô hình tương tự.

Nói cách khác, giá trị thực sự của việc tiền huấn luyện không nên chỉ là giảm lượng dữ liệu cần thu thập trong giai đoạn huấn luyện sau, mà là giúp robot cuối cùng có được khả năng “học trực tiếp từ ngữ cảnh”.

Học qua ngữ cảnh

Vậy thì, lần này S1 đã học được gì từ ngữ cảnh?

Skild cho rằng, thực chất chỉ có hai chiều để kiểm tra khả năng học ngữ cảnh của robot:

Một là, liệu có thể học được những kỹ năng mới mà trong quá trình huấn luyện chưa từng thấy; hai là, liệu có thể kết hợp lại các kỹ năng hiện có để hoàn thành một nhiệm vụ mới dài và phức tạp.

Ví dụ: robot chỉ cần xem một đoạn video về việc lật bánh kếp là có thể học cách làm bánh kếp—

Even if this skill has never appeared in its training data before.

Đồng thời, so với video cấp độ giây được trình bày ở Gen-1.5 tuần trước, S1 lần này đã kéo dài việc học ngữ cảnh lên tới 10 phút.

Trong các nhiệm vụ như thay chậu cây, mỗi nhiệm vụ yêu cầu hoàn thành liên tiếp hàng chục bước thao tác. Trong các màn trình diễn các nhiệm vụ dài hạn này, robot không chỉ cần bắt chước theo, mà còn cần biết:

Tôi đang ở bước nào rồi, bước tiếp theo nên làm gì, các kỹ năng nên kết hợp ra sao, và nếu giữa chừng gặp sự cố thì phải làm sao để tiếp tục.

Nói cách khác, robot cần thực sự hiểu được ý định của các nhiệm vụ-hành động trong video hướng dẫn, linh hoạt ứng biến từng tình huống, chứ không chỉ đơn thuần là sao chép hành vi.

Ngoài ra, trong nhiệm vụ thay chậu cho thực vật, từ lúc bắt đầu ghi lại hướng dẫn đến khi robot tự thực hiện chỉ mất 11 phút, trực tiếp vượt trội về hiệu suất so với các phương pháp huấn luyện truyền thống.

Cuối cùng, trong suốt quá trình này, S1 không sử dụng fine-tuning hay post-training, trọng số mô hình hoàn toàn không thay đổi, và chỉ với một bộ trọng số duy nhất, đã hoàn thành tất cả các nhiệm vụ được trình bày trong bài viết blog.

Đã cơ bản đạt được sự đồng bộ từ việc các mô hình lớn cần tinh chỉnh đặc biệt cho từng ngữ cảnh như BERT, đến việc GPT-3 chỉ cần xem ví dụ là có thể hoàn thành các nhiệm vụ OOD.

Sự khác biệt duy nhất là prompt được sử dụng không còn là ngôn ngữ, mà là các video hành động giúp căn chỉnh tốt hơn với nhiệm vụ hạ lưu.

Skild AI

Thử nghiệm: ICL có thực sự dễ mở rộng hơn không?

Trong phần thí nghiệm, Skild đã so sánh video Prompt ICL với prompt ngôn ngữ truyền thống VLA trên cả các nhiệm vụ đã thấy và chưa thấy trong dữ liệu huấn luyện.

Skild AI

Kết quả kiểm tra cho thấy, khi dữ liệu huấn luyện chỉ có 1.000 giờ, prompt ngôn ngữ hoạt động tốt hơn, nhưng khi quy mô dữ liệu tăng lên, ICL bắt đầu vượt lên.

Ở 100.000 giờ, hiệu suất trên các nhiệm vụ đã thấy trong quá trình huấn luyện: ICL 96%, Language Prompt 89%.

Trong các nhiệm vụ OOD quan trọng thực sự: ICL đạt 66%, ngôn ngữ Prompt chỉ có 9%, tạo ra khoảng cách hơn 7 lần.

Để kiểm tra tính tổng quát của S1, Skild đã tiến hành thử nghiệm trong các điều kiện thí nghiệm khác nhau.

Skild AI

Kết quả cho thấy, hiệu suất của Prompt VLA bằng ngôn ngữ giảm xuống mức cao nhất gấp 3 lần so với ICL.

Nói cách khác, ICL không học cách lặp lại hành động trong các tình huống cố định, mà học cách tái lập kế hoạch hành động dựa trên môi trường hiện tại.

Cuối cùng, về mặt học một lần.

S1 hoàn toàn không thực hiện post-training trên nhiệm vụ mới, chỉ xem một đoạn video hướng dẫn, tỷ lệ thành công đã đạt 66%.

Skild AI

So sánh với đó, VLA truyền thống cần khoảng 380 lần huấn luyện sau khi hiển thị để đạt được mức độ tương đương.

Tất nhiên, sau khi tiếp tục tích lũy đến 2.000 lần trình diễn, post-training truyền thống cuối cùng có thể đạt được 86%.

Vì vậy, kết luận có thể không phải là “sau này không cần huấn luyện robot nữa”, mà là:

Trước đây, một kỹ năng mới có thể phải dạy hàng trăm lần, bây giờ chỉ cần xem một lần là có thể làm được sáu bảy điểm.

Đây cũng là định luật mở rộng ICL mà Skild gọi là:

Càng nhiều dữ liệu, mô hình không chỉ học được nhiều kỹ năng hơn mà còn ngày càng giỏi trong việc “học kỹ năng từ các ví dụ”.

Skild AI là ai?

Skild được thành lập vào năm 2023, với sự hậu thuẫn của hai cựu thành viên quen thuộc trong cộng đồng robot của CMU: Deepak Pathak và Abhinav Gupta.

Skild AI

Cả hai đều là giáo sư tại Viện Robotics, Đại học Carnegie Mellon. Deepak chủ yếu nghiên cứu về học máy cho robot, học tăng cường và thị giác máy tính, trong khi Abhinav là chuyên gia hàng đầu trong lĩnh vực thị giác máy tính và học tự giám sát.

Ngay từ năm 2022, hai người đã hợp tác phát triển WHIRL, cho phép robot học cách bắt chước thông qua việc xem video của con người, có thể nói tuyến đường S1 này cũng không phải đột ngột xuất hiện từ đâu.

Skild AI

Là doanh nghiệp nổi bật trong cộng đồng embodied tại Bắc Mỹ, năm 2024, Skild vừa thoát khỏi chế độ ẩn danh đã huy động được vòng gọi vốn A trị giá 300 triệu USD với định giá 1,5 tỷ USD;

Đến tháng 1 năm nay, công ty đã hoàn thành vòng gọi vốn C trị giá 1,4 tỷ USD, định giá tăng lên hơn 14 tỷ USD, với SoftBank dẫn đầu, trong khi NVIDIA, Bezos và các nhà đầu tư khác tiếp tục tham gia. Trong hơn hai năm, định giá đã tăng gần 10 lần.

Ở góc độ so sánh ngang, Skild cũng có vị thế khá đặc biệt trong cộng đồng embodiment tại Bắc Mỹ.

So với PI, Generalist gần đây nhấn mạnh hơn vào việc trở thành one-shot learner, cùng với xu hướng toàn diện gần đây của Genesis AI và Sunday, Skild luôn nhấn mạnh một câu: Any robot, any task, one brain.

Nó nhấn mạnh hơn vào việc vượt qua các thể hiện khác nhau, mong muốn cùng một Skild Brain có thể chạy trên nhiều loại cơ thể khác nhau như tay máy, robot bốn chân, người máy...

Nói một cách dễ hiểu hơn, đó là muốn trở thành Android của thời đại robot: một lớp thông minh có thể nhét vào nhiều loại cơ thể khác nhau.

Điều này cũng xác định chiến lược dữ liệu của Skild: muốn tất cả.

Skild xem dữ liệu robot theo ba chiều: hardware proximity, diversity và scalability:

Điều khiển từ xa trên thiết bị thật gần với phần cứng nhất nhưng đắt đỏ; video từ góc nhìn thứ nhất của con người dễ dàng mở rộng quy mô nhất nhưng cách xa cơ thể robot; mô phỏng thì rẻ và có thể sản xuất hàng loạt, nhưng lại tồn tại khoảng cách từ mô phỏng sang thực tế.

Skild AI

Vì vậy, họ về cơ bản áp dụng chiến lược sử dụng tất cả cho Robot Teleop, UMI, Egocentric Video và Simulation.

Còn ICL của S1 thực chất cũng là sự mở rộng tự nhiên của con đường này:

Skild AI

Tháng 9 năm 2025 LocoFormer → Tháng 2 năm 2026 ICL trong lĩnh vực đầu tiên → Tháng 5 lần đầu tiên lật bánh kếp → Tháng 8 phát hành S1, trực tiếp đẩy học ngữ cảnh đến nhiệm vụ dài hạn OOD kéo dài tới 10 phút.

Vì vậy, vấn đề thực sự đáng quan tâm bây giờ có lẽ không còn là robot có thể học thêm nhiều kỹ năng nữa hay không, mà là:

Chi phí để robot học một kỹ năng mới có thực sự có thể chuyển từ “dạy vài trăm lần” thành “bạn làm một lần, nó xem một lần” không?

Nếu định luật mở rộng này vẫn tiếp tục đúng, thì thời điểm GPT của robot có thể thật sự không chỉ là một chiêu trò tiếp thị nữa.

Liên kết tham khảo: [1] https://www.skild.ai/blogs/s1

Bài viết này đến từ tài khoản công chúng WeChat "Quantum Bit", tác giả: henry

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.