Skild AI เปิดตัวรุ่นหุ่นยนต์ S1 พร้อมการเรียนรู้บริบทใน 10 นาที

icon MarsBit
แชร์
AI summary iconสรุป
ข่าว AI และคริปโตแพร่กระจายเมื่อ Skild AI เปิดตัวรุ่นหุ่นยนต์ S1 ซึ่งใช้การเรียนรู้จากบริบทเพื่อดำเนินงานที่ซับซ้อนจากตัวอย่างเพียงหนึ่งครั้ง โมเดลนี้มีอัตราความสำเร็จ 66% บนงานที่ไม่เคยเห็นมาก่อน สูงกว่าวิธี VLA แบบดั้งเดิมที่ 9% S1 กำจัดความจำเป็นในการใช้ตัวอย่างการฝึกฝนนับร้อย ลดเวลาการเรียนรู้อย่างมาก การ listing โทเค็นใหม่บนแพลตฟอร์มแลกเปลี่ยนมักสะท้อนถึงความก้าวหน้าทางเทคโนโลยี และการพัฒนานี้อาจส่งผลต่อโครงการที่เกี่ยวข้องกับ AI ที่กำลังจะเกิดขึ้นในพื้นที่คริปโต

ผลลัพธ์ใหญ่ของ Embodied Intelligence กำลังจะมาแล้ว!!!

ตั้งแต่ทั่วไปเผยแพร่สมองกายภาพ Gen 1.5 ที่สามารถเรียนรู้การเคลื่อนไหว 3 ถึง 12 วินาทีเมื่อสัปดาห์ที่แล้ว~

เมื่อไม่นานนี้ Skild AI บริษัทสตาร์ทอัพด้านหุ่นยนต์ของอเมริกาเหนือได้เปิดตัวโมเดลพื้นฐานหุ่นยนต์รุ่นใหม่ S1 ซึ่งยืดความยาวของงานการเรียนรู้บริบทของหุ่นยนต์ไปเกิน 10 นาที

Skild AI

S1 ครั้งนี้เน้นการเรียนรู้ในบริบท (in-context learning, ICL):

ไม่จำเป็นต้องเรียนรู้ข้อมูลการดำเนินการใหม่ในขั้นตอนการฝึกหลัง แค่ดูวิดีโอตัวอย่างจากมนุษย์ก็สามารถเลียนแบบและดำเนินการขั้นตอนที่ซับซ้อนทั้งชุดที่ไม่เคยเห็นมาก่อนได้ทันที

ในการสาธิตอย่างเป็นทางการ หุ่นยนต์ได้ดำเนินงานระยะยาวต่างๆ เช่น การทำแพนเค้ก การชงกาแฟ การเปลี่ยนกระถางต้นไม้ และการประกอบอุปกรณ์ และยังสามารถเพิ่มอัตราความสำเร็จเป็น 66% สำหรับงานที่ไม่เคยเห็นมาก่อน ซึ่งสูงกว่า VLA ที่ใช้คำสั่งทางภาษาอย่างมาก (เพียง 9%)

นอกจากนี้ แม้จะใช้วิธีการปรับแต่งแบบดั้งเดิมหลังการฝึกอบรม ก็ยังต้องป้อนตัวอย่างงานประมาณ 380 ครั้ง เพื่อให้สามารถเทียบเท่ากับประสิทธิภาพของ S1 ที่ดูเพียงครั้งเดียว

ยอดเยี่ยมมาก!

สามารถพูดได้ว่า งานล่าสุดที่มุ่งเน้นไปที่การเรียนรู้จากบริบท ได้ปลุกความหวังเรื่องการมีร่างกายให้กับอีกหลายคนอีกครั้ง

มีผู้ใช้ทวิตเตอร์แสดงความเห็นว่า หุ่นยนต์ทั่วไปอาจเกิดขึ้นภายในสองปี ไม่ใช่เจ็ดปี

Skild AI

ผู้ใช้งานรายอื่นยังระบุว่า ตั้งแต่ Rhoda ไปจนถึง Generalist เมื่อสัปดาห์ที่แล้ว และตอนนี้คือภารกิจ 10 นาทีของ Skild S1 ดูเหมือนว่าช่วงเวลา GPT ที่แท้จริงของหุ่นยนต์กำลังเกิดขึ้น

Skild AI

เพราะเมื่อความสามารถนี้ถูกนำไปใช้อย่างกว้างขวางในอนาคต การพัฒนาทักษะของหุ่นยนต์อาจกลายเป็นเรื่องง่ายเหมือนการเขียนพรอมต์ให้กับ ChatGPT

Skild AI

มันจะดีจริงอย่างนั้นหรือ? มาดูกันร่วมกัน

จากยุค BERT สู่ยุค GPT

เพื่อเข้าใจว่า S1 ครั้งนี้เรียนรู้ในบริบทอย่างไร เราต้องมาดูก่อนว่าหุ่นยนต์แบบดั้งเดิมเรียนรู้ทักษะใหม่ได้อย่างไร

ในระบบ pipeline แบบดั้งเดิม การเรียนรู้ของหุ่นยนต์แท้จริงแล้วคล้ายกับโมเดลขนาดใหญ่:

ก่อนหน้านี้ให้ฝึกล่วงหน้าบนข้อมูลปริมาณมหาศาล เพื่อเรียนรู้ทักษะพื้นฐาน จากนั้นเมื่อเข้าสู่บริบทเฉพาะ ให้รวบรวมข้อมูลสำหรับงานเฉพาะทาง และผ่านการฝึกเพิ่มเติม เพื่อให้หุ่นยนต์เรียนรู้ทักษะเฉพาะตัว

Skild AI

แต่ปัญหาคือ แม้หุ่นยนต์และโมเดลขนาดใหญ่จะมีขั้นตอนคล้ายกัน แต่ต้นทุนข้อมูลกลับไม่เหมือนกันเลย

ข้อมูลการฝึกล่วงหน้าของโมเดลขนาดใหญ่ส่วนใหญ่มาจากการอินเทอร์เน็ต; แม้แต่ในบริบทเฉพาะเช่น การเขียนโปรแกรมและเอเจนต์ ข้อมูลการฝึกเพิ่มเติมจำนวนมากก็สามารถรับได้อย่างรวดเร็วออนไลน์ หรือแม้แต่สร้างขึ้นเอง

แต่หุ่นยนต์นั้นค่อนข้างแย่กว่า ข้อมูลการฝึกล่วงหน้าต้องเก็บจากโลกแห่งความเป็นจริง และข้อมูลการฝึกหลังก็ยังต้องเก็บจากโลกแห่งความเป็นจริงเช่นกัน

ดังนั้น ในบล็อกเทคนิค Skild AI จึงพูดออกมาตรงๆ:

หากโมเดลพื้นฐานของหุ่นยนต์ต้องใช้ข้อมูลจริงเป็นเวลาหลายสิบถึงหลายร้อยชั่วโมงสำหรับแต่ละงานใหม่ที่เรียนรู้ และต้องฝึกใหม่ทั้งหมด แล้วฉันขอถามว่า “โมเดลพื้นฐาน” นี้พื้นฐานอยู่ที่ไหน?

พวกเขายังอ้างงานวิจัยที่มีอยู่แล้วว่า หากข้อมูลสำหรับงานใหม่มีเพียงพอ โมเดลที่ฝึกจากศูนย์อาจสามารถเทียบเท่ากับโมเดลพื้นฐานที่ผ่านการฝึกล่วงหน้าแล้วปรับแต่งเพิ่มเติม

ดังนั้น ความหมายของ pre-training แบบ embodiment คืออะไร?

สำหรับเรื่องนี้ Skild ให้คำตอบว่า: การเรียนรู้จากบริบท

เพื่อให้มีจุดอ้างอิง Skild ได้นำเส้นทางการพัฒนาของโมเดลขนาดใหญ่มาเป็นตัวเปรียบเทียบ

BERT ในยุคแรกๆ นั้นแข็งแกร่งอยู่แล้ว แต่เมื่อเจอภารกิจใหม่แต่ละครั้ง มักต้องเตรียมข้อมูลใหม่และปรับแต่งอีกครั้ง

สิ่งที่เปลี่ยนกฎของเกมอย่างแท้จริง คือความสามารถในการเรียนรู้จากบริบทที่ค่อยๆ ปรากฏขึ้นหลังจาก GPT-3:

ไม่จำเป็นต้องปรับน้ำหนักโมเดล เพียงแค่ให้ตัวอย่างไม่กี่ตัวอย่างในคำสั่ง โมเดลจะสามารถ “เรียนรู้” งานใหม่ได้ชั่วคราว

Skild AI

จากจุดนี้ Skild มองว่า หุ่นยนต์ในปัจจุบันยังคงติดอยู่ในยุคที่คล้ายกับ BERT และสิ่งที่พวกเขาต้องการจริงๆ คือการทำให้หุ่นยนต์สามารถผ่านการเปลี่ยนผ่านเชิงรูปแบบเดียวกันนี้ได้เช่นกัน

กล่าวคือ คุณค่าที่แท้จริงของการฝึกล่วงหน้า ไม่ควรอยู่ที่การลดปริมาณข้อมูลที่ต้องใช้ในการฝึกต่อ แต่ควรอยู่ที่การทำให้หุ่นยนต์สามารถพัฒนาความสามารถในการ “เรียนรู้โดยตรงจากบริบท” ในที่สุด

Context Learning

แล้ว S1 ครั้งนี้เรียนรู้อะไรจากบริบทบ้าง?

Skild คิดว่า สิ่งที่สามารถทดสอบความสามารถในการเรียนรู้บริบทของหุ่นยนต์ได้จริง มีเพียงสองมิติ:

หนึ่งคือ สามารถเรียนรู้ทักษะใหม่ที่ไม่เคยเจอในการฝึกได้หรือไม่ อีกข้อคือ สามารถนำทักษะที่มีอยู่มาจัดเรียงใหม่เพื่อ hoàn thiệnงานใหม่ที่ยาวและซับซ้อนได้หรือไม่

ตัวอย่างเช่น หุ่นยนต์เพียงแค่ดูวิดีโอการพลิกแพนเค้ก ก็สามารถเรียนรู้วิธีทำแพนเค้กได้—

แม้ว่าทักษะนี้จะไม่เคยปรากฏมาก่อนในชุดข้อมูลการฝึกของมัน

ในขณะเดียวกัน ต่างจากวิดีโอระดับวินาทีที่ Gen-1.5 แสดงเมื่อสัปดาห์ที่แล้ว S1 ครั้งนี้ได้ขยายการเรียนรู้บริบทไปสูงสุดถึง 10 นาที

ในงานต่างๆ เช่น การปลูกพืชใหม่ในกระถางใหม่ แต่ละงานต้องดำเนินการขั้นตอนหลายสิบขั้นตอนอย่างต่อเนื่อง ในตัวอย่างงานระยะยาวเหล่านี้ หุ่นยนต์ไม่เพียงแต่ต้องเลียนแบบตาม แต่ยังต้องรู้ว่า:

ตอนนี้ฉันทำถึงขั้นไหนแล้ว ขั้นต่อไปควรทำอะไร ทักษะต่างๆ ควรจับคู่กันอย่างไร และถ้าทำผิดระหว่างทางจะต้องทำอย่างไรต่อ

กล่าวคือ หุ่นยนต์ต้องเข้าใจอย่างแท้จริงถึงเจตนาของงานและการกระทำในวิดีโอสาธิต สามารถตอบสนองต่อสถานการณ์ต่างๆ ได้อย่างยืดหยุ่น ไม่ใช่เพียงแค่เลียนแบบพฤติกรรมอย่างง่าย

นอกจากนี้ ในภารกิจการปลูกถ่ายพืช ตั้งแต่เริ่มบันทึกการสาธิตจนถึงหุ่นยนต์เริ่มทำงานด้วยตัวเอง ใช้เวลาเพียง 11 นาที โดยตรงในด้านประสิทธิภาพ ทำให้การฝึกอบรมแบบดั้งเดิมตกอยู่เบื้องหลัง

สุดท้ายนี้ ในกระบวนการทั้งหมด S1 ไม่ได้ใช้การปรับแต่งแบบละเอียดหรือการฝึกอบรมหลังการฝึกอบรม น้ำหนักของโมเดลยังคงไม่เปลี่ยนแปลง โดยใช้น้ำหนักชุดเดียวกันเพื่อเสร็จสิ้นภารกิจทั้งหมดที่แสดงในบล็อก

ได้จัดเรียงพื้นฐานให้สอดคล้องกับการก้าวข้ามจากโมเดลขนาดใหญ่ที่ต้องการการปรับแต่งเฉพาะบริบทเช่น Bert ไปสู่ GPT-3 ที่สามารถทำภารกิจ OOD ได้เพียงดูตัวอย่าง

ความแตกต่างเพียงอย่างเดียวคือ แทนที่จะใช้คำสั่งเป็นภาษา ตอนนี้ใช้วิดีโอการกระทำที่สามารถจัดแนวให้เหมาะสมกับงานย่อยได้ดีกว่า

Skild AI

การทดลอง: ICL จริงๆ แล้วสามารถขยายขนาดได้ดีกว่าไหม?

ในส่วนการทดลอง Skild เปรียบเทียบวิดีโอ Prompt แบบ ICL กับภาษา Prompt VLA แบบดั้งเดิมบนงานที่เคยเห็นแล้วและงานที่ยังไม่เคยเห็น

Skild AI

ผลการทดสอบแสดงว่า เมื่อข้อมูลการฝึกมีเพียง 1,000 ชั่วโมง ภาษา Prompt จะมีประสิทธิภาพดีกว่า แต่เมื่อขนาดข้อมูลเพิ่มขึ้น ICL จะเริ่มแซงหน้า

เมื่อถึง 100,000 ชั่วโมง บนงานที่เคยเห็นระหว่างการฝึกอบรม: ICL 96% ภาษา Prompt 89%

ในงาน OOD ที่สำคัญที่สุด: ICL อยู่ที่ 66% ในขณะที่ภาษา Prompt มีเพียง 9% ห่างกันมากกว่า 7 เท่า

เพื่อตรวจสอบความทั่วไปของ S1 Skild จึงทำการทดสอบภายใต้เงื่อนไขการทดลองที่แตกต่างกัน

Skild AI

ผลการทดลองแสดงว่า ประสิทธิภาพของภาษา Prompt VLA ลดลงสูงสุดถึงสามเท่าของ ICL

กล่าวคือ ICL ไม่ได้เรียนรู้การซ้ำพฤติกรรมในสถานการณ์ที่คงที่ แต่สามารถวางแผนวิธีดำเนินการใหม่ตามสภาพแวดล้อมปัจจุบัน

สุดท้าย ในด้านการเรียนรู้แบบ One shot

S1 ไม่ทำการฝึกฝนหลังการสร้างแบบจำลองในงานใหม่ใดๆ แต่เพียงดูวิดีโอสาธิตหนึ่งวิดีโอ ก็สามารถบรรลุอัตราความสำเร็จถึง 66%

Skild AI

ในทางตรงกันข้าม VLA แบบดั้งเดิมต้องผ่านการฝึกหลังการเรียนรู้ประมาณ 380 ครั้งจึงจะสามารถตามให้ทันระดับเดียวกัน

แน่นอน หลังจากสะสมถึง 2,000 ครั้งของการแสดงผล แบบดั้งเดิมหลังการฝึกอบรมสามารถทำได้ถึง 86%

ดังนั้น ข้อสรุปอาจไม่ใช่ “ในอนาคตหุ่นยนต์จะไม่ต้องฝึกอีกแล้ว” แต่คือ:

ก่อนหน้านี้ การเรียนทักษะใหม่หนึ่งอย่างอาจต้องสอนหลายร้อยครั้ง แต่ตอนนี้แค่ดูครั้งเดียวก็สามารถทำได้ถึงหกหรือเจ็ดสิบคะแนน

นี่คือกฎหมายการขยายขนาด ICL ที่ Skild อ้างถึง:

ยิ่งมีข้อมูลมากเท่าไหร่ โมเดลไม่เพียงแต่จะมีทักษะมากขึ้น แต่ยังจะยิ่งเรียนรู้ทักษะ “จากตัวอย่าง” ได้ดีขึ้น

Skild AI คือใคร?

Skild ก่อตั้งขึ้นในปี 2023 โดยมีสองผู้เชี่ยวชาญจากวงการหุ่นยนต์ของ CMU ได้แก่ Deepak Pathak และ Abhinav Gupta อยู่เบื้องหลัง

Skild AI

ทั้งสองคนเป็นศาสตราจารย์ที่สถาบันหุ่นยนต์ของมหาวิทยาลัยคาร์เนกี เมลลอน โดย Deepak มุ่งเน้นการวิจัยด้านการเรียนรู้ของหุ่นยนต์ การเรียนรู้แบบเสริมแรง และการมองเห็นของคอมพิวเตอร์ ส่วน Abhinav เป็นผู้เชี่ยวชาญด้านการมองเห็นของคอมพิวเตอร์และการเรียนรู้แบบไม่มีผู้สอน

ตั้งแต่ปี 2022 ทั้งสองคนเคยร่วมมือกันใน WHIRL ให้หุ่นยนต์เรียนรู้การเลียนแบบแบบ one-shot โดยดูวิดีโอของมนุษย์ สามารถกล่าวได้ว่าเส้นทาง S1 นี้ไม่ได้เกิดขึ้นอย่างกะทันหันจากไหนเลย

Skild AI

ในฐานะบริษัทชั้นนำในวงการ embodiment ของอเมริกาเหนือ ปี 2024 Skild เพิ่งออกจากโหมดซ่อนตัว ก็ได้รับการระดมทุนรอบ A มูลค่า 3 พันล้านดอลลาร์สหรัฐ และมีมูลค่าบริษัท 15 พันล้านดอลลาร์สหรัฐ

ถึงเดือนมกราคมปีนี้ ได้เสร็จสิ้นการระดมทุนรอบ C มูลค่า 1.4 พันล้านดอลลาร์สหรัฐ โดยมี SoftBank เป็นผู้นำการลงทุน ขณะที่ NVIDIA, Bezos และอื่นๆ ยังคงร่วมลงทุนต่อ ภายในเวลาสองปีครึ่ง มูลค่าบริษัทใกล้เคียงกับการเพิ่มขึ้นเกือบ 10 เท่า

เมื่อเปรียบเทียบในแนวนอน Skild มีตำแหน่งที่พิเศษมากในวงการ embodiment ของอเมริกาเหนือ

เมื่อเทียบกับ PI ที่ดูเหมือนกำลังพัฒนา “หุ่นยนต์ GPT” Generalist ล่าสุดเน้นที่ one-shot learner และแนวโน้มแบบเต็มสแต็กของ Genesis AI และ Sunday ในขณะที่ Skild เน้นย้ำเพียง一句话: Any robot, any task, one brain

มันเน้นการข้าม embodiment มากขึ้น โดยหวังว่า Skild Brain เดียวกันจะสามารถรันบนร่างกายที่แตกต่างกันได้ เช่น แขนกล หุ่นยนต์สี่ขา และหุ่นยนต์รูปคน

พูดให้เข้าใจง่ายๆ ก็คือ ต้องการเป็น Android ของยุคหุ่นยนต์: ชั้นปัญญาที่สามารถใส่ลงไปในร่างกายต่างๆ ได้มากมาย

สิ่งนี้จึงกำหนดกลยุทธ์ข้อมูลของ Skild: ต้องการทั้งหมด

Skild มองข้อมูลหุ่นยนต์ในสามมิติ: hardware proximity, diversity และ scalability:

การควบคุมจากระยะไกลด้วยอุปกรณ์จริงใกล้เคียงกับฮาร์ดแวร์ที่สุด แต่ราคาแพง; วิดีโอจากมุมมองแรกของมนุษย์ง่ายต่อการขยายขนาดมากที่สุด แต่ห่างไกลจากตัวหุ่นยนต์จริง; การจำลองมีราคาถูกและผลิตได้จำนวนมาก แต่มีช่องว่างระหว่างการจำลองกับความเป็นจริง

Skild AI

ดังนั้นพวกเขาจึงใช้กลยุทธ์ที่ใช้ทั้งหมดสำหรับ Robot Teleop, UMI, Egocentric Video และ Simulation

ในขณะที่ ICL ของ S1 ก็เป็นการขยายตัวตามธรรมชาติของเส้นทางนี้:

Skild AI

กันยายน 2025: LocoFormer → กุมภาพันธ์ 2026: ICL ในโดเมนแรก → พฤษภาคม: กลับด้านครั้งแรก → สิงหาคม: เปิดตัว S1 โดยตรงผลักดันการเรียนรู้บริบทไปยังงานระยะยาว OOD ที่ยาวนานถึง 10 นาที

ดังนั้น คำถามที่แท้จริงที่ควรให้ความสนใจในขณะนี้ อาจไม่ใช่การที่หุ่นยนต์ยังสามารถเรียนรู้ทักษะเพิ่มเติมได้อีกหรือไม่ แต่คือ:

ต้นทุนในการสอนหุ่นยนต์ให้เรียนรู้ทักษะใหม่ สามารถเปลี่ยนจาก “ต้องสอนหลายร้อยครั้ง” เป็น “คุณทำครั้งเดียว มันดูครั้งเดียว” ได้จริงไหม

หากกฎการขยายตัวนี้ยังคงใช้ได้ต่อไป อาจเป็นไปได้ว่าช่วง GPT ของหุ่นยนต์นั้น ไม่ใช่เพียงแค่คำโฆษณาอีกต่อไป

ลิงก์อ้างอิง: [1]https://www.skild.ai/blogs/s1

บทความนี้มาจาก微信号 “Quantum Bit” โดยผู้เขียน: henry

คำปฏิเสธความรับผิดชอบ: ข้อมูลในหน้านี้อาจได้รับจากบุคคลที่สาม และไม่จำเป็นต้องสะท้อนถึงมุมมองหรือความคิดเห็นของ KuCoin เนื้อหานี้จัดทำขึ้นเพื่อวัตถุประสงค์ในการให้ข้อมูลทั่วไปเท่านั้น โดยไม่มีการรับรองหรือการรับประกัน และจะไม่ถูกตีความว่าเป็นคำแนะนำทางการเงินหรือการลงทุน KuCoin จะไม่รับผิดชอบต่อความผิดพลาดหรือการละเว้นในเนื้อหา หรือผลลัพธ์ใดๆ ที่เกิดจากการใช้ข้อมูลนี้ การลงทุนในสินทรัพย์ดิจิทัลอาจมีความเสี่ยง โปรดประเมินความเสี่ยงของผลิตภัณฑ์และความเสี่ยงที่คุณยอมรับได้อย่างรอบคอบตามสถานการณ์ทางการเงินของคุณเอง โปรดดูข้อมูลเพิ่มเติมได้ที่ข้อกำหนดการใช้งานและเอกสารเปิดเผยข้อมูลความเสี่ยงของเรา