Skild AI, 10 Dakikalık Bağlam Öğrenmesi ile S1 Robot Modelini Başlatıyor

icon MarsBit
Paylaş
AI summary iconÖzet
AI + kripto haberleri, Skild AI'nin S1 robot modelini piyasaya sürmesiyle patladı; bu model, tek bir gösterimden karmaşık görevleri gerçekleştirmek için bağlam öğrenmesini kullanıyor. Model, görülmemiş görevlerde %66 başarı oranı elde etti, bu da geleneksel VLA yöntemlerinin %9'undan çok daha yüksek. S1, yüzlerce eğitim örneğine ihtiyaç duymadan öğrenme süresini büyük ölçüde kısaltıyor. Borsalarda yeni token listelemeleri genellikle teknolojik ilerlemeleri yansıtır ve bu gelişme, kripto uzayında yaklaşan AI ile ilgili projeleri etkileyebilir.

Bedenli akıl büyük sonucu yakında!

Geçen hafta Generalist, 3 ila 12 saniyelik hareketleri öğrenen gövdeli zekâ Gen 1.5'i yayınladı~

Daha önce, Kuzey Amerika'daki vücutlu AI startup'ı Skild AI, S1 adlı yeni bir robot temel modeli yayınladı ve robotun bağlam öğrenme görev uzunluğunu 10 dakikadan yukarı çıkardı.

Skild AI

Bu S1, bağlamda öğrenmeyi (in-context learning, ICL) öne çıkarıyor:

Yeni işlem verilerini eğitimin sonraki aşamasında özel olarak öğrenmeye gerek yoktur; sadece bir insan gösteri videosu izleyerek, daha önce görülmemiş karmaşık işlem akışlarını doğrudan taklit edebilir.

Resmi demo sırasında, robot uzun mesafeli görevleri tamamladı: pankek pişirmek, kahve demlemek, bitkileri yeni çiçekliklere dikmek ve cihaz montajı. Görülmemiş görevlerde başarı oranını %66'ya çıkardı, bu da dil tabanlı VLA'nın (%9) çok üstünde bir performanstır.

Ayrıca, geleneksel sonrası eğitme ince ayar yolunu izleseniz bile, S1'in yalnızca bir kez gösterimden elde ettiği etkiyi yakalamak için yaklaşık 380 kez görev gösterimi vermeniz gerekecek.

Çok harika!

Son zamanlarda bağlam öğrenimine odaklanan bu dalganın, birçok kişiye bedensellik konusunda yeniden umut aşıladığını söylemek mümkündür.

Bir Twitter kullanıcısı, genel amaçlı robotların yedi yıl değil, iki yıl içinde ortaya çıkabileceğini belirtti.

Skild AI

Bazı kullanıcılar, Rhoda'dan geçen haftaki Generalist'e ve şimdi Skild S1'in 10 dakikalık görevlerine kadar olan süreçte, robotların gerçek GPT anının yaklaştığını belirtti.

Skild AI

Çünkü bu yetenek gerçekten genelleştiğinde, robot becerileri geliştirmek aslında ChatGPT'ye talimat yazmak gibi hale gelebilir.

Skild AI

Bu kadar mı etkili? Birlikte inceleyelim.

BERT döneminden GPT dönemine geçiş

S1'in bu kez nasıl bağlam öğrenimi yaptığını anlamak için, geleneksel robotların yeni bir beceriyi nasıl öğrendiğine bakmalıyız.

Geleneksel bir pipeline'da, robotların öğrenmesi aslında büyük modellerle neredeyse aynıdır:

Öncelikle büyük veri setleri üzerinde önceden eğitilir ve temel beceriler kazanılır; ardından belirli senaryolarda, belirli bir görev için veri toplanır ve son eğitimle robot özel becerileri öğrenir.

Skild AI

Ancak sorun, robotların ve büyük modellerin süreçleri neredeyse aynı olsa da, veri maliyetlerinin tamamen farklı olması.

Büyük modellerin ön eğitim verileri büyük ölçüde internetten gelir; programlama, Agent gibi özel senaryolara kadar birçok sonrası eğitim verisi çevrimiçi olarak hızlıca elde edilebilir veya otomatik olarak üretilebilir.

Ancak robotlar daha kötü durumda. Önceden eğitme verileri gerçek dünyadan toplanmalı, sonraki eğitme verileri de gerçek dünyadan toplanmalı.

Bu nedenle teknik blogda Skild AI doğrudan konuştu:

Eğer bir robot temel modeli, her yeni görevi öğrenmek için hâlâ onlarca ya da yüzlerce saat gerçek veriye ihtiyaç duyup yeniden eğitiliyorsa, o zaman bu “temel model”in temeli nerede?

Hatta mevcut araştırmalara dayanarak, yeni bir görev için yeterli veri varsa, sıfırdan eğitilen modellerin önceden eğitilmiş ve ince ayarlanmış temel modellerle eşitlenebileceğini belirttiler.

Yani, gövdeli ön eğitimnin anlamı nedir?

Buna göre Skild'in verdiği cevap: bağlam öğrenmesidir.

Bir referans noktası olarak, Skild büyük modellerin gelişim yolunu karşılaştırma olarak çekti.

Erken BERT zaten güçlüydü, ancak her yeni görevde genellikle verileri yeniden hazırlamak ve tekrar ince ayarlamak gerekirdi.

Sonrasında GPT-3 sonrası ortaya çıkan bağlam öğrenme yeteneği, oyun kurallarını gerçekten değiştirdi:

Model ağırlıklarını değiştirmenize gerek yok, sadece Prompt'a birkaç örnek vererek model geçici olarak yeni bir görevi "öğrenebilir".

Skild AI

Buna dayanarak, Skild, robotların şu anda aslında benzer bir BERT dönemi içinde takılı kaldığını düşünüyor ve robotların da aynı bir paradigmalar dönüşümünü tamamlamasını istiyor.

Yani, ön eğitimizin gerçek değeri, sonraki eğitimi daha az veriyle yapmak değil, robotun nihayetinde "bağlamdan doğrudan öğrenme" yeteneğine sahip olmasındadır.

Bağlam öğrenimi

Peki, S1 bu sefer bağlamdan gerçekten ne öğrendi?

Skild, robotların bağlam öğrenme yeteneğini gerçekten test eden iki boyut olduğunu düşünüyor:

Biri, eğitim sırasında hiç görülmemiş yeni becerileri öğrenip öğrenememesi; diğeri, mevcut becerileri yeniden birleştirerek uzun ve karmaşık yeni bir görev tamamlayıp tamamlayamaması.

Örneğin, bir robot yalnızca bir panekek çevirme videosu izleyerek panekek yapmayı öğrenebilir—

Bu beceri daha önce eğitim verilerinde yer almasa da.

Bu arada, S1, geçen hafta Gen-1.5'in gösterdiği saniye bazlı videolara kıyasla, bağlam öğrenimini en uzun 10 dakikaya çıkardı.

Bitki transplante etme gibi görevlerde, her görev sürekli olarak onlarca işlem adımını tamamlamayı gerektirir. Bu uzun menzilli görevlerin gösterimlerinde, robot sadece taklit etmekle kalmamalı, aynı zamanda şunu bilmelidir:

Şu anda hangi adımdasınız, bir sonraki adım ne olmalı, becerileri nasıl birleştirebilirsiniz, arada bir hata yaparsanız nasıl devam edebilirsiniz.

Yani robot, sadece davranış klonlamadan ibaret olmaksızın, video gösterimindeki görev-aksiyon niyetlerini gerçekten anlamalı ve duruma göre tepki vermelidir.

Ayrıca, bitki transplante etme görevinde, demo kaydını başlatmaktan robotun kendi kendine işlem yapmasına kadar sadece 11 dakika sürdü ve doğrudan verimlilik açısından geleneksel sonrası eğitimi geride bıraktı.

Son olarak, tüm süreç boyunca S1, ince ayar kullanmadı ve post-egitim uygulamadı; model ağırlıkları tamamen değişmeden, aynı ağırlık setiyle blogta gösterilen tüm görevler tamamlandı.

Temel olarak, büyük modellerin BERT'in özel senaryolar için ince ayarlanması gerekliliğinden GPT-3'ün yalnızca örneklerle OOD görevlerini tamamlayabilmesine kadar olan atlama sağlanmıştır.

Tek fark, aşağı akış görevleriyle daha iyi hizalanabilen eylem videolarının kullanılmasıdır.

Skild AI

Deneysel: ICL gerçekten daha iyi ölçeklenebilir mi?

Deneme bölümünde, Skild, ICL video İpucu ve geleneksel dil İpucu VLA'yı (eğitim verilerinde) görülen görevlerde ve görülmemiş görevlerde karşılaştırdı.

Skild AI

Test sonuçları, eğitim verileri yalnızca 1000 saat olduğunda dil Prompt'un daha iyi performans gösterdiğini, ancak veri ölçeği arttıkça ICL'nin öne çıktığını göstermektedir.

100.000 saatte, eğitim sırasında görülen görevlerde: ICL %96, dil promptu %89.

Ancak gerçek kritik OOD görevlerinde: ICL %66, dilsel İpucu sadece %9, böylece 7 katın üzerinde bir fark oluşturuldu.

S1'in genelleme yeteneğini doğrulamak için Skild, farklı deney koşullarında testler gerçekleştirdi.

Skild AI

Sonuçlar, dil Prompt VLA'nın performansındaki düşüşün, ICL'nin en fazla üç katı olduğunu göstermektedir.

Yani ICL, sabit senaryolardaki eylemleri tekrarlamayı değil, mevcut ortama göre nasıl hareket edeceğine yeniden planlamayı öğreniyor.

Son olarak, One shot learning açısından.

S1, yeni görevde hiçbir post-egitim yapmadan yalnızca bir video gösterisi izleyerek %66 başarı oranı elde ediyor.

Skild AI

Karşılaştırıldığında, geleneksel VLA aynı seviyeye ulaşmak için yaklaşık 380 kez gösterim sonrası eğitim gerektirir.

Elbette, 2000 kez gösterimden sonra geleneksel post-egitim sonunda %86'ya ulaşabilir.

Sonuç dolayısıyla “artık robotlar eğitilmeyecek” değil, şudur:

Daha önce bir yeni beceri yüzlerce kez öğretilmeliydi, şimdi sadece bir kez bakarak doğrudan altı yedi puan alabilirsiniz.

Bu, Skild'in dediği ICL ölçekleme yasasıdır:

Veri ne kadar artarsa, model sadece daha fazla beceri kazanmakla kalmaz, aynı zamanda "gösterimlerden beceri öğrenme" yeteneği de giderek artar.

Skild AI kim?

Skild, 2023 yılında CMU robotik topluluğundan iki tanıdık olan Deepak Pathak ve Abhinav Gupta tarafından kuruldu.

Skild AI

İkisi de Carnegie Mellon Üniversitesi Robotik Enstitüsü'nde profesör; Deepak, robot öğrenimi, pekiştirmeli öğrenme ve bilgisayarla görme alanlarında çalışırken, Abhinav bilgisayarla görme ve kendini denetimli öğrenme alanlarında bir efsanedir.

2022 yılında, ikili WHIRL üzerinde birlikte çalışmış ve robotların insan videolarını izleyerek one-shot imitation yapmasını sağlamıştı; bu nedenle S1 yolunda çıkan bu gelişme aniden taş çatısından çıkmış gibi değil.

Skild AI

Kuzey Amerika'nın vücutlu AI alanında öncü şirketlerinden biri olan Skild, 2024'te gizli durumundan çıktıktan hemen sonra 300 milyon dolarlık A serisi finansmanını ve 1,5 milyar dolarlık değerlemeyi elde etti;

Bu yıl Ocak'ta 1,4 milyar dolarlık C serisi finansman turu tamamlandı ve değerlemesi 14 milyar doların üzerine çıktı; SoftBank öncülük etti, NVIDIA, Bezos ve diğerleri yine masaya oturdu. İki buçuk yıl içinde değerlemesi neredeyse on katına çıktı.

Yatay bir karşılaştırmada, Skild Kuzey Amerika'da vücutlu alanlarda oldukça özel bir konuma sahip.

PI’ye kıyasla daha çok “robot GPT” gibi görünüyor; Generalist son zamanlarda one-shot learner ve Genesis AI’ya odaklanırken, Sunday son dönemde tam yığın hızını artırmış durumda, Skild her zaman şu cümleyi vurguladı: Her robot, her görev, bir beyni.

Bu, farklı vücutlarda — robot kollar, dört ayaklı, insan benzeri vb. — aynı Skild Brain'in çalışmasını vurgulamaktadır.

Daha anlaşılır bir dille, robot çağının Android'i olmak istiyorsunuz: Farklı vücutlara yerleştirilebilen bir akıllı katman.

Bu, Skild'in veri stratejisini de belirler: hepsini.

Skild, robot verilerini hardware proximity, diversity ve scalability üç boyutu olarak değerlendirir:

Gerçek cihaz uzaktan kontrolü donanıma en yakın ancak pahalıdır; birinci kişi insan videoları ölçeklenebilirliği en yüksektir ancak robot vücudundan çok uzaktır; simülasyon ucuz ve yoğun üretilebilir ancak sim-to-real boşluğu vardır.

Skild AI

Bu nedenle Robot Teleop, UMI, Egocentric Video ve Simulation için temel olarak tümünü kullanma stratejisini benimsemişler.

S1'in ICL'si aslında bu rota doğal bir uzantısıdır:

Skild AI

2025 yılının Eylül ayında LocoFormer → 2026 yılının Şubat ayında İlk İç Alan ICL → Mayıs'ta İlk Ters Çevirme → Ağustos'ta S1 yayımlandı, doğrudan bağlam öğrenmesini en uzun 10 dakikalık OOD uzun menzilli görevlere taşıdı.

Bu nedenle şimdi gerçekten dikkat edilmesi gereken soru, robotların daha fazla beceri öğrenip öğrenemeyeceği değil:

Bir robotun yeni bir beceri kazanma maliyeti, gerçekten “yüzlerce kez öğretmek”ten “bir kez sen yap, o izlesin” haline gelebilir mi?

Eğer bu ölçek yasası hâlâ geçerliyse, robotların GPT anı gerçekten sadece başka bir pazarlama sözü olmayabilir.

Referans bağlantısı: [1]https://www.skild.ai/blogs/s1

Bu yazı, WeChat hesabından "Quantum Bits" tarafından yazılmıştır, yazar: henry

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.