source avatarGrid (❖,❖) 🟩 🐬TermMax 🚢

Paylaş

[Axis tarafından paylaşılan 100 saatlik Egocentric Veri: İnsan eylemlerinin robot öğrenme verisine nasıl dönüştürülmesi] @KaitoAI X @axisrobotics Axis'e katılım bağlantısı (referans): https://t.co/hUbWSVsBVR İnsan bir bardağı elinde tutarken parmak açılarını veya bilek izini hesaplamaz. Sadece önünde duran bardağı doğal bir şekilde alıp başka bir yere koyar. Robotlara aynı şeyi öğretmek ise farklı bir hikâyedir. Elin nesneye yaklaştığı an, gerçek temas anı, kaldırıldıktan sonra izlediği yol ve yeniden bırakıldığı an gibi eylemler ayrı ayrı bölümlere ayrılmalıdır. İnsan için bir bütünü oluşturan bu hareketler, robotun öğrenmesi için her birinin veri olarak ayrıştırılması gerekir. Axis’in Eylül başlarında güncellediği axis-ego-samples, bu insan eylemlerinin robot öğrenme verisine nasıl dönüştürüldüğünü gerçek dosyalarla gösterir. Şu ana kadar paylaşılan egocentric videoların toplam süresi 100 saattir. Bu, eğitim, konaklama, perakende, depolama, el sanatları, katering, ofis, üretim ve lojistik gibi gerçek iş ortamlarını sahne kategorilerine göre sınıflandıran, çalışanın görüş açısından çekilmiş birinci şahıs videolardır. Veriler LeRobot formatında düzenlenmiştir ve ilk yoğun eylem etiketlemesi de aynı pakette yer almaktadır. Videolarda görülen eylemler özel değildir. Nesneleri alıp başka bir yere koymak, araç kullanmak, çalışma masasını düzenlemek gibi işlemlerdir. Günlük hayatta veya iş yerlerinde sıkça karşılaşılan sahnelerdir. Ancak bu sıradan eylemler de robot öğrenme verisi haline gelmek için çok daha detaylı hale getirilmelidir. Etiketleme incelemesinde 101 clip yer almakta ve frame-by-frame dil etiketlemesi 80.090 segmente ayrılmıştır. Bir tam videoya tek bir iş adı verilmez; bunun yerine eylem değiştiği her an için bölümler oluşturulur ve hangi anda hangi hareketin gerçekleştiğine dair kayıtlar tutulur. Bir bardağı taşımak için bile aynı yöntem kullanılır. Elin bardağa yaklaşması ve gerçek tutma anı farklıdır; taşınma sırasındaki durum ve bırakma anı da ayrı ayrı belirlenir. İnsan gözünde tek bir doğal hareket gibi görünen bu süreç, veri içinde birçok aşamaya bölünmüştür. Bu sürecin gerekli olmasının nedeni, insan ve robot vücutlarının aynı olmamasıdır. İnsan eli birçok eklem ve parmağı serbestçe kullanırken, robotlar yapılarına göre hareket aralıkları farklıdır. Basit bir gripper kullanılabileceği gibi kamera konumları da her birinde farklı olabilir. İnsan el hareketlerini doğrudan robot eylemine kopyalamak yeterli değildir. Öncelikle videoda eylem aralıklarını ve nesne durumlarını tespit edip, ardından bu bilgileri robotun gerçekçi olarak gerçekleştirebileceği eylem temsillerine dönüştürmek gerekir. Kamera cihazları da çeşitli türlerde kullanılmaktadır. axis-ego-samples’te dual fisheye, altı kamera RGB+SLAM, MEgo, Gen DAS Ego, FEAGINE EGO ve GI Labs gibi farklı cihazlardan elde edilen örnekler paylaşılmıştır. Aynı işi çekmesine rağmen kamera konfigürasyonu videoları farklılaştırabilir. Görüş açısı değişir, elin ekran üzerindeki konumu değişir ve konum bilgisi alma yöntemi cihazlar arasında farklılık gösterir. Gerçek ortamlarda büyük ölçekli veri toplarken bu farklılıkları kaçınmak zordur. Sadece bir tür cihaz ve tek bir çekim koşulu varsaymak yerine, farklı girişleri öğrenme sürecinde kullanabilecek şekilde düzenlemek de gereklidir. Ayrı bir sample-150h-10cat klasöründe, teslimat corpus’undan kategori bazında alınmış 150 saatlik 10 epizod paylaşılmıştır. Ancak genel depoya sadece bu 10 örnek yüklenmiştir; 150 saatlik corpus tamamı henüz yayınlanmamıştır. Şu anda axis-ego-samples deposunun toplam dosya boyutu yaklaşık 770 GB’dır. Bu verinin Axis’in diğer ürünlerine nasıl bağlandığı da görülebilir. Mobile Egocentric App, insan hareketleri sırasında el pozisyonunu gerçek zamanlı olarak takip edip bu hareketleri robotik harekete dönüştürmeyi hedeflemektedir. Tarayıcı simülasyonunda insan doğrudan sanal bir robotu kontrol ederek durum ve eylemler oluşturur. Egocentric capture’da ise gerçek uzayda insanın yaptığı işler öncelikle kaydedilir ve ardından bu kayıtlar içinde robot öğrenmesi için gerekli olan eylemler tespit edilir. Biri robotu doğrudan hareket ettirerek veri oluşturma yöntemidir; diğeri ise insanın zaten yaptığı eylemleri veriye dönüştürme yöntemidir. Burada ilginç bir nokta ortaya çıkar: Robotlara deneyim kazandırmak için onları sürekli hareket ettirmek zorunda değilsiniz. İnsanlar her gün binlerce nesneyi zaten işliyorlar. Bardak alıp taşımak, kapı açmak, kutuları düzenlemek ve araç kullanmak gibi eylemler gerçek yaşamda sürekli tekrarlanmaktadır. Eğer bu eylemler yeterince doğru şekilde kaydedilip robot hareketleriyle bağlanabiliyorsa, insanın günlük yaşamında ürettiği sıradan eylemler kendiliğinden robot öğrenme verisinin kaynağı haline gelebilir. Bu fikrin gerçek robot araştırmalarında nasıl kullanıldığı, Axis’in bağımsız bir çalışması olan EgoScale’de de gözlemlenebilir.2026 yılında Şubat'ta duyurulan EgoScale, önce 20.854 saatten fazla egozentrik insan videosu ile VLA'yı önceden eğitip ardından insan-robot uyumlu verilerle ek eğitim gerçekleştirdi. 22-DoF zahmetli robotik el değerlendirmesinde, son politikanın ortalama başarı oranı, önceden eğitilmemiş temel modelden %54 daha yüksek oldu. EgoScale, Axis'ten bağımsız bir araştırmadır ve sadece insan videolarını çokça eklemekle robotun hemen iyi hareket etmeye başlayacağı anlamına gelmez. Bu, insan davranışları ile önce geniş bir deneyim seti öğrenildikten sonra gerçek robotun embodiment ve eylemlerine uygun veriler eklenerek performansın artırıldığı bir örnektir. Axis, bu verileri gerçek işbirliklerine de bağlamaktadır. 28 Ağustos'ta duyurulan Dexmal ile yapılan işbirliğinde, Axis, Dexmal'in VLA'sı ve dünya modeli için büyük ölçekli egozentrik, simülasyon ve gerçek dünya veri üretimi sorumluluğunu üstlendiğini açıkladı. Henüz açıklanmayan bazı detaylar da mevcuttur. Dexmal'e gerçekten iletilen veri miktarı ve bu verilerin model performansına nasıl bir etki yarattığı henüz duyurulmadı. Şu ana kadar açıklanan malzemelerle bile Axis'in hangi çalışmaları yürüttüğü tamamen anlaşılabilir. 100 saatlik LeRobot verisi gerçekten yüklendi ve frame-by-frame etiketleme 80.090 segmente ayrıldı. Farklı kamera cihazlarından elde edilen örnekler de birlikte paylaşıldı. Bu, insanın gerçek dünyada doğal olarak gerçekleştirdiği kısa eylemlerin çekilmesi, bu eylemler içinde hareket sınırlarının belirlenmesi, nesnelerin ve ellerin hareketlerinin düzenlenmesi ve ardından robotun öğrenmesi için uygun hale getirilmesi sürecidir. İnsanlar için önemsiz görünen birkaç saniye, robotlar için bir öğrenme deneyimi haline gelir. Axis'in şu anda paylaştığı şey, bu sürecin gerçek verilerle somutlaştırılmış sonucudur. #PhysicalAI #RobotLearning

No.0 picture
Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.