Huawei Noah's Ark Laboratuvarı, Çok Stratejili Robot Koordinasyonu İçin RoboHarness Sistemi Geliştiriyor

iconMetaEra
Paylaş
AI summary iconÖzet
Huawei Noah's Ark Laboratuvarı, VLA, WAM, RL ve TAMP gibi çoklu stratejileri uzun vadeli görevlerde koordine etmek için RoboHarness sistemini tanıttı. Sistem, anlama, bellek ve evrimi birleştiriyor ve strateji geçişlerini iyileştiren bir Bellek Köprüsü modülüne sahip. Deneyler, %86 başarı oranı gösterdi. Kripto için TA'nın popülerleşmesiyle bu yenilikler, kripto stratejilerinde değer yatırımı üzerinde etki yaratabilir.
Huawei Noah's Ark Laboratuvarı, RoboHarness sistemini duyuruyor; Coding Agent ile VLA, WAM, RL, TAMP gibi heterojen stratejileri koordine ederek sıfır örnek uzun zincirli görevleri tamamlıyor. Sistem, anlama, bellek ve evrim olmak üzere üç tür beceriyi içeriyor; Memory Bridge modülü, strateji geçişlerindeki durum dağılımı uyumsuzluğunu çözüyor ve deneylerde %86 başarı oranı elde ediliyor. Bu çalışma, gövdeli akıllılığın tek bir modelden sistemsel koordinasyona doğru ilerleyişini temsil ediyor.

Yazan ve Kaynak: Leifengwang

Bir görevi hayal edin: dolap kapısını açın, içinde saklı olan blokları bulun ve onları bir köprü oluşturmak için birleştirin.

İnsanlar için bu çok basit bir şey, birkaç hareket doğal olarak birbirine bağlanır ve anaokulu çocukları bile kolayca tamamlayabilir.

Ancak robotlar için bu görev, blokları bulmak (görsel anlama ve dil talimatlarını takip etme gerektirir), dolap kapısını açmak (çevreyle karmaşık etkileşim gerektirir) ve blokları birleştirmek (geometrik planlama, hassas kontrol ve çevre değişikliklerini tahmin etme gerektirir) gibi tamamen farklı yetenekleri kapsar.

Daha da karmaşık olan, bu yeteneklerin farklı “okullara” ait modellerle temsil edilmesidir—VLA (Görsel-Dil-Eylem Modeli), WAM (Dünya-Eylem Modeli), RL Stratejileri (Güçlendirilmiş Öğrenme) ve TAMP (Görev ve Hareket Planlama). Bunlar her biri farklı güçlü yanlara sahip olup birbirinden ayrılmıştır; eğitim yöntemleri, giriş formatları ve durum uzayları farklıdır.

Bugün robot alanında yetenek eksik değil, ancak iş birliği yok.

Huawei Noah's Ark Laboratuvarı, son zamanlarda farklı stratejiler arasındaki işbirliği sorununu çözmek için RoboHarness adlı bir sistem öneren bir makale yayınladı. Bu çalışma etrafında, makale yazarları bizi (Leifengwang) bilgilendirdi.

Ajan, Bedenli Dünyaya Doğru: Dilsel Zekâdan Robotlar İçin "Beyin Komutanı"

Makale: https://arxiv.org/abs/2607.18060

Proje Ana Sayfası: https://www.robo-harness.com/

01 Evrensel modelin illüzyonu ile gerçeklik arasındaki uçurum

Bu yaz, robotik araştırma alanında Harness etrafında yoğun bir şekilde birkaç çalışma ortaya çıktı ve bunlar ortak bir algıyı işaret ediyor: daha büyük modellerle her şeyi çözmek şu anda mümkün değil, robotlara bir yürütme organizasyon sistemi gerekiyor.

Tsinghua Üniversitesi Profesör Yu Çao ekibi, Temmuz'da Harness VLA'yı yayınladı ve dijital zekânın yaygın olarak kullandığı Harness Katmanını vücutlu zekâya dahil etti; bu sayede donmuş bir VLA, yoğun temas gerektiren manipülasyonlara odaklanırken, bir Harness katmanı onu ne zaman, nasıl çağıracağını ve VLA başarısız olduktan sonra nasıl sıfırlayacağını ve tekrar deneyeceğini öğrendi. LIBERO-Pro bozulma testlerinde, bu sistem başarı oranını %50'den %82,4'e çıkardı.

Fikir olarak, Harness VLA, bir modelin dağıtım dışı bozulmalarda nasıl kararlı bir şekilde performans göstereceğini çözer. Sorunu, tek stratejinin kararlılığıdır.

Huawei Noah's Ark Laboratuvarı'nın RoboHarness'ı, görevin herhangi bir modelin yetenek sınırlarını aştığı durumda ne yapılacağını ele alıyor.

İkisi de Harness adını taşır, her ikisi de Coding Agent’ı organizasyon katmanı olarak kullanır, ancak farklı boyutlardaki zorlukları çözer. İlki bir uzmanı daha kararlı hale getirir, diğeri farklı yeteneklere sahip uzmanların birlikte çalışmasını sağlar. Robot görevlerinin karmaşıklığı arttıkça, ikinci sorun giderek kaçınılmaz hale gelmektedir.

Sorunun kökeni, çeşitli modellerin kapasite sınırlarına kadar uzanır.

VLA modelinin avantajı açık uçlu dil talimatlarını anlamak ve yeni ortamlarda genelleştirmektir, ancak eylemleri uçtan uca üretme yöntemi uzun süreli görevlerde tutarlılık sağlamakta zorlanır; pekiştirmeli öğrenme stratejileri belirli eğitim senaryolarında kararlı kapalı döngü davranışları geliştirebilir, ancak bu tutarlılık eğitim dağılımına yüksek oranda bağımlıdır ve ortamda küçük bir değişiklik bile başarısızlığa yol açabilir; TAMP sembolik akıl yürütme ve geometrik kısıtlamalarda ustadır, ancak eylem primitiflerini önceden tanımlamak zorundadır ve açık senaryolarda ve belirsiz hedeflerle karşılaştığında planlayıcı hızla zorlanır; WAM, gelecek durumları tahmin ederek uzun süreli karar verme süreçlerine yardımcı olabilir, ancak tahmin süresi arttıkça hata birikimi yaşar.

Karmaşık gerçek görevler, anlamsal anlama, geometrik planlama, kapalı döngü kontrolü, uzun zaman serisi çıkarımı ve çevre değişikliklerini tahmin etme yeteneklerini aynı anda gerektirir; bu yeteneklere karşılık gelen eğitim hedefleri farklıdır ve bazen birbirleriyle çelişir. Bu yeteneklerden her birinde ayrı ayrı atılımlar elde etmekten, tek bir modelin açık bir ortamda uzun süreli olarak tüm yetenekleri dengeli bir şekilde yerine getirmesine kadar, hâlâ tam olarak aşılı olmayan bir uçurum vardır.

RoboHarness'in temel fikri, bu boşluğu kapanmasını beklemek yerine, zaten var olan ve her biri farklı güçlü yanlara sahip modellerin gerçekten birlikte çalışmasını sağlamaktır. Yazar, bir model diğer tüm modelleri tamamen bastırmadan ve mutlak bir hakimiyet göstermeden önce, bu tür bir düzenleme yapısının çok anlamlı olduğunu düşünmektedir.

Bu çalışma rastgele ortaya çıkmadı. Yazar, (LeiFeng.com) bize RoboHarness'in ilk haliyle geçen yıl düzenlenen Global Robotics Challenge BEHAVIOR Challenge'e katılmaktan ilham aldığını anlatıyor. Yarışma görevleri uzun ve zor olduğundan, ekip hem uçtan uca VLA eğitimi hem de davranış klonlama gibi modellerin görevin zorluğunu karşılayamayacağını fark etti. Bu başarısızlık, ekip için gerçek sorunun nerede olduğunu netleştirmeye yardımcı oldu.

02 Yönetim beyni, kimin sahaya çıkacağını nasıl karar verir

RoboHarness'in temel fikri, VLA, WAM, RL stratejileri, TAMP gibi bağımsız olarak geliştirilen kontrol sistemlerini, Coding Agent'in üst düzey kararları yerine getirmesi için tek bir sistemde yönetilebilir agentic becerilere dönüştürmektir.

Bu tasarımın temel ön koşulu, herhangi bir alt stratejinin değiştirilmesi veya yeniden eğitilmesidir. Tüm stratejiler kendi orijinal uygulamalarını korur, model yapılarını, eylem uzaylarını veya eğitim verilerini paylaşmaz. RoboHarness, bunların üzerine yalnızca bir organizasyon katmanı ekler.

Strateji seçmek o kadar kolay değil.

Bir Coding Agent için, yalnızca orijinal görüntü girişiyle bu görevin kimin görevi olacağını güvenilir bir şekilde belirlemek zordur. Çünkü bu karar, dil modellerinin semantik anlama yeteneğiyle cevaplanamayan birçok nicel sorunu içerir. Bardağı tabağa koymayı anlayabilir, ancak bir RGB görüntüsünden mevcut sahnenin belirli bir strateji eğitim dağılımıyla benzerliğini hesaplayamaz ve bu anda sensör verilerinin güvenilirliğini değerlendiremez.

Bu sorunu çözmek için sistem, Coding Agent'in karar vermek için gerekli bilgileri çıkarmak üzere üç tür yardımcı beceri tasarladı.

Ajan, Bedenli Dünyaya Doğru: Dilsel Zekâdan Robotlar İçin "Beyin Komutanı"

Becerileri Anlama, orijinal girişi nicelleştirilebilir sinyallere dönüştürmekle sorumludur; örneğin: görüntü gömme ve her stratejinin eğitim verileri arasındaki benzerlik, nesne pozisyonunun zaman penceresi içindeki kararlılığı, mevcut ışıklandırma ve görüntü kalitesinin standartları karşılayıp karşılamadığı vb. Bu metrikler, strateji yönlendirme için gerçek temel oluşturur. Yazar, bu modülün temelinin, her stratejinin şu anki görevle ne kadar uyumlu olduğunu çok boyutlu olarak ölçmek olduğunu düşünmektedir.

Bellek Becerileri, geçmiş yürütme deneyimlerini arayarak strateji seçimi için referans sağlar ve Memory Bridge aracılığıyla stratejiler arasındaki durum dağılım uyumsuzluğunu çözer—bu, sistemin en temel tasarımıdır ve aşağıda ayrıntılı olarak ele alınacaktır.

Evolution Skills, çevrimiçi geri bildirimleri kullanarak strateji metaverilerini ve düzenlemelerini sürekli olarak güncelleyerek, sistemin her yeni durumla karşılaştığında sıfırdan karar vermesi yerine her yürütmeden öğrenmesini sağlar.

Üç tür becerinin bilgi akışı birbirleriyle etkileşim halindedir ve Coding Agent'in karar vermesine ortak olarak yardımcı olur. Gerçek uygulamada, bu mekanizmanın iki ana rolü vardır: birincisi, uzun talimatları farklı stratejiler tarafından işlenebilecek alt görevlere bölmek; ikincisi, dinamik geçiş, mevcut strateji kapasite sınırına yaklaştığında sistemin daha uygun bir stratejiye geçerek farklı stratejiler arasındaki kapasite tamamlayıcılığını sağlamasıdır.

Makale, bu iki katmanın ayrı ayrı katkılarını göstermek için bir ablatif deney seti kullanır: yalnızca dil modeli kullanarak pi0.5'e görevi çözmek ve göndermek, başarı oranını açıkça artırır; bu üzerine çoklu heterojen stratejiler eklenince başarı oranı daha da büyük ölçüde artar. Doğru şekilde bölmek birinci adımdır, doğru şekilde dağıtmak ikinci adımdır ve ikisi de eksiksiz olmalıdır.

Ancak üçüncü bir sorun daha var ve bu, yalnızca strateji seçerek çözülemeyen en zor sorun.

03, bayrak geçişinin anında koşu galibinin belirlendiği anlamına gelir.

İki bağımsız eğitilmiş strateji, genellikle kendi veri dünyalarında yaşar. Girdi formatları farklıdır ve robot durumları için deneyim dağılımları da farklıdır. TAMP işlemi tamamlandığında durduğu konum, VLA'nın hiç işlem yapmadığı ve kararlı bir şekilde başlatılamadığı durum uzayında tam olarak yer alabilir.

Bu, heterojen strateji düzenlemeye özgü bir zorluktur.

Bu nedenle, iki stratejinin kararlı bir şekilde geçişini sağlayan Memory Bridge, yazar tarafından RoboHarness'in en önemli modülü olarak sıralandı. Yazar, gelecekteki bir genel modelin tüm durum uzayını mükemmel şekilde kapsayabilmesi durumunda Memory Bridge'in gerekli olmayabileceğini kabul ediyor; ancak şu anki durumda, herhangi bir model geçiş anında kolayca yetenek dağılımının dışına düşebiliyor.

Ajan, Bedenli Dünyaya Doğru: Dilsel Zekâdan Robotlar İçin "Beyin Komutanı"

Memory Bridge'in çalışması üç adımdan oluşur.

Arama: Bir sonraki alt görev ve mevcut gözlem doğrultusunda, metin ve görsel benzerlikler aracılığıyla çokmodalli bellekten hedef stratejinin başarıyla yürütülmüş olan en üst K benzer trajektory'yi bulun, robot durumları olarak son eksekütör pozisyonu, eklemler açısı vb. çıkarın.

Modelleme: Her durumun izdeki göreli ilerlemesine göre denetim sinyali verilerek, çevrimiçi regresyon aracılığıyla hedef strateji "alışkanlıkla devralma" durum aralığı anlık olarak uygun hale getirilir.

Bağlantı: Hedef stratejinin konfor bölgesine girmeye yönelik güven ve hareket maliyetini dikkate alarak aday durumları örnekle ve puanla, en uygun bağlantı hedefini seç ve geçiş yörüngesini oluştur; robot bu duruma ulaştıktan sonra kontrolü bir sonraki stratejiye devret.

Bu mekanizma, tarihsel yürütme verilerine dayalı olarak doğrudan öğrenir; herhangi bir strateji için eklenebilir ve kullanılabilmektedir, alt yapıyı değiştirmenize veya ortak eğitim yapmanıza gerek yoktur.

Memory Bridge kaldırıldığında, görev ilerlemesindeki düşüş büyük değil, bu da strateji seçimlerinin hâlâ temel olarak doğru olduğunu gösteriyor; ancak toplam başarı oranı %86,0’tan %60,4’e düşüyor. Birçok görev son adıma kadar geliyor, ancak devir durumları uyumsuz olduğu için başarısız oluyor; bu da Memory Bridge’in değerini kanıtlıyor.

04 İki teknik akım, sessizce birleşen bir akış

Bu makaleden uzaklaşarak, daha büyük bir gövdeli teknoloji haritasını betimlemek istiyoruz.

RoboHarness'in yazarı, son üç yıl içinde VLA'nın hızlı gelişimi bağlamında, geleneksel TAMP ve hiyerarşik planlama yöntemlerinin açık senaryolarda end-to-end VLA'ya kıyasla genelleştirme yeteneklerinin belirgin şekilde daha zayıf olması nedeniyle topluluk ilgisinden uzaklaştığını gözlemledi. Ancak bu yıl agentic sistemler ve coding agentlerin hızlı ilerlemesiyle, hiyerarşik yapılar yeniden yeni bir canlanma yaşadı: üst düzey agentler, birleştirilebilir beceriler aracılığıyla görevleri parçalayabilir, araçları çağırabilir ve dinamik planlama yapabilir; bu da geleneksel hiyerarşik yöntemlerin genelleştirme yeteneğini ve esnekliğini önemli ölçüde artırır. Bu nedenle, akademik topluluk yeniden ilgi göstermeye başlamış ve güçlü genelleştirme yeteneğine sahip üst düzey akıl yürütme ile heterojen alt düzey stratejileri nasıl birleştirebileceğini araştırmaya başlamıştır.

Bu makalenin yazarı, Kanada'nın doğusundaki çeşitli üniversiteler ve araştırma kurumlarından gelmektedir. Yazar, Kuzey Amerika'da robotik araştırmalarının uzun süredir iki açıkça akademik kökenli teknik yol izlediğini gözlemlemiştir: Stanford, Berkeley gibi kurumlarla temsil edilen ABD'nin batı kıyısı, öğrenme ve ölçeklendirmeye daha çok vurgu yapar, uçtan uca öğrenme, veri boyutu ve model genelleştirme üzerinde odaklanır; bununla karşılaştırıldığında, MIT, Toronto Üniversitesi, MILA gibi kurumlarla temsil edilen ABD'nin kuzeydoğu kısmı ve Kanada, hiyerarşik mimarilere, sembolik akıl yürütme, mantıksal planlama ve yapılandırılmış karar verme üzerinde uzun süredir daha fazla önem vermiştir.

RoboHarness'in yazarları, sonraki çizginin bir uzantısındadır.

Teknoloji yollarındaki ayrılma, gövdeli akıl endüstrisinde de net izler bırakmıştır. Son yıllarda hızlı gelişen ekipler, foundation model scaling'den agentic hierarchy'ye kadar bir teknoloji spektrumu oluşturmuştur: Bir grup, genel gövdeli temel modeller, VLA ve world model üzerinde daha çok durur; tek bir model, veri ölçeği ve model yeteneklerinin artırılmasıyla genelleme sınırlarını sürekli genişletir. Diğer grup ise yeniden kullanılabilir operasyon becerileri ve katmanlı mimariye odaklanır; görev planlama, beceri birleştirme ve alt seviye kontrolün koordinasyonuyla karmaşık görevleri tamamlar. Çin'de Zhiyuan gibi ekipler ilk gruba daha yakındır;苏度科技 ve Magic Atom ise ikinci gruba daha çok vurgu yapar. Yurt dışındaysa, Physical Intelligence'in pi serisi uzun süredir scaling yolunu temsil etmiştir; Gemini Robotics ise "üst seviye akıl yürütme ve planlama + alt seviye beceri uygulama" katmanlı gelenekini sürdürmektedir.

İlginç olan, bu teknolojik türevin ayrılması statik bir karşıtlık değil, sürekli gelişen bir tamamlayıcılık şeklidir. Son aylarda, bu iki teknoloji yolu belirgin bir şekilde birleşmeye başlamıştır. Örneğin, Physical Intelligence, pi0.7'de kontrollülüğü ve beceri kombinasyonunu daha temel bir konuma getirmiştir; aynı zamanda NVIDIA gibi ekipler de temel modellerin anlama ve çıkarım yeteneklerini VLA ile birleştiren daha katmanlı robot agentic sistemleri sürekli olarak piyasaya sürmektedir. Genel olarak, foundation model scaling ve agentic hierarchy, bir zamanlar nispeten bağımsız iki teknoloji yolu olarak görülürken, şimdi aynı robot sisteminde tamamlayıcı yetenekler haline gelmektedir.

05, düzenlemeyi temel alarak daha evrensel akla doğru ilerleyin

RoboHarness'ın açıkça belirli sınırlamaları vardır: Var olan stratejileri zamanlayabilir, ancak tüm stratejilerin yapamadığı şeyleri çözemez. Memory Bridge'in güvenilirliği yeterli geçmiş yürütme verilerine dayanır; yeni eklenen stratejilerin erken aşamadaki kapasite değerlendirmelerinde büyük belirsizlikler vardır.

Makalenin temel savı, büyük bir modelin gerekliliğini reddetmek değildir.

Yazar, uzun süreli görevlerin düzenlemesinin yalnızca mevcut yeteneklerin bir kombinasyonu olmadığını, aynı zamanda tek bir modelin bağımsız olarak elde edemeyeceği çoklu yetenekli ve çoklu senaryolu yürütme verilerinin sürekli olarak ürettiğini vurguluyor. Bu tür veriler, farklı stratejiler arasındaki geçişleri, bağlantıları, başarısızlık durumlarından kurtuluşu ve iş birliğini kaydeder; tam olarak bu veriler, bir sonraki nesil genel amaçlı robot modellerinin eğitimi için önemli bir kaynak olabilir. Bu fikre dayanarak, RoboHarness ekibi, karışık strateji düzenlemesi ve yürütme süreci sırasında oluşan verileri alt seviye stratejilerin eğitimi için yeniden kullanmayı da araştırmaktadır; heterojen düzenlemenin yürütme deneyimi, modelin temel yeteneklerinin geliştirilmesine ek olarak katkıda bulunur.

En güçlü modeli bulmaktan en uygun yetenekleri organize etmeye kadar, gövdeli akıl yarışması, sistem düzeyindeki tasarıma doğru sessizce genişliyor. Heterojen strateji koordinasyonu ve tek büyük model, iki farklı tepe boyunca yürütülen iki yürüyüş gibi, nihayetinde aynı hedefe doğru yöneliyor: robotlara daha genel ve daha güvenilir bir akıl kazandırmak.

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.