PolicyTrim, VLA Robot verimliliğini yeniden eğitmeden 5,83 kat artırıyor

icon MarsBit
Paylaş
AI summary iconÖzet
MarsBit'e göre, PolicyTrim, yeniden eğitme gerektirmeden VLA robot verimliliğini 5,83 kat artırıyor. Bu çerçeve, gereksiz adımları kaldırarak ve güvenilir eylem dizilerini uzatarak yürütme performansını iyileştiriyor. LIBERO Object/π0.5 gibi görevlerde %98 başarı oranı sağlıyor. PolicyTrim, iki aşamada çalışıyor: güvenilir eylemleri genişletme ve fiziksel adımları sıkıştırma. Yöntem, mevcut VLA modelleri için maliyet etkin bir yükseltme sunarak CFT ve MiCA uyumluluk hedefleriyle uyumlu. Yeni veri toplama veya yeniden eğitme gerekmiyor.

【Giriş】 VLA modeli zaten görevleri yerine getirebiliyor, ancak gerçek robotlar hâlâ yavaş! PolicyTrim, VLA robotlarının yürütme verimliliğini yeniden eğitmeden optimize eden bir yöntemdir. Güvenilir eylem dizilerini genişleterek ve gereksiz adımları azaltarak robotların görevleri daha doğrudan tamamlamasını sağlar ve genel hızı artırır.

Vision-Language-Action (VLA) model, görsel gözlemleri, dil talimatlarını ve robot hareketlerini tek bir strateji modelinde birleştirerek robotların doğal dil ile karmaşık operasyon görevlerini tamamlamasını sağlar.

OpenVLA, OpenVLA-OFT, π0.5 ve GR00T gibi modeller, gövdeli akıllılık için önemli bir teknoloji yolunu oluşturmaktadır.

Ancak VLA modeli gerçekten bir robot üzerine dağıtıldığında, bir kritik darboğaz hemen ortaya çıkar: Robotun görevi tamamlama süresi, her bir çıkarımın ne kadar hızlı olduğuna değil, stratejinin kaç kez çıkarım yapmasına ve kaç tane gerçek fiziksel eylem gerçekleştirmesine bağlıdır.

İşlem Botu

Aynı görevin birden fazla rollout'unda VLA modelinin yürütme adımları önemli ölçüde değişkenlik gösteriyor, bu da daha kısa ve doğrudan başarı yollarının erişilebilir olduğunu, ancak mevcut stratejinin genellikle rastgele bu yolları bulabildiğini gösteriyor.

İşlem parçasının sonundaki güvenilirlik sorunu: Model aynı anda birden fazla işlem tahmin eder, ancak sonraki işlemler giderek daha fazla hata birikimi yaşar; bu nedenle sistem sıklıkla yeniden planlama yapmak zorunda kalır. Gerçekleştirme süresini zorla uzatmak, başarı oranını düşürür ve fiziksel adımları artırır.

Fiziksel hareketlerde ciddi bir fazlalık var: Görev sonunda başarılı olsa bile, trajektori birçok düzeltme, geri alma ve tekrar hareketi içerebilir.

Bu nedenle, VLA dağıtım verimliliği yalnızca her adımdaki çıkarım gecikmesine değil, aynı zamanda strateji verimliliğine (policy efficiency) bakılmalıdır: Bir tahminde kaç eylem güvenle yürütülebilir? Görev tamamlanmak için gerçekte kaç fiziksel adım gereklidir?

Mevcut yöntemler çoğunlukla hesaplama tarafından yaklaşır; örneğin görsel token kesme, kantizasyon, KV-cache yeniden kullanım, distilasyon veya çıkarım motoru optimizasyonu. Bu yöntemler tek bir çıkarım gecikmesini azaltabilir, ancak strateji hâlâ büyük miktarda fazladan fiziksel adımlar gerektiriyorsa, gerçek görevlerin süresi hâlâ uzun kalır.

Daha uzun bir action chunk'ı doğrudan sabitlemek de güvenilir değildir.

Deneyler, eylem uzunluğunu zorla uzattıkça başarı oranının düşebileceğini ve fiziksel adımların artabileceğini göstermektedir. Bu, düşük kaliteli son tahminlerin hataları fiziksel dünyaya taşıdığını ve robotun daha fazla düzeltme eylemi gerçekleştirmek zorunda kaldığını göstermektedir.

Ana soru: Görev başarı oranını riske atmadan, mevcut VLA stratejilerini sonraki eğitme yoluyla daha az fiziksel adımda görevi tamamlamayı otomatik olarak öğrenmeleri mümkün mü?

Sichuan Üniversitesi'nden Prof. Lei Yinye liderliğindeki ekip, PolicyTrim adlı, "stratejik verimlilik" odaklı iki aşamalı bir takviyeli öğrenme sonrası eğitim çerçevesi önerdi. Bu çerçeve, VLA mimarisini değiştirmiyor ve uzman verilerini yeniden toplamıyor; bunun yerine, mevcut önceden eğitilmiş stratejiler üzerinde robotun gerçek yürütme davranışını optimize ediyor.

İşlem Botu

Proje Ana Sayfası: https://inceptionwang.github.io/PolicyTrim/

Makale bağlantısı: https://arxiv.org/abs/2606.22540

Kod bağlantısı: https://github.com/INCEPTIONwang/PolicyTrim

Model bağlantısı: https://huggingface.co/INCEPTIONwang/PolicyTrim

Yeni yöntem başarıyla uygulandı:

  • 3× işlem chunk kullanım oranı, daha uzun ufuk için güvenilir yürütme;
  • %51,4 fiziksel adım azaltıldı, gereksiz hareketler düzeltildi;
  • 5,83× uçtan uca en yüksek hızlama, LIBERO Object/π0.5;

Daha Hızlı Hesaplamaktan Daha Hızlı Yapmaya

PolicyTrim'in temel amacı, hesaplama tarafındaki hızlandırmayı değiştirmek değil, unutulan başka bir boyutu tamamlamak: görevi tamamlamak için gereken ileri yönlü çıkarım sayısını azaltmak. Strateji verimliliğini, güvenilir eylem parçalarını genişletip ardından gereksiz fiziksel adımları sıkıştırmak olmak üzere iki optimize edilebilir hedefe ayırır.

İşlem Botu

1. Güvenilir Eylem Parçası Uzantısı

Şu anda birçok VLA stratejisi, eylem dizilerini action chunk biçiminde üretir, ancak dağıtım sırasında sadece ilk birkaç adımı gerçekleştirmeye cesaret edilir. PolicyTrim’in ilk aşaması, dinamik yürütme süresi keşfi kullanır: Aynı rollout grubuna farklı kabul oranları atanır ve model, kısa, orta ve uzun pencerelerde güvenilir sınırları paralel olarak keşfeder.

Başarıyla görevi tamamlayan ve yürütme penceresi daha uzun olan yollar daha yüksek ödül alır; bu, orijinal olarak güvenilir olmayan chunk sonu eylemlerini daha kullanışlı hale getirmeyi teşvik eder.

Horizon ödülü, yalnızca grup içinde başarı yolu gerçekleştiğinde etkinleşir ve modelin başarısız durumlarda daha uzun chunk uzunlukları takip etmesini önler.

2. Artıklığı Algılayan Adım Azaltma

Güvenilir horizon genişletildikten sonra, ikinci aşama toplam fiziksel adım sayısını daha da azaltır. PolicyTrim, adım tasarrufu ödülleri getirir: başarıyla tamamlanan trajektoriler ne kadar az adımda tamamlanırsa, o kadar yüksek ödül alınır.

Adım tasarrufu ödülü, doğrudan "daha kısa, daha doğrudan bir başarı yolu"nu optimizasyon hedefine yazın.

Grup-aşırılıklı düzenlileştirme, tekrarlanamayan spekülatif kısayolları engeller ve modelin başarı oranını zarar vererek yalnızca kısa yolları takip etmesini önler.

İki aşamalı sıralı optimizasyon, "chunk'u uzatma" ve "adım sayısını azaltma" hedeflerinin birbirini engellemesini önler ve görevi tamamlamak için gereken ileri yönlü çıkarım sayısını sonunda azaltır.

Deneysel sonuçlar

PolicyTrim, LIBERO, ManiSkill, Meta-World ve gerçek robot görevlerinde test edildi ve π0.5, OpenVLA-OFT, GR00T gibi farklı VLA mimarilerini kapsadı. Genel sonuçlar, PolicyTrim'in görev başarı oranını sabit tutarken yürütme verimliliğini önemli ölçüde artırdığını gösterdi.

LIBERO'da π0.5, başarı oranını %98'in üzerinde tutarken en fazla 5,83 kat uçtan uca hızlanma sağlıyor.

Çapraz referans sonuçları, PolicyTrim'in ManiSkill üzerinde en fazla 2,36 kat hızlanma ve Meta-World üzerinde 2,52 kat hızlanma sağladığını göstermektedir.

Çapraz mimari sonuçları, tam iki aşamalı işlem kullanılarak yeniden önceden eğitilen OpenVLA-OFT'nin 2,97 kat hızlanma sağladığını gösteriyor; OpenVLA yalnızca ikinci aşamayı kullanarak da 1,41 kat hızlanma sağlıyor.

İşlem Botu

Niteliksel karşılaştırma: Daha az sapma, daha doğrudan bir yol

Rastgele örneklenen LIBERO görevlerinde, Baseline genellikle fazla düzeltme eylemleri ve hedefe yakın titreme/tereddüt gösterir; PolicyTrim'in yörüngesi daha düzgün ve doğrudur ve aynı görevi daha az fiziksel adımda tamamlayabilir, genellikle fiziksel adımları yaklaşık yarısına indirir.

İşlem Botu

Gerçek robot dağıtımı: Simülasyondaki verimlilik kazançları fiziksel dünyaya aktarılabilir.

İlave olarak, iki Intel RealSense D435i kamera ile donatılmış Agilex Piper robot kolunda FlipMug, HangMug ve TapeBox olmak üzere üç gerçek robot görevi doğrulandı. Deneyler, sabit hedef konumları içeren standart ayarları ve tutma sırasında hedefe rastgele bozucular uygulayan dinamik ayarları kapsıyor.

PolicyTrim, hem standart hem de dinamik gürültü ayarlarında başarı oranını koruyor veya artırıyor ve gerçek yürütme süresini önemli ölçüde kısaltıyor. Standart gerçek robot ayarında, ortalama olarak %1,86 oranında uçtan uca hızlanma sağlanıyor.

İşlem Botu

İşlem Botu

Deneysel sonuçlara göre, PolicyTrim yalnızca benchmark metriklerini optimize etmiyor: fiziksel robotlarda görev tamamlama süresi baseline'ın yaklaşık yarısına indirilebiliyor ve dinamik müdahale senaryolarında dayanıklılığını koruyor.

PolicyTrim neden etkilidir?

• Stratejiye yönelik verimlilik artırımı: Sadece tek seferlik çıkarım gecikmesini azaltmakla kalmaz, aynı zamanda gereksiz eylemleri ve gereksiz yeniden planlamaları da azaltır.

• Baştan eğitme gerekmez: Var olan VLA modelleri üzerinde bir sonrası eğitim çerçevesi olarak kullanılarak veri toplama ve eğitim maliyetleri azaltılabilir.

Hız ve başarı oranını dengede tutun: Güvenilir bir horizon genişletmesi, chunk'ları göz ardı ederek uzatmaz; kararlılık kısıtlamaları, kısa yol taktiklerini önler.

• Hesaplama yanındaki hızlandırma ile birlikte kullanılabilir: PolicyTrim, ileri yönlü çıkarım sayısını optimize eder, VLA-Cache gibi yöntemler ise her çıkarım için geçen süreyi optimize eder; bu iki yol birbirine dik olup birleşik hızlandırma sağlar.

PolicyTrim'in temel noktası, VLA robotları için dağıtım verimliliğinin yalnızca daha hızlı model çıkarımı değil, aynı zamanda daha verimli strateji davranışlarından da kaynaklandığıdır. Robotlara "daha az sapma yapmasını" sağlamak, önemli bir hızlanma sağlayabilir.

Kaynaklar: https://arxiv.org/abs/2606.22540

Bu yazı, WeChat hesabı "Yeni Zihin" tarafından yayınlanmıştır; yazar: Yeni Zihin; editör: LRST

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.