PolicyTrim aumenta a eficiência do robô VLA em 5,83x sem re-treinamento

icon MarsBit
Compartilhar
AI summary iconResumo
O PolicyTrim aumenta a eficiência do robô VLA em 5,83x sem necessidade de re-treinamento, conforme relatado pela MarsBit. O framework melhora a execução ao eliminar etapas redundantes e estender sequências de ações confiáveis. Ele alcança taxas de sucesso de 98% em tarefas como LIBERO Object/π0.5. O PolicyTrim opera em duas etapas: expansão de ações confiáveis e compressão de passos físicos. O método alinha-se aos objetivos de conformidade com CFT e MiCA, oferecendo uma atualização econômica para modelos VLA existentes. Nenhuma coleta de novos dados ou re-treinamento é necessária.

[Guia] O modelo VLA já consegue realizar tarefas, mas robôs reais ainda são lentos! PolicyTrim é um método para otimizar a eficiência de execução de robôs VLA sem necessidade de re-treinamento. Ao expandir sequências de ações confiáveis e reduzir etapas redundantes, ele ajuda os robôs a completar tarefas de forma mais direta, aumentando a velocidade geral.

Modelos Vision-Language-Action (VLA) unificam observações visuais, instruções em linguagem natural e ações robóticas em um único modelo de política, permitindo que robôs realizem tarefas complexas com base em linguagem natural.

De OpenVLA e OpenVLA-OFT até π0.5 e GR00T, esses modelos estão se tornando uma importante linha tecnológica para a inteligência embutida.

Mas quando o modelo VLA é realmente implantado em um robô, um gargalo crítico se torna imediatamente evidente: o tempo total para o robô completar uma tarefa não depende apenas de quão rápido é cada inferência, mas também de quantas inferências a estratégia precisa executar e quantos movimentos físicos reais são necessários.

Robô

Ao longo de múltiplas execuções da mesma tarefa, o número de passos executados pelo modelo VLA apresenta variações significativas, indicando que caminhos mais curtos e diretos para o sucesso são alcançáveis, mas a estratégia atual geralmente apenas os encontra acidentalmente.

A parte final do chunk de ações é confiável: o modelo prevê múltiplas ações de uma vez, mas as ações mais posteriores tendem a acumular erros, forçando o sistema a replanejar frequentemente. Forçar o alongamento do comprimento de execução reduz a taxa de sucesso e aumenta o número de passos físicos.

Excesso significativo de movimentos físicos: mesmo que a tarefa seja bem-sucedida, a trajetória pode conter muitos movimentos de correção, retrocesso e repetição.

Portanto, a eficiência da implantação da VLA não deve ser avaliada apenas pela latência de inferência em cada etapa, mas também pela eficiência da política (policy efficiency): quantas ações podem ser executadas com segurança em uma única previsão? Quantos passos físicos reais são necessários para concluir a tarefa?

Os métodos existentes geralmente abordam o lado do cálculo, por exemplo, poda de tokens visuais, quantização, reutilização de KV-cache, distilação ou otimização de motores de inferência. Esses métodos podem reduzir a latência de inferência única, mas se a estratégia ainda exigir muitos passos físicos redundantes, o tempo real de execução da tarefa ainda será longo.

Também não é confiável executar diretamente chunks de ação mais longos.

Os experimentos no artigo mostram que, ao forçar o aumento do comprimento da ação executada, a taxa de sucesso pode diminuir, enquanto o número de passos físicos aumenta. Isso indica que previsões de cauda de baixa qualidade introduzem erros no mundo físico, fazendo com que o robô precise realizar mais ações de correção.

Questão-chave: É possível, por meio de pós-treinamento, fazer com que estratégias de VLA já existentes aprendam automaticamente a “evitar caminhos desnecessários” e completar tarefas com menos passos físicos, sem comprometer a taxa de sucesso das tarefas?

A equipe liderada pelo professor Lei Yinjie da Universidade Sichuan propôs o PolicyTrim — um framework de pós-treinamento por reforço em duas fases voltado para a "eficiência de estratégia". Ele não altera a arquitetura VLA nem coleta novamente dados de especialistas, mas sim continua a otimizar o comportamento real de execução do robô com base nas estratégias pré-treinadas existentes.

Robô

Página do projeto: https://inceptionwang.github.io/PolicyTrim/

Link do artigo: https://arxiv.org/abs/2606.22540

Link do código: https://github.com/INCEPTIONwang/PolicyTrim

Link do modelo: https://huggingface.co/INCEPTIONwang/PolicyTrim

Novo método implementado:

  • 3× utilização do chunk de ação, execução confiável com horizonte mais longo;
  • Redução de 51,4% nos passos físicos, compressão de ações de correção redundantes;
  • 5,83× aceleração máxima ponto a ponto, LIBERO Object/π0.5;

De "calcular mais rápido" para "fazer mais rápido"

O objetivo principal do PolicyTrim não é substituir a aceleração no lado do cálculo, mas sim preencher outra dimensão negligenciada: reduzir o número de inferências para frente necessárias para concluir uma tarefa. Ele divide a eficiência da política em dois objetivos otimizáveis: primeiro, expandir chunks de ações confiáveis, depois comprimir passos físicos redundantes.

Robô

1. Extensão de Chunk de Ação Confiável (Reliable Action Chunk Extension)

Muitas estratégias VLA atualmente outputam sequências de ações na forma de action chunks, mas, durante a implantação, geralmente se ousa executar apenas os primeiros passos. A primeira fase do PolicyTrim utiliza dynamic execution horizon exploration: atribui diferentes taxas de aceitação a um mesmo conjunto de rollouts, permitindo que o modelo explore paralelamente limites confiáveis em janelas curtas, médias e longas.

Trajetórias que concluem com sucesso e possuem janelas de execução mais longas recebem recompensas maiores, incentivando o modelo a tornar as ações da cauda dos chunks originalmente não confiáveis mais utilizáveis.

A recompensa horizon só é ativada quando uma trajetória bem-sucedida ocorre dentro do grupo, evitando que o modelo busque cegamente comprimentos de chunk maiores em casos de falha.

2. Redução de passos com consciência de redundância (Redundancy-Aware Step Reduction)

Após a expansão do horizon confiável, a segunda fase reduz ainda mais o número total de passos físicos. O PolicyTrim introduz uma recompensa de economia de passos: quanto menos passos forem usados para concluir uma trajetória bem-sucedida, maior será a recompensa.

step-saving reward escreva diretamente "trajetória de sucesso mais curta e mais direta" no objetivo de otimização.

Regularização ancorada em grupo inibe atalhos especulativos não reproduzíveis, evitando que o modelo busque apenas caminhos curtos às custas da taxa de sucesso.

A otimização em duas fases sequenciais evita que os objetivos de "alongar o chunk" e "reduzir o número de passos" interfiram entre si, reduzindo finalmente o número de inferências forward necessárias para concluir a tarefa.

Resultados do experimento

PolicyTrim foi validado em tarefas LIBERO, ManiSkill, Meta-World e robôs reais, abrangendo diferentes arquiteturas VLA, como π0.5, OpenVLA-OFT e GR00T. Os resultados gerais mostram que PolicyTrim melhora significativamente a eficiência de execução, mantendo a taxa de sucesso da tarefa estável.

No LIBERO, o π0.5 atinge aceleração ponto a ponto de até 5,83 vezes, mantendo ao mesmo tempo uma taxa de sucesso acima de 98%.

Os resultados cruzados de referência mostram que o PolicyTrim alcançou até 2,36 vezes de aceleração no ManiSkill e 2,52 vezes de aceleração no Meta-World.

Os resultados cruzados de arquitetura mostram que o OpenVLA-OFT re-treinado, ao utilizar o fluxo completo de duas etapas, alcança uma aceleração de 2,97 vezes; o OpenVLA utilizando apenas a segunda etapa também alcança uma aceleração de 1,41 vezes.

Robô

Comparação qualitativa: evite desvios, trajetória mais direta

Em tarefas LIBERO amostradas aleatoriamente, o baseline frequentemente apresenta ações de correção redundantes e hesitação/oscilação nas proximidades do objetivo; as trajetórias do PolicyTrim são mais suaves e diretas, conseguindo concluir a mesma tarefa com menos passos físicos, geralmente reduzindo o número de passos físicos para cerca da metade.

Robô

Real robot deployment: Efficiency gains from simulation can be transferred to the physical world

O artigo valida ainda tarefas reais de robôs em um braço robótico Agilex Piper equipado com duas câmeras Intel RealSense D435i, incluindo três tipos de tarefas: FlipMug, HangMug e TapeBox. Os experimentos cobrem tanto o cenário padrão com posição alvo fixa quanto o cenário dinâmico com perturbações aleatórias na posição alvo durante a captura.

PolicyTrim mantém ou melhora a taxa de sucesso tanto nas configurações padrão quanto nas configurações de perturbação dinâmica, reduzindo significativamente o tempo de execução real. Na configuração padrão de robôs reais, atinge uma aceleração end-to-end média de 1,86 vezes.

Robô

Robô

Com base nos resultados experimentais, o PolicyTrim não apenas otimiza as métricas de referência: o tempo de conclusão da tarefa em robôs físicos também foi reduzido para cerca da metade do baseline, mantendo robustez em cenários com interferências dinâmicas.

Por que o PolicyTrim é eficaz?

• Melhoria da eficiência da própria estratégia: reduz ações redundantes e replanejamentos desnecessários, e não apenas a latência de inferência individual.

• Sem necessidade de treinamento do zero: como um framework de pós-treinamento, pode otimizar modelos VLA já existentes, reduzindo os custos de coleta de dados e treinamento.

• Equilíbrio entre velocidade e taxa de sucesso: expansão confiável do horizon evita alongar chunk cegamente; restrições de estabilidade evitam especulação em caminhos curtos.

• Pode ser combinado com aceleração no lado de cálculo: PolicyTrim otimiza o número de inferências forward, enquanto métodos como VLA-Cache otimizam o tempo de inferência por operação; os dois caminhos são ortogonais e podem gerar aceleração composta.

A ideia central do PolicyTrim é que, para os robôs VLA, a eficiência de implantação não vem apenas de inferência de modelo mais rápida, mas também de comportamentos de estratégia mais eficientes. Fazer com que os robôs "evitem caminhos desnecessários" também pode proporcionar aceleração significativa.

Referência: https://arxiv.org/abs/2606.22540

Este artigo é do número oficial do WeChat "Nova Inteligência", autor: Nova Inteligência; editor: LRST

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.