[Giới thiệu] Mô hình VLA đã có thể thực hiện nhiệm vụ, nhưng robot thực tế vẫn còn chậm! PolicyTrim là một phương pháp tối ưu hóa hiệu suất thực thi của robot VLA mà không cần tái huấn luyện. Nó giúp robot hoàn thành nhiệm vụ một cách trực tiếp hơn bằng cách mở rộng chuỗi hành động đáng tin cậy và giảm các bước thừa, từ đó nâng cao tốc độ tổng thể.
Mô hình Vision-Language-Action (VLA) tích hợp quan sát thị giác, chỉ lệnh ngôn ngữ và hành động robot vào một mô hình chiến lược, giúp robot thực hiện các nhiệm vụ thao tác phức tạp dựa trên ngôn ngữ tự nhiên.
Từ OpenVLA, OpenVLA-OFT đến π0.5, GR00T, các mô hình này đang trở thành một tuyến công nghệ quan trọng trong trí tuệ thể chất.
Tuy nhiên, khi mô hình VLA được triển khai thực tế lên robot, một điểm nghẽn quan trọng sẽ lập tức xuất hiện: tổng thời gian robot hoàn thành nhiệm vụ không chỉ phụ thuộc vào tốc độ suy luận mỗi lần, mà còn phụ thuộc vào việc chiến lược cần thực hiện bao nhiêu lần suy luận và bao nhiêu hành động vật lý thực tế.

Trong nhiều lần rollout của cùng một nhiệm vụ, số bước thực thi của mô hình VLA có sự biến động đáng kể, cho thấy các đường dẫn thành công ngắn gọn và trực tiếp hơn là có thể đạt được, nhưng chiến lược hiện tại thường chỉ tình cờ tìm thấy chúng.
Các hành động ở cuối chunk không đáng tin cậy: mô hình dự đoán nhiều hành động cùng lúc, nhưng các hành động càng về sau càng dễ tích lũy sai số, khiến hệ thống phải lập kế hoạch lại thường xuyên; việc ép kéo dài thời gian thực thi sẽ làm giảm tỷ lệ thành công và tăng số bước vật lý.
Sự trùng lặp hành động vật lý nghiêm trọng: ngay cả khi nhiệm vụ cuối cùng thành công, quỹ đạo cũng có thể chứa nhiều hành động sửa lỗi, lùi lại và lặp lại.
Do đó, hiệu quả triển khai VLA không chỉ phụ thuộc vào độ trễ suy luận ở từng bước, mà còn phải xem xét hiệu quả chính sách (policy efficiency): trong một lần dự đoán, có bao nhiêu hành động có thể thực thi một cách an toàn? Để hoàn thành nhiệm vụ, cần bao nhiêu bước vật lý thực tế?
Các phương pháp hiện có chủ yếu tập trung vào phía tính toán, ví dụ như cắt giảm token thị giác, lượng tử hóa, tái sử dụng KV-cache, học sinh và tối ưu hóa engine suy luận. Những phương pháp này có thể giảm độ trễ của một lần suy luận, nhưng nếu chiến lược vẫn yêu cầu nhiều bước vật lý thừa thãi, thời gian thực tế để hoàn thành nhiệm vụ vẫn sẽ kéo dài.
Việc cố định thực thi chunk hành động dài hơn cũng không đáng tin cậy.
Các thí nghiệm trong bài báo cho thấy, khi tăng dần độ dài hành động bị ép buộc, tỷ lệ thành công có thể giảm và số bước vật lý lại tăng lên. Điều này cho thấy dự đoán đầu cuối kém chất lượng sẽ đưa sai số vào thế giới vật lý, khiến robot cần thực hiện nhiều hành động sửa lỗi hơn.
Vấn đề then chốt: Liệu có thể thông qua huấn luyện sau để các chiến lược VLA hiện có tự học cách “đi đường ngắn hơn”, hoàn thành nhiệm vụ với ít bước vật lý hơn, mà không làm giảm tỷ lệ thành công của nhiệm vụ?
Đội ngũ do Giáo sư Lei Yinjie từ Đại học Tứ Xuyên dẫn đầu đã đề xuất PolicyTrim — một khung đào tạo sau hai giai đoạn nhằm tối ưu hóa “hiệu quả chiến lược”. Nó không thay đổi kiến trúc VLA, cũng không thu thập lại dữ liệu chuyên gia, mà tiếp tục tối ưu hóa hành vi thực tế của robot dựa trên các chiến lược đã được tiền đào tạo.

Trang chủ dự án: https://inceptionwang.github.io/PolicyTrim/
Liên kết bài báo: https://arxiv.org/abs/2606.22540
Liên kết mã: https://github.com/INCEPTIONwang/PolicyTrim
Liên kết mô hình: https://huggingface.co/INCEPTIONwang/PolicyTrim
Phương pháp mới đã đạt được:
- Sử dụng chunk hành động 3×, thực thi đáng tin cậy với horizon dài hơn;
- Giảm 51,4% bước đi vật lý, nén các hành động sửa lỗi dư thừa;
- 5,83× tốc độ tăng tốc端到端 tối đa, LIBERO Object/π0.5;
Từ “tính nhanh hơn” đến “làm nhanh hơn”
Mục tiêu chính của PolicyTrim không phải là thay thế việc tăng tốc phía tính toán, mà là lấp đầy một chiều kích bị bỏ qua khác: giảm số lần suy luận thuận cần thiết để hoàn thành nhiệm vụ. Nó chia hiệu quả chiến lược thành hai mục tiêu có thể tối ưu hóa: mở rộng các chunk hành động đáng tin cậy trước, sau đó nén các bước vật lý thừa thãi.

1. Mở rộng chunk hành động đáng tin cậy (Reliable Action Chunk Extension)
Hiện nay, nhiều chiến lược VLA đầu ra chuỗi hành động dưới dạng action chunk, nhưng khi triển khai thường chỉ dám thực hiện vài bước đầu tiên. Giai đoạn đầu của PolicyTrim sử dụng dynamic execution horizon exploration: phân bổ cùng một bộ rollout với các tỷ lệ chấp nhận khác nhau, giúp mô hình song song khám phá ranh giới đáng tin cậy trên các cửa sổ ngắn, trung và dài.
Các quỹ đạo hoàn thành nhiệm vụ thành công và có cửa sổ thực thi dài hơn sẽ nhận được phần thưởng cao hơn, khuyến khích mô hình làm cho các hành động ở phần cuối chunk ban đầu không đáng tin cậy trở nên hữu dụng hơn.
Hành động phần thưởng horizon chỉ được kích hoạt khi có chuỗi thành công trong nhóm, nhằm tránh mô hình theo đuổi vô tội vạ độ dài chunk dài hơn trong trường hợp thất bại.
2. Nén bước nhận biết tính trùng lặp (Redundancy-Aware Step Reduction)
Khi horizon đáng tin cậy được mở rộng, giai đoạn hai tiếp tục giảm tổng số bước vật lý. PolicyTrim giới thiệu phần thưởng tiết kiệm bước: càng ít bước để hoàn thành nhiệm vụ trên quỹ đạo thành công, phần thưởng càng cao.
step-saving reward viết trực tiếp "quỹ đạo thành công ngắn gọn và trực tiếp hơn" vào mục tiêu tối ưu.
Chuẩn hóa dựa trên nhóm ức chế các lối tắt đầu cơ không thể lặp lại, tránh để mô hình chỉ theo đuổi các con đường ngắn nhưng làm giảm tỷ lệ thành công.
Việc tối ưu hóa theo hai giai đoạn giúp tránh sự can thiệp lẫn nhau giữa hai mục tiêu “kéo dài chunk” và “giảm số bước”, từ đó giảm tổng số lần suy luận thuận cần thiết để hoàn thành nhiệm vụ.
Kết quả thí nghiệm
PolicyTrim đã được xác minh trên các nhiệm vụ LIBERO, ManiSkill, Meta-World và robot thực tế, bao gồm các kiến trúc VLA khác nhau như π0.5, OpenVLA-OFT và GR00T. Kết quả tổng thể cho thấy PolicyTrim làm tăng đáng kể hiệu suất thực thi trong khi duy trì độ thành công của nhiệm vụ ổn định.
Trong LIBERO, π0.5 đạt tốc độ tăng tốc端到端 lên tới 5,83 lần, đồng thời duy trì tỷ lệ thành công trên 98%.
Kết quả so sánh chéo cho thấy PolicyTrim đạt tốc độ tăng tốc tối đa 2,36 lần trên ManiSkill và 2,52 lần trên Meta-World.
Kết quả trên các kiến trúc chéo cho thấy OpenVLA-OFT được tái huấn luyện lại, khi sử dụng quy trình đầy đủ hai giai đoạn, đạt tốc độ tăng tốc 2,97 lần; OpenVLA chỉ sử dụng giai đoạn thứ hai cũng đạt tốc độ tăng tốc 1,41 lần.

So sánh định tính: Ít đi đường vòng, quỹ đạo trực tiếp hơn
Trong các nhiệm vụ LIBERO được lấy mẫu ngẫu nhiên, Baseline thường xuất hiện các hành động sửa lỗi dư thừa và sự do dự/giao động gần mục tiêu; quỹ đạo của PolicyTrim mượt mà và trực tiếp hơn, có thể hoàn thành cùng một nhiệm vụ với ít bước vật lý hơn, thường giảm số bước vật lý xuống khoảng một nửa.

Real robot deployment: Efficiency gains from simulation can be transferred to the physical world
Bài báo còn được xác minh trên cánh tay robot Agilex Piper được trang bị hai camera Intel RealSense D435i, với các nhiệm vụ robot thực tế bao gồm FlipMug, HangMug và TapeBox. Thí nghiệm bao gồm cả thiết lập tiêu chuẩn với vị trí mục tiêu cố định và thiết lập động với nhiễu ngẫu nhiên lên mục tiêu trong quá trình nắm bắt.
PolicyTrim trong cả cài đặt tiêu chuẩn và cài đặt nhiễu động động đều duy trì hoặc nâng cao tỷ lệ thành công, đồng thời rút ngắn đáng kể thời gian thực thi thực tế. Trong cài đặt robot thực tế tiêu chuẩn, trung bình đạt tốc độ tăng tốc đầu đến cuối 1,86 lần.


Từ kết quả thí nghiệm, PolicyTrim không chỉ tối ưu các chỉ số benchmark: trên robot vật lý, thời gian hoàn thành nhiệm vụ cũng được rút ngắn xuống khoảng một nửa so với baseline và duy trì độ bền vững trong các kịch bản nhiễu động.
Tại sao PolicyTrim lại hiệu quả?
• Tăng hiệu quả cho chính chiến lược: Nó giảm các hành động trùng lặp và việc lập kế hoạch lại không cần thiết, chứ không chỉ giảm độ trễ của mỗi lần suy luận.
• Không cần huấn luyện từ đầu: Là khung hậu huấn luyện, có thể tối ưu hóa tiếp dựa trên các mô hình VLA đã có, giảm chi phí thu thập dữ liệu và huấn luyện.
• Cân bằng giữa tốc độ và tỷ lệ thành công: mở rộng horizon đáng tin cậy tránh kéo dài chunk một cách bừa bãi, các ràng buộc về độ ổn định tránh đầu cơ đường ngắn.
• Có thể kết hợp với tăng tốc bên tính toán: PolicyTrim tối ưu số lần suy luận tiến, các phương pháp như VLA-Cache tối ưu thời gian mỗi lần suy luận, hai phương hướng này trực giao và có thể tạo ra tăng tốc tổng hợp.
Quan điểm cốt lõi của PolicyTrim là: đối với robot VLA, hiệu quả triển khai không chỉ đến từ việc suy luận mô hình nhanh hơn, mà còn đến từ hành vi chiến lược hiệu quả hơn. Việc giúp robot "đi thẳng đến đích" cũng có thể mang lại tốc độ gia tăng đáng kể.
Tài liệu tham khảo: https://arxiv.org/abs/2606.22540
Bài viết này đến từ tài khoản WeChat “New Intelligence Yuan”, tác giả: New Intelligence Yuan; biên tập: LRST
