El laboratorio Noah's Ark de Huawei lanza el sistema RoboHarness, que logra completar tareas de larga secuencia en cero muestras mediante un Coding Agent que coordina estrategias heterogéneas como VLA, WAM, RL y TAMP. El sistema incluye tres tipos de habilidades: comprensión, memoria y evolución; el módulo Memory Bridge resuelve el problema de desajuste de distribución de estado durante el cambio de estrategias, logrando una tasa de éxito del 86% en experimentos. Este trabajo representa la evolución de la inteligencia encarnada desde modelos individuales hacia una organización sistemática.Autor del artículo, fuente: LeFeng.com
Imagina una tarea así: abrir la puerta del armario, encontrar los bloques de construcción escondidos dentro y construir un puente con ellos.
Para una persona, esto es algo muy sencillo; varios movimientos se enlazan naturalmente, y hasta un niño de jardín de infantes puede completarlo con facilidad.
Pero para un robot, esta tarea abarca múltiples habilidades completamente diferentes: encontrar bloques, que requiere comprensión visual y seguimiento de instrucciones lingüísticas; abrir una puerta de gabinete, que requiere interacción compleja con el entorno; y apilar bloques, que requiere planificación geométrica y manipulación precisa, además de predecir cambios en el entorno.
Lo que complica aún más las cosas es que estas capacidades pertenecen a modelos de varios “estilos” distintos: VLA (modelos visuales-lingüísticos-accionales), WAM (modelos mundo-acción), políticas de RL (aprendizaje por refuerzo) y TAMP (planificación de tareas y movimientos). Cada uno tiene sus fortalezas, pero están desconectados entre sí, con distintos métodos de entrenamiento, formatos de entrada y espacios de estado.
Hoy en el ámbito de los robots, la capacidad no falta, pero sí la colaboración.
El Laboratorio Ark of Huawei publicó recientemente un artículo de investigación que presenta el sistema RoboHarness, diseñado específicamente para resolver el problema de la falta de colaboración entre diferentes estrategias. Los autores de este trabajo mantuvieron una conversación con nosotros (LeiFengNet) en torno a este proyecto.

Papel: https://arxiv.org/abs/2607.18060
Página principal del proyecto: https://www.robo-harness.com/
01 La brecha entre la ilusión y la realidad del modelo universal
Este verano, varios trabajos centrados en Harness surgieron intensamente en el campo de la investigación de robots, apuntando todos a un mismo reconocimiento: por ahora, no es viable resolverlo todo con modelos más grandes; los robots necesitan un sistema de organización de ejecución.
El equipo del profesor Yu Chao de la Universidad Tsinghua lanzó Harness VLA en julio, introduciendo la capa Harness, ampliamente utilizada en la inteligencia digital, en la inteligencia encarnada, permitiendo que un VLA congelado se enfoque en la manipulación intensiva en contacto para la que es más adecuado, mientras que una capa Harness aprende cuándo y cómo invocarla, así como cómo reiniciarla y volver a intentarlo tras un fallo del VLA. En la evaluación de perturbaciones LIBERO-Pro, este sistema aumentó la tasa de éxito del 50% al 82,4%.
En términos de enfoque, Harness VLA aborda cómo un modelo puede mantener un rendimiento estable bajo perturbaciones fuera de la distribución. Su problema es la estabilidad de una sola estrategia.
RoboHarness del Laboratorio Noah's Ark de Huawei enfrenta un problema diferente: ¿qué hacer cuando la tarea excede los límites de capacidad de cualquier modelo?
Ambos se llaman Harness y utilizan Coding Agent como capa de organización, pero resuelven desafíos en dimensiones diferentes. El primero hace que un especialista sea más estable, mientras que el segundo permite que un grupo de especialistas con distintas fortalezas trabaje en conjunto. A medida que la complejidad de las tareas de los robots sigue aumentando, este último problema se vuelve cada vez más inevitable.
La raíz de este problema debe explicarse a partir de los límites de capacidad de los diversos modelos.
La ventaja del modelo VLA es comprender instrucciones de lenguaje abierto y generalizar en nuevos entornos, pero su forma de generar acciones de extremo a extremo tiene dificultades para mantener coherencia en tareas de larga secuencia; las estrategias de aprendizaje por refuerzo pueden lograr comportamientos de bucle cerrado estables dentro de escenarios de entrenamiento específicos, pero esta estabilidad depende en gran medida de la distribución de entrenamiento y puede fallar con pequeños cambios en el entorno; TAMP es hábil en razonamiento simbólico y restricciones geométricas, pero requiere definir previamente primitivas de acción, y su planificador se ve sobrecargado rápidamente ante escenarios abiertos y objetivos ambiguos; WAM puede ayudar en la toma de decisiones de larga secuencia mediante la predicción de estados futuros, pero es propenso a acumular errores a medida que aumenta el horizonte de predicción.
Las tareas reales complejas requieren simultáneamente comprensión semántica, planificación geométrica, control en bucle cerrado, razonamiento de larga secuencia temporal y predicción de cambios en el entorno; estas capacidades tienen objetivos de entrenamiento distintos y a veces incluso contradictorios. Existe una brecha aún no superada entre lograr avances individuales en cada capacidad y lograr que un único modelo mantenga de forma estable y duradera todas ellas en entornos abiertos.
El punto de partida de RoboHarness es precisamente: en lugar de esperar a que se llene este abismo, es mejor hacer que los modelos ya existentes, cada uno con sus propias fortalezas, trabajen realmente en conjunto. El autor considera que, hasta que un modelo pueda dominar por completo a todos los demás y demostrar una autoridad absoluta, esta arquitectura de coordinación es muy significativa.
Este trabajo no surgió de la nada. El autor nos cuenta (LeiFeng.com) que el prototipo de RoboHarness nació de su experiencia participando en el BEHAVIOR Challenge, un concurso global de robótica el año pasado. La tarea del concurso era larga y difícil, y el equipo descubrió que ni el entrenamiento end-to-end de VLA ni modelos como la inmersión de comportamiento podían abordar la complejidad de la tarea. Este revés ayudó al equipo a identificar claramente el verdadero problema.
02 Cómo el cerebro de programación decide quién entra en juego
La idea central de RoboHarness es encapsular sistemas de control desarrollados de forma independiente, como VLA, WAM, estrategias de RL y TAMP, como habilidades agénticas susceptibles de ser programadas de forma unificada, con el Coding Agent encargado de la toma de decisiones de alto nivel.
Este diseño tiene un supuesto importante: no modificar ni volver a entrenar ninguna estrategia subyacente. Cada estrategia conserva su implementación original y no necesita compartir estructura de modelo, espacio de acciones ni datos de entrenamiento. RoboHarness simplemente añade una capa de organización sobre ellas.
Elegir la estrategia correcta no es tan fácil.
Para un agente de codificación, es difícil determinar de manera confiable a quién asignar esta tarea solo con entradas de imágenes crudas, ya que esta decisión oculta muchos problemas cuantitativos que los modelos de lenguaje no pueden responder. Puede comprender colocar una taza sobre un plato, pero no puede calcular la similitud entre la escena actual y la distribución de entrenamiento de una estrategia a partir de una imagen RGB, ni evaluar la confiabilidad de los datos de los sensores en este momento.
Para resolver este problema, el sistema diseñó tres tipos de habilidades auxiliares diseñadas específicamente para que el Coding Agent extraiga la información necesaria para la evaluación.

Comprender habilidades, encargado de convertir la entrada original en señales cuantificables, como: la similitud entre los embeddings de imagen y los datos de entrenamiento de cada estrategia, la estabilidad de la pose del objeto dentro de una ventana temporal, y si la iluminación actual y la calidad de la imagen cumplen con los estándares requeridos. Estos indicadores son la verdadera base para el enrutamiento de estrategias. El autor considera que la esencia de este módulo consiste en medir multidimensionalmente si cada estrategia es adecuada o no para la tarea actual.
Memory Skills, recupera la experiencia de ejecución histórica para servir como referencia en la selección de estrategias y utiliza Memory Bridge para manejar las incompatibilidades en la distribución de estados entre estrategias: este es el diseño más fundamental del sistema, que se desarrollará por separado a continuación.
Evolution Skills, actualiza continuamente los metadatos y la lógica de orquestación mediante retroalimentación en línea, permitiendo que el sistema aprenda de cada ejecución en lugar de evaluar cada nueva situación desde cero.
Los flujos de información de las tres categorías de habilidades interactúan entre sí para respaldar conjuntamente la toma de decisiones del Coding Agent. En la ejecución práctica, este mecanismo tiene dos funciones principales: primero, descomponer la tarea, dividiendo instrucciones largas en subtareas adecuadas para que las distintas estrategias las asuman; segundo, cambiar dinámicamente, cuando la estrategia actual se acerca progresivamente a sus límites de capacidad, el sistema cambia oportunamente a una estrategia más adecuada, logrando complementariedad de capacidades entre distintas estrategias.
El artículo utiliza un conjunto de experimentos de ablación para ilustrar la contribución individual de ambas capas: solo con el modelo de lenguaje para descomponer la tarea y enviarla a pi0.5, la tasa de éxito ya aumentó significativamente; al integrar múltiples estrategias heterogéneas sobre esta base, la tasa de éxito aumentó aún más. Descomponer correctamente es el primer paso, y asignar con precisión es el segundo; ambos son indispensables.
Pero hay un tercer problema, el más difícil, que no se puede resolver solo eligiendo una estrategia.
03 El momento del relevo decide la victoria en la carrera de relevos.
Dos estrategias entrenadas de forma independiente suelen vivir en sus propios mundos de datos. Sus formatos de entrada son diferentes y también difieren en la distribución empírica del estado del robot. La posición en la que se detiene la operación TAMP probablemente caiga exactamente dentro del espacio de estados que la VLA nunca ha procesado y no puede iniciar de forma estable.
Este es un desafío exclusivo de la orquestación de estrategias heterogéneas.
Por lo tanto, el Memory Bridge, encargado de asegurar una transición estable entre dos estrategias, es considerado por el autor como el módulo más importante de RoboHarness. Admite que, si en el futuro algún modelo general pudiera cubrir perfectamente todo el espacio de estados, el Memory Bridge podría no ser necesario; pero en la situación actual, cualquier modelo fácilmente cae fuera de su distribución de capacidad en el momento de la transición.

El funcionamiento de Memory Bridge se divide en tres pasos.
Buscar: según la siguiente subtarea y la observación actual, utilizar la similitud textual y visual para encontrar las Top-K trayectorias similares en las que se ejecutó con éxito la estrategia objetivo en la memoria multimodal, y extraer el estado del robot, como la pose del efector final y los ángulos de las articulaciones.
Modelado: Asignar señales de supervisión según el progreso relativo de cada estado en la trayectoria, y ajustar en tiempo real el rango de estados de la estrategia objetivo “acostumbrado a asumir” mediante regresión en línea.
Puente: Muestrea y evalúa los estados candidatos, considerando conjuntamente la confianza en alcanzar la zona de confort de la estrategia objetivo y el costo del movimiento, para seleccionar el objetivo de puente más adecuado y generar la trayectoria de transición; una vez que el robot alcance este estado, se transfiere el control a la siguiente estrategia.
Este mecanismo depende completamente del aprendizaje en línea a partir de datos históricos de ejecución, es compatible con cualquier estrategia de forma plug-and-play, sin necesidad de modificar la implementación subyacente ni requerir entrenamiento conjunto.
En el experimento de ablación, al eliminar Memory Bridge, el progreso de la tarea disminuyó solo ligeramente, lo que indica que la selección de estrategias sigue siendo básicamente correcta; sin embargo, la tasa de éxito completa cayó bruscamente del 86,0% al 60,4%. Muchas tareas llegaron hasta el último paso, pero fracasaron debido a incompatibilidades en el estado de transferencia, lo que demuestra el valor de Memory Bridge.
04 Dos líneas técnicas, un flujo silencioso que converge
Alejando la vista de este artículo, deseamos describir un panorama más amplio de la tecnología embodied.
El autor de RoboHarness observó que, en el contexto del rápido desarrollo de VLA durante los últimos tres años, los TAMP tradicionales y la planificación jerárquica, debido a su capacidad de generalización significativamente inferior en escenarios abiertos en comparación con los VLA de extremo a extremo, dejaron de recibir atención en la comunidad. Sin embargo, con los rápidos avances este año en sistemas agentes y agentes de codificación, la arquitectura jerárquica ha recuperado nueva vitalidad: el agente de alto nivel puede descomponer tareas, llamar herramientas y realizar planificación dinámica mediante habilidades componibles, mejorando así notablemente la capacidad de generalización y adaptabilidad de los métodos jerárquicos tradicionales. En consecuencia, la comunidad académica está redirigiendo su atención y comenzando a explorar cómo combinar el razonamiento de alto nivel de fuerte generalización con estrategias heterogéneas de bajo nivel.
El autor de este artículo proviene de varias universidades e instituciones de investigación del este de Canadá. El autor observa que la investigación robótica en Norteamérica ha mantenido históricamente dos líneas técnicas con claras raíces académicas: en la costa oeste de Estados Unidos, representada por Stanford, Berkeley y otras, se enfatiza más el aprendizaje y la escala, con atención al aprendizaje end-to-end, el volumen de datos y la generalización del modelo; mientras que en el noreste de Estados Unidos y Canadá, representado por MIT, la Universidad de Toronto, MILA y otros, se ha valorado tradicionalmente más la arquitectura jerárquica, el razonamiento simbólico, la planificación lógica y la toma de decisiones estructurada.
Los autores de RoboHarness se encuentran en la extensión de este último espectro.
La diferenciación en las líneas técnicas ha dejado una huella clara en la industria de la inteligencia encarnada. En los últimos años, los equipos de rápido crecimiento han formado gradualmente una secuencia técnica que va desde el escalado de modelos fundamentales hasta la jerarquía agente: un enfoque que enfatiza modelos fundamentales encarnados universales, VLA y modelos del mundo, ampliando continuamente los límites de generalización mediante la unificación de modelos, el aumento del volumen de datos y el fortalecimiento de las capacidades del modelo; otro enfoque que enfatiza habilidades operativas reutilizables y arquitecturas jerárquicas, logrando tareas complejas mediante la planificación de tareas, la combinación de habilidades y la coordinación del control de bajo nivel. En China, equipos como Baidu Academy se acercan más al primer enfoque, mientras que Suduo Technology y Magic Atom destacan más el segundo; en el extranjero, la serie pi de Physical Intelligence ha representado históricamente la línea de escalado, mientras que Gemini Robotics continúa la tradición jerárquica de “razonamiento y planificación de alto nivel + ejecución de habilidades de bajo nivel”.
Es interesante que la división de esta genealogía tecnológica no es una oposición estática, sino que se desarrolla de forma complementaria. En los últimos meses, ambas líneas tecnológicas han comenzado a mostrar una clara convergencia. Por ejemplo, Physical Intelligence ha elevado la controlabilidad y la combinación de habilidades a un papel más central en pi0.7; al mismo tiempo, equipos como NVIDIA continúan lanzando sistemas robot agentic con características más jerárquicas, integrando las capacidades de comprensión e inferencia de los modelos base con VLA. En general, el escalado de los modelos fundamentales y la jerarquía agente están evolucionando desde dos rutas tecnológicas relativamente independientes hacia capacidades complementarias dentro de un mismo sistema robótico.
05 Con la orquestación como camino, hacia una inteligencia más universal
RoboHarness tiene limitaciones claras: puede programar estrategias existentes, pero no puede resolver cosas que ninguna estrategia pueda hacer. La confiabilidad de Memory Bridge depende de suficientes datos históricos de ejecución; la evaluación de la capacidad de nuevas estrategias en las etapas iniciales tiene una incertidumbre considerable.
El argumento central del artículo no niega la necesidad de un modelo unificado.
El autor enfatiza que la orquestación de tareas de largo plazo no solo combina capacidades existentes, sino que también genera continuamente datos de ejecución transversales entre capacidades y escenarios que un solo modelo difícilmente podría obtener por sí solo. Estos datos registran los cambios, transiciones, recuperaciones de fallos y procesos de colaboración entre diferentes estrategias, y precisamente podrían convertirse en una fuente importante para entrenar el próximo modelo general de robots. Sobre la base de esta idea, el equipo de RoboHarness también está explorando la reutilización de los datos generados durante la orquestación y ejecución híbridas para el entrenamiento de las estrategias subyacentes, lo que permite que las experiencias de orquestación heterogénea refuercen aún más las capacidades fundamentales del modelo.
Desde la búsqueda del modelo más potente hasta la organización de las capacidades más adecuadas, la competencia en inteligencia encarnada se está extendiendo silenciosamente al nivel del diseño del sistema. La orquestación de estrategias heterogéneas y el modelo unificado grande son como dos caminatas que siguen crestas distintas, pero ambas apuntan al mismo horizonte: dotar a los robots de una inteligencia más universal y confiable.
