En la primera mitad de 2026, la financiación total en la categoría de modelos mundiales de IA en China alcanzó aproximadamente 90.000 millones de yuanes, con un crecimiento de más de cinco veces.Autor y fuente del artículo: Leifengwang

En la primera mitad de 2026, el dinero y los talentos del ecosistema de IA en China se dirigieron hacia la misma dirección: modelos mundiales.
Solo en los primeros seis meses, el total de financiamiento revelado en la categoría de modelos mundiales nacionales alcanzó aproximadamente 30 mil millones de yuanes; si se incluye la categoría fusionada de «inteligencia encarnada + modelos mundiales», esta cifra se eleva a más de 90 mil millones.
El crecimiento de la financiación supera cinco veces el del mismo período del año pasado.
Miles de millones en fondos y una gran cantidad de talento que fluyen como una marea.
Una pregunta inevitable es: tantas personas entran, ¿cuántas realmente han reflexionado bien sobre qué es esto?
Los profesionales buscan dirección, los inversores buscan personas, los reclutadores exploran organizaciones y los departamentos de estrategia de las grandes empresas estudian quién sobrevivirá.
Una cosa extraña es que todos hacen la misma pregunta: ¿alguien puede explicar qué es el modelo mundial?
Sí.
Hoy entrevistamos en profundidad al científico principal del Instituto IDEA y fundador de ShiQi Future, Zhang Lei, para aclarar este tema.
Es Fellow del IEEE y tiene más de 77,000 citas en Google Scholar. Su serie DINO dominó COCO durante cinco meses, y Grounding DINO junto con sus sucesores DINO-X superaron a Google y Meta, siendo adoptados como estándar por reconocidos institutos globales como el equipo de Li Fei-Fei, NVIDIA y Galaxy General.
En 2025, él fundó Vision Future con su equipo a partir de IDEA, y recibió casi 100 millones de yuanes en la ronda ángel en un mes.
Detrás de él se encuentran dos gigantes de la IA: el mentor académico, el académico Zhang Bo (uno de los fundadores de la inteligencia artificial en China), y el mentor industrial, el académico Shen Xiangyang (ex vicepresidente ejecutivo global de Microsoft y ex director del Instituto de Investigación de Microsoft Asia).
Pero ninguna de estas es la razón principal por la que lo buscamos.
La razón por la que lo buscamos es sencilla: en 2026, cuando todos discutían "¿qué es un modelo mundial?", Zhang Lei fue uno de los pocos que ofreció una respuesta clara, operativa y que no cedía a ninguna corriente principal.
De investigador principal del Microsoft Research, a científico destacado del IDEA Research Institute, y luego emprendedor: su trayectoria profesional ha cambiado varias veces, pero su tema de investigación nunca ha variado: “hacer que la IA comprenda los objetos”.
El modelo del mundo es la respuesta clave a esta pregunta que se ha planteado durante más de veinte años en el mundo físico.
Si estás observando la carrera de los modelos mundiales, quieres entender si realmente se trata de una burbuja, deseas saber quién ganará la batalla de las rutas y buscas determinar qué tipo de equipos merecen más tu atención, esta conversación vale la pena que la leas hasta el final. Porque, It's totally worth your time.
A continuación, se presenta el transcript de la conversación, con modificaciones realizadas por AI Tech Review que no alteran el significado original.
Dr. Zhang Lei, IEEE Fellow, fundador y CEO de ShiQi WeiLai, es científico principal del Centro de Investigación en Visión por Computadora y Robótica (CVR) del Instituto IDEA, profesor adjunto de la Universidad Ciencia y Tecnología de Hong Kong (Guangzhou), y ex investigador principal del Microsoft Research Asia y el Microsoft Research Headquarters. Ha publicado más de 200 artículos en áreas como la visión por computadora, con más de 77.000 citas en Google Scholar, un H-Index de 107 y más de 60 patentes estadounidenses concedidas. Fue elegido Fellow de la IEEE por sus contribuciones destacadas en el reconocimiento de imágenes a gran escala y la recuperación de información multimedia.
El mayor cuello de botella de la inteligencia encarnada no es el cuerpo, sino el cerebro
Comentario sobre tecnología de IA: Desde el año pasado, la inteligencia encarnada ha experimentado un auge, y las empresas de robótica han logrado avances cada vez más impresionantes en el control del movimiento: los robots de Unitree corren en una pista de maratón, y los robots de AgiBot pueden hacer volteretas. Sin embargo, observamos que aún parece faltar un impulso para su aplicación práctica. ¿Cuáles cree usted que son los desafíos clave que aún deben superarse para que la inteligencia encarnada se convierta plenamente en realidad?
Zhang Lei: Los dos aspectos fundamentales que los robots deben resolver son la tasa de éxito y la capacidad de generalización. La tasa de éxito se refiere a si una tarea se puede completar de manera suficientemente confiable; la generalización, a la capacidad de completar de forma confiable la misma tarea en entornos o con cuerpos diferentes.
Hay cuatro desafíos específicos:
En primer lugar, la generalización en escenarios únicos es insuficiente. Muchos equipos hoy en día pueden lograr una tasa de éxito del 70% e incluso del 80% en escenarios únicos, lo que parece un gran avance. Pero, ¿qué significa el 80% en una aplicación real? Significa que por cada cinco operaciones, hay una falla, lo que aún requiere una gran cantidad de mano de obra para respaldar, y es completamente imposible implementar de forma independiente.
En segundo lugar, la generalidad de los escenarios horizontales es insuficiente. Primero se debe empujar la capacidad puntual hasta su límite, y luego ampliar la extensión horizontal de las aplicaciones en escenarios, permitiendo que realice más tareas, más complejas, en entornos más complejos. Este es el mayor obstáculo que impide que los robots pasen de la “demostración de laboratorio” a la “aplicación real”.
Tercero, falta la capacidad profunda del "cerebro". El aprendizaje profundo actual se centra más en aprender el "comportamiento" de la inteligencia, no su "mecanismo" (los principios subyacentes de la inteligencia). Un cerebro encarnado necesita poseer una verdadera inferencia causal del mundo físico (no solo correlaciones estadísticas, sino comprender la cadena lógica de "porque A, entonces B"), comprensión del sentido común y capacidad de adaptación, y en este aspecto, apenas hemos comenzado.
Cuarto, aún está muy lejos de ser una aplicación de nivel "terminal". Actualmente, la mayoría de los robots aún dependen de enormes recursos de cómputo externos; se debe resolver el problema fundamental de "no necesitar un respaldo humano" para poder implementarse en una gran variedad de escenarios y generar un ciclo virtuoso de "aplicación-datos-iteración".
Comentario sobre tecnología de IA: Francamente, la industria está dividida sobre este tema. Los equipos de hardware creen que la ventaja de la cadena de suministro china es clara y que se debe reducir primero el costo del producto; los equipos de algoritmos consideran que el cerebro es realmente el cuello de botella. ¿Cuál es su opinión?
Zhang Lei: El cerebro es más difícil, pero también más importante.
En cuanto al hardware, China se enorgullece de su iteración. Empresas como Unitree y Zhiyuan han perfeccionado el control mediante aprendizaje por refuerzo por simulación (entrenar algoritmos de control en entornos virtuales y luego transferirlos a robots reales), refinando constantemente componentes clave como motores y mecanismos de transmisión, logrando una optimización significativa en costos y confiabilidad, y trazando un camino muy sólido. Sin embargo, las capacidades demostradas por el hardware en maratones y actuaciones solo pueden considerarse básicamente equiparadas a las capacidades fundamentales de los animales; aún no alcanza los reflejos instintivos, saltos, evasiones e interacciones con el entorno propios de los animales.
Comentario sobre tecnología de IA: Dices que el "cerebro" es más difícil, ¿en qué sentido? ¿Falta de datos o aún entendemos demasiado poco sobre la inteligencia en sí?
Zhang Lei: Lo difícil es que no entendemos realmente los mecanismos subyacentes. El cerebro humano tiene la mayor distinción y el nivel más alto de inteligencia en comparación con otros animales. Actualmente, todos los avances en aprendizaje profundo se basan en observar desde la superficie hasta qué punto la inteligencia humana puede lograrse, y luego implementarlos mediante algoritmos. La IA realmente está aprendiendo el comportamiento humano, no la inteligencia humana en sí. Como el profesor Zhang Bo suele decir, los modelos de lenguaje grandes pueden hablar como los humanos, pero su forma de comprender el lenguaje es completamente diferente a la de las personas.
¿Por qué los modelos mundiales fueron ignorados durante veinte años y ahora de repente se han vuelto populares?
Comentario sobre tecnología de IA: Junto con el auge de la inteligencia corporal, el concepto de "modelo del mundo" se ha vuelto repentinamente popular. Pero todos en la industria saben que no es un término nuevo; ya fue mencionado por académicos en los años 90. Nos resulta curioso: ¿por qué este concepto permaneció en silencio durante dos décadas y ahora de repente se ha convertido en una tendencia?
Zhang Lei: Esta es una buena pregunta. Los modelos del mundo no son un concepto nuevo. A principios de los años 90, algunos académicos intentaron modelar el entorno necesario para la interacción de agentes (sistemas de IA capaces de percibir el entorno y tomar acciones para lograr objetivos) con el fin de mejorar los algoritmos de aprendizaje por refuerzo, pero en ese momento el aprendizaje profundo aún no había surgido, por lo que fue difícil validar el concepto tras su propuesta.
Este concepto se validó realmente alrededor de 2018-2019, cuando aparecieron artículos verdaderamente llamados “World Models” y se aplicaron en escenarios de juegos, ya que los juegos son el mejor entorno para validar el aprendizaje por refuerzo.
Después de varios años de desarrollo del aprendizaje por refuerzo, la IA ya podía vencer a jugadores humanos en videojuegos. En ese momento, los investigadores comenzaron a preguntarse: ¿podría un agente de IA aprender de forma autónoma un modelo del mundo a través de la interacción continua con el entorno del juego, incorporando el proceso de evolución del entorno dentro de dicho modelo? Esta idea se verificó completamente alrededor de 2018 a 2020.
Comentario sobre tecnología de IA: ¿Entonces, qué tiene que ver esto con la inteligencia encarnada de hoy? Parece que lo que realmente encendió la popularidad de los modelos del mundo es la inteligencia encarnada.
Zhang Lei: Esta asociación debe comenzar con los modelos de lenguaje. La industria primero desarrolló VLA (Vision-Language-Action, es decir, modelos de visión-lenguaje-acción, donde los robots observan imágenes y predicen el siguiente movimiento), utilizando el paradigma de aprendizaje por imitación de los modelos de lenguaje: los modelos de lenguaje realizan la predicción del siguiente token; el VLA corporizado es cuando el robot observa la imagen actual y predice cómo realizar el siguiente movimiento.
Pero este enfoque pronto alcanzó un límite. El límite no solo está en los datos; creo que los datos son solo un aspecto, y el otro es que el aprendizaje por refuerzo aún no se aplica suficientemente. Tengo una metáfora: el aprendizaje por imitación permite que los modelos de lenguaje aprendan a hablar, mientras que el aprendizaje por refuerzo les permite decir lo correcto.
La inteligencia del robot y la tasa de éxito de sus acciones también requieren aprendizaje por refuerzo.
Sin embargo, al aplicar el aprendizaje por refuerzo en sistemas embocados, se enfrentan dos obstáculos mortales: primero, la eficiencia en la recopilación de datos es extremadamente baja, mucho menor que la de los modelos de lenguaje, ya que los robots deben ejecutar cada acción en el entorno real y esperar la retroalimentación física; segundo, el costo de los fracasos es inaceptable: si no aprendes a lavar los platos, rompes los platos; si un automóvil autónomo aprende a evitar accidentes, puede necesitar experimentar numerosos accidentes reales para lograrlo. Esto es completamente diferente al aprendizaje por prueba y error de bajo costo que ocurre en el mundo digital de los modelos de lenguaje.
El entorno virtual proporcionado por los modelos del mundo es precisamente la salida para resolver estos problemas. Si un modelo puede predecir “¿Cómo se volverá el entorno si hago este movimiento?”, entonces el robot puede “imaginar” innumerables intentos y errores en el mundo virtual, sin necesidad de romper realmente diez mil platos.
(Note: Simplify the logic chain of this passage. First, robots require extensive trial and error to learn a task. Second, trial and error in the real world is too costly and dangerous. Third, a world model creates a “virtual training ground” for the robot, allowing it to simulate the consequences of various actions in its mind. Fourth, only the optimal solution is executed in the real world. This is why world models have suddenly become the industry’s focal point at this moment.)
Sin usar acciones como condición de entrada, no se llama modelo del mundo
Comentario sobre la tecnología de IA: Actualmente, la industria tiene una definición bastante confusa del término "modelo del mundo". Se llama modelo del mundo a la generación de video, a la modelización del espacio 3D, e incluso al JEPA (arquitectura de embebido conjunto de predicción) de LeCun. Entonces, ¿qué condiciones debe cumplir al menos un modelo para merecer estos cuatro caracteres?
Zhang Lei: Creo que los modelos del mundo deben tener dependencia de acciones, es decir, Action Conditioned (los modelos deben poder responder: "¿Cómo cambiará el entorno si se ejecuta una acción específica?").
Los agentes pueden interactuar con el entorno gracias a las acciones: las acciones del agente provocan cambios en el entorno, y tras estos cambios, se genera un nuevo estado que se devuelve al agente, indicándole si su acción lo acercó un paso más al objetivo. Se trata de un bucle cerrado completo, en el que cada transición del estado del entorno depende de la acción específica ejecutada en el paso anterior.
A menudo se dice que los modelos del mundo consisten en cambiar la predicción del siguiente token de los modelos de lenguaje por una predicción del siguiente estado, pero considero que esta definición no es lo suficientemente rigurosa y carece de una condición clave. La formulación correcta debería ser: Predicción del siguiente estado condicionada por la acción. Solo al incorporar la acción como condición previa, la predicción del estado adquiere sentido y realmente cumple con los requisitos del aprendizaje por refuerzo.
Comentario sobre tecnología de IA: Para ser honestos, muchas personas, incluidos algunos inversores en los BP, tienen la costumbre de llamar a modelos de generación de video como Sora también modelos del mundo. Pero según el estándar que acaba de mencionar, claramente les falta la dimensión de acción. ¿Nos gustaría escuchar cómo usted desglosa este problema?
Zhang Lei: El modelo del mundo que discutimos aquí proviene de los métodos basados en modelos del campo del aprendizaje por refuerzo, y está diseñado para ayudar a los agentes a interactuar de manera más eficiente con su entorno. Aunque los modelos del mundo tienen muchas aplicaciones, la inteligencia encarnada es actualmente la aplicación más clara y valiosa.
En este sentido, modelos puramente de generación de video, como Sora en sus primeras versiones, no pueden denominarse modelos del mundo. La razón fundamental es que no modelan “acciones”; en esencia, generan una secuencia de video coherente, prediciendo cómo cambian los píxeles, pero no modelan en absoluto las acciones de interacción entre robots y entornos. ¿Puede ayudar indirectamente a los robots? Sí, puede aprender ciertas regularidades del cambio en el mundo, pero es difícil que ayude a los robots a interactuar mejor con su entorno.
Comentario sobre tecnología de IA: ¿Qué hay del recientemente popular World Action Model (modelo de acción mundial)? Hemos oído que también habla de acciones, ¿es otro tipo de modelo mundial?
Zhang Lei: WAM tampoco es un modelo del mundo en el sentido del aprendizaje por refuerzo. Utiliza supervisión a nivel de píxeles proporcionada por la predicción de imágenes futuras para mejorar la predicción de acciones, y ya ha demostrado un rendimiento superior al de VLA en ciertas tareas. Sin embargo, su modelado es de efecto a causa: genera primero las imágenes futuras y luego retrocede para inferir las acciones; no puede utilizarse en aprendizaje por refuerzo, por lo que no cumple con la definición de modelo del mundo que estamos discutiendo aquí.
PixelPunks vs. LatentSpace: ambos están haciendo realmente lo mismo
Comentario sobre tecnología de IA: Al hablar de la disputa de rutas, este es actualmente el tema más candente en el campo de los modelos mundiales. LeCun es la figura emblemática del enfoque de espacio latente, mientras que Sora representa el enfoque de píxeles. Parece que ambas rutas son incompatibles; ¿cuál es su opinión?
Zhang Lei: En primer lugar, debemos reconocer que ambas líneas tienen puntos en común.
De hecho, actualmente la gente generalmente siente que son muy opuestos, posiblemente porque LeCun es bastante firme y claro en sus postulados; a veces, un académico debe expresarse con claridad para que el público exterior recuerde sus ideas.
Pero la ruta de los píxeles también depende del espacio latente para operar. Stable Diffusion y Sora primero comprimen las imágenes o videos a un espacio de representación de baja dimensión antes de procesarlos. Por lo tanto, el espacio de representación es el problema más fundamental. La verdadera diferencia entre ambas rutas no radica en si se debe usar o no un espacio latente, sino en qué se debe conservar y qué se debe descartar una vez dentro del espacio latente.
La diferencia radica en que la ruta del espacio latente busca excluir detalles de píxeles como la iluminación y la textura, que no son impulsados por leyes físicas, lo que ayuda al modelo a aprender las leyes más fundamentales detrás de los cambios de estado; sin embargo, enfrenta el riesgo de colapso de representación: si diez mil imágenes diferentes se mapean a una representación idéntica, la representación colapsa, lo que significa que el modelo pierde la capacidad de distinguir entre diferentes estados. La ruta de píxeles persigue una precisión minuciosa, lo que en esencia busca complacer los ojos humanos, ya que las personas son muy sensibles a los detalles visuales.
Comentario sobre la inteligencia artificial: Al llegar aquí, tenemos una intuición. ¿No es también el cerebro humano un espacio latente al realizar inferencias? Cuando cierras los ojos e imaginas las consecuencias de un movimiento, ¿quién renderiza pixel por pixel en la mente?
Zhang Lei: Correct. If the human brain contains a world model, imagining how actions change the environment is essentially operating in a latent space, rather than rendering every pixel of the entire scene in the mind. Therefore, using human visual judgment of image quality as a criterion for evaluating a world model is insufficient. If the pixel-based approach aims to build a world model, what it should truly pursue is not how realistic the pixels are, but whether the generated video sequences adhere to physical plausibility.
(Nota del autor: Este diálogo trata sobre la disputa entre dos enfoques para los modelos de mundo de IA. El enfoque de píxeles, representado por Sora, se enfoca únicamente en la realismo visual, pero a menudo presenta errores que violan el sentido común físico, como tazas flotando, objetos atravesándose o velas que no se pueden apagar. En cambio, LeCun y Zhang Lei defienden el enfoque del espacio latente, que primero abstracta la imagen en reglas y luego la simula, comprendiendo mejor la causalidad física. La innovación clave de Zhang Lei consiste en incorporar "estructura de objetos" dentro del espacio latente, permitiendo que la IA distinga primero objetos independientes como tazas, mesas y personas, y luego aprenda las reglas de interacción entre ellos. Esto evita los errores visuales típicos de Sora y resulta más adecuado que los espacios latentes puramente abstractos para que los robots eviten obstáculos, agarren objetos y planeen movimientos en el mundo real.
Comentario sobre inteligencia artificial: Usted sigue la misma ruta de espacio latente que LeCun. Pero hemos escuchado que su enfoque tiene una diferencia clave con el suyo: usted enfatiza la necesidad de "introducir la estructura de los objetos". ¿Cuál es la diferencia fundamental?
Zhang Lei: Nuestra línea de pensamiento comparte el mismo principio fundamental que LeCun: el cerebro humano realiza razonamiento contrafactual ("¿qué pasaría si hiciera esto?") de forma condicionada por la acción, realizando inferencias en representaciones abstractas, no reensamblando píxeles.
LeCun ha validado este axioma en los últimos años con I-JEPA, V-JEPA y LeJEPA: la predicción debe ocurrir en el espacio de representación. Sin embargo, la complejidad del espacio físico en la dirección encarnada es extremadamente alta, y creemos que, para aplicar realmente este método a entornos reales a gran escala, aún es necesario introducir estructuras necesarias en el espacio latente.
Esta perspectiva proviene de nuestras capacidades verificadas. El DINO-X, desarrollado bajo la dirección de nuestro equipo central, ya ha resuelto el problema de "ver objetos" en mundos abiertos. Por lo tanto, ahora hacemos de los objetos la unidad básica para la predicción y planificación del modelo del mundo. Intuitivamente, las leyes físicas actúan sobre los objetos; comprender los objetos mediante representaciones en el espacio latente permite aprender de manera más eficiente las leyes físicas.
Comentario sobre tecnología de IA: Espera un momento, queremos hacer una pregunta adicional. LeCun y su AMI Labs han recaudado miles de millones de dólares y también están enfocándose intensamente en esta dirección. ¿Por qué creen que su mejora de “introducir estructura de objetos” puede avanzar más allá de su marco general?
Zhang Lei: Debido a que anteriormente desarrollamos DINO-X, un modelo general de percepción de objetos abierto, ya hemos logrado lo mejor del mundo en "comprender los objetos". Nuestra comprensión del mecanismo de los modelos visuales y por qué estos modelos pueden generar razonamiento físico está altamente alineada con la línea original de comprensión general de objetos.
En resumen, el enfoque de LeCun es el marco básico; sobre este marco, introducimos la estructura de los objetos y lo hacemos funcionar en un bucle cerrado en entornos reales. Esta capacidad de “bucle cerrado” es lo que hemos desarrollado en los últimos años.
¿Por qué la serie DINO puede superar a Google y Meta?
Comentario sobre la tecnología de IA: Su equipo ha logrado resultados demasiado destacados en la etapa de modelos visuales grandes. Grounding DINO y el posterior DINO-X han superado a Google y Meta, y son citados de forma estándar por instituciones líderes mundiales como el equipo de Li Fei-Fei, NVIDIA y Galaxy AI. Hemos discutido esto internamente y todos sentimos que es un poco “anormal”: normalmente son los equipos chinos los que siguen a los extranjeros, ¿cómo lograron que sean los equipos extranjeros los que los siguen a ustedes?
Zhang Lei: Dos dimensiones destacan.
En términos de paradigma, somos el primer equipo en el campo visual en lograr un rendimiento SOTA (State of the Art, nivel óptimo del campo) en detección con Transformer (una arquitectura de aprendizaje profundo basada en mecanismos de atención propia, que también sirve como base para los modelos de lenguaje grandes). Grounding DINO introdujo el paradigma de los modelos de lenguaje y, por primera vez, amplió la detección de objetos al dominio abierto: el modelo ya no se limita a reconocer solo las categorías de objetos con las que fue entrenado, sino que puede detectar cualquier objeto nunca visto antes. Hasta hoy, sigue siendo el modelo de código abierto con más citas y descargas, lo que puede considerarse un avance paradigmático.
En términos de datos y estrategia de ingeniería, tras Grounding DINO, nos inclinamos hacia una ruta cerrada, impulsando ideas validadas hacia la escala. Al mismo tiempo, tengo altos estándares para la calidad del trabajo. Aunque el equipo era joven y no había realizado trabajos de esta magnitud antes, mantuve firmemente los requisitos y enfaticé que solo se lanzaría una versión si lograba un avance a nivel de gran actualización. Por eso tardamos aproximadamente un año en lanzar Grounding DINO 1.5 y otros seis meses en lanzar DINO-X. La evidencia demuestra que estas versiones, pulidas durante más de un año, han obtenido un alto reconocimiento en la industria.
Comentario sobre la inteligencia artificial: ¿Cuál es la relación entre los grandes modelos visuales que están desarrollando y los modelos del mundo de hoy?
Zhang Lei: Nuestro trabajo es continuo. Anteriormente, al trabajar en la percepción de objetos, nuestro objetivo principal era proporcionar una base de percepción para los robots, y posteriormente muchos equipos utilizaron nuestro Grounding DINO para resolver problemas de comprensión del entorno embodiado.
En términos de arquitectura técnica, los modelos del mundo son más nativamente visuales que los lingüísticos, y casi todos los trabajos sobre modelos del mundo no se basan en arquitecturas puramente lingüísticas como GPT.
En términos de experiencia del equipo, nuestra comprensión del mecanismo de los modelos visuales coincide en gran medida con la línea técnica original de comprensión general de objetos. Esta es la razón por la que tenemos confianza en continuar iterando el modelo del mundo.
El equipo, compuesto por más de 20 personas provenientes de IDEA, es muy estable. Durante el desarrollo de modelos cerrados, hemos seguido atrayendo a expertos externos con fuertes habilidades en algoritmos e ingeniería. Estas más de 20 personas son hoy en día la "semilla" de ShiQi Future.

La evolución desde los modelos DINO hasta los modelos mundiales
¿Cómo hacer que la IA realmente "vea" los objetos?
Comentario sobre inteligencia artificial: Dijo que los enfoques actuales de espacio latente "no comprenden realmente los objetos", que no saben qué elementos en la escena son objetos independientes ni cuáles son las relaciones entre ellos. Nos resulta interesante: ¿cómo se determina esto? ¿Cómo se sabe si el modelo realmente "entiende" los objetos o simplemente "finge" entenderlos?
Zhang Lei: La comprensión en sí misma es difícil de verificar directamente. Nadie puede explicar actualmente cómo los modelos de lenguaje comprenden el lenguaje; solo se puede juzgar a través de su comportamiento aparente. Si genera texto continuo y parece indistinguible del habla humana, se dice que comprende.
Los modelos mundiales enfrentan problemas similares. Es difícil explicar directamente si el modelo realmente comprende las leyes físicas o si realmente capturó la estructura de los objetos. Analizaremos mediante la visualización de pasos intermedios; si los resultados coinciden con la intuición humana, indica que probablemente capturó la estructura de los objetos.
Comentarios sobre IA: ¿Hay algún método de prueba específico? ¿Podríamos hacer un experimento para verlo?
Zhang Lei: Sí. La prueba contrafáctica es un buen método para que el modelo intente diferentes acciones y vea si puede generar resultados físicamente razonables. Si puede hacerlo correctamente incluso con una ligera desviación en la trayectoria, significa que ha aprendido las reglas; si no lo hace correctamente, es probable que solo haya aprendido correlaciones estadísticas.
Esto requiere mucha perspicacia. Como dijo el profesor Richard Sutton, los investigadores siempre tienen la tentación de ayudar al modelo y inyectarle su propia experiencia. Los investigadores de modelos de lenguaje alguna vez quisieron desglosar la estructura sintáctica, alimentarle el tokenizado y los grupos de palabras, pero finalmente fueron superados por el simple paradigma de "predecir el siguiente token".
Yo mismo confío mucho en el poder de esta sencilla paradigma para iterar hacia adelante. Demasiado diseño humano, efectivo a corto plazo, obstaculiza la iteración a largo plazo.
Comentario sobre tecnología de IA: En el mundo físico, hay algunos objetos bastante complicados, como la arena movediza, el agua, el humo y la tela, que no tienen límites claros. Nos preguntamos si su marco "centrado en el objeto" podría verse limitado por el propio concepto de "objeto".
Zhang Lei: Nosotros mismos también estamos reflexionando sobre esta pregunta. Desde el punto de vista técnico, la forma más sencilla de abordarlo es mediante una máscara, separando los píxeles de la región del objeto. En los últimos años, el campo de la visión por computadora ha logrado un gran avance en la comprensión semántica de objetos y la predicción de máscaras, y puede manejar objetos no rígidos como la arena movediza o las masas de agua.
Por lo tanto, comenzar con Mask es un punto de partida práctico. Y nuestra experiencia en percepción de objetos generales es más profunda que la de cualquier otro equipo.
EgoTwin: Enseñar a la mano del robot con la mano humana
Comentario sobre tecnología de IA: En su marco técnico hay un concepto clave llamado "alineación de acciones", que mapea acciones de diferentes configuraciones, como la mano humana, la pinza de dos dedos y la mano hábil de múltiples dedos, a un mismo espacio latente. Lo entendemos así: esto suena un poco como hacer traducción para robots, permitiéndoles comprender acciones en diferentes "lenguajes", ¿verdad?
Zhang Lei: Las entradas principales del modelo mundial son dos: la imagen (estado) y la acción, por lo que comprender la acción es fundamental.
La alineación de acciones es una necesidad básica en problemas de múltiples ontologías. Alinear la mano humana con un brazo robótico es aún más difícil: las posiciones de las articulaciones del brazo robótico en las coordenadas XYZ del espacio físico son precisamente conocidas, pero los datos de la mano humana suelen provenir de videos 2D; si alguien graba un video cocinando, solo contiene imágenes bidimensionales, sin coordenadas tridimensionales. Usarlos directamente juntos es muy ineficiente.
Nuestro enfoque consiste en extraer puntos clave 3D, convirtiendo videos 2D de la mano humana en secuencias de operaciones en espacio 3D, alineándolas con los datos del brazo robótico en el mismo espacio físico. Esto es lo que hoy en día la industria denomina la recopilación y procesamiento de datos Ego (datos de operaciones humanas capturados desde una perspectiva en primera persona).
Anteriormente lanzamos EgoTwin, que resuelve precisamente este tipo de problemas de recolección de datos, y actualmente estamos colaborando con el equipo de recolección de datos de Baidu Cloud.
Comentario sobre tecnología de IA: EgoTwin resuelve el problema de los datos de "cómo se mueven las manos". Pero queremos preguntar: ¿qué pasa con la información de nivel superior implícita en los videos humanos, es decir, la intención detrás de "por qué se mueven así las manos"?
Zhang Lei: La comprensión de la intención detrás de las acciones de niveles superiores la dejaremos para que la resuelvan los modelos de mundo o VLA. Pero el requisito previo es que la calidad de los datos sea lo suficientemente alta. La materia prima de los datos es fundamental. La industria ha invertido una gran cantidad de recursos humanos y costos en la recopilación de datos, pero en muchos casos la eficiencia de uso de estos datos no es ideal. La experiencia clave que acumulamos en los trabajos Grounding DINO y DINO-X es encontrar personas que entiendan los algoritmos para realizar un trabajo profundo en los datos; de lo contrario, los datos recopilados podrían no ser útiles durante el entrenamiento. Es necesario iterar en paralelo tanto en algoritmos como en datos.
Zhang Bo y Shen Xiangyang: Dos mentores, un mismo matiz
Comentario sobre la tecnología de IA: Notamos que detrás de usted hay dos personas que han tenido una gran influencia: el académico Zhang Bo (uno de los pioneros de la inteligencia artificial en China) y el académico Shen Xiangyang (ex vicepresidente ejecutivo global de Microsoft y ex director del Instituto de Investigación de Microsoft Asia). Uno se inclina más hacia lo académico y el otro hacia la industria; nos gustaría saber qué les debe a cada uno.
Zhang Lei: El académico Zhang Bo siempre ha sido mi mentor y ejemplo. Conocí al profesor Zhang por primera vez cuando ingresé a la sala de investigación de Tsinghua como estudiante de licenciatura; él era el director del laboratorio. En ese entonces, yo trabajaba en AGV (vehículos guiados automáticamente) y pasaba gran parte de mi tiempo libre ajustando hardware y realizando experimentos en el laboratorio, donde a menudo veía al profesor Zhang guiando a estudiantes de doctorado en trabajos relacionados con robótica. Más tarde, tuve la suerte de convertirme en su estudiante de doctorado. Lo que más recuerdo es su gran sensibilidad hacia las nuevas tecnologías y su fuerte curiosidad. Cada vez que iba a mostrarle los resultados de mis experimentos y discutirlos, él se sentaba entusiasmado a mi lado y decía: “¿Por qué no modificas esto y ves qué pasa?”. Él también profundizaba su propia comprensión de esta manera. Podías ver cómo la comprensión de un académico sobre los algoritmos y los problemas estaba completamente impulsada por la curiosidad.
Otro punto que sigue siendo útil es su énfasis en "comprender las cosas hasta el final"; si no se comprende completamente, se puede ser engañado, y solo al comprenderlo totalmente se entiende cómo funcionan los principios subyacentes. Esta frase más tarde se convirtió en mi principio al guiar a mis estudiantes: comprender a fondo, buscar lo mejor.
El académico Shen Xiangyang también tuvo un gran impacto en mí. Durante mi tiempo en Microsoft, él fue siempre mi jefe superior y influyó en toda mi trayectoria profesional: fue él quien me contrató para ir de China a Estados Unidos, y quien me animó a regresar a Shenzhen desde Estados Unidos. Además, posee una gran agudeza en la dirección industrial y me brindó muchos consejos concretos y compartió su experiencia en la construcción de equipos y la recaudación de fondos.
Comentario sobre tecnología de IA: ¿Se dice que el profesor Zhang Bo, a sus 90 años, aún visitó su equipo para intercambiar ideas? Eso nos conmueve mucho al oírlo.
Zhang Lei: Sí. En noviembre del año pasado, la Escuela de Posgrado de la Universidad Tsinghua lo invitó a dar una conferencia en Shenzhen; después de terminar su clase por la mañana, dedicó toda la tarde a nuestro equipo. Pasamos toda la tarde intercambiando ideas y cenamos juntos por la noche. Tiene una visión muy amplia y nos dio muchos consejos sobre nuestras áreas de comprensión visual general y robótica. Aunque es de edad avanzada, su pensamiento es extremadamente claro, y su capacidad lógica y profundidad de comprensión de los problemas no ceden en nada a las de los jóvenes.
Cada ola supera la imaginación, pero la ola vendrá por ti misma
Comentario sobre tecnología de IA: En los últimos años, ha participado profundamente en cada ola, desde el aprendizaje profundo hasta los modelos grandes y luego los modelos corporales y del mundo. Queremos saber: ¿hubo algún momento en que sintió “esto es lo que debo hacer”?
Zhang Lei: El trabajo de detección de objetos está muy cerca del estado que mencionaste. Este trabajo me llena de orgullo, ya que puedo ver cómo todo el campo ha logrado un avance revolucionario.
El próximo modelo del mundo también es una dirección que me entusiasma y en la que estoy dispuesto a invertir todos mis esfuerzos. Podemos aprender de los últimos decenios de desarrollo alternado entre el aprendizaje por refuerzo y los modelos del mundo, así como del paradigma exitoso de los modelos de lenguaje. Creo que esta dirección tendrá un gran impacto en toda la industria de la IA.
Comentarios sobre la inteligencia artificial: Los momentos destacados de los investigadores se mencionan con frecuencia, pero los bajones rara vez se abordan. ¿Ha experimentado usted un bajón tecnológico?
Zhang Lei: Sí. Alrededor de 2018, intenté usar datos con supervisión débil para detección de objetos, logrando la detección solo con etiquetas de categoría de imagen, evitando marcar cuadros para cada objeto. Este método parecía muy atractivo, y dediqué bastante tiempo a ello, pero nunca lo resolví por completo.
Luego, en IDEA, realizamos Grounding DINO, combinando la comprensión del lenguaje y la capacidad de detección, lo que resolvió el problema desde otro ángulo. Este avance se debió en parte a la sólida base que nos proporcionaron las innovaciones en el modelo de detección DINO, y en gran medida también al desarrollo de los modelos de lenguaje. El avance de Grounding DINO ocurrió a finales de 2022 y principios de 2023, justo en el momento en que salió ChatGPT. Existe una afirmación que dice: “Cuando los datos son lo suficientemente grandes, la inteligencia surge naturalmente”; con datos suficientemente grandes, los algoritmos pueden ser lo suficientemente simples.
Creo que enfrentar obstáculos es normal; lo clave es tener la determinación de persistir frente a problemas difíciles. Si no logras resolverlo en este intento, cambia de ángulo, piensa en él mientras comes y duermes, dale vueltas una y otra vez. Los verdaderos buenos problemas te acompañarán durante años, y en algún momento, de forma natural, surgirá un avance cualitativo.
Comentario sobre tecnología de IA: Muchos jóvenes también están emprendiendo en modelos mundiales, como Chen Boyuan y Ji Jiaming de Inverse Matrix, y Bai Yinqi de Baize Technology, quienes incluso aún son estudiantes universitarios. Nos parece algo muy interesante; ¿qué piensa usted de esta “ola posterior”?
Zhang Lei: Esto indica que la barrera de entrada a la investigación ha disminuido realmente. Antes del auge del aprendizaje profundo, los nuevos entrantes necesitaban años para construir una base sólida. Ahora, las tecnologías de código abierto han simplificado la técnica: comprender Transformer es suficiente para ingresar a este campo. La ventaja de los jóvenes radica en no tener cargas; es más fácil adoptar nuevos paradigmas desde primeros principios. Sin embargo, los verdaderos problemas difíciles también requieren la visión, comprensión y capacidad de dirección de investigadores experimentados.
Las tendencias sociales siempre están cambiando, pero si solo persigues tendencias por perseguirlas, nunca las alcanzarás. La esencia es: sin importar cómo cambie la dirección, cada equipo siempre necesita a las personas más capaces. Si mantienes una actitud de aprendizaje constante y una base sólida, las direcciones más avanzadas vendrán a buscarte.
Una revelación
Lo que más nos conmovió en esta entrevista no fueron los logros técnicos brillantes de Zhang Lei, ni siquiera los jóvenes talentos que él guió: los pasantes Huang Zheng, Li Xuelong, y los miembros del equipo del primer proyecto de detección facial de Microsoft, Zhu Long, Xiao Rong y Yan Shuicheng.
Lo que más nos conmovió fue una palabra que mencionó repetidamente: "comprender a fondo".
Esta palabra, Zhang Lei la anotó durante treinta años.
A principios de los años 90, en el campus de Tsinghua, la inteligencia artificial era una disciplina tan poco conocida que nadie le prestaba atención; Zhang Lei era aún un estudiante de pregrado del departamento de informática jugando con vehículos AGV en el laboratorio. El director del laboratorio, que guiaba a estudiantes de doctorado en trabajos relacionados con robótica, le impresionó profundamente, y más tarde también se convirtió en su discípulo.
El director del laboratorio se llama Zhang Bo, uno de los fundadores de la inteligencia artificial en China. Cada vez que Zhang Lei lo invita a revisar los resultados del experimento, él siempre se sienta entusiasmado junto a Zhang Lei, mira la pantalla un momento y extiende el dedo: “Cambia esto un poco y ve qué pasa.” No es revisar tarea; realmente quiere saber qué sucede cuando modificas los parámetros.
Lo que Zhang Bo enseñó a Zhang Lei se resumió luego en tres palabras: "entender a fondo".
Si no lo entiendes bien, te engañarán; si lo entiendes bien, sabrás cómo funcionan los principios subyacentes.
La esencia de la generación china de investigadores se transmite a través de estos pequeños detalles.
En 2018, Zhang Lei trabajó en detección de objetos con supervisión débil en Microsoft, no logró hacerlo funcionar, pero no cambió de tema.
Si no puedes hacerlo funcionar en este round, cambia de perspectiva; piensa en ello mientras comes y duermes, y dale vueltas sin cesar.
No es una metáfora, es su rutina diaria.
Luego, en IDEA, trabajó en Grounding DINO y resolvió el problema desde otro ángulo. El momento de ruptura fue a finales de 2022, con la aparición de ChatGPT: las capacidades de los modelos de lenguaje mejoraron y los datos eran lo suficientemente grandes.
Zhang Lei usó una descripción: "surge de manera natural".
Desde cambiar los parámetros de los vehículos AGV hasta desentrañar modelos mundiales, pasaron treinta años. Durante esas tres décadas, pasó de la búsqueda masiva de imágenes a la comprensión visual general, persiguiendo una comprensión profunda y la excelencia en cada problema, hasta regresar finalmente a la dirección de “construir modelos mundiales para robots”. Como dijo Jobs: “connect the dots” — cada cosa realizada con seriedad nunca se pierde.
A finales de 2025, Zhang Bo, de 90 años, viajó a Shenzhen para dar una conferencia. Después de terminar la clase por la mañana, pasó la tarde en las oficinas de ShiQi Weilai. Un grupo de siete u ocho jóvenes lo rodeaban, y él les habló durante toda la tarde; por la noche cenaron juntos y contó historias sobre sus años de estudio y sus juicios sobre esta dirección. Su pensamiento era claro, su lógica rigurosa, y no le ganaba en nada a los jóvenes. Zhang Lei también le contó a su maestro sobre lo que estaba haciendo actualmente.

El académico Zhang Bo en "Mirando hacia el Futuro", Zhang Lei le cuenta al profesor sobre el progreso de la investigación
Treinta años atrás, en el campus de Tsinghua, el profesor sentado junto al estudiante dijo: "Cambia esto un poco y ve cómo queda."
Treinta años después, en la oficina de Shenzhen, un estudiante le cuenta a su profesor de 90 años sobre el modelo mundial que está desarrollando.
Qué escena tan conmovedora de recreación.
Las personas envejecen, las mareas retroceden, y las tendencias se enfrian, pero la determinación de los investigadores chinos por comprender profundamente cada problema mundial nunca ha cambiado. Leifeng.com
