La próxima gran frontera de la innovación en IA se está concentrando en la generación 3D.
Desde la generación multimodal, modelos del mundo, hasta inteligencia espacial y robots de inteligencia encarnada…
3D está convirtiéndose en el motor central de la próxima generación de IA.
Y ahora, la figura legendaria del campo de la gráfica y la empresa más popular en el sector de IA 3D se han unido.
Últimas noticias:
Tong Xin se ha unido oficialmente a Meshy, fundada por Hu Yuanming.
Reunión de los maestros de Hu Yuanming
Según las últimas noticias, Tong Xin asumirá el cargo de Científica Principal en la empresa de IA 3D Meshy, encargándose de establecer la estrategia de investigación a largo plazo de Meshy.
Esto podría significar que las dos generaciones más representativas de la comunidad china de gráficos por computadora — Hu Yuanming, fundador de Meshy, y Tong Xin — colaborarán para impulsar avances en modelos mundiales multimodales y sistemas de interacción en tiempo real.
Tong Xin trabajó durante 25 años en Microsoft Research Asia, donde lideró el grupo de gráficos de red y actuó como socio de investigación global.
Sus áreas de investigación abarcan la gráfica por computadora y la visión por computadora tridimensional, específicamente, incluyen, entre otras, captura y modelado de materiales, síntesis de texturas, procesamiento y modelado de geometría tridimensional, análisis y simulación de transmisión de luz, renderizado realista y animación tridimensional de rostros.

△
La gráfica por computadora, en términos sencillos, se enfoca en "cómo crear, manipular y presentar un mundo tridimensional en una computadora".
Este campo tiene un papel fundamental en juegos, cine y simulación industrial, y actualmente se está convirtiendo cada vez más en la infraestructura de percepción y expresión de la IA.
Después de todo, sin comprender la tercera dimensión, la IA no puede comprender ni ingresar realmente al mundo físico.
Y Tong Xin es uno de los académicos que más tiempo ha estado arraigado y ha acumulado mayor experiencia en esta dirección.
En 1999, Tong Xin recién graduado con su doctorado de Tsinghua, ingresó en el Instituto de Investigación de Microsoft en China, fundado hace menos de un año, que más tarde se conocería como el "West Point de la tecnología china", el Instituto de Investigación de Microsoft en Asia.
Durante más de veinte años, aquí surgieron innumerables figuras clave que influyeron en el panorama de la investigación informática en China y en todo el mundo—pero esa es otra historia.
Como uno de los primeros investigadores del Instituto de Investigación de Asia, Tong Xin ha estado aquí durante 25 años, avanzando desde investigador hasta socio global de investigación y jefe del grupo de gráficos de red.
Ha presenciado casi todos los momentos importantes de la gráfica por computadora en China.

△
During this period, Tong Xin published numerous papers in top journals and conferences, with over 21,000 citations on Google Scholar.
Estos estudios técnicos dejaron a Microsoft una buena cantidad de recursos, incluyendo API de desarrollo de juegos Xbox, software compatible con Xbox, controladores de impresión 3D de Windows y el kit de desarrollo gráfico Direct3D, entre otros.
Además, Tong Xin dejó otra “herencia” para el Grupo de Gráficos por Redes del Instituto Yayan: un grupo de profesionales suficientes para sustentar la fuerza principal de la gráfica china actual.
Durante 25 años, ha colaborado, intercambiado ideas y guiado a una serie de investigadores destacados aquí.
Zhou Kun de la Universidad de Zhejiang, Fellow del ACM y Fellow del IEEE, director del Laboratorio Nacional Clave de CAD&CG, ha colaborado durante muchos años con Tong Xin, explorando desde la impresión 3D y el diseño computacional hasta NeRF y la renderización neural;
Xu Kun de Tsinghua, profesor titular del Departamento de Informática de la Universidad Tsinghua y ganador del Premio Nacional de Jóvenes Investigadores Destacados, colaboró múltiples veces con Tong Xin durante su doctorado para publicar artículos en SIGGRAPH;
Wang Pengshuai de la Universidad de Pekín, profesor asistente del Instituto Wang Xuan, ha estado bajo la dirección de Tong Xin desde su época de pasante hasta convertirse en investigador principal, y ahora es un académico representativo en el campo del aprendizaje de geometría tridimensional…
Las personas que han trabajado con él suelen tener una evaluación sorprendentemente uniforme sobre Tong Xin:
Cercano y siempre en primera línea, capaz de mantener discusiones rigurosas sobre problemas técnicos extremadamente detallados, y también de explicar problemas técnicos complejos con lenguaje sencillo y claro.
Porque, según Tong Xin, la gráfica por computadora es una disciplina de aplicación informática, y por ello, todos los problemas de investigación surgen de necesidades prácticas y de la aparición de nuevos dispositivos y nuevos datos.
Además, Tong Xin es muy humorístico y divertido; por ejemplo, así describe su investigación:
Mi familia, además de reconocer la comida que preparo, suele bromearme diciendo que me entusiasmo mucho viendo teteras y conejos tridimensionales en la pantalla, pero parece que lo que hago no puede cambiar la situación mundial ni mejorar la vida de la gente, y realmente no entiendo de dónde proviene mi sentido de logro.

△
Esta es la "Tong Lao", conocida en todo el mundo de la gráfica, con una profunda capacidad académica pero con la ternura y la curiosidad de un niño.
También es apropiado.
IA para divertirse
Se puede decir que, en el campo de la gráfica, solo una estrella unicornio como Meshy puede compararse con Tong Xin en este punto.
Meshy es la primera empresa fundada por Hu Yuanming después de obtener su doctorado en el MIT, y su propósito es sencillo: convertir texto e imágenes en modelos 3D.
Actualmente, Meshy cuenta con 12 millones de usuarios, y sus clientes abarcan la mitad de las empresas con mayor capitalización y valoración mundial.
En julio de este año, Meshy completó una ronda de financiación B de casi 400 millones de dólares, con una valoración posterior a la inversión superior a 10.000 millones de yuanes chinos.
Estableció récords mundiales en la financiación individual más grande y la valoración más alta en el campo global de IA 3D, convirtiéndose en la empresa con la valoración más alta en este sector.
Sin embargo, ya sea un crecimiento más rápido o una valoración más alta, aún son demasiado específicos en comparación con la visión de Meshy.
Hu Yuanming, fundador de Meshy.ai, campeón de 400 metros en los Juegos Deportivos Escolares de la Escuela Media de Yangzhou, segundo premio en el concurso de canto de la clase Yao de Tsinghua, doctor en gráficos por computadora del MIT, nominado al mejor trabajo de doctorado de SIGGRAPH, autor del lenguaje y compilador Taichi.

△
Él planteó un objetivo que parece un poco especial:
IA para divertirse.
Su cadena lógica es así.
En el futuro, cuando la IAG resuelva una gran cantidad de problemas de productividad, la humanidad solo tendrá un problema central.
¿Cómo creamos, expresamos y nos conectamos? ¿Sobre todo, cómo obtenemos significado?
Leer, viajar, jugar videojuegos, ver series cortas... estos actividades ciertamente nos generan alegría, pero en una era en la que el tiempo libre es tan abundante, "ciertamente buscaremos formas más novedosas y eficaces de generar alegría y sentido".
Este enfoque está destinado a ser impulsado por IA.
Por lo tanto, "usar la IA para brindar alegría y sentido a los humanos será uno de los problemas más importantes de los próximos cinco años".
Y Meshy quiere ser el pieza más crucial de este panorama.


En palabras de Hu Yuanming, lo que buscan hacer es "redefinir la gráfica mediante IA generativa, encontrando la solución óptima global para materializar la imaginación."
¿Qué significa esto?
En otras palabras, hoy en día, AI 3D no solo debe hacer que la IA complete modelado, texturizado y renderizado de manera más eficiente bajo la guía de la gráfica.
A largo plazo, el fin último de la IA 3D podría ser la materialización de la imaginación.
Esta perspectiva prospectiva se alinea muy bien con la filosofía de Tong Xin.
En 2016, Tong Xin propuso resolver el problema de la producción de contenido gráfico para everyone y everywhere, permitiendo que cualquier persona en cualquier lugar cree contenido de medios visuales.
Hoy, diez años después, “everyone everywhere crea contenido de medios visuales” se ha convertido en “permitir que cualquier persona convierta una sola frase en una experiencia inmersiva e interactiva”.
This is certainly a grand aspiration.
Para lograrlo, Meshy actualmente está realizando investigaciones técnicas fundamentales en tres niveles:
Primero, y lo más importante: reinventar la gráfica.
Para ello, es necesario salir del óptimo local de la tubería de renderizado gráfico en la gráfica de red anterior y utilizar IA para crear una solución global óptima que no dependa del "triángulo", que es la unidad mínima que la GPU utiliza para renderizar objetos tridimensionales.

△
En segundo lugar, se debe establecer el sistema de dirección.
Si la nueva gráfica se asemeja más a un equipo de producción, entonces se necesita un sistema de dirección complementario para lograr AI for Fun.
Este sistema de dirección se encarga de establecer los mecanismos de funcionamiento del mundo y el esqueleto 3D, permitiendo la escritura en tiempo real del guion.
Finalmente, la infraestructura.
Es necesario una infraestructura de generación y renderizado 3D con baja latencia, alta calidad de imagen y bajo costo, ya que incluso un leve retraso en la experiencia de AI for Fun se amplifica cientos de veces.
Para ello, es necesario rediseñar una infraestructura de alto rendimiento, lo cual está directamente relacionado con la tesis doctoral de Hu Yuanming y la base del lenguaje de programación Taichi desarrollado al inicio de Meshy.
Además de estas investigaciones básicas, el nuevo modelo de Meshy también aborda puntos específicos de dificultad en el campo actual de la IA 3D.
Por ejemplo, el problema de "control", es decir, si los resultados generados son fieles a la imagen de entrada, manifestado en la precisión de las proporciones generales, la razonabilidad de la distribución espacial y la fidelidad en la reproducción de los detalles superficiales.
El 10 de agosto de este año, Meshy lanzó Meshy-7, dando un gran paso adelante en la alineación geométrica (geometry alignment), específicamente:
En cuanto a los personajes orgánicos, el modelo puede reproducir detalles como expresiones faciales, estructura anatómica y arrugas de la piel;
En superficies duras y piezas mecánicas, cada componente cae con precisión en la posición indicada en la imagen, y los componentes adyacentes no se adhieren entre sí;
En cuanto al texto y los patrones, el texto grabado en relieve y los diseños en bajorrelieve son claros y limpios, ideales para aplicaciones industriales como la grabación láser.
Debería decirse que la exploración de Meshy en estas direcciones se alinea con los intereses de Tong Xin, cuyas líneas de investigación recientes se encuentran en la intersección entre la generación 3D y la generación de video.
Como planteó en 2024 esa pregunta clásica: "¿Es la tercera dimensión solo un caso especial de generación de video?"
Es decir, si un video ya puede "ver" un objeto desde cualquier ángulo, ¿todavía es necesario construir explícitamente su modelo tridimensional?
The answer is not yet clear.
But what is clear right now is that Tong Xin's cutting-edge research and engineering expertise in AI multimodal training can take Meshy's explorations even further.
Mora: Más allá del modelo mundial
En el momento de redactar este artículo, Hu Yuanming publicó nuevamente el nuevo trabajo del equipo Meshy, Mora, en su propio canal de WeChat.
Mora es la abreviatura de "Multimodal Open-world Real-time Architecture", que significa "arquitectura en tiempo real de mundo abierto multimodal".
Esto es bastante interesante; todos pueden probar el demo del juego interactivo generado con él.
En pocas palabras, está compuesto por tres piezas de rompecabezas:
Agente de codificación, utilizado para generar el esqueleto del mundo del juego y el código de ejecución;
Generación 3D, que es la pieza más importante de Meshy, se puede utilizar para enriquecer el esqueleto y generar señales de control para modelos de video;
Modelo de video, recibe señales de escena 3D y genera la imagen final y el efecto de sonido.
Hu Yuanming described this as a technology "beyond world models."
Qué gran afirmación, ¿cómo piensas superarlo?
Recuerde en enero de este año, Google Genie 3 lanzó una demo interactiva, afirmando que "es un modelo de mundo general que permite a los usuarios generar entornos reales explorables mediante texto".
Por esto, Unity cayó un 24% en un día, Roblox cayó un 27%, el mercado está demasiado entusiasmado: en el futuro, no se necesitarán motores de juegos para hacer juegos, con un modelo de video bastará.
Sin embargo, después de más de un año jugando con todos los demos de modelos del mundo disponibles en el mercado,胡渊鸣 enumeró ocho deficiencias de casi todos los modelos de video interactivo actuales.
Incluye baja coherencia, interacción simple, capacidad de cálculo físico limitada, duración de experiencia corta, incapacidad para soportar tramas y lógica compleja, enfoque principal en juego individual, incapacidad para aprovechar la capacidad de generación mediante codificación y alta latencia.
En una palabra, es difícil de jugar.
Sin embargo, es muy probable que este no sea un problema que se pueda resolver solo con optimización.
Los modelos de video actuales no poseen verdadera inteligencia; en esencia, son solo renderizadores, y si se sigue por este camino, finalmente solo se logrará un simulador de paseos.
La estrategia de Mora es hacer lo contrario: si los modelos de video no pueden resolver la consistencia espacial en 3D, entonces que se enfoquen en hacer bien lo que les corresponde.
Deja que el agente de codificación construya la estructura, que Meshy genere el 3D y finalmente que el modelo de video produzca la escena; así, el espacio será estable, refinado y divertido.

Se puede ver que el jefe Hu es realmente un jugador experimentado y muy apasionado.
Sin embargo, Mora 1 aún se encuentra en una etapa muy inicial.
Solo se utiliza para validar un marco. Luego, dentro de este marco, se aproxima al objetivo paso a paso mediante escalado.
Volviendo a la pregunta de Tong Xin, ¿es la generación tridimensional solo un caso especial de generación de video?
Mora dio una respuesta preliminar: al menos en el momento actual, ambos no necesitan ser sustitutos; pueden desempeñar sus respectivas funciones bajo la conexión de un agente de codificación.
Esta respuesta, por supuesto, aún está lejos de ser precisa, pero hasta aquí, la pregunta ya se ha vuelto borrosa.
Esta sensación no es extraña para Tong Xin.
Durante dos o tres décadas, presenció una y otra ola de impactos tecnológicos: antes, dibujar en 3D dependía completamente de reglas escritas a mano; luego llegaron las redes neuronales de renderizado, y la IA aprendió la luz y la sombra a partir de fotos; llegó la IA generativa, y las imágenes realistas ya no dependieron de la tubería 3D; llegaron los modelos de video, e incluso hicieron posible que mundos dinámicos surgieran de la nada…
Nuevas tecnologías cuestionan una y otra vez los límites de la gráfica tradicional: ¿de qué forma debería seguir existiendo la gráfica?
Ante esta problemática cada vez más urgente, Tong Xin partió nuevamente.
Él quiere crear una nueva gráfica junto con los jóvenes más imaginativos de esta generación.
Este artículo proviene del canal de WeChat "Quantum Bit", autor: Cheng Qian
