Le prochain frontière de l'innovation en IA se concentre sur la génération 3D.
De la génération multimodale et des modèles du monde à l'intelligence spatiale et aux robots d'intelligence incarnée...
3D devient le moteur central de la prochaine génération d'IA.
Et maintenant, le maître incontesté du domaine de la graphisme et l'entreprise la plus en vue sur le segment de l'IA 3D s'unissent.
Dernières nouvelles :
Tong Xin a officiellement rejoint Meshy, fondée par Hu Yuanming.
Réunion des maîtres de Hu Yuanming
Selon les dernières informations, Tong Xin assumera le poste de scientifique en chef chez Meshy, une entreprise d'IA 3D, et sera chargé de définir la stratégie de recherche à long terme de Meshy.
Cela pourrait signifier que les deux générations les plus représentatives de la communauté chinoise en graphisme informatique — Hu Yuanming, fondateur de Meshy, et Tong Xin — collaboreront pour faire progresser les modèles de mondes multimodaux et les systèmes d'interaction en temps réel.
Tong Xin a travaillé pendant 25 ans au Microsoft Research Asia, où elle a dirigé le groupe de graphiques réseau et a occupé le poste de partenaire de recherche mondial.
Ses domaines de recherche couvrent l'infographie informatique et la vision informatique tridimensionnelle, notamment, sans s'y limiter : la capture et la modélisation des matériaux, la synthèse de textures, le traitement et la modélisation géométrique tridimensionnels, l'analyse et la simulation du transfert de lumière, le rendu réaliste, ainsi que l'animation tridimensionnelle du visage.

△
L'informatique graphique, simplifiée, s'intéresse à la manière de créer, manipuler et afficher un monde tridimensionnel dans un ordinateur.
Ce domaine occupe une position fondamentale dans les jeux vidéo, le cinéma et la simulation industrielle, et devient de plus en plus l'infrastructure de la perception et de l'expression de l'IA.
Après tout, sans comprendre les trois dimensions, l'IA ne peut pas véritablement comprendre ni pénétrer le monde physique.
Tong Xin est l'un des chercheurs ayant le plus longue expérience et la plus grande profondeur dans ce domaine.
En 1999, Tong Xin vient de terminer son doctorat à Tsinghua et rejoint le laboratoire de recherche Microsoft en Chine, créé depuis moins d’un an, qui deviendra plus tard l’Institut de recherche Microsoft en Asie, surnommé « l’École militaire de la technologie chinoise ».
Pendant plus de vingt ans, de nombreuses figures clés ayant influencé la recherche informatique en Chine et dans le monde entier ont émergé ici — mais c’est une autre histoire.
En tant que l'un des premiers chercheurs de l'Institut de recherche asiatique, Tong Xin est resté ici pendant 25 ans, passant du poste de chercheur à celui de partenaire de recherche mondial et responsable du groupe Graphique réseau.
A presque assisté à tous les moments importants de l'informatique graphique en Chine.

△
Pendant cette période, Tong Xin a publié de nombreux articles dans des revues et conférences de premier plan, avec plus de 21 000 citations sur Google Scholar.
Ces recherches techniques ont laissé à Microsoft de nombreux éléments précieux, notamment les API de développement de jeux Xbox, les logiciels compatibles Xbox, les pilotes d’impression 3D Windows et le kit de développement graphique Direct3D, entre autres.
En outre, Tong Xin a également laissé à l'équipe de graphisme de l'Institut de recherche Yayan un autre « héritage » : un groupe de talents suffisamment nombreux pour constituer la colonne vertébrale de la communauté chinoise en graphisme actuelle.
Pendant 25 ans, il a collaboré, échangé et encadré une série d'excellents chercheurs ici.
Zhou Kun de l'Université Zhejiang, ACM Fellow et IEEE Fellow, directeur du laboratoire national clé en CAD&CG, a collaboré pendant de nombreuses années avec Tong Xin, explorant depuis l'impression 3D et la conception computationnelle jusqu'au NeRF et au rendu neuronal ;
Xu Kun de Tsinghua, professeur titulaire au département d'informatique de l'Université Tsinghua, lauréat du programme National Excellent Young Scientist, a collaboré à plusieurs reprises avec Tong Xin pendant son doctorat pour publier des articles dans SIGGRAPH ;
Wang Pengshuai de l'Université de Pékin, assistant professeur à l'Institut Wang Xuan, a travaillé sous la direction de Tong Xin depuis son stage jusqu'à devenir chercheur senior et est aujourd'hui un chercheur de référence dans le domaine de l'apprentissage géométrique 3D…
Les personnes ayant travaillé avec lui évaluent souvent Tong Xin de manière étonnamment cohérente :
Accessibles, toujours sur le terrain, capables de mener des discussions rigoureuses sur des questions techniques très détaillées, tout en expliquant clairement les problèmes complexes en termes simples.
Selon Tong Xin, la synthèse d'images par ordinateur est une discipline d'application informatique, ce qui signifie que toutes les questions de recherche proviennent des besoins pratiques et de l'apparition de nouveaux appareils et de nouvelles données.
En outre, Tong Xin est aussi très humoristique ; par exemple, il décrit ainsi sa recherche :
Ma famille, en dehors de reconnaître les plats que je prépare, se moque souvent en disant que je me réjouis énormément chaque jour devant des théières 3D et des lapins à l’écran, mais il semble que ce que je fais ne change ni la situation mondiale ni le quotidien des gens ; je ne comprends vraiment pas d’où vient mon sentiment d’accomplissement.

△
C'est la "Tonglao", connue de tous dans le domaine de la graphique, possédant une expertise académique exceptionnelle, tout en conservant une chaleur et une curiosité d'enfant.
C'est aussi approprié.
« L’IA pour le plaisir »
On peut dire que, dans le domaine de la graphique, peu d’acteurs, comme la startup star Meshy, peuvent être comparés à Tong Xin à ce stade.
Meshy est la première entreprise fondée par Hu Yuanming après avoir obtenu son doctorat au MIT, et son positionnement est simple : transformer du texte et des images en modèles 3D.
Actuellement, Meshy compte 12 millions d'utilisateurs et sert la moitié des dix entreprises les plus valorisées au monde.
En juillet de cette année, Meshy a réalisé un financement de série B d'environ 4 milliards de dollars américains, avec une valorisation post-financement dépassant 10 milliards de yuans chinois.
A établi deux records mondiaux pour le financement et la valorisation lors d’un seul tour de financement dans le domaine mondial de l’IA 3D, devenant ainsi la société la plus valorisée dans ce secteur.
Cependant, que ce soit une croissance plus rapide ou une évaluation plus élevée, cela reste trop spécifique par rapport à la vision de Meshy.
Hu Yuanming, fondateur de Meshy.ai, champion du 400 mètres des Jeux sportifs du lycée de Yangzhou, deuxième prix au concours de chant de la classe Yao de Tsinghua, docteur en informatique graphique du MIT, nominé pour le meilleur mémoire de doctorat SIGGRAPH, auteur du langage et du compilateur Taichi.

△
Il a énoncé un objectif qui semble un peu particulier :
IA pour le plaisir.
Sa chaîne de raisonnement est la suivante.
À l'avenir, lorsque l'IGA aura résolu un grand nombre de problèmes de productivité, l'humanité ne se retrouvera plus qu'avec un seul problème fondamental.
Comment créons-nous, exprimons-nous et nous connectons-nous ? Plus important encore, comment trouvons-nous du sens ?
Lire, voyager, jouer à des jeux, regarder des courtes séries… Ces activités apportent effectivement du bonheur, mais dans une ère où le temps libre est si abondant, nous « chercherons inévitablement de nouvelles façons plus efficaces de générer du bonheur et un sentiment de sens ».
Ce mode de fonctionnement sera inévitablement piloté par l'IA.
Ainsi, « utiliser l'IA pour apporter bonheur et sens à l'humanité sera l'une des questions les plus importantes des cinq prochaines années ».
Et Meshy souhaite devenir la pièce la plus cruciale de ce puzzle.


Selon les mots de Hu Yuanming, ils visent à « redéfinir la graphique grâce à l'IA générative et à trouver la solution globalement optimale pour concrétiser l'imagination. »
What does this mean?
Autrement dit, aujourd'hui, AI 3D ne se contente pas de permettre à l'IA de réaliser plus efficacement la modélisation, le texturage et le rendu sous la direction de la graphique.
À long terme, l’aboutissement de l’IA 3D pourrait être la concrétisation de l’imagination.
Cette perspective prospective s'aligne bien avec les valeurs de Tong Xin.
En 2016, Tong Xin a proposé de résoudre les problèmes « everyone » et « everywhere » de la production de contenu graphique, permettant à n'importe qui, n'importe où, de créer du contenu multimédia visuel.
Dix ans plus tard, « everyone everywhere crée du contenu médiatique visible » est devenu « permettre à n'importe qui de transformer une seule phrase en une expérience immersive et interactive ».
C'est certainement un vœu très ambitieux.
Pour y parvenir, Meshy mène actuellement des recherches technologiques fondamentales sur trois niveaux :
D'abord, et surtout — réinventer la graphique.
Pour cela, il faut sortir de la solution optimale locale des pipelines de rendu graphique issus des graphismes réseau passés, et utiliser l'IA pour créer une solution optimale globale ne reposant pas sur le « triangle », qui est l'unité minimale de rendu 3D par GPU.

△
Ensuite, il faut mettre en place le système de direction.
Si la nouvelle graphique ressemble davantage à une équipe de tournage, alors un système de réalisation associé est nécessaire pour réaliser l'IA pour le plaisir.
Ce système de réalisation est chargé de définir les mécanismes de fonctionnement du monde et le squelette 3D, permettant l'écriture en temps réel du scénario.
Enfin, l'infrastructure.
Une infrastructure de génération et de rendu 3D à faible latence, haute qualité visuelle et coût réduit est nécessaire, car même un léger ralentissement est amplifié des centaines de fois dans l'expérience AI for Fun.
Pour cela, il faut redessiner une infrastructure haute performance, ce qui s'inscrit directement dans la lignée de la thèse de doctorat de Hu Yuanming et de la base du langage Taichi développée au début de l'aventure Meshy.
En dehors de ces études fondamentales, le nouveau modèle de Meshy aborde également les points bloquants actuels du domaine de l'IA 3D.
Par exemple, le problème de « contrôlabilité », c’est-à-dire la fidélité des résultats générés par rapport à l’image d’entrée, se manifeste par la précision des proportions globales, la rationalité de la distribution spatiale et le niveau de restitution des détails de surface.
Le 10 août de cette année, Meshy a lancé Meshy-7, accomplissant une avancée majeure dans le domaine de l'alignement géométrique (geometry alignment), notamment :
En ce qui concerne les personnages organiques, le modèle peut reconstituer les détails tels que les expressions faciales, la structure anatomique et les plis de la peau ;
Sur les surfaces dures et les pièces mécaniques, chaque composant tombe précisément à l'emplacement indiqué par l'image, et les composants adjacents ne collent pas entre eux ;
Les textes en gravure creuse et les motifs en relief sont nets et propres, directement utilisables dans des applications industrielles telles que la gravure au laser.
Il faut souligner que les recherches de Meshy dans ces domaines s'alignent sur les intérêts de Tong Xin, dont les orientations de recherche récentes se situent à l'intersection de la génération 3D et vidéo.
Comme il l'a posé en 2024, cette question classique : « Le 3D n'est-il qu'un cas particulier de génération vidéo ? »
Autrement dit, si une vidéo permet déjà de « voir » un objet sous n'importe quel angle, est-il encore nécessaire d'en construire explicitement un modèle 3D ?
La réponse n'est pas encore claire.
Mais ce qui est certain à ce jour, c’est que les recherches de pionnier et l’expérience technique de Tong Xin dans le domaine de l’entraînement multimodal en IA peuvent pousser les explorations de Meshy bien plus loin.
Mora : Au-delà du modèle mondial
Au moment où cet article est rédigé, Hu Yuanming a publié sur son公众号 un nouveau travail de l'équipe Meshy, Mora.
Mora est l'abréviation de « Multimodal Open-world Real-time Architecture », ce qui signifie « architecture temps réel ouverte et multimodale ».
C'est assez intéressant, tout le monde peut découvrir la démo de jeu interactif générée avec.
En bref, il se compose de trois pièces de puzzle :
Agent de codage, utilisé pour générer le squelette du monde de jeu et le code d'exécution ;
La génération 3D, soit le morceau le plus important de Meshy, peut être utilisée pour enrichir les squelettes et générer les signaux de contrôle pour les modèles vidéo ;
Modèle vidéo, reçoit des signaux de scènes 3D, génère l'image finale et les effets sonores.
Hu Yuanming describes this as a technology "beyond world models."
Tu as de grandes prétentions, mais comment comptes-tu dépasser ?
Rappelez-vous en janvier de cette année, Google Genie 3 a lancé une démonstration interactive, affirmant être « un modèle universel de monde permettant aux utilisateurs de générer des environnements réels explorables à l'aide de texte ».
Unity a chuté de 24 % en une journée, Roblox de 27 %, le marché est trop excité : il ne faudra plus d' moteurs de jeu pour créer des jeux, un modèle vidéo suffira.
Cependant, après avoir testé pendant plus d'un an tous les démos de modèles du monde disponibles sur le marché, Hu Yuanming a pointé huit défauts majeurs des modèles de vidéos interactives actuels.
Faible cohérence, interaction simple, capacité de calcul physique limitée, durée d'expérience courte, impossibilité de prendre en charge des intrigues et des logiques complexes, jeu principalement en solo, incapacité à exploiter les mécanismes de génération par codage, latence élevée.
En bref, c'est difficile à jouer.
Cependant, il est très probable que ce ne soit pas un problème résolvable par optimisation.
Les modèles vidéo actuels ne possèdent pas véritablement d'intelligence ; ils ne sont en réalité qu'un moteur de rendu, et en poursuivant sur cette voie, on ne finira que par créer un simulateur de promenade.
La stratégie de Mora consiste à faire l'inverse : puisque les modèles vidéo ne peuvent pas résoudre la cohérence spatiale 3D, qu'ils se concentrent simplement sur ce qu'ils sont censés faire.
Laissez l'agent Coding créer la structure, Meshy générer le 3D, puis le modèle vidéo produire les images : ainsi, l'espace est à la fois stable, raffiné et interactif.

Il est évident que le patron Hu est un joueur expérimenté très passionné.
Cependant, Mora 1 est encore à un stade très précoce.
Il sert uniquement à valider un cadre. Ensuite, sous ce cadre, on s'approche progressivement de l'objectif grâce au scaling.
En revenant à la question de Tong Xin, la dimension trois n'est-elle qu'un cas particulier de génération vidéo ?
Mora a fourni une réponse initiale : au moins pour le moment, les deux n'ont pas besoin d'être en substitution l'une de l'autre ; elles peuvent jouer leurs rôles respectifs sous la coordination d'un agent de codage.
Cette réponse est bien sûr loin d'être exacte, mais en arrivant ici, la question est devenue floue.
Ce sentiment n'est pas étranger à Tong Xin.
Au cours des deux à trois dernières décennies, il a vécu une série de bouleversements technologiques : autrefois, la création de contenus 3D reposait entièrement sur des règles écrites à la main, puis la rendu neuronal est arrivé, permettant à l’IA d’apprendre la lumière et les ombres à partir de photos ; avec l’IA générative, des images réalistes ne dépendent plus des pipelines 3D ; puis les modèles vidéo sont apparus, capables de faire émerger des mondes dynamiques de rien…
Les nouvelles technologies interrogent sans cesse les limites de la graphique traditionnelle : sous quelle forme la graphique doit-elle continuer à exister ?
Face à cette question de plus en plus urgente, Tong Xin est reparti une fois de plus.
Il veut créer une nouvelle graphique avec la génération la plus imaginative de jeunes.
Cet article provient du compte officiel WeChat « Quantum Bit », auteur : Cheng Qian
