Ang sumusunod na malaking taas ng pagkakabuo sa AI ay nagtatarget sa 3D generation.
Mula sa multimodal generation, world models, hanggang sa spatial intelligence at embodied intelligent robots…
3D, na nagsisilbing pangunahing motor ng susunod na henerasyon ng AI.
At ngayon, ang mga lider sa larangan ng graphics at ang pinakamainam na kompanya sa AI 3D赛道, nagtutulungan.
Pinakabagong balita:
Tong Xin ay opisyal na sumali sa Meshy, na itinatag ni Hu Yuanming.
Pagkikita ng mga tagapag-ugnay ni Hu Yuanming
Ayon sa pinakabagong balita, si Tong Xin ay magiging Chief Scientist ng AI 3D company na Meshy, na responsable sa pagbuo ng matagalang panahon na estratehiya sa pananaliksik ng Meshy.
Maaaring ibig sabihin nito na ang dalawang pinakamakabuluhang henerasyon ng mga siyentipiko sa larangan ng Chinese computer graphics—si Hu Yuanming, ang tagapagtatag ng Meshy, at si Tong Xin—ay magkakasama upang ipagpatuloy ang pagpapalago sa pagbuo ng multimodal na mundo at mga real-time interactive system.
Noong nakaraan, nagtrabaho si Tong Xin sa Microsoft Asia Research Institute nang 25 taon, kung saan siya ay nangunguna sa Network Graphics Group at naging Global Research Partner.
Ang kanyang larangan ng pag-aaral ay kasama ang computer graphics at three-dimensional computer vision, partikular na kabilang ang pagkuha at pagbuo ng materyales, pagbuo ng texture, pagproseso at pagbuo ng three-dimensional geometry, pagsusuri at simulasyon ng light transport, photorealistic rendering, at three-dimensional facial animation.

△
Ang computer graphics, sa simpleng salita, ay tumutok sa "paano lumikha, manipulahin, at ipakita ang three-dimensional world sa loob ng computer".
Ang larangang ito ay may pangunahing papel sa mga laruan, pelikula, at industriyal na simulasyon, at sa kasalukuyan ay patuloy na naging batayan ng AI sa pagpapansin at pagpapahayag.
Sa katotohanan, kung hindi nauunawaan ng AI ang tatlong dimensyon, mahihirapan ito na talagang maunawaan at makapasok sa pisikal na mundo.
Si Tong Xin naman ay isa sa mga akademiko na pinakamahabang panahon nangumiti at nagkaroon ng pinakamalalim na pagkakaunawa sa direksyong ito.
Noong 1999, agad nangumha si Tong Xin sa Microsoft China Research Institute, na itinatag nang higit sa isang taon lamang, matapos makatapos sa kanyang doktorado sa Tsinghua University—na kilala ngayon bilang Microsoft Asia Research Institute, o “West Point ng teknolohiya sa Tsina.”
Sa loob ng higit sa dalawampung taon, maraming pangunahing tauhan na nag-impluwensya sa pag-aaral ng kompyuter sa China at sa buong mundo ang lumabas dito—ngunit iyon ay ibang kuwento.
Bilang isa sa mga unang research fellow ng Asian Research Institute, nanatili si Tong Xin dito ng 25 taon, mula sa research fellow hanggang sa pagiging global research partner at puno ng Network Graphics Group.
Nakakasaksi sa halos lahat ng mahahalagang sandali sa Chinese computer graphics.

△
Sa panahong ito, nag-publish ang Tong Xin ng maraming papel sa mga pinakamataas na journal at konperensya, at ang kanyang mga pag-angkat sa Google Scholar ay hihigit sa 21,000.
Ang mga teknikal na pag-aaral na ito ay nag-iwan ng maraming magagandang bagay para sa Microsoft, kabilang ang Xbox game development API, Xbox compatibility software, Windows 3D printing driver, at ang Direct3D graphics development toolkit, atbp.
Dagdag pa ni Tong Xin ang isa pang “may-ari” para sa Network Graphics Group ng Yayan: isang hanay ng mga propesyonal na sapat na makapagsuporta sa pangunahing puwersa ng Chinese graphics community ngayon.
Sa loob ng 25 taon, nagtrabaho, nagkukwento, at nagturo siya sa isang serye ng mga karapat-dapat na mga mananaliksik.
Si Zhou Kun mula sa Zhejiang University, ACM Fellow, IEEE Fellow, at Punong-tagapamahala ng National Key Laboratory ng CAD&CG, na nagtrabaho nang mahabang panahon kasama ang Tong Xin, mula sa 3D printing at computational design hanggang sa NeRF at neural rendering;
Si Xu Kun mula sa Tsinghua, pangmatagalang associate professor sa Department ng Computer Science ng Tsinghua University, at recipient ng National Excellent Young Scientist Award, ay nagtrabaho nang maraming beses kasama ang Tong Xin habang nag-aaral ng doktorato at nag-publish ng mga papel sa SIGGRAPH;
Si Wang Pengshuai mula sa Peking University, assistant professor sa Institute ng Wang Xuan ng Peking University, na nagsimula bilang intern at umabot sa posisyon ng senior researcher sa ilalim ni Tong Xin, at ngayon ay isang kilalang eksperto sa larangan ng 3D geometric learning…
Ang mga taong nagtrabaho kasama niya, ang kanilang pagtataya kay Tong Xin ay karaniwang magkakatulad:
Makabago, laging nasa harapan, kayang magdiskut ng mahigpit tungkol sa pinakamaliit na teknikal na detalye, at kayang ipaliwanag ang mga kumplikadong teknikal na isyu sa madaling salita.
Sa pananaw ni Tong Xin, ang computer graphics ay isang aplikasyon ng kompyuter, kaya ang lahat ng mga problema sa pag-aaral ay nagmumula sa tunay na pangangailangan at sa pagkakaroon ng mga bagong device at bagong data.
Bukod dito, si Tong Xin ay lubos na nakakatawa at mapagpatawa, halimbawa, ganito niya isinalarawan ang kanyang pag-aaral:
Kahit na kilala ng aking pamilya ang pagkain ko, madalas nilang sinasabi nang may tawa na bawat araw akong nakikinig sa 3D teapot at rabbit sa screen at nasisiyahan nang sobra, ngunit tila hindi ko kayang baguhin ang pandaigdigang sitwasyon, o kahit paano ay mapabuti ang buhay ng mga tao. Hindi ko maintindihan kung saan galing ang aking pakiramdam ng pagkamit.

△
Ito ang kilalang “Tong Lao” sa larangan ng grafika, may malalim na akademikong kakayahan ngunit may kawalan ng pagkakapag-isa at pagkakaintindi na katulad ng isang bata.
Maaari rin itong maging angkop.
“AI para sa Kaligayahan”
Maaaring sabihin na sa larangan ng graphics, ang mga katulad ni Tong Xin ay limitado lamang sa mga star unicorn tulad ng Meshy.
Ang Meshy ay ang unang kumpanyang itinatag ni Hu Yuanming pagkatapos ng kanyang doktorado sa MIT, at ang kanyang posisyon ay simpleng gawin ang mga teksto at larawan bilang 3D models.
Kasalukuyan, may 12 milyong user ang Meshy, na kumakalat sa kalahati ng mga kompanya sa top 10 sa buong mundo batay sa market capitalization at valuation.
Noong July ng taong ito, natapos ng Meshy ang kanyang B-round ng pagsasapalaran na halos $4 bilyon, na may post-money valuation na higit sa ¥10 bilyon.
Nakapagtagumpay sa dalawang rekord sa buong mundo sa larangan ng AI 3D: pinakamalaking pondo sa isang pagsasama at pinakamataas na valuation, gawing pinakamataas na valuation na kompanya sa larangan.
Gayunpaman, anumang mas mabilis na paglago o mas mataas na valuation, ay mas espesipiko kaysa sa pangarap ng Meshy.
Hu Yuanming, tagapagtatag ng Meshy.ai, tagapagpanalo sa 400-meter ng school sports meet ng Yangzhou High School, pangalawang gantimpala sa kanta ng清华姚班, doktor sa computer graphics ng MIT, nangalap na nominasyon sa pinakamahusay na doktoral na papel sa SIGGRAPH, may-akda ng wika at compiler na Taichi.

△
Isinampa niya ang isang layunin na may tila espesyal:
AI para sa Kaligayahan.
Ganito ang kanyang lohikal na serye.
Sa hinaharap, pagkatapos ng AGI ay lutasin ang malaking bilang ng mga problema sa produktibidad, ang tao ay may iisang pangunahing problema na natitira.
Paano natin gagawin, ipapakita, at iuugnay? Sa huli, paano natin makakakuha ng kahulugan?
Basahin, biyahe, laruin ang mga laro, bisitahin ang mga maikling dula... totoo na ito ay nakakagawa ng kasiyahan, ngunit sa isang panahon kung saan ang libreng oras ay sobrang puno, “tutok tayong humahanap ng mas bago at mas epektibong paraan upang makalikha ng kasiyahan at pakiramdam ng kahulugan.”
Ang ganitong paraan, ay inaasahang idedebelop ng AI.
Kaya, "ang paggamit ng AI upang magdala ng kasiyahan at pakiramdam ng kahulugan sa mga tao ay isa sa mga pinakamahalagang isyu sa susunod na limang taon."
At ang Meshy, nais maging ang pinakamahalagang piraso sa larawang ito.


Ayon kay Hu Yuanming, ang kanilang layunin ay “muling ibuhos ang graphics sa pamamagitan ng generative AI upang makahanap ng global optimum na solusyon para gawing tunay ang imahinasyon.”
Ano ang ibig sabihin nito?
Sa madaling salita, sa ngayon, ang AI 3D ay hindi lang naglalayong gawing mas epektibo ang AI sa paggawa ng model, texturing, at rendering sa ilalim ng direksyon ng graphics.
Sa matagalang panahon, ang katapusan ng AI 3D ay maaaring ang pagkakaroon ng mga imahinasyon.
Ang pananaw na ito ay malapit sa paniniwala ni Tong Xin.
Noong 2016, ipinangako ni Tong Xin na lutasin ang problema ng “everyone” at “everywhere” sa paggawa ng graphic content, upang makapaglikha ng anumang uri ng visual media content kahit saan ang sinumang tao.
Sa araw na ito, sampung taon na ang nakalipas, ang “everyone everywhere creating visual media content” ay naging “pagsasalin sa anumang tao ng isang pangarap sa isang makikita at interaktibong mundo gamit ang isang pangungusap lamang.”
Ito ay siguradong isang malaking pangarap.
Upang makamit ito, kasalukuyang nagpapatupad ang Meshy ng mga pangunahing teknikal na pag-aaral sa tatlong antas:
Una, at pinakamahalaga—muling inimbento ang graphics.
Para dito, kailangan lumabas sa lokal na optimal na solusyon sa nakaraang graphics pipeline ng network graphics, at gamitin ang AI upang lumikha ng isang bagong global na optimal na solusyon na hindi nakabatay sa “triangle,” kung saan ang “triangle” ay ang pinakamaliit na yunit ng GPU para sa pag-render ng 3D objects.

△
Sa pangalawa, kailangan mong itayo ang director system.
Kung ang bagong graphics ay mas katulad ng isang production team, kailangan ng isang kaukulang system ng director upang maisakatuparan ang AI for Fun.
Ang director system na ito ang responsable sa pagbuo ng mekanismo ng mundo at ang 3D skeleton, upang maisagawa ang real-time paggawa ng skrip.
Huling sa imprastraktura.
Kailangan ng isang infrastruktura para sa 3D generation at rendering na may mababang latency, mataas na kalidad ng imahe, at mababang gastos, dahil kahit anumang sandaling paghinto ay maaaring mapalaki ng mga daan-daang beses sa karanasan ng AI for Fun.
Para dito, kailangan ng pag-redesign ng isang mataas na performance na infra, at ito ay nagpapatuloy sa doktorado ni Hu Yuanming at sa mga pundasyon ng Taichi programming language na ginawa noong simula ng Meshy.
Sa labas ng mga pangunahing pag-aaral, ang bagong modelo ng Meshy ay nagtatagpo rin ng mga tiyak na hamon sa kasalukuyang AI 3D na larangan.
Halimbawa ang isyu ng “kontrolabilidad”, kung saan ang resulta ng pagbuo ay nagtataglay ng katotohanan sa orihinal na imahe, na ipinapakita sa tamang proporsyon, makatotohanang distribusyon ng espasyo, at antas ng pagbabalik ng detalye sa surface.
Noong Agosto 10, 2023, inilabas ng Meshy ang Meshy-7, na nagdala ng malaking hakbang sa direksyon ng geometry alignment, partikular na:
Sa mga organic na elemento, ang modelo ay nakakapagbalik ng detalye tulad ng mga ekspresyon ng mukha, anatomiya, at mga wrinkles sa balat;
Sa mga hard surface at mechanical parts, ang bawat komponent ay maaaring makarating nang tama sa posisyon na ibinigay ng imahe, at ang mga kapitbahay na komponent ay hindi nagkakadikit.
Sa mga teksto at disenyo, ang mga imprinted na teksto at relief patterns ay malinaw at malinis, at direktang gamitin sa mga industriyal na aplikasyon tulad ng laser engraving.
Dapat ipahiwatig na ang pag-aaral ni Meshy sa mga direksyong ito ay nagkakatugma sa interes ni Tong Xin, na ang kanyang mga kamakailang direksyon sa pag-aaral ay nasa krus ng 3D at video generation.
Tulad ng kanyang itinatanong noong 2024: “Ang 3D ay isang espesyal na kaso lang ba ng video generation?”
Kaya, kung isang video ay kaya nang “makita” ang isang bagay mula sa anumang pananaw, kailangan pa ba naming gawing eksplisito ang kanyang 3D model?
Ang sagot ay hindi pa malinaw.
Ngunit ang tiyak na punto sa kasalukuyan ay ang maunlad na pag-aaral at teknikal na karanasan ni Tong Xin sa AI multimodal training, na makakapagdala sa mga pag-aaral ni Meshy sa mas malalayong lugar.
Mora: Labas sa Mundo ng Modelos
Sa panahon ng pagkakasulat ng artikulong ito, ipinahayag ni Hu Yuanming ang bagong proyekto ng tim ng Meshy, ang Mora, sa kanyang public account.
Ang Mora ay isang abbreviation para sa "Multimodal Open-world Real-time Architecture", na nangangahulugan ng "Multimodal Open-world Real-time Architecture".
Kamangmangan ito, maaaring subukan ng lahat ang interactive game demo na ito.
Sa simpleng termino, ito ay binubuo ng tatlong piraso ng puzzle:
Coding agent, ginagamit upang lumikha ng mga balangkas ng mundo sa laro at mga code na nagpapatakbo;
3D generation, ang pinakamahalagang piraso ng Meshy, ay maaaring gamitin upang mapalawak ang skeleton at maglabas ng control signal para sa video model;
Video model, tumatanggap ng 3D scene signal, naglalabas ng final frame at audio effects.
Sinabi ni Hu Yuanming na ito ay isang teknolohiya na “naglalampas sa mga mundo model”.
Malakas ang boses, paano ba ito aabotin?
Tandaan mo ba noong Enero ng taong ito, ang Google Genie 3 ay naglabas ng isang interactive demo, na nag-claim na “isang pangkalahatang mundo model na nagpapahintulot sa mga user na gumawa ng mga tunay na kapaligiran na maaaring masuri gamit ang teksto”?
Dahil dito, bumaba ang Unity ng 24% sa isang araw, at ang Roblox ay bumaba ng 27%; sobrang excited ang merkado: hindi na kailangan ng game engine para gumawa ng mga laro, sapat na ang isang video model.
Ngunit matapos ang mahigit isang taon, pagkatapos ng pagsubok ni Hu Yuanming sa lahat ng demo ng mundo sa merkado, sinabi niya ang walong kakulangan sa mga kasalukuyang interactive video model.
Kasama ang mahinang konsistensya, simpleng interaksyon, mahinang physical computing capability, maikling oras ng pagkaranas, hindi kayang suportahan ang kuwento at komplikadong lohika, pangunahing isang laro, hindi kayang gamitin ang mechanism ng Coding para sa pagbuo, at mataas na latency.
Sa isang salita, mahirap laruin.
Gayunpaman, malamang ay hindi ito isang problema na maaaring lutasin sa pamamagitan ng pag-optimize.
Ang mga umiiral na modelo ng video ay hindi talaga may talino; sila ay本质上是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是是 is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is is a renderer, at kung susundin mo ang landas na ito, magtatapos ka lamang sa paggawa ng simulator ng paglalakad.
Ang landas ng Mora ay kabaligtaran: kung ang video model ay hindi kayang lutasin ang 3D spatial consistency, gawin nito ang tamang gawain nito.
Gawin ng Coding agent ang balangkas, gawin ng Meshy ang 3D, at huli ay gawin ng video model ang mga imahe, upang ang espasyo ay magiging matatag, maalab, at maaaring laruin.

Nakikita na talaga na si Ginoong Hu ay isang napakaseryoso at matandang player.
Ngunit ang Mora 1 ay kasalukuyang nasa napakasimulang yugto pa.
Ito ay ginagamit lamang upang patunayan ang isang framework. Pagkatapos, sa ilalim ng framework na ito, haharapin ang layunin sa pamamagitan ng scaling.
Bumabalik sa tanong ni Tong Xin, ang 3D ay isang espesyal na kaso lang ba ng video generation?
Binigay ni Mora ang isang unang sagot: sa kasalukuyan, hindi kailangang magpalitan ang dalawa; maaari silang magkaroon ng sariling papel sa ilalim ng pagkakasundo ng Coding agent.
Ang sagot na ito ay tiyak na hindi pa tiyak, ngunit sa puntong ito, ang tanong ay naging malabo na.
Hindi bagay sa童欣 ang ganitong pakiramdam.
Sa loob ng dalawampu't tatlong taon, siya ay naging saksi sa bawat siklo ng teknolohikal na pagbabago: dati, ang paggawa ng 3D ay ganap na nakabatay sa pagsusulat ng mga patakaran, pagkatapos ay dumating ang neural rendering, at natutunan ng AI ang liwanag at anino mula sa mga larawan; dumating ang generative AI, at hindi na kailangan ng 3D pipeline para sa mga realistiko na imahe; dumating ang video models, at kahit na nagpapalabas ng isang dinamikong mundo mula sa wala...
Ang bawat bagong teknolohiya ay paulit-ulit na tinatawag ang hangganan ng tradisyonal na graphics: paano dapat patuloy na umiiral ang graphics?
Sa harap ng mas makapangyarihang tanong na ito, muli nang umalis si Tong Xin.
Gusto niyang maglikha ng isang bagong graphics kasama ang pinakamalikhaing henerasyon ng mga kabataan.
Nakukuha ang artikulong ito mula sa WeChat public account na "Quantum Bit", may-akda: Cheng Qian
