Bậc thang tiếp theo của sự đổi mới AI đang tập trung vào tạo dựng 3D.
Từ sinh học đa mô态, mô hình thế giới, đến trí thông minh không gian, robot trí thông minh thể chất…
3D đang trở thành động cơ cốt lõi của AI thế hệ tiếp theo.
Và bây giờ, bậc thầy trong lĩnh vực đồ họa và công ty nổi bật nhất trên phân khúc AI 3D đã hợp tác với nhau.
Tin mới nhất:
Tong Xin đã chính thức gia nhập Meshy do Hu Yuanming sáng lập.
Hồ Viên Minh đại hội đồng tẩu
The latest news reports that Tong Xin will assume the role of Chief Scientist at AI 3D company Meshy, responsible for formulating Meshy’s long-term research strategy.
Điều này có thể có nghĩa là hai thế hệ nghiên cứu viên tiêu biểu nhất của cộng đồng đồ họa Hoa Kỳ—Hồ Viên Minh, người sáng lập Meshy, và Đồng Tân—sẽ cùng nhau thúc đẩy sự đột phá trong mô hình thế giới đa phương thức và hệ thống tương tác thời gian thực.
Tong Xin trước đây đã làm việc tại Phòng thí nghiệm Nghiên cứu Á Châu của Microsoft trong 25 năm, trong đó từng dẫn đầu nhóm Đồ họa mạng và đảm nhiệm vai trò Đối tác Nghiên cứu Toàn cầu.
Các hướng nghiên cứu của họ bao gồm đồ họa máy tính và thị giác máy tính ba chiều, cụ thể hơn bao gồm nhưng không giới hạn ở việc bắt và mô hình hóa chất liệu, tổng hợp kết cấu, xử lý và mô hình hóa hình học ba chiều, phân tích và mô phỏng truyền ánh sáng, vẽ thực tế, hoạt hình khuôn mặt ba chiều.

△
Đồ họa máy tính, nói một cách đơn giản, quan tâm đến việc “làm thế nào để tạo ra, thao tác và hiển thị thế giới ba chiều trong máy tính”.
Lĩnh vực này có vị trí nền tảng trong game, phim ảnh và mô phỏng công nghiệp, và hiện nay ngày càng trở thành hạ tầng cho nhận thức và biểu đạt của AI.
Vì không hiểu ba chiều, AI sẽ khó thực sự hiểu và tiếp cận thế giới vật lý.
Và Đồng Tân là một trong những học giả gắn bó lâu nhất và tích lũy sâu sắc nhất trong hướng này.
Năm 1999, Đồng Tân vừa tốt nghiệp tiến sĩ tại Đại học Thanh Hoa đã gia nhập Viện Nghiên cứu Microsoft Trung Quốc, nơi mới thành lập chưa đầy một năm và sau này được gọi là "Huangpu Quân trường của giới công nghệ Trung Quốc" – Viện Nghiên cứu Microsoft Châu Á.
Trong hơn hai mươi năm qua, nơi đây đã đào tạo ra vô số nhân vật cốt lõi ảnh hưởng đến cục diện nghiên cứu máy tính của Trung Quốc乃至 toàn cầu—nhưng đó là một câu chuyện khác.
Là một trong những nhà nghiên cứu đầu tiên của Viện Nghiên cứu Châu Á, Đồng Tân đã làm việc ở đây suốt 25 năm, từ nhà nghiên cứu tiến lên vị trí Đối tác Nghiên cứu Toàn cầu và Trưởng nhóm Đồ họa Mạng.
Đã chứng kiến gần như mọi khoảnh khắc quan trọng của đồ họa máy tính Trung Quốc.

△
Trong thời gian này, Tong Xin đã công bố rất nhiều bài báo trên các tạp chí và hội nghị hàng đầu, với hơn 21.000 lần trích dẫn trên Google Scholar.
Những nghiên cứu kỹ thuật này đã để lại cho Microsoft nhiều tài sản quý giá, bao gồm API phát triển trò chơi Xbox, phần mềm tương thích Xbox, trình điều khiển in 3D Windows và bộ công cụ phát triển đồ họa Direct3D, v.v.
Ngoài ra, Đồng Tân còn để lại cho Nhóm Đồ họa Mạng của Viện Nghiên cứu Á Đông một “tài sản” khác: một đội ngũ đủ mạnh để trở thành lực lượng cốt cán của cộng đồng đồ họa Hoa ngữ hiện nay.
Trong 25 năm, ông đã hợp tác, trao đổi và hướng dẫn từng thế hệ các nhà nghiên cứu xuất sắc tại đây.
Chu Khôn từ Đại học Chiết Giang, ACM Fellow, IEEE Fellow, Giám đốc Phòng thí nghiệm Quốc gia CAD&CG, đã hợp tác lâu năm với Đồng Tân, từ in 3D, thiết kế tính toán đến NeRF và render thần kinh;
Hứa Khôn, Phó giáo sư thường trực tại Khoa Máy tính, Đại học Thanh Hoa, Nhà khoa học xuất sắc quốc gia, đã hợp tác nhiều lần với Đồng Tân trong thời gian học tiến sĩ để công bố các bài báo tại SIGGRAPH;
Wang Pengshuai của Đại học Bắc Kinh, trợ lý giáo sư tại Viện Wang Xuan, đã làm việc dưới sự lãnh đạo của Tong Xin từ khi còn là thực tập sinh đến nay là nhà nghiên cứu cấp cao, hiện đã trở thành học giả tiêu biểu trong lĩnh vực học tập hình học ba chiều…
Những người từng làm việc cùng anh ấy thường có đánh giá về Đồng Tân rất nhất quán:
Dễ gần, luôn ở tuyến đầu, có thể thảo luận nghiêm túc về các vấn đề kỹ thuật cực kỳ chi tiết và giải thích rõ ràng các vấn đề kỹ thuật phức tạp bằng ngôn ngữ đơn giản.
Vì theo Đồng Tân, đồ họa máy tính là một ngành ứng dụng máy tính, do đó, mọi vấn đề nghiên cứu đều xuất phát từ nhu cầu thực tế và sự xuất hiện của các thiết bị mới, dữ liệu mới.
Ngoài ra, Đồng Tân cũng rất hài hước và thú vị, ví dụ như anh ấy mô tả nghiên cứu của mình như sau:
Gia đình tôi ngoài việc công nhận món ăn tôi nấu, thường đùa rằng tôi每天都对着屏幕上的三维茶壶、兔子甘之如饴自High不已,但看起来我做的事情大不能改变世界局势,小不能提高百姓生活,实在不明白我的成就感来自哪里。

△
Đây chính là “Đồng Lão” nổi tiếng khắp giới đồ họa, sở hữu năng lực học thuật sâu sắc nhưng lại mang vẻ thân thiện và tò mò như một đứa trẻ.
Cũng khá phù hợp.
“AI để vui vẻ”
Có thể nói, đến bước này trong lĩnh vực đồ họa, chỉ có những công ty khởi nghiệp nổi bật như Meshy mới có thể sánh ngang với Đồng Tân.
Meshy là công ty đầu tiên mà Hu Yuanming thành lập sau khi tốt nghiệp tiến sĩ tại MIT, với định vị đơn giản là biến văn bản và hình ảnh thành mô hình 3D.
Hiện tại, Meshy đã thu hút 12 triệu người dùng, với khách hàng bao gồm một nửa trong số các doanh nghiệp có vốn hóa và định giá cao nhất thế giới.
Tháng 7 năm nay, Meshy đã hoàn thành vòng gọi vốn B gần 4 tỷ USD, với định giá sau vòng gọi vốn vượt quá 10 tỷ nhân dân tệ.
Đã thiết lập hai kỷ lục toàn cầu về quy mô vòng gọi vốn và định giá trong lĩnh vực AI 3D, trở thành công ty có định giá cao nhất trong lĩnh vực này.
Tuy nhiên, dù là tốc độ tăng trưởng nhanh hơn hay định giá cao hơn, thì so với tầm nhìn của Meshy, chúng vẫn quá cụ thể.
Hu Yuanming, người sáng lập Meshy.ai, vô địch 400 mét tại giải thể thao trường trung học Dương Châu, giải nhì cuộc thi hát của lớp Yao tại Thanh Hoa, tiến sĩ ngành đồ họa máy tính tại MIT, đề cử bài luận tiến sĩ xuất sắc nhất SIGGRAPH, tác giả của ngôn ngữ và trình biên dịch Taichi.

△
Anh ấy đã đưa ra một mục tiêu nghe có vẻ hơi đặc biệt:
AI để vui vẻ.
Chuỗi lập luận của anh ấy là như vậy.
Trong tương lai, khi AGI giải quyết được rất nhiều vấn đề về năng suất, loài người sẽ chỉ còn lại một vấn đề cốt lõi.
Chúng ta sẽ tạo ra, biểu đạt và kết nối như thế nào? Quan trọng nhất, chúng ta sẽ tìm kiếm ý nghĩa như thế nào?
Đọc sách, du lịch, chơi game, xem các bộ phim ngắn... những điều này thực sự có thể mang lại niềm vui cho chúng ta, tuy nhiên, trong một thời đại mà thời gian tự do dồi dào như vậy, chúng ta “chắc chắn sẽ tìm kiếm những cách thức tạo ra niềm vui và cảm giác ý nghĩa mới mẻ, hiệu quả hơn.”
Cách thức này chắc chắn sẽ được điều khiển bởi AI.
Vì vậy, “việc sử dụng AI để mang lại niềm vui và cảm giác ý nghĩa cho con người sẽ là một trong những vấn đề quan trọng nhất trong năm năm tới”.
Còn Meshy, muốn trở thành mảnh ghép quan trọng nhất trong bức tranh này.


Theo lời của Hồ Viên Minh, họ đang làm là “tái định hình đồ họa dựa trên AI sinh thành, tìm ra giải pháp toàn cục tối ưu để hiện thực hóa những tưởng tượng.”
Điều này có nghĩa là gì?
Nói cách khác, hôm nay AI 3D không chỉ đơn thuần giúp AI thực hiện hiệu quả hơn các tác vụ mô hình hóa, ánh xạ và hiển thị dưới sự hướng dẫn của đồ họa học.
Trong dài hạn, kết cục cuối cùng của AI 3D có thể là hiện thực hóa những tưởng tượng.
Góc nhìn tiên phong này rất phù hợp với triết lý của Tong Xin.
Năm 2016, Đồng Tân đã đề xuất giải quyết vấn đề "everyone" và "everywhere" trong sản xuất nội dung đồ họa, cho phép bất kỳ ai ở bất kỳ đâu đều có thể tạo ra nội dung phương tiện trực quan.
Hôm nay, mười năm sau, “mọi người mọi nơi tạo nội dung truyền thông trực quan” đã trở thành “giúp bất kỳ ai chỉ cần một câu để biến tưởng tượng thành một thế giới có thể bước vào và tương tác”.
Đây chắc chắn là một mong muốn rất lớn lao.
Để thực hiện điều này, Meshy hiện đang tiến hành các nghiên cứu kỹ thuật nền tảng trên ba cấp độ:
Đầu tiên, và quan trọng nhất—tái phát minh đồ họa.
Để làm điều này, cần vượt ra khỏi giải pháp tối ưu cục bộ trong đường ống hiển thị đồ họa của đồ họa mạng trước đây, và sử dụng AI để xây dựng lại một giải pháp tối ưu toàn cầu không phụ thuộc vào "tam giác" — đơn vị nhỏ nhất mà GPU sử dụng để hiển thị đối tượng ba chiều.

△
Thứ hai, cần xây dựng hệ thống đạo diễn.
Nếu đồ họa mới giống như một ê-kíp quay phim, thì cần có hệ thống đạo diễn đi kèm để thực hiện AI for Fun.
Hệ thống đạo diễn này chịu trách nhiệm thiết lập cơ chế vận hành của thế giới và khung xương 3D, đồng thời thực hiện việc biên soạn kịch bản theo thời gian thực.
Cuối cùng là cơ sở hạ tầng.
Cơ sở hạ tầng tạo và hiển thị 3D với độ trễ thấp, chất lượng hình ảnh cao và chi phí thấp là cần thiết, vì ngay cả một giây gián đoạn nhỏ cũng sẽ được khuếch đại hàng trăm lần trong trải nghiệm AI for Fun.
Để làm điều này, cần thiết kế lại một hạ tầng hiệu suất cao, và điều này hoàn toàn nhất quán với luận án tiến sĩ của Hồ Viên Minh và nền tảng ngôn ngữ lập trình Taichi được phát triển trong giai đoạn đầu của Meshy.
Ngoài những nghiên cứu cơ bản này, mô hình mới của Meshy cũng đang giải quyết những điểm nghẽn cụ thể trong lĩnh vực AI 3D hiện nay.
Ví dụ như vấn đề “khả năng kiểm soát”, tức là kết quả tạo ra có trung thành với hình ảnh đầu vào hay không, thể hiện qua độ chính xác của tỷ lệ tổng thể, tính hợp lý của phân bố không gian và mức độ tái hiện chi tiết bề mặt.
Vào ngày 10 tháng 8 năm nay, Meshy đã ra mắt Meshy-7, tiến một bước lớn trong hướng tối ưu hóa sự căn chỉnh hình học (geometry alignment), cụ thể:
Về các yếu tố hữu cơ, mô hình có thể tái tạo chi tiết biểu cảm khuôn mặt, cấu trúc giải phẫu và nếp nhăn da;
Về bề mặt cứng và các bộ phận cơ khí, các bộ phận có thể chính xác rơi vào vị trí được chỉ định trong hình ảnh, các bộ phận kế cận không dính vào nhau;
Về văn bản và hoa văn, các chữ khắc lõm và họa tiết nổi rõ ràng, sạch sẽ, có thể sử dụng trực tiếp trong các ứng dụng công nghiệp như khắc laser.
Nên nói rằng, sự khám phá của Meshy trong những hướng này trùng hợp với sự quan tâm của Đồng Tân, khi hướng nghiên cứu gần đây của nó đang nằm ở giao điểm giữa 3D và sinh video.
Như câu hỏi kinh điển mà anh ấy đưa ra vào năm 2024: “Liệu ba chiều có chỉ là một trường hợp đặc biệt của việc tạo video?”
Nghĩa là, nếu một đoạn video đã có thể “nhìn thấy” một vật thể từ mọi góc độ, liệu chúng ta còn cần phải xây dựng mô hình ba chiều của nó một cách rõ ràng không?
Câu trả lời vẫn chưa rõ ràng.
Tuy nhiên, điểm chắc chắn hiện tại là những nghiên cứu tiên tiến và tích lũy kỹ thuật của Đồng Tân trong lĩnh vực huấn luyện đa mô hình AI có thể đưa những khám phá của Meshy đi xa hơn nữa.
Mora: Vượt ra ngoài mô hình thế giới
Ngay khi bài viết này được hoàn thành, Hu Yuanming đã công bố công việc mới của đội ngũ Meshy, Mora, trên公众号 của mình.
Mora là viết tắt của “Multimodal Open-world Real-time Architecture”, nghĩa là “Kiến trúc thời gian thực thế giới mở đa mô态”.
Điều này khá thú vị, mọi người có thể trải nghiệm demo trò chơi tương tác được tạo ra bằng nó.
Nói một cách đơn giản, nó bao gồm ba mảnh ghép:
Agent mã hóa, dùng để tạo khung thế giới trò chơi và mã chạy;
Tạo 3D, tức là mảnh ghép quan trọng nhất của Meshy, có thể được sử dụng để làm phong phú thêm khung xương và tạo tín hiệu điều khiển cho mô hình video;
Mô hình video, tiếp nhận tín hiệu cảnh 3D, đầu ra hình ảnh và âm thanh cuối cùng.
Hu Yuanming described this as a technology that "goes beyond world models."
Nói to vậy, vậy thì vượt qua thế nào?
Còn nhớ vào tháng 1 năm nay, Google Genie 3 đã ra mắt bản demo có thể chơi, tuyên bố rằng “đây là một mô hình thế giới tổng quát, cho phép người dùng tạo ra các môi trường thực tế có thể khám phá bằng văn bản”.
Vì vậy, Unity giảm 24% trong một ngày, Roblox giảm 27%, thị trường quá hưng phấn: tương lai làm game không cần engine game nữa, chỉ cần một mô hình video là đủ.
Tuy nhiên, sau hơn nửa năm trải nghiệm tất cả các bản demo mô hình thế giới trên thị trường, Hồ Viên Minh đã chỉ ra tám nhược điểm của hầu hết các mô hình video tương tác hiện nay.
Bao gồm độ nhất quán yếu, tương tác đơn giản, khả năng giải quyết vật lý yếu, thời gian trải nghiệm ngắn, không thể hỗ trợ cốt truyện và logic phức tạp, chủ yếu chơi một mình, không thể tận dụng khả năng sinh tạo cơ chế của Coding, độ trễ cao.
Nói tóm lại, rất khó chơi.
Tuy nhiên, đây rất có thể không phải là một vấn đề có thể giải quyết chỉ bằng cách tối ưu hóa.
Các mô hình video hiện tại không thực sự có trí thông minh; về bản chất, chúng chỉ là trình render, và nếu tiếp tục theo hướng này, cuối cùng chỉ có thể tạo ra các mô phỏng đi dạo.
Con đường của Mora là làm ngược lại: nếu mô hình video không thể giải quyết tính nhất quán không gian 3D, thì hãy để nó làm tốt những gì nó nên làm.
Để Coding agent tạo khung xương, Meshy tạo 3D, sau đó mô hình video tạo cảnh, như vậy không gian sẽ vừa ổn định, tinh tế, lại vừa có thể tương tác.

Rõ ràng ông Hồ là một người chơi kỳ cựu rất đam mê.
Tuy nhiên, Mora 1 hiện vẫn đang ở giai đoạn rất sớm.
Nó chỉ được sử dụng để xác minh một khung. Sau đó, trong khung này, từng bước tiếp cận mục tiêu thông qua việc mở rộng quy mô.
Từ đó quay lại câu hỏi của Đồng Tân, liệu ba chiều có chỉ là một trường hợp đặc biệt của sinh video?
Mora đã đưa ra câu trả lời ban đầu: ít nhất hiện tại, cả hai không cần phải là mối quan hệ thay thế, mà có thể cùng hoạt động song song dưới sự kết nối của agent mã hóa.
Câu trả lời này tất nhiên vẫn chưa chính xác, nhưng đến đây, vấn đề đã trở nên mờ nhạt.
Cảm giác này không xa lạ với Đồng Tân.
Trong hai ba thập kỷ, ông đã chứng kiến từng đợt tác động công nghệ liên tiếp: trước đây, vẽ 3D hoàn toàn dựa vào quy tắc viết tay, sau đó công nghệ neural rendering xuất hiện, AI học được ánh sáng và bóng đổ từ ảnh; đến khi AI sinh ra xuất hiện, hình ảnh chân thực không còn phụ thuộc vào quy trình 3D; rồi mô hình video ra đời, thậm chí còn có thể tạo ra thế giới động từ hư không...
Các công nghệ mới liên tục đặt câu hỏi về ranh giới của đồ họa truyền thống: Đồ họa nên tồn tại dưới hình thức nào tiếp theo?
Đối mặt với vấn đề ngày càng cấp bách này, Đồng Tân lại một lần nữa lên đường.
Anh ấy muốn cùng thế hệ trẻ giàu trí tưởng tượng nhất này tạo ra một đồ họa mới.
Bài viết này đến từ tài khoản chính thức WeChat “Quantum Bit”, tác giả: Cheng Qian
