Pelopor Grafis Tong Xin Bergabung dengan Meshy untuk Meningkatkan AI untuk Bersenang-senang

icon MarsBit
Bagikan
AI summary iconRingkasan
Berita AI + kripto pecah ketika Tong Xin, seorang ahli grafis komputer top, bergabung dengan Meshy sebagai Ilmuwan Kepala. Ia akan berkolaborasi dengan pendiri Hu Yuanming untuk mengembangkan model dunia multimodal dan sistem interaksi real-time. Tong membawa pengalaman 25 tahun dari Microsoft Asia Research, yang berfokus pada Xbox APIs dan Direct3D. Meshy, perusahaan AI 3D terkemuka, telah mengumpulkan dana $400 juta dalam putaran B, dengan valuasi melebihi RMB 10 miliar. Berita tentang aset dunia nyata (RWA) semakin mendapat perhatian seiring konvergensi AI dan blockchain.

Tingkat berikutnya dari inovasi AI sedang berkumpul di generasi 3D.

Dari generasi multimodal, model dunia, hingga kecerdasan spasial, robot kecerdasan tubuh...

3D, sedang menjadi mesin inti generasi berikutnya dari AI.

Sekarang, tokoh legendaris di bidang grafika dan perusahaan paling diminati di lintasan AI 3D, bergabung.

Berita terbaru:

Tong Xin secara resmi bergabung dengan Meshy yang didirikan oleh Hu Yuanming.

Pertemuan Besar Hu Yuanming Tonglao

Menurut kabar terbaru, Tong Xin akan menjabat sebagai Ilmuwan Utama di perusahaan AI 3D Meshy, bertanggung jawab atas penyusunan strategi penelitian jangka panjang Meshy.

Ini mungkin berarti dua generasi peneliti paling representatif di bidang grafika Tiongkok—Hu Yuanming, pendiri Meshy, dan Tong Xin—akan bersama-sama mendorong terobosan dalam model dunia multimodal dan sistem interaktif real-time.

Tong Xin sebelumnya bekerja di Microsoft Research Asia selama 25 tahun, di mana ia memimpin kelompok grafis jaringan dan menjabat sebagai mitra penelitian global.

Bidang penelitiannya mencakup grafik komputer dan visi komputer tiga dimensi, khususnya meliputi, namun tidak terbatas pada, penangkapan dan pemodelan material, sintesis tekstur, pemrosesan dan pemodelan geometri tiga dimensi, analisis dan simulasi transmisi cahaya, rendering realistis, serta animasi wajah tiga dimensi.

Meshy

Ilmu komputer grafis, secara sederhana, berfokus pada "bagaimana menciptakan, mengelola, dan menampilkan dunia tiga dimensi di dalam komputer".

Bidang ini memiliki posisi mendasar dalam game, film, dan simulasi industri, dan kini semakin menjadi infrastruktur persepsi dan ekspresi AI.

Setelah semua, tanpa memahami tiga dimensi, AI akan sulit benar-benar memahami dan memasuki dunia fisik.

Dan Tong Xin adalah salah satu akademisi yang paling lama menanamkan akar dan memiliki paling banyak pengalaman di bidang ini.

Pada tahun 1999, Tong Xin baru saja lulus dari program doktoral di Tsinghua University dan bergabung dengan Microsoft China Research Institute, yang baru berdiri kurang dari satu tahun, dan kemudian dikenal sebagai "Akademi Militer Ilmu Pengetahuan dan Teknologi Tiongkok"—Microsoft Asia Research Institute.

Selama lebih dari dua puluh tahun, banyak tokoh kunci yang memengaruhi tatanan penelitian komputer di Tiongkok bahkan secara global telah lahir di sini—namun itu adalah cerita lain.

Sebagai salah satu peneliti pertama di Institut Penelitian Asia, Tong Xin telah tinggal di sini selama 25 tahun, naik dari peneliti hingga menjadi mitra risiko global dan kepala grup grafik jaringan.

Hampir menyaksikan semua momen penting dalam grafik komputer Tiongkok.

Meshy

Selama periode ini, Tong Xin menerbitkan banyak makalah di jurnal dan konferensi terkemuka, dengan sitasi di Google Scholar melebihi 21.000 kali.

Penelitian teknis ini meninggalkan banyak hal berguna bagi Microsoft, termasuk API pengembangan game Xbox, perangkat lunak kompatibel Xbox, driver pencetakan 3D Windows, serta toolkit pengembangan grafis Direct3D, dan lainnya.

Selain itu, Tong Xin juga meninggalkan satu "aset" lain bagi Grup Grafis Network Akademi Ya: sekelompok kekuatan inti yang cukup kuat untuk mendukung bidang grafika Tiongkok saat ini.

Selama 25 tahun, ia bekerja sama, berkomunikasi, dan membimbing sejumlah besar peneliti hebat di sini.

Zhou Kun dari Zhejiang University, ACM Fellow, IEEE Fellow, dan Direktur Laboratorium Nasional Utama CAD&CG, telah bekerja sama dengan Tong Xin selama bertahun-tahun, mengeksplorasi dari pencetakan 3D dan desain komputasional hingga NeRF dan rendering neural;

Xu Kun dari Tsinghua University, profesor tetap di Departemen Ilmu Komputer Tsinghua University, penerima Penghargaan Nasional untuk Ilmuwan Muda Unggul, pernah berkolaborasi beberapa kali dengan Tong Xin selama masa PhD dalam menerbitkan paper SIGGRAPH;

Wang Pengshuai dari Universitas Peking, asisten profesor di Institut Wang Xuan, telah berada di bawah kepemimpinan Tong Xin sejak masa magang hingga menjadi peneliti senior, dan kini merupakan tokoh utama di bidang pembelajaran geometri tiga dimensi…

Orang-orang yang pernah bekerja sama dengannya sering memberikan penilaian yang luar biasa konsisten tentang Tong Xin:

Ramah, selalu berada di garis depan, mampu membahas masalah teknis yang sangat rinci dengan ketat, serta menjelaskan masalah teknis yang kompleks dengan bahasa yang sederhana dan mudah dimengerti.

Karena menurut Tong Xin, grafika komputer adalah disiplin aplikasi komputer, sehingga semua masalah penelitian berasal dari kebutuhan nyata dan munculnya perangkat baru serta data baru.

Selain itu, Tong Xin juga sangat humoris, misalnya, ia menggambarkan penelitiannya sebagai berikut:

Selain mengakui masakan yang saya buat, keluarga saya sering bercanda bahwa saya setiap hari menikmati dan bersenang-senang sendiri dengan teko 3D dan kelinci di layar, tetapi tampaknya pekerjaan saya tidak mampu mengubah situasi dunia, apalagi meningkatkan kualitas hidup masyarakat—saya benar-benar tidak mengerti dari mana kepuasan saya berasal.

Meshy

Ini adalah "Tong Lao" yang dikenal luas di kalangan dunia grafika, memiliki keahlian akademis yang sangat mendalam, namun membawa kehangatan dan rasa ingin tahu seperti seorang anak-anak.

Juga tepat.

“AI untuk Bersenang-senang”

Dapat dikatakan bahwa Tong Xin telah mencapai tahap ini di dunia grafika, dan hanya perusahaan unicorn seperti Meshy yang dapat sepadan dengannya.

Meshy adalah perusahaan pertama yang didirikan oleh Hu Yuanming setelah menyelesaikan doktornya di MIT, dengan posisi yang sederhana, yaitu mengubah teks dan gambar menjadi model 3D.

Saat ini, Meshy telah mengumpulkan 12 juta pengguna, dengan pelanggan yang mencakup setengah dari perusahaan terbesar di dunia berdasarkan kapitalisasi pasar dan valuasi.

Pada Juli tahun ini, Meshy menyelesaikan putaran pendanaan Seri B senilai hampir 4 miliar dolar AS, dengan valuasi setelah investasi melebihi 10 miliar yuan Tiongkok.

Mencatat dua rekor sekaligus dalam pendanaan seri tunggal dan valuasi di bidang AI 3D global, menjadi perusahaan dengan valuasi tertinggi di bidang ini.

Namun, baik pertumbuhan yang lebih cepat maupun valuasi yang lebih tinggi, dibandingkan dengan visi Meshy, masih terlalu spesifik.

Hu Yuanming, pendiri Meshy.ai, juara 400 meter di pertandingan atletik sekolah menengah Yangzhou, peraih penghargaan kedua di kompetisi menyanyi kelas Yao di Tsinghua, doktor ilmu komputer grafis dari MIT, nominasi makalah doktor terbaik SIGGRAPH, pencipta bahasa dan kompiler Taichi.

Meshy

Dia mengajukan tujuan yang terdengar agak istimewa:

AI untuk Bersenang-senang.

Rantai logikanya seperti ini.

Di masa depan, setelah AGI menyelesaikan sejumlah besar masalah produktivitas, umat manusia hanya akan memiliki satu masalah inti.

Bagaimana kita menciptakan, mengekspresikan, dan terhubung? Yang paling penting, bagaimana kita akan memperoleh makna?

Membaca buku, bepergian, bermain game, menonton drama pendek... memang bisa menciptakan kebahagiaan bagi kita, namun di era di mana waktu luang begitu melimpah, kita "akan pasti mencari cara baru yang lebih inovatif dan lebih efektif untuk menghasilkan kebahagiaan dan rasa makna."

Cara seperti ini pasti akan didorong oleh AI.

Jadi, "menggunakan AI untuk membawa kebahagiaan dan rasa makna bagi manusia akan menjadi salah satu masalah terpenting dalam lima tahun ke depan".

Sedangkan Meshy ingin menjadi potongan teka-teki paling krusial dalam pemandangan ini.

Meshy

Meshy

Menurut Hu Yuanming, yang mereka lakukan adalah "meng重塑 grafika berdasarkan AI generatif, mencari solusi global optimal untuk mewujudkan imajinasi."

What does this mean?

Dengan kata lain, hari ini, AI 3D tidak hanya berfokus pada membuat AI lebih efisien dalam pemodelan, texturing, dan rendering di bawah bimbingan grafika.

Dalam jangka panjang, akhir dari AI 3D mungkin adalah manifestasi dari imajinasi.

Perspektif proaktif ini sangat selaras dengan filosofi Tong Xin.

Pada tahun 2016, Tong Xin mengusulkan untuk menyelesaikan masalah everyone dan everywhere dalam produksi konten grafis, sehingga siapa pun di mana pun dapat menciptakan konten media visual.

Sepuluh tahun kemudian, "everyone everywhere menciptakan konten media visual" berubah menjadi "memungkinkan siapa pun hanya dengan satu kalimat untuk mengubah imajinasi menjadi dunia yang dapat diakses dan interaktif".

Ini tentu saja harapan yang sangat besar.

Untuk mencapainya, Meshy saat ini sedang melakukan penelitian teknis dasar di tiga tingkatan:

Pertama dan yang paling penting—menciptakan ulang grafika.

Untuk itu, harus keluar dari solusi lokal optimal dalam pipeline rendering grafis jaringan masa lalu, dan menggunakan AI untuk menciptakan solusi global optimal baru yang tidak bergantung pada "segitiga", di mana "segitiga" adalah unit terkecil GPU dalam merender objek tiga dimensi.

Meshy

Kedua, bangun sistem direktur.

Jika grafika baru lebih seperti sebuah tim produksi, maka diperlukan sistem sutradara yang sesuai untuk mewujudkan AI for Fun.

Sistem direktur ini bertanggung jawab untuk menetapkan mekanisme operasi dunia dan kerangka 3D, serta mewujudkan penulisan naskah secara real-time.

Terakhir adalah infrastruktur.

Infrastruktur generasi dan rendering 3D dengan latensi rendah, kualitas gambar tinggi, dan biaya rendah diperlukan, karena bahkan gangguan sesaat pun dalam pengalaman AI for Fun akan diperbesar ratusan kali lipat.

Untuk itu, diperlukan desain ulang infrastruktur berperforma tinggi, yang secara konsisten sejalan dengan disertasi doktoral Hu Yuanming dan dasar bahasa pemrograman Taichi yang dibuat saat awal pendirian Meshy.

Di luar penelitian dasar ini, model baru Meshy juga menangani titik-titik kendala spesifik di bidang AI 3D saat ini.

Misalnya, masalah "kendali", yaitu sejauh mana hasil generasi setia terhadap gambar input, yang ditunjukkan oleh akurasi proporsi keseluruhan, kepatutan distribusi spasial, dan tingkat reproduksi detail permukaan.

Pada 10 Agustus tahun ini, Meshy meluncurkan Meshy-7, yang membuat kemajuan besar dalam arah geometry alignment, khususnya:

Dalam hal peran organik, model mampu mereproduksi detail ekspresi wajah, struktur anatomi, dan kerutan kulit;

Pada permukaan keras dan komponen mekanis, setiap komponen dapat jatuh tepat pada posisi yang ditentukan dalam gambar, dan komponen yang berdekatan tidak saling menempel;

Dalam hal teks dan pola, teks ukir cekung dan pola relief jelas dan bersih, sehingga langsung dapat digunakan dalam skenario industri seperti laser engraving.

Seharusnya dikatakan bahwa eksplorasi Meshy di bidang-bidang ini sejalan dengan fokus Tong Xin, yang arah penelitiannya dalam beberapa tahun terakhir berada di persimpangan 3D dan generasi video.

Seperti pertanyaan klasik yang dia ajukan pada tahun 2024: "Apakah tiga dimensi hanyalah kasus khusus dari generasi video?"

Artinya, jika sebuah video sudah dapat "melihat" suatu objek dari sudut mana pun, apakah masih perlu secara eksplisit membangun model tiga dimensinya?

Jawaban belum jelas.

Namun, yang pasti saat ini adalah bahwa penelitian mutakhir dan akumulasi teknis Tong Xin di bidang pelatihan multimodal AI dapat membawa eksplorasi Meshy ke tempat yang lebih jauh.

Mora: Melampaui Model Dunia

Pada saat artikel ini ditulis, Hu Yuanming kembali mempublikasikan karya baru tim Meshy, Mora, di公众号-nya.

Mora adalah singkatan dari "Multimodal Open-world Real-time Architecture", yang berarti "Arsitektur Real-time Dunia Terbuka Multimodal".

Ini cukup menarik, silakan coba demo game interaktif yang dihasilkan darinya.

Secara sederhana, ia terdiri dari tiga keping teka-teki:

Agen pemrograman, digunakan untuk menghasilkan kerangka dunia game dan kode runtime;

Generasi 3D, yang merupakan bagian paling penting dari Meshy, dapat digunakan untuk memperkaya kerangka, menghasilkan sinyal kontrol untuk model video;

Model video, menerima sinyal adegan 3D, menghasilkan gambar akhir dan efek suara.

Hu Yuanming menyebut ini sebagai teknologi "melampaui model dunia".

Kata-katamu besar, bagaimana caranya melebihi?

Masih ingat pada Januari tahun ini, Google Genie 3 meluncurkan demo interaktif, mengklaim bahwa "ini adalah model dunia universal yang memungkinkan pengguna membuat lingkungan nyata yang dapat dieksplorasi menggunakan teks."

Dengan demikian, Unity turun 24% dalam sehari, Roblox turun 27%, pasar terlalu antusias: nanti membuat game tidak perlu mesin game lagi, satu model video sudah cukup.

Namun, setelah lebih dari setengah tahun berlalu, Hu Yuanming telah mencoba semua demo model dunia yang tersedia di pasar, dan menyoroti delapan kelemahan utama pada hampir semua model video interaktif saat ini.

Termasuk konsistensi lemah, interaksi sederhana, kemampuan pemrosesan fisik lemah, durasi pengalaman singkat, tidak dapat mendukung alur cerita dan logika kompleks, berfokus pada permainan tunggal, tidak dapat memanfaatkan kemampuan generasi berbasis Coding, serta latensi tinggi.

Singkatnya, sulit dimainkan.

Namun ini kemungkinan besar bukan masalah yang bisa diselesaikan hanya dengan optimasi.

Model video yang ada saat ini sebenarnya tidak memiliki kecerdasan sejati; pada dasarnya, mereka hanyalah sebuah renderer, dan jika terus mengikuti jalur ini, pada akhirnya hanya akan menghasilkan simulator jalan-jalan.

Rute Mora adalah sebaliknya, jika model video tidak dapat menyelesaikan konsistensi ruang 3D, biarkan ia melakukan tugasnya sendiri.

Biarkan agen Coding membuat kerangka, biarkan Meshy menghasilkan 3D, lalu biarkan model video menghasilkan gambar, sehingga ruangnya stabil, halus, dan bisa dimainkan.

Meshy

Jelas bahwa Bos Hu adalah pemain lama yang sangat antusias.

Namun Mora 1 saat ini masih berada pada tahap yang sangat awal.

Ini hanya digunakan untuk memverifikasi sebuah kerangka. Kemudian, dalam kerangka ini, tujuan dicapai secara bertahap melalui scaling.

Dengan demikian, kembali ke pertanyaan Tong Xin, apakah tiga dimensi hanya merupakan kasus khusus dari generasi video?

Mora memberikan jawaban awal: setidaknya saat ini, keduanya tidak perlu bersifat saling menggantikan, dan dapat masing-masing menjalankan perannya melalui rangkaian agen Coding.

Jawaban ini tentu masih jauh dari pasti, tetapi sampai di sini, masalahnya pun telah menjadi kabur.

Perasaan ini tidak asing bagi Tong Xin.

Dalam dua hingga tiga dekade, ia menyaksikan gelombang demi gelombang dorongan teknologi: dulu, membuat 3D sepenuhnya bergantung pada aturan yang ditulis tangan, lalu muncul neural rendering, AI belajar cahaya dan bayangan dari foto; generative AI datang, membuat gambar realistis tidak lagi bergantung pada pipeline 3D; model video muncul, bahkan mampu menciptakan dunia dinamis dari ketiadaan...

Teknologi baru terus-menerus menguji batas-batas grafika tradisional: bagaimana bentuk yang seharusnya dimiliki grafika untuk terus eksis?

Menghadapi masalah yang semakin mendesak ini, Tong Xin kembali berangkat.

Dia ingin bersama generasi muda paling imajinatif saat ini untuk menciptakan grafika baru.

Artikel ini berasal dari akun WeChat "Quantum Bit", penulis: Cheng Qian

Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini. Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.