グラフィックスパイオニアのトウ・シンがMeshyに参加し、AIを楽しく進化させます

icon MarsBit
共有
AI summary icon概要
トップのコンピュータグラフィックス専門家であるトウ・シンが、Meshyのチーフサイエンティストとして加入し、AIと暗号通貨のニュースが注目を集めました。彼は創設者の胡元明と協力し、マルチモーダルワールドモデルとリアルタイムインタラクションシステムの推進にあたります。トウはマイクロソフトアジアリサーチで25年にわたり、Xbox APIやDirect3Dの開発に従事してきました。AI 3D分野のリーディングカンパニーであるMeshyは、Bラウンドで4億ドルを調達し、100億元人民元以上の評価額を達成しました。AIとブロックチェーンの融合により、リアルワールドアセット(RWA)に関するニュースが注目を集めています。

AIの次なる革新の高地は、3D生成に向かって集まっている。

マルチモーダル生成、ワールドモデル、空間知能、エンボディード知能ロボットまで…

3Dは、次世代AIのコアエンジンとなっています。

そして今、グラフィックス分野の巨匠と、AI 3D分野で最も注目を集めるスタートアップが手を組みました。

最新情報:

童欣が、胡淵鳴が設立したMeshyに正式に加入しました。

胡淵鳴童姥大会師

最新の情報によると、童欣はAI 3D企業Meshyのチーフサイエンティストに就任し、Meshyの長期的な研究戦略を策定します。

これは、中国のコンピュータグラフィックス分野を代表する二世代の研究者であるMeshyの創設者であるHu YuanmingとTong Xinが、マルチモーダルワールドモデルとリアルタイムインタラクティブシステムの突破を共に推進することを意味する可能性がある。

童欣は以前、マイクロソフトアジア研究院で25年間勤務し、ネットワークグラフィックスチームを率い、グローバルリサーチパートナーを務めた。

研究分野はコンピュータグラフィックスおよび三次元コンピュータビジョンをカバーし、具体的には、マテリアルのキャプチャとモデリング、テクスチャ合成、三次元ジオメトリ処理とモデリング、光伝搬の解析とシミュレーション、リアルなレンダリング、三次元顔アニメーションを含みます。

Meshy

コンピュータグラフィックスは、簡単に言えば、「コンピュータ内で3次元の世界をどのように作成し、操作し、表示するか」に注目しています。

この分野はゲーム、映画、産業シミュレーションにおいて基盤的な地位を占めており、現在ではさらにAIの認識と表現のインフラとして重要性を増しています。

結局、三次元を理解できないと、AIは物理世界を真正に理解し、入り込むことはできない。

一方、童欣は、この分野で最も長く深く研究を積んできた学者の一人である。

1999年、童欣は清华大学で博士号を取得した直後に、設立から1年にも満たないマイクロソフト中国研究院、すなわち後に「中国科技界の黄埔軍校」と呼ばれるマイクロソフトアジア研究院に入社した。

ここでは、過去20年以上にわたり、中国乃至世界のコンピュータ研究の構図に大きな影響を与えた数多くの核心的人物が育まれました——しかし、それはまた別の話です。

童欣作为亞研院的第一批研究員,在此工作了25年,從研究員逐步晉升為全球研究合夥人兼網絡圖形組負責人。

中国のコンピュータグラフィックスのほぼすべての重要な瞬間を目の当たりにしてきた。

Meshy

この期間中に童欣は多くの論文をトップジャーナルおよびトップ会議に発表し、Google Scholarの引用数は21,000回を超えています。

これらの技術研究は、Xboxゲーム開発API、Xbox互換ソフトウェア、Windows 3Dプリントドライバー、Direct3Dグラフィックス開発キットなど、マイクロソフトに多くの貴重な成果をもたらしました。

また、童欣は亜研院ネットワークグラフィックスグループに、現在の華人グラフィックス界を支えるのに十分な中堅力量というもう一つの「財産」を残した。

25年間、彼はここで多くの優秀な研究者と協力し、交流し、指導してきました。

浙江大学の周昆は、ACMフェロー、IEEEフェローであり、CAD&CG国家重点実験室の主任。童欣と長年にわたり協力し、3Dプリントや計算設計からNeRFおよびニューラルレンダリングまでを探索してきた。

清華大学コンピュータ科学科の長期准教授で、国家傑出青年科学基金受賞者。博士課程中、童欣と複数回共同でSIGGRAPH論文を発表。

北京大学王鹏帅、北京大学王选研究所助理教授,自实习生时期起便在童欣指导下,逐步成长为高级研究员,如今已成为三维几何学习领域的代表性学者……

彼と共同で働いた人々の童欣に対する評価は、驚くほど一貫している:

親しみやすく、常に第一線で活躍し、非常に細かい技術的な問題についても厳密に議論でき、複雑な技術的な問題を誰にでもわかる言葉で説明できます。

童欣によると、コンピュータグラフィックスはコンピュータ応用分野であり、そのためすべての研究課題は実際のニーズや新しいデバイス、新しいデータの登場から生じている。

また、童欣は非常にユーモアに富んでおり、たとえば、彼は自分の研究を次のように表現しています:

私の家族は、私が作る料理だけは認めていますが、毎日スクリーン上の3Dの茶壺やウサギに夢中になり、自ら高揚しているとよく冗談を言います。しかし、私のやっていることは、世界の情勢を変えるほど大それたものでもなければ、人々の生活を向上させるほど小さなことでもなく、一体どこに私の達成感があるのか、まったく理解できません。

Meshy

これはグラフィックス界で誰もが知る「童姥」で、極めて深い学術的実力を持ちながらも、子供のような親しみやすさと好奇心を備えている。

それも適切だ。

楽しくAI

童欣がグラフィックス分野でこの地位を築いたことについて、彼女と同等の存在はMeshyのようなスター・ユニコーンだけであると言える。

Meshyは、胡淵鳴がMITの博士課程を修了後に設立した初の企業であり、その定位はシンプルで、テキストや画像を3Dモデルに変換することである。

現在、Meshyは1,200万人のユーザーを抱えており、顧客は世界の時価総額および評価額上位10社の半数をカバーしています。

今年7月、Meshyは約4億ドルのBラウンド資金調達を完了し、投資後評価額は100億元人民元を超えた。

AI 3D分野で単一ラウンドの調達規模と評価額の両方の世界記録を樹立し、同分野で最も評価の高い企業となった。

しかし、より速い成長率であろうと、より高い評価額であろうと、Meshyのビジョンに比べれば、あまりにも具体的である。

胡淵鳴、Meshy.ai創始人、揚州中学校運動会400メートル優勝者、清華大学姚班歌唱コンテスト二等賞、MITコンピュータグラフィックス博士、SIGGRAPH最優秀博士論文ノミネート、Taichiプログラミング言語およびコンパイラ作者。

Meshy

彼は少し特異に聞こえる目標を掲げた:

楽しみのためのAI。

彼の論理の流れは以下の通りです。

将来的、AGIが多数の生産性の問題を解決した後、人類には一つの核心的な問題しか残らない。

私たちはどのように創造し、表現し、つながるのか?そして何より、どのようにして意味を得るのか?

読書、旅行、ゲーム、短編ドラマの視聴……これらは確かに私たちに喜びをもたらすが、自由な時間がこれほど豊かな時代において、私たちは「より新しく、より効果的な喜びと意味の生成方法を追求するだろう。」

このような方式は、AIによって駆動されることが必然である。

したがって、「AIを使って人間に喜びと意味感をもたらすことは、今後5年で最も重要な課題の一つとなるだろう」。

そしてMeshyは、この図像において最も重要なピースになりたいと考えています。

Meshy

Meshy

胡淵鳴の言葉を借りれば、彼らが目指しているのは「生成AIに基づいてグラフィックスを再構築し、想像を具現化するためのグローバル最適解を見つけること」である。

これは何を意味しますか?

言い換えれば、今日のAI 3Dは、コンピュータグラフィックスの指導のもとでAIがモデリング、テクスチャ貼り、レンダリングをより効率的に完了するだけでなく、それ以上のことを行う必要があります。

長期的には、AI 3Dの最終形は、想像の具体化である可能性がある。

この前向きな視点は、トンシンの理念とよく合っています。

2016年、童欣は、誰でもどこでも視覚的メディアコンテンツを作成できるように、グラフィックコンテンツ生成の「everyone」と「everywhere」の問題を解決すると提唱した。

十年後の今日、「everyone everywhereが視覚的メディアコンテンツを創造する」は、「誰でも一文だけで想像を、体験可能でインタラクティブな世界に変える」こと变成了。

これは確かに壮大な願いです。

それを実現するために、Meshyは現在、以下の3つのレベルで基礎的な技術研究を進めています:

まず、そして最も重要なこと——グラフィックスを再発明すること。

そのため、従来のネットワークグラフィックスにおけるレンダリングパイプラインの局所最適解から脱却し、AIを用いて「三角形」に依存しない全局最適解を再構築する必要がある。ここで「三角形」とは、GPUが3次元オブジェクトをレンダリングする最小単位を指す。

Meshy

次に、ディレクターシステムを構築する必要があります。

新しいグラフィックスがより映画の撮影チームに似ているならば、AI for Funを実現するには、それに応じたディレクターシステムが必要である。

このディレクターシステムは、世界の動作メカニズムと3Dスケルトンを設計し、シナリオのリアルタイム作成を実現します。

最後はインフラです。

低遅延、高画質、低コストの3D生成とレンダリング基盤が不可欠です。なぜなら、AI for Funの体験において、わずかなカクつきでも数百倍に拡大されるからです。

そのため、高性能なインフラを再設計する必要があり、これはHu Yuanmingの博士論文やMeshy創業当初に開発したTaichiプログラミング言語の基盤と一貫しています。

これらの基礎研究に加えて、Meshyの新しいモデルは、現在のAI 3D分野における具体的な課題にも取り組んでいます。

例えば「制御性」の問題、つまり生成結果が入力画像にどれほど忠実であるかは、全体の比率の正確さ、空間的分布の妥当性、および表面の詳細の再現度によって表されます。

今年8月10日、MeshyはMeshy-7をリリースし、幾何学的アライメント(geometry alignment)の分野で大きな進歩を遂げました。具体的には:

有機的なキャラクターにおいて、モデルは顔の表情、解剖学的構造、肌のしわなどの細部を再現できます。

硬質表面および機械部品において、各部品は画像に指定された位置に正確に配置され、隣接する部品同士は互いに付着しない。

文字と模様に関して、陰刻文字と浮彫パターンは明確で清潔であり、レーザー彫刻などの工業用途に直接使用できます。

Meshyがこれらの分野で行っている探求は、童欣の関心と一致しており、彼女の近年の研究分野は3Dと動画生成の交差点に位置している。

彼が2024年に提起した古典的な質問のように、「三次元は動画生成の特殊例に過ぎないのか?」

つまり、ある物体がすでにあらゆる角度から「見える」動画が存在する場合、その三维モデルを明示的に構築する必要はあるのでしょうか?

答えはまだ明確ではありません。

しかし現在確定しているのは、童欣がAIマルチモーダルトレーニング分野で培ってきた先進的な研究とエンジニアリングの蓄積が、Meshyの探求をさらに遠くへ導くことができるということである。

Mora:世界モデルを超える

本文を執筆している際、胡淵鳴は自身の公式ブログでMeshyチームの新作であるMoraを発表した。

Moraは「Multimodal Open-world Real-time Architecture」の略で、多模態開放世界リアルタイムアーキテクチャを意味します。

これは興味深いので、皆さんは生成されたインタラクティブゲームのデモをお試しください。

簡単に言えば、それは3つのパズルピースで構成されています:

コーディングエージェント。ゲームワールドの骨格と実行コードを生成するために使用します。

3D生成、つまりMeshyの最も重要なピースは、骨格を豊かにし、ビデオモデルへの制御信号を出力するために使用できます;

ビデオモデルは3Dシーン信号を受け取り、最終的な映像と音響を出力します。

Hu Yuanmingは、これを「世界モデルを超える技術」と称した。

口は大きいですね、どのように超えるつもりですか?

今年1月、Google Genie 3がプレイ可能なデモをリリースし、「ユーザーがテキストを使用して探索可能な現実的な環境を生成できる汎用的世界モデルである」と主張しました。

これによりUnityは1日で24%下落し、Robloxは27%下落しました。市場は大変興奮しています:今後、ゲームを開発するにはゲームエンジンは必要なく、1つのビデオモデルで十分だというのです。

しかし、大半の年月が経過し、胡淵鳴が市場のすべてのワールドモデルデモを体験した後、現在のほぼすべてのインタラクティブ動画モデルに対して、8つの欠点を指摘した。

包括一貫性が弱く、インタラクションが単純で、物理的計算能力が低く、体験時間が短く、シナリオや複雑なロジックをサポートできず、単人プレイが中心で、コーディングの生成機能を活用できず、遅延が大きい。

要するに、やりにくいです。

しかし、これは最適化だけで解決できる問題ではない可能性が高いです。

現在のビデオモデル自体には本当の知能はなく、本質的にはただのレンダラーに過ぎず、この道を進み続ければ、最終的には散歩シミュレーターしか作れない。

Moraのアプローチは逆で、ビデオモデルが3D空間の一貫性を解決できないなら、それ自身が本来果たすべき役割に集中させる。

Codingエージェントに骨組みを作らせ、Meshyに3Dを生成させ、最後にビデオモデルで映像を出力すれば、空間は安定し、洗練され、楽しみながら利用できます。

Meshy

胡社長が本当に熱心なベテランプレイヤーであることがわかります。

しかし、Mora 1は現在まだ非常に初期の段階です。

これは単にフレームワークを検証するために使用されます。その後、このフレームワークの下で、スケーリングを通じて段階的に目標に近づきます。

この点から童欣の質問に戻ると、三次元は動画生成の特殊例に過ぎないのか?

Moraは初期の回答として、少なくとも現在の段階では、両者は互いに代替関係である必要はなく、Coding agentによって連携してそれぞれの役割を果たすことができる、と述べました。

この答えはまだはるかに確定的ではありませんが、ここまで来ると、問題もあいまいになってきました。

この感覚は童欣にとってなじみ深いものだった。

20年から30年の間に、彼は次々と技術の衝撃を体験してきた。かつて3Dを描くには手でルールを書き込むしかなかったが、その後、ニューラルレンダリングが登場し、AIは写真から光と影を学んだ。生成型AIが登場し、リアルな画像はもはや3Dパイプラインに依存しなくなった。動画モデルが登場し、動的な世界を空から生み出すことさえ可能になった……

新しい技術が繰り返し従来のコンピュータグラフィックスの境界を問うている:グラフィックスはどのような形で今後も存在し続けるべきか?

このますます切実な問題に直面して、童欣は再び出発した。

彼はこの世代で最も想像力豊かな若者たちと共に、新しいグラフィックスを生み出そうとしている。

本文は微信公衆アカウント「量子位」より、著者:程浅

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。