Графічний новатор Тонг Син приєднується до Meshy для розвитку ШІ для розваг

icon MarsBit
Поділитися
AI summary iconКороткий зміст
Новини про ШІ та криптовалюту: Тон Сінь, провідний експерт у галузі комп’ютерної графіки, приєднався до Meshy на посаді головного наукового співробітника. Він буде співпрацювати з засновником Ху Юаньміном над розробкою багатомодальних світових моделей та систем реального часу. Тон має 25 років досвіду роботи в Microsoft Asia Research, де працював над API Xbox та Direct3D. Meshy, провідна компанія у сфері ШІ-3D, зібрала 400 мільйонів доларів у серії B, досягнувши оцінки понад 10 мільярдів юанів. Новини про реальні активи (RWA) набирають обертів завдяки злиттю ШІ та блокчейну.

Наступна велика область інновацій у сфері ШІ зосереджується на 3D-генерації.

Від мультимодального генерування, світових моделей до просторового інтелекту, роботів з втіленим інтелектом…

3D стає ядром штучного інтелекту наступного покоління.

А зараз легенда галузі графіки та найпопулярніша компанія у сфері AI 3D об’єдналися.

Останні новини:

Тон Сінь офіційно приєднався до Meshy, заснованого Ху Юаньміном.

Зустріч Ху Юаньміна і Тоньляо

За останніми повідомленнями, Тон Сінь призначений головним науковим співробітником компанії Meshy зі створення 3D-моделей на основі ШІ, відповідальний за розробку довгострокової науково-дослідної стратегії Meshy.

Це може означати, що дві найбільш представницькі генерації дослідників з китайської галузі комп’ютерної графіки — засновник Meshy Ху Юаньмін і Тон Сінь — разом зроблять прорив у багатомодальних світових моделях та системах реального часу.

Тон Сін раніше працювала в Азійському дослідному інституті Microsoft протягом 25 років, під час чого керувала групою мережевої графіки та була глобальним дослідницьким партнером.

Його напрямки досліджень охоплюють комп'ютерну графіку та тривимірну комп'ютерну візуалізацію, зокрема, збирання та моделювання матеріалів, синтез текстур, обробка та моделювання тривимірної геометрії, аналіз та симуляція перенесення світла, реалістичне відтворення, тривимірна анімація обличчя.

Meshy

Комп'ютерна графіка, простими словами, стосується «як створювати, маніпулювати та відображати тривимірний світ у комп'ютері».

Ця галузь має фундаментальне значення в іграх, кіно та промисловому симулюванні, а зараз все більше стає інфраструктурою для сприйняття та вираження ШІ.

Оскільки не розуміє тривимірність, ШІ важко справді зрозуміти та ввійти у фізичний світ.

А Тон Сінь — один із найбільш досвідчених і глибоко вкорінених в цьому напрямку вчених.

У 1999 році Тон Сінь, щойно захистивши докторську дисертацію в Цінхуа, вступив до Мікрософтського дослідницького інституту в Китаї, який був заснований менше року тому і згодом отримав назву «Китайська Вест-Пойнт» у світі китайських технологій — Мікрософт Азійський інститут досліджень.

За двадцять з лишком років тут вийшло безліч ключових фігур, що вплинули на інфраструктуру комп’ютерних досліджень в Китаї та за його межами — але це вже інша історія.

Як один із перших дослідників Інституту досліджень Азії, Тон Сінь працює тут вже 25 років, пройшовши шлях від дослідника до глобального дослідницького партнера та керівника групи мережевої графіки.

Майже всі ключові моменти китайської комп’ютерної графіки.

Meshy

Під час цього періоду Тон Сінь опублікувала велику кількість статей у провідних журналах та на провідних конференціях, а її цитування в Google Scholar перевищили 21 000.

Ці технологічні дослідження залишили для Microsoft багато корисного, включаючи API розробки ігор Xbox, сумісне програмне забезпечення Xbox, драйвери тривимірної друкування Windows та набір інструментів розробки графіки Direct3D.

Крім того, Тун Сінь залишила Академії Янь ще одну «нерухомість» — серію фахівців, які становлять основу китайського світу графіки сьогодні.

Протягом 25 років він співпрацював, обмінювався досвідом і керував цілою чергою видатних дослідників.

Чжо Кун з Цзяньтанського університету, ACM Fellow, IEEE Fellow, керівник Національної лабораторії CAD&CG, багато років співпрацює з Тон Сінем, досліджуючи від 3D-друку та обчислювального дизайну до NeRF та нейронної рендерингу;

Сю Кун з Цинхуа, довічний доцент кафедри комп’ютерних наук Цинхуа, лауреат національної премії «Видатні молоді дослідники»; під час навчання в аспірантурі неодноразово співпрацював з Тон Сінем з приводу публікацій статей у SIGGRAPH;

Ван Пэншуй з Пекінського університету, асистент-професор інституту Ван Сюань, який під керівництвом Тон Сінь від інтерна до старшого дослідника став визнаним вченим у галузі навчання тривимірної геометрії…

Ті, хто працював з ним, часто дають однакову оцінку Тоньсін:

Доступний, завжди на передовій, здатний вести строгі обговорення щодо найбільш дрібних технічних питань і пояснювати складні технічні проблеми простими словами.

Оскільки Тоньсінь вважає комп’ютерну графіку застосованою галуззю інформатики, усі дослідницькі питання виникають з реальних потреб та через з’явлення нових пристроїв і нових даних.

Крім того, Тон Сінь дуже веселий і гумористичний, наприклад, він так описує своє дослідження:

Моя сім’я, крім того, що цінує мої страви, часто жартує, що я щодня захоплено дивлюся на тривимірний чайник та кролика на екрані, самозадоволений, але, здається, мої дії ніяк не змінюють світову ситуацію і не підвищують рівень життя людей — я справді не розумію, звідки береться моя задоволеність.

Meshy

Це та сама «Тонгляо», про яку всі знають у світі графіки, — вона має надзвичайно глибокі академічні знання, але водночас дуже щиро і з дитячою цікавістю.

Також доречно.

«Штучний інтелект для розваг»

Можно сказати, що на цьому етапі в галузі графіки з童欣 може порівнюватися лише така зіркова унікорна компанія, як Meshy.

Meshy — це перша компанія, заснована Ху Юаньміном після захисту докторської дисертації в MIT; її позиціонування просте: перетворення тексту та зображень у 3D-моделі.

На даний момент Meshy об’єднує 12 мільйонів користувачів, а його клієнти охоплюють половину з десяти найбільших за ринковою капіталізацією та оцінкою компаній світу.

У липні цього року Meshy отримала раунд фінансування серії B на майже 4 мільярди доларів США, після чого її оцінка перевищила 10 мільярдів юанів.

Здобула два рекорди на глобальному ринку AI 3D — найбільший обсяг фінансування в одному раунді та найвищу оцінку, ставши найціннішою компанією у цій галузі.

Проте, незалежно від швидшого темпу зростання чи вищої оцінки, це все ще надто конкретно порівняно з баченням Meshy.

Ху Юаньмін, засновник Meshy.ai, чемпіон спортивних змагань середньої школи Янчжоу на дистанції 400 метрів, лауреат другої премії на пісенному конкурсі класу Яо Цинхуа, доктор філософії з комп’ютерної графіки MIT, номінація на найкращу докторську дисертацію SIGGRAPH, автор мови та компілятора Taichi.

Meshy

Він поставив перед собою мету, яка звучить трохи неординарно:

Штучний інтелект для задоволення.

Його логічна ланцюжок така.

У майбутньому, коли AGI вирішить велику кількість проблем продуктивності, у людей залишиться лише одна основна проблема.

Як ми можемо створювати, висловлювати та з’єднуватися? Найголовніше, як ми здобудемо зміст?

Читання, подорожі, гра в ігри, перегляд коротких серіалів… Це дійсно може створювати для нас радість, проте в епоху, коли вільного часу так багато, ми «обов’язково будемо шукати більш новітні та ефективніші способи генерації радості та відчуття сенсу».

Такий підхід обов’язково буде рухатися завдяки ШІ.

Отже, «використання ШІ для надання людям щастя та відчуття змісту стане одним із найважливіших питань у найближчі п’ять років».

А Meshy хоче стати найважливішим шматочком цієї картини.

Meshy

Meshy

За словами Ху Юаньміна, їхня мета — «перетворити графіку за допомогою генеративного ІІ, знайшовши глобально оптимальний розв’язок для конкретизації уяви».

Що це означає?

Іншими словами, сьогодні AI 3D має зробити більше, ніж просто допомогти AI ефективніше виконувати моделювання, нанесення текстур і рендеринг під керівництвом комп'ютерної графіки.

У довгостроковій перспективі фінальною точкою AI 3D може стати конкретизація уяви.

Ця погляд у майбутнє добре поєднується зі філософією Тонсін.

У 2016 році Тон Сінь запропонував вирішити проблеми everyone та everywhere у виробництві графічного контенту, щоб будь-хто будь-де міг створювати візуальний мультимедійний контент.

Сьогодні, через десять років, «everyone everywhere створює візуальний медіа-контент» перетворилося на «дозволити будь-кому перетворити уявлення на вхідний та інтерактивний світ лише за допомогою одного речення».

Це, звичайно, дуже величезне бажання.

Щоб досягти цього, Meshy зараз проводить фундаментальні технологічні дослідження на трьох рівнях:

Спочатку, і найголовніше — винайти графіку знову.

Для цього потрібно вийти за межі локального оптимуму, запропонованого минулими архітектурами графічних конвейерів, і за допомогою ШІ створити нову глобально оптимальну систему, яка не залежить від «трикутників» — найменших одиниць, які GPU використовує для відтворення тривимірних об’єктів.

Meshy

Другим кроком є створення системи керівництва.

Якщо нова графіка схожа на кіностудію, то для реалізації AI for Fun необхідна відповідна система режисури.

Ця директорська система відповідає за створення механік світу та 3D-скелету, забезпечуючи реалізацію сценарію в реальному часі.

Нарешті, інфраструктура.

Необхідна інфраструктура для генерації та відтворення 3D-контенту з низькою затримкою, високою якістю зображення та низькою вартістю, оскільки навіть миттєві зупинки в досвіді AI for Fun будуть посилені в сотні разів.

Для цього необхідно розробити нову високопродуктивну інфраструктуру, що безпосередньо пов’язано з докторською дисертацією Ху Юаньміна та основами мови програмування Taichi, створеними на початку підприємства Meshy.

Крім цих базових досліджень, нова модель Meshy також вирішує конкретні виклики сьогоднішньої галузі AI 3D.

Наприклад, проблема «контролюваності», тобто чи відповідають згенеровані результати вхідному зображенню, що проявляється у точності загальних пропорцій, раціональності просторового розподілу та ступені відтворення поверхневих деталей.

10 серпня цього року Meshy випустила Meshy-7, що стало значним кроком у напрямку геометричного вирівнювання (geometry alignment), а саме:

Щодо природних ролей, модель може відтворювати деталі, такі як вираз обличчя, анатомічна будова та складки шкіри;

Щодо твердих поверхонь і механічних деталей, всі компоненти точно розташовуються у вказаних місцях зображення, а сусідні компоненти не прилипають один до одного;

Щодо тексту та орнаментів, глибокий текст і рельєфні малюнки чіткі й чисті, їх можна безпосередньо використовувати в промислових застосуваннях, таких як лазерна гравіювання.

Слід зазначити, що дослідження Meshy в цих напрямках збігаються з інтересами Тоньсіна, оскільки його дослідницькі напрямки за останні роки перебувають на перетині 3D та генерації відео.

Як він ставив класичне питання 2024 року: «Чи є тривимірність лише окремим випадком генерації відео?»

Тобто, якщо відео вже дозволяє «бачити» об’єкт з будь-якого кута, чи має сенс явно створювати його тривимірну модель?

Відповідь ще не відома.

Але зараз відомо, що передові дослідження та інженерні досягнення Тон Хсіна в галузі багатомодального навчання ШІ можуть вивести дослідження Meshy на новий рівень.

Mora: Поза межами світової моделі

На момент написання цієї статті Ху Юаньмін опублікував нову роботу команди Meshy — Mora, у своєму блозі.

Mora — це скорочення від «Multimodal Open-world Real-time Architecture», що означає «багатомодальна відкрита світова реальна архітектура».

Це цікаво, всі можуть спробувати інтерактивний гейм-демо, згенерований за його допомогою.

Просто кажучи, він складається з трьох частин головоломки:

Кодуючий агент, який генерує скелет ігрового світу та виконує код;

3D-генерація, що є найважливішим компонентом Meshy, може використовуватися для багатства скелетів та генерації керуючих сигналів для відеомоделей;

Відеомодель приймає сигнали 3D-сцен, виводячи кінцеве зображення та звук.

Ху Юаньмін назвав цю технологію «перевищенням світової моделі».

Досить сміливо, але як саме плануєте перевершити?

Пам’ятаєте, як у січні цього року Google Genie 3 запустила інтерактивний демо-версію, стверджуючи, що «це універсальна світова модель, яка дозволяє користувачам створювати реальні середовища для дослідження за допомогою тексту».

За це Unity впав на 24%, Roblox — на 27%, ринок занадто збуджений: у майбутньому для створення ігор не знадобляться ігрові движки, достатньо одного відеомоделю.

Проте після півтора року, коли Ху Юаньмін випробував усі демонстрації світових моделей на ринку, він висловив вісім основних недоліків майже всіх інтерактивних відеомоделей на даний момент.

Включаючи слабку послідовність, просту інтерактивність, слабкі фізичні обчислювальні можливості, короткий час відтворення, неможливість підтримки сюжету та складної логіки, переважно одиночну гру, неможливість використання механізмів генерації Coding та високу затримку.

Просто скажу — грати важко.

Проте це, ймовірно, не проблема, яку можна вирішити лише за допомогою оптимізації.

Сучасні відеомоделі не мають справжнього інтелекту; вони суть лише рендерери, і, продовжуючи цей шлях, нарешті можна створити лише симулятор прогулянок.

Шлях Mora — зробити навпаки: якщо відеомоделі не можуть забезпечити 3D-сумісність, то нехай вони добре виконують те, для чого призначені.

Нехай агент Coding створить каркас, Meshy згенерує 3D-модель, а потім відеомодель створить зображення — так простір буде стабільним, витонченим і інтерактивним.

Meshy

Видно, що господин Ху — справжній запеклий досвідчений гравець.

Проте Mora 1 зараз перебуває на дуже ранній стадії.

Це лише для перевірки рамок. Потім, у межах цих рамок, досягнення мети здійснюється поступово за допомогою масштабування.

Повертаючись до питання Тоньсіна, чи є тривимірність лише окремим випадком генерації відео?

Mora надала початкову відповідь: щонайменше на даний момент, вони не обов’язково повинні бути взаємозамінними і можуть виконувати свої функції за допомогою послідовного з’єднання Coding agent.

Ця відповідь, звичайно, ще далеко не точна, але дійшовши сюди, питання вже ставало нечітким.

Це відчуття не є незнайомим для Тонсін.

Протягом двох-трьох десятиліть він став свідком хвилі за хвилею технологічних зрушень: раніше 3D-графіку створювали виключно за допомогою ручного написання правил, потім з’явилися нейрорендеринг, і ШІ навчився розуміти світло і тіні з фотографій; з’явився генеративний ШІ, і реалістичні зображення більше не залежали від 3D-конвеєра; з’явилися відеомоделі, які навіть можуть створювати динамічний світ з нізвідки…

Нові технології неодноразово ставлять під питання межі традиційної графіки: яким чином графіка повинна продовжувати існувати?

Стикаючись із цією все більш терміновою проблемою, Тон Сінь знову вирушив у путь.

Він хоче разом із найбільш уявливим поколінням молоді створити нову графіку.

Цей матеріал зі сторінки WeChat «Quantum Bit», автор: Чен Цянь

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.