Сектор ИИ «Мировая модель» Китая демонстрирует пятикратный рост финансирования в Q1 2026

iconMetaEra
Поделиться
AI summary iconСводка
Сектор китайских мировых моделей ИИ зафиксировал рост финансирования проектов в 5 раз, достигнув 90 млрд юаней в I квартале 2026 года. Прямые инвестиции составили 30 млрд юаней, еще 60 млрд — от связанных усилий в области встраиваемого интеллекта. Рост отражает сильную динамику в новостях и развитии инфраструктуры ИИ + криптовалюта. Рост финансирования превысил показатель за аналогичный период прошлого года в четыре раза. Ключевые игроки, такие как MetaEra, движут этой тенденцией.
В первой половине 2026 года объем финансирования в сегменте мировых моделей ИИ в Китае составил около 90 миллиардов юаней, темпы роста превысили 5 раз.

Автор статьи, источник: LeFeng.com

Диалог с Чжан Лэем из IDEA: «Если действие не является условием ввода, это не называется мировой моделью»

В первой половине 2026 года деньги и люди из китайского AI-сообщества потянулись в одном направлении: мировые модели.

Только за первые шесть месяцев общий объем привлеченного капитала в сегменте китайских мировых моделей составил около 30 млрд юаней; если включить сегмент, объединяющий «эмбоди-интеллект + мировые модели», эта цифра возрастает до более чем 90 млрд юаней.

Рост финансирования превысил в пять раз показатель за тот же период прошлого года.

Миллиарды долларов и огромное количество талантов хлынули, как волна.

Невозможно обойти вопрос: сколько из этих людей действительно понимают, что это такое?

Практики ищут направление, инвесторы ищут людей, рекрутеры изучают структуры организаций, стратегические отделы крупных компаний анализируют, кто выживет.

Странно то, что все задают один и тот же вопрос: есть ли кто-нибудь, кто может объяснить, что такое мировая модель?

Есть.

Сегодня мы провели глубокое интервью с профессором-ученым Института IDEA и основателем ShiQi Future Zhang Lei, чтобы разобраться в этом вопросе.

Он — член IEEE, цитируемость в Google Scholar превышает 77 000 раз. Его серия DINO возглавляла рейтинг COCO в течение пяти месяцев; Grounding DINO и последующие версии DINO-X превзошли Google и Meta и стали «стандартным» выбором для таких мировых ведущих организаций, как команда Ли Фэйфэй, NVIDIA и Galaxy General.

В 2025 году он вместе с командой основал ShiQi Future из IDEA, и в течение одного месяца в рамках ангельского раунда поступило почти 100 миллионов юаней.

Сзади стоят два гиганта ИИ: академический наставник академик Чжан Бо (один из основателей искусственного интеллекта в Китае) и промышленный наставник академик Шэнь Сянъян (бывший глобальный исполнительный вице-президент Microsoft и бывший директор Microsoft Research Asia).

Но это не основная причина, по которой мы его искали.

Причина, по которой мы ищем его, проста: в 2026 году, когда все спорят о том, «что такое мировая модель», Чжан Лэй — один из немногих, кто дал ясный, практичный и не компромиссный ответ.

От главного исследователя Microsoft Research до исследователя-стипендиата IDEA Research и далее — до предпринимателя: его карьерный путь неоднократно менял направление, но исследовательская задача оставалась неизменной: «Заставить ИИ понимать объекты».

Модель мира — это ключевой ответ на эту задачу, над которой работают уже более двадцати лет в физическом мире.

Если вы следите за направлением мировых моделей, хотите понять, является ли это пузырем, узнать, кто победит в борьбе за стратегию и определить, какие команды наиболее стоят вашего внимания — этот разговор стоит прочитать до конца. Потому что это абсолютно стоит вашего времени.

Вот транскрипт диалога, отредактированный AI Tech Review без изменения смысла.

Доктор Чжан Лэй, член IEEE, основатель и генеральный директор VisionNext, текущий ведущий ученый Центра компьютерного зрения и робототехники (CVR) Института IDEA, доцент Гонконгского научно-технического университета (Гуанчжоу), бывший главный исследователь в Microsoft Research Asia и Microsoft Research, автор более 200 научных статей в области компьютерного зрения, более 77 000 цитирований в Google Scholar, H-индекс 107, обладатель более 60 патентов США. Избран членом IEEE за выдающийся вклад в область масштабного распознавания изображений и мультимедийного поиска информации.

Самое большое ограничение для эмбоди-интеллекта — не тело, а мозг

Обзор AI-технологий: С момента прошлого года наблюдается взрывной рост в области встраиваемого интеллекта — компании-разработчики роботов все больше поражают своими достижениями в управлении движением: роботы от Unitree бегут по марафонской трассе, а роботы от AgiBot умеют делать кувырки. Однако мы замечаем, что на практике применение пока еще не до конца реализовано. Какие, по вашему мнению, ключевые вызовы необходимо преодолеть, чтобы встраиваемый интеллект действительно стал реальностью?

Чжан Лэй: Две ключевые задачи, которые должны решить роботы — это успешность и обобщаемость. Успешность означает, насколько надежно выполняется задача; обобщаемость — способность надежно выполнять одну и ту же задачу при изменении среды или исполнителя.

Есть четыре конкретные проблемы:

Во-первых, недостаточная обобщаемость в одиночных сценариях. Сейчас многие команды могут достичь успеха в 70–80% в одиночных сценариях — звучит как значительный прорыв. Но что на самом деле означает 80% в реальных условиях? Это означает, что каждый пятый запрос завершается неудачей, требуя значительных человеческих ресурсов для обеспечения надежности и полностью исключающего возможность самостоятельного развертывания.

Во-вторых, универсальность сценариев горизонтального расширения недостаточна. Сначала следует довести возможности отдельных точек до предела, а затем расширять широту применения сценариев, чтобы позволить им выполнять больше и более сложных задач в более сложных условиях. Это наибольший разрыв, препятствующий переходу роботов от «лабораторных демонстраций» к «реальному применению».

В-третьих, отсутствие глубоких возможностей «мозга». Современное глубокое обучение в основном изучает «поведение» интеллекта, а не его «механизмы» (принципы работы интеллекта). Телесный мозг должен обладать истинной причинно-следственной логикой по отношению к физическому миру (не просто статистическая связь, а понимание логической цепочки «поскольку А, то В»), здравым смыслом и адаптивными способностями — в этом отношении мы только начинаем.

В-четвертых, далеко не достигнут уровень «конечного» приложения. В настоящее время большинство роботов все еще зависят от огромной внешней вычислительной мощности; необходимо решить фундаментальную проблему «отсутствия необходимости в поддержке человека», чтобы внедрить их в массовые сценарии и сформировать благоприятный цикл «приложение-данные-итерация».

Обзор AI-технологий: Честно говоря, мнения в отрасли по этому вопросу сильно разделились. Команды, занимающиеся оборудованием, считают, что китайские цепочки поставок имеют явное преимущество, и следует сначала снизить стоимость основного продукта; команды, занимающиеся алгоритмами, считают, что настоящим узким местом является «мозг». Как вы считаете?

Чжан Лэй: Мозг сложнее, но и важнее.

В плане аппаратной платформы Китай гордится своими достижениями в обновлении оборудования. Компании, такие как Yushu и Zhiyuan, совершенствуют управление с помощью симуляционного обучения с подкреплением (обучение алгоритмов управления в виртуальной среде, а затем перенос их на реальных роботов), постоянно улучшая ключевые компоненты, такие как двигатели и передаточные механизмы, значительно оптимизировав стоимость и надежность, проложив очень устойчивый путь. Однако способности платформы, продемонстрированные в марафоне и выступлениях, можно охарактеризовать лишь как базовые животные способности — реакции, прыжки, уклонения и взаимодействие с окружающей средой, присущие животным, пока еще не достигнуты.

Комментарий по ИИ: Вы говорите, что «мозг» сложнее — в чем именно сложность? Недостаточно данных или наше понимание самого интеллекта слишком поверхностно?

Чжан Лэй: Сложность заключается в том, что мы на самом деле не понимаем механизмы, лежащие в основе этого. Человеческий мозг по сравнению с другими животными обладает наибольшей дифференциацией и наивысшим уровнем интеллекта. Все современные прорывы в глубоком обучении основаны на наблюдении за тем, на каком уровне проявляется интеллект мозга, и последующей реализации этого с помощью алгоритмов. ИИ фактически учится поведению человека, а не самому человеческому интеллекту. Как часто говорит профессор Чжан Бо, большие языковые модели могут говорить, как люди, но понимают язык совершенно иначе.

Почему мировые модели игнорировались двадцать лет, а сегодня внезапно стали популярными?

Комментарий по ИИ: вместе с всплеском эмбоди-технологий внезапно стало популярным понятие «модели мира». Но все в отрасли знают, что это не новое слово — еще в 90-х годах об этом говорили ученые. Нас интересует, почему это понятие было забыто на двадцать лет и вдруг стало трендом сегодня?

Чжан Лэй: Хороший вопрос. Модели мира — это не новая концепция. В начале 90-х годов ученые пытались смоделировать среду, необходимую для взаимодействия агентов (ИИ-систем, способных воспринимать окружающую среду и принимать действия для достижения целей), чтобы улучшить алгоритмы усиленного обучения, но в то время глубокое обучение еще не начало развиваться, и после появления концепции ее было сложно проверить.

Эта концепция действительно была подтверждена примерно в 2018–2019 годах, когда появились настоящие научные работы под названием «World Models» и они были применены в игровых сценариях, поскольку игры являются лучшей средой для проверки обучения с подкреплением.

Спустя несколько лет развития обучения с подкреплением ИИ уже смог победить человеческих игроков в играх. В этот момент исследователи начали задумываться: можно ли заставить агент ИИ самостоятельно «освоить» модель мира в процессе постоянного взаимодействия с игровой средой, поместив процесс эволюции среды внутрь модели? Эта идея была полностью подтверждена примерно в 2018–2020 годах.

Комментарий по ИИ: Как это связано с сегодняшними встраиваемыми интеллектуальными системами? Похоже, именно встраиваемые системы стали настоящим толчком, который запустил популярность моделей мира?

Чжан Лэй: Эта связь начинается с языковых моделей. Отрасль сначала разработала VLA (Vision-Language-Action — модель зрения-языка-действия, робот смотрит на изображение и предсказывает следующее действие), используя парадигму имитационного обучения языковых моделей: языковая модель выполняет предсказание следующего токена; в случае встраиваемой VLA робот смотрит на текущее изображение и предсказывает, какое действие следует выполнить следующим.

Но этот подход быстро достиг ограничений. Ограничения связаны не только с данными — я считаю, что данные — это лишь одна сторона, а другая — недостаточное применение обучения с подкреплением. У меня есть аналогия: обучение по подражанию заставляет языковую модель научиться говорить, а обучение с подкреплением заставляет её говорить правильно.

Интеллект робота и成功率 действий также требуют обучения с подкреплением.

Однако применение усиленного обучения в робототехнике сталкивается с двумя смертельными препятствиями: во-первых, эффективность сбора данных чрезвычайно низка, намного ниже, чем у языковых моделей; робот должен фактически выполнять каждое действие в реальной среде и ждать физической обратной связи; во-вторых, стоимость неудачи неприемлемо высока — если робот не научится мыть посуду, он разобьет тарелку; если автономный автомобиль учится избегать аварий, ему может потребоваться пережить множество реальных аварий, чтобы научиться. Это совершенно отличается от низкозатратного экспериментирования языковых моделей в цифровом мире.

Виртуальная среда, предоставляемая мировыми моделями,正是解决这些问题的出路。如果一个模型能够预测“如果我做出这个动作,环境会变成什么样”,那么机器人就可以在虚拟世界中“脑补”无数次试错,而无需真的打碎一万个碗。

(Примечание автора: Просто понимайте логическую цепочку этого текста. Во-первых, роботу требуется множество попыток и ошибок, чтобы научиться выполнять задачу. Во-вторых, ошибки в реальном мире слишком дороги и опасны. В-третьих, модель мира — это создание «виртуального тренировочного поля» для робота, где он может в уме смоделировать последствия всех своих действий. В-четвертых, достаточно применить оптимальное решение в реальном мире. Именно поэтому модель мира в этот момент стала ключевой целью для всей отрасли.)

Если действие не является условием ввода, это не называется мировой моделью

Комментарий по ИИ: Сейчас в отрасли существует большая путаница в определении термина «модель мира». Генерацию видео называют моделью мира, 3D-моделирование пространства тоже называют моделью мира, и JEPA (архитектура совместного встраивания и прогнозирования) от Лекуна также называют моделью мира. Какие, по вашему мнению, минимальные условия должен выполнять модель, чтобы заслужить это название?

Чжан Лэй: Я считаю, что модель мира обязательно должна быть зависимой от действий, то есть Action Conditioned (действия должны быть входными условиями, и модель должна уметь отвечать на вопрос: «Как изменится среда, если выполнить определенное действие?»).

Агент может взаимодействовать с окружающей средой благодаря действиям: действия агента вызывают изменения в окружающей среде, после чего возникает новое состояние, которое возвращается агенту и сообщает ему, насколько его текущее действие приблизило его к цели. Это замкнутый цикл, при котором каждый переход состояния окружающей среды зависит от конкретного действия, выполненного на предыдущем шаге.

Часто говорят, что мировая модель — это замена прогнозирования следующего токена в языковой модели на прогнозирование следующего состояния, но я считаю, что это определение недостаточно строго и не учитывает ключевое условие. Правильная формулировка должна быть: прогнозирование следующего состояния с учетом действия. Только при добавлении условия действия прогнозирование состояния приобретает смысл и действительно соответствует требованиям усиленного обучения.

Обзор AI-технологий: Честно говоря, многие люди, включая некоторых инвесторов в бизнес-планах, привыкли называть такие модели генерации видео, как Sora, моделями мира. Но согласно вашему только что указанному критерию, им явно не хватает измерения действия. Мы хотели бы услышать ваш подход к разбору этой проблемы?

Чжан Лэй: Модель мира, которую мы обсуждаем здесь, происходит из методов model-based в области усиленного обучения и предназначена для того, чтобы помочь агенту более эффективно взаимодействовать с окружающей средой. Хотя модель мира имеет множество применений, олицетворенный интеллект является сегодня самым четким и наиболее ценным применением.

В этом смысле чистые модели генерации видео, такие как ранняя версия Sora, нельзя назвать моделями мира. Основная причина заключается в том, что они не моделируют «действия» — они по сути генерируют согласованные видеопоследовательности, предсказывая, как изменяются пиксели, но полностью не моделируют действия взаимодействия робота с окружающей средой. Могут ли они косвенно помочь роботу? Да, они могут изучить некоторые закономерности изменений в мире, но с трудом помогут роботу лучше взаимодействовать с окружающей средой.

Обзор AI-технологий: а что насчет недавно популярной World Action Model (модели мировых действий)? Мы слышали, что она тоже говорит о действиях — это другая модель мира?

Чжан Лэй: WAM также не является моделью мира в смысле обучения с подкреплением. Он использует пиксельный контроль, предоставляемый прогнозируемыми будущими изображениями, для улучшения прогнозирования действий и уже продемонстрировал лучшую производительность, чем VLA, в некоторых задачах. Однако его моделирование является причинно-следственным в обратном порядке: сначала генерируются будущие изображения, а затем обратно выводятся действия; он не может использоваться в обучении с подкреплением и, следовательно, не соответствует определению модели мира, обсуждаемой здесь.

Пиксель-пай vs Инкогнито-пай: на самом деле обе стороны делают одно и то же

Обзор AI-технологий: Когда речь заходит о конкуренции подходов, это сейчас самая горячая тема в области моделей мира. Лекун — ключевая фигура сторонников скрытого пространства, а Sora представляет пиксельный подход. Эти два направления кажутся несовместимыми. Как вы на это смотрите?

Чжан Лэй: Во-первых, мы должны заметить, что два подхода имеют общее.

На самом деле сейчас многие чувствуют, что они сильно противопоставлены друг другу, возможно, потому что Лекун довольно четко и решительно отстаивает свою позицию; иногда ученый, чтобы его позиция запомнилась, должен излагать ее достаточно ясно.

Но пиксельный подход также использует латентное пространство для операций. Stable Diffusion, Sora сначала сжимают изображения или видео в низкоразмерное представительное пространство, а затем обрабатывают их. Таким образом, представительное пространство — это более фундаментальная проблема. Истинное различие между двумя подходами заключается не в том, использовать латентное пространство или нет, а в том, что сохранять и что отбрасывать после входа в латентное пространство.

Разница заключается в том, что скрытое пространство стремится исключить пиксельные детали, такие как свет, тень и текстура, которые не определяются физическими законами, что помогает модели освоить более фундаментальные закономерности изменения состояния; однако оно сталкивается с риском коллапса представления: если десять тысяч различных изображений отображаются в абсолютно одинаковое представление, представление коллапсирует, что означает потерю модели способности различать разные состояния. Пиксельный подход стремится к максимальной детализации, по сути, пытаясь угодить человеческому глазу, поскольку люди чрезвычайно чувствительны к визуальным деталям.

Комментарий по ИИ: Дойдя до этого момента, у нас возникло интуитивное ощущение. Разве человеческий мозг при проведении рассуждений не работает в скрытом пространстве? Когда вы закрываете глаза и представляете последствия действия, кто именно в уме рендерит его пиксель за пикселем?

Чжан Лэй: Верно. Если человеческий мозг содержит модель мира, то при воображении, как действия изменяют окружающую среду, человек оперирует в скрытом пространстве, а не прокручивает всю картинку пиксель за пикселем в уме. Поэтому использование восприятия качества изображения человеческим глазом в качестве критерия оценки модели мира недостаточно. Если подход, основанный на пикселях, используется для создания модели мира, то настоящей целью должно быть не достижение максимальной реалистичности пикселей, а обеспечение физической обоснованности сгенерированных видеопоследовательностей.

(Примечание автора: Этот диалог посвящён спору между двумя подходами к моделям ИИ для мира. Пиксельный подход, представленный Sora, сосредоточен исключительно на реалистичности изображения, но часто приводит к ошибкам, нарушающим физические законы — например, к подвешенным чашкам, проникновению объектов друг в друга или негаснущим свечам. В то время как Лекун и Чжан Лэй выступают за подход скрытого пространства, который сначала абстрагирует изображение до закономерностей, а затем выводит их, лучше понимая физические причинно-следственные связи. Ключевым нововведением Чжан Лэя стало добавление «структуры объектов» в скрытое пространство, позволяющее ИИ сначала различать отдельные объекты — чашку, стол, человека — а затем изучать законы их взаимодействия. Это предотвращает визуальные артефакты в стиле Sora и делает подход более подходящим для роботов, которым необходимо избегать препятствий, захватывать предметы и планировать движения в реальном мире.

Комментарий по ИИ: Вы следуете той же траекторией скрытого пространства, что и Лекун. Однако мы слышали, что ваш подход имеет ключевое отличие — вы подчеркиваете необходимость «введения структуры объектов». В чем суть различия?

Чжан Лэй: Наш подход основан на той же первой принципиальной идее, что и у Лекуна: человеческий мозг осуществляет контрфактические рассуждения («что произойдет, если я сделаю это?») в условиях действия, проводя рассуждения на уровне абстрактных представлений, а не воспроизводя пиксели.

В течение нескольких последних лет Лекун подтвердил эту аксиому с помощью I-JEPA, V-JEPA и LeJEPA: предсказание должно происходить в пространстве представлений. Однако сложность физического пространства в направлении овеществления чрезвычайно высока, и, по нашему мнению, для применения этого метода в масштабных реальных средах необходимо ввести необходимую структуру в скрытое пространство.

Эта идея основана на наших проверенных возможностях. DINO-X, разработанный под руководством нашей ключевой команды, уже решил проблему «видения объектов» в открытых мирах. Теперь мы делаем объекты базовыми единицами для прогнозирования и планирования в модели мира. Интуитивно понятно, что физические законы действуют на объекты; понимание объектов в скрытом пространстве представлений позволяет более эффективно изучать физические законы.

Комментарий по ИИ: Подождите, мы хотим задать еще один вопрос. LeCun и его AMI Labs привлекли миллиарды долларов и также упорно работают в этом направлении. На чем основано ваше мнение, что ваше улучшение «введения структуры объекта» сможет продвинуться дальше в его общей рамке?

Чжан Лэй: Поскольку ранее мы разрабатывали DINO-X — это открытая универсальная модель восприятия объектов, которая уже достигла лучшего в мире результата в области «понимания объектов». Наши представления о механизмах визуальных моделей и о том, почему визуальные модели способны обеспечивать физическую обоснованность, полностью согласуются с нашей прежней линией работы над универсальным пониманием объектов.

Проще говоря, подход Лекуна — это базовая архитектура, на которую мы добавили структуру объектов и обеспечили замкнутый цикл в реальной среде. Эту способность «замкнутого цикла» мы разработали за последние несколько лет.

Почему серия DINO способна превзойти Google и Meta?

Комментарий по ИИ-технологиям: Ваша команда достигла слишком выдающихся результатов на этапе крупных визуальных моделей. Grounding DINO и последующий DINO-X опередили Google и Meta, став стандартом для таких ведущих мировых институтов, как команда Ли Фэйфэй, NVIDIA и Galaxy AI. Мы уже обсуждали это внутри компании и все чувствуем, что это немного «ненормально»: обычно китайские команды догоняют зарубежные, но как вам удалось перевернуть эту ситуацию — заставить зарубежные команды догонять вас?

Чжан Лэй: Два аспекта особенно выделяются.

На уровне парадигмы мы — первая команда в области компьютерного зрения, которая достигла SOTA (State of the Art, лучший результат в области) в обнаружении с использованием Transformer (архитектуры глубокого обучения на основе механизма самовнимания, лежащей в основе крупных языковых моделей). Grounding DINO ввела парадигму языковых моделей и впервые расширила задачу обнаружения объектов до открытого домена: модель больше не ограничена только классами объектов, на которых она была обучена, а может обнаруживать любые объекты, которых она никогда не видела ранее. На сегодняшний день это самый цитируемый и скачиваемый открытый модель, что можно назвать парадигмальным прорывом.

С точки зрения данных и инженерной стратегии, после Grounding DINO мы перешли на закрытый путь, продвигая проверенные идеи в направлении масштабирования. В то же время я предъявляю высокие требования к качеству работы. Хотя команда в то время была молодой и не имела опыта в выполнении столь сильных задач, я настаивал на том, чтобы установить высокий порог и подчеркивал, что выпускать можно только тогда, когда достигнут прорыв уровня крупной версии. Поэтому нам потребовалось около года, чтобы выпустить Grounding DINO 1.5, а затем еще полгода — чтобы выпустить DINO-X. Факт подтверждает, что версии, выдержавшие более года тщательной доработки, получили высокое признание в отрасли.

Комментарий по ИИ: Как соотносятся ваши визуальные крупные модели с созданием моделей мира сегодня?

Чжан Лэй: Наша работа непрерывна. Раньше мы занимались восприятием объектов, и нашей основной целью было предоставить роботам основу для восприятия; позже многие команды использовали нашу модель Grounding DINO для решения задач понимания окружающей среды.

В технической реализации модели мира более визуально ориентированы, чем языковые модели, и почти все работы над моделями мира не основаны на чисто языковой архитектуре, такой как GPT.

В плане накопления командного опыта наше понимание механизмов визуальных моделей сильно соответствует нашей прежней технической направленности в области общего понимания объектов. Именно это дает нам уверенность в постоянной итерации нашей модели мира.

Команда состоит из более чем 20 человек, вышедших из IDEA, и она очень стабильна. Даже при разработке закрытых моделей мы постоянно привлекаем внешних специалистов с сильными навыками в алгоритмах и инженерии. Эти более 20 человек — это «семена» будущего Shiqi.

Диалог с Чжан Лэем из IDEA: «Если действие не является условием ввода, это не называется мировой моделью»

Эволюционный путь от моделей серии DINO до мировых моделей

Как заставить ИИ по-настоящему «видеть» объекты?

Комментарий по ИИ: Вы говорите, что существующие методы скрытого пространства «на самом деле не понимают объекты», они не знают, какие элементы в сцене являются отдельными объектами и как эти объекты связаны между собой. Нам интересно, как это можно определить? Как понять, действительно ли модель «понимает» объекты или просто «притворяется», что понимает?

Чжан Лэй: Само понимание трудно проверить напрямую. Сейчас никто не может четко объяснить, как языковые модели действительно понимают язык; можно судить только по поведенческим проявлениям: если модель непрерывно генерирует текст, и он не отличается от того, что говорит человек, то можно сказать, что она понимает.

Мировые модели сталкиваются с аналогичными трудностями. Трудно прямо сказать, понимает ли модель физические законы на самом деле и действительно ли она захватила структуру объектов. Мы будем анализировать это через визуализацию промежуточных этапов; если результаты совпадают с человеческой интуицией, это говорит о том, что модель, возможно, захватила структуру объектов.

Обзор AI-технологий: Есть ли какие-либо конкретные методы тестирования? Можно ли провести эксперимент, чтобы посмотреть?

Чжан Лэй: Да. Контрфактическое тестирование — это отличный метод, позволяющий модели попробовать различные действия и проверить, сможет ли она дать физически обоснованные результаты. Если при небольшом отклонении траектории модель все еще может правильно выполнить задачу, это означает, что она усвоила закономерности; если не может — значит, она, вероятно, изучила только статистическую корреляцию.

Это требует проницательности. Как сказал профессор Ричард Саттон, исследователи всегда хотят помочь модели, навязывая ей свой опыт. Исследователи языковых моделей когда-то стремились разобрать синтаксическую структуру, ввести в модель разбиение на токены и фразы, но в итоге победил простой подход «предсказание следующего токена».

Я сам очень верю в силу итеративного развития этой простой парадигмы. Чрезмерное человеческое проектирование эффективно в краткосрочной перспективе, но в долгосрочной замедляет итерации.

Комментарий по ИИ: В физическом мире есть еще несколько сложных объектов — скользкий песок, потоки воды, дым, ткань — у них нет четких границ. Мы беспокоимся, не станет ли ваша «объектно-ориентированная» рамка ограничивающей из-за самого понятия «объект»?

Чжан Лэй: Мы сами также задумываемся над этим вопросом. С технической точки зрения, самым простым подходом является Mask — выделение пикселей области объекта. За последние несколько лет в области визуального восприятия достигнут большой прогресс в понимании семантики объектов и предсказании масок, что позволяет обрабатывать такие неупругие объекты, как песок и водные поверхности.

Поэтому начало с Mask — это практичный подход. Наш накопленный опыт в области обнаружения общих объектов глубже, чем у любой другой команды.

EgoTwin: научить руку робота рукой человека

Обзор технологий ИИ: В вашей технической рамке есть ключевое понятие — «выравнивание действий», которое сопоставляет действия различных конфигураций — человеческой руки, двухпальцевого захвата, многопальцевой ловкой руки — в одно и то же скрытое пространство. Мы понимаем это примерно как перевод для роботов, позволяющий им понимать действия на разных «языках», верно?

Чжан Лэй: Основными входными данными для мировой модели являются изображение (состояние) и действие, поэтому понимание действия имеет ключевое значение.

Выравнивание действий — это базовое требование для многотельных задач. Выравнивание руки человека и роботизированной руки еще сложнее: положения суставов роботизированной руки в физическом пространстве по осям XYZ точно известны, но данные о руке человека, как правило, представляют собой 2D-видео. Люди снимают видео приготовления пищи, в котором присутствуют только двумерные изображения, без трехмерных координат. Прямое смешивание этих данных крайне неэффективно.

Наш подход заключается в извлечении 3D-ключевых точек, преобразовании 2D-видео руки человека в последовательность операций в 3D-пространстве и выравнивании их с данными роботизированной руки в одной физической пространственной системе. Это и есть сбор и обработка Ego-данных (данных о человеческих действиях, собранных с перспективы первого лица), о которых сейчас говорят в отрасли.

Ранее мы выпустили EgoTwin, который решает именно такие проблемы сбора данных, и сейчас сотрудничаем с командой сбора данных Baidu Cloud.

Комментарий по ИИ: EgoTwin решает проблему данных «как двигаются руки». Но мы хотим задать еще один вопрос: в человеческих видео содержится более высокий уровень информации — намерение «почему руки двигаются именно так». Что с этим делать?

Чжан Лэй: Понимание намерений действий более высокого уровня мы оставим на усмотрение моделей мира или VLA. Но前提是 качество самих данных должно быть достаточно высоким. Исходные данные чрезвычайно важны. В отрасли в сбор данных вложено огромное количество человеческих ресурсов и затрат, однако во многих случаях эффективность использования данных остается низкой. Основной опыт, накопленный нами в рамках работ Grounding DINO и DINO-X, заключается в том, чтобы привлечь к глубокой работе с данными специалистов, понимающих алгоритмы; иначе собранные данные могут оказаться бесполезными при обучении. Необходимо параллельно итеративно развивать как алгоритмы, так и данные.

Чжан Бо и Шэнь Сянъян: два наставника, одна основа

Комментарий по ИИ: Мы заметили, что за вами стоят два человека, оказавших глубокое влияние на вас — академик Чжан Бо (один из основателей искусственного интеллекта в Китае) и академик Шэнь Сянъян (бывший глобальный исполнительный вице-президент Microsoft и бывший директор Microsoft Research Asia). Один из них ориентирован на академическую сферу, другой — на промышленность. Мы очень хотим узнать, что именно каждый из них вам дал?

Чжан Лэй: Профессор Чжан Бо всегда был для меня наставником и примером. Впервые я познакомился с профессором Чжаном, когда только поступил в清华 на бакалавриат — он был директором лаборатории. Тогда я занимался AGV (автоматизированными направляемыми тележками) и проводил большую часть свободного времени в лаборатории, настраивая оборудование и проводя эксперименты, и часто видел, как профессор Чжан руководит аспирантами в их работах по робототехнике. Позже мне повезло стать его аспирантом. Самое яркое впечатление — его чрезвычайная чувствительность к новым технологиям и сильное любопытство. Каждый раз, когда я приходил к нему обсудить результаты экспериментов, он с энтузиазмом садился рядом и говорил: «Попробуй изменить это и посмотри, что получится». Он таким образом углублял собственное понимание. Вы можете увидеть, как понимание алгоритмов и проблем ученым полностью движимо любопытством.

Еще один урок, который остается актуальным до сих пор, — это его акцент на том, что «нужно полностью понимать вещи»; если вы не понимаете до конца, вас обманут, а только полностью осознав суть, вы поймете, как работают базовые принципы. Позже эта фраза стала моим принципом при работе со студентами: глубокое понимание, стремление к наилучшему.

Западный Шэнь оказал на меня огромное влияние. Во время работы в Microsoft он был моим непосредственным руководителем и повлиял на весь мой профессиональный путь: именно он пригласил меня из Китая в США и убедил меня вернуться в Шэньчжэнь из США. Кроме того, он обладал исключительно тонким пониманием промышленных направлений и дал мне множество конкретных советов и ценных рекомендаций по формированию команды и привлечению инвестиций.

Комментарий по ИИ: Мы слышали, что профессор Чжан Бо, в возрасте 90 лет, все еще приходил на встречу с вашей командой? Это действительно трогает нас.

Чжан Лэй: Да. В ноябре прошлого года аспирантура Циньхуа пригласила его прочитать лекцию в Шэньчжэне. После утренней лекции он весь послеобеденный временной блок выделил нашей команде. Мы провели целый вечер в обмене идеями, а вечером поужинали вместе. Его кругозор очень широк, он дал нам множество советов по направлениям общего визуального понимания и робототехники. Несмотря на возраст, его мышление очень ясное, логичное и глубокое — оно ничем не уступает мышлению молодых людей.

Каждая волна превосходит воображение, но волна придет к тебе сама

Обзор AI-технологий: В последние годы, от глубокого обучения до крупных моделей, а затем к эмбоди-моделям и моделям мира, вы активно участвовали в каждой волне. Мы хотим узнать, был ли момент, когда вы подумали: «Вот это то, что я должен делать»?

Чжан Лэй: Работа по обнаружению объектов очень близка к состоянию, которое вы описали. Эта работа вызывает у меня большое чувство гордости, поскольку я вижу прорывной прогресс во всей области.

Следующая модель мира — это также направление, которое меня очень вдохновляет и заставляет полностью вложить в него свои усилия. Мы можем перенять опыт прошлых десятилетий, когда усиление обучения и модели мира развивались поочередно, а также успешную парадигму языковых моделей. Я считаю, что это направление окажет огромное влияние на всю индустрию ИИ.

Обзор AI-технологий: Времена успехов исследователей часто упоминаются, но периоды спада редко обсуждаются. Вы сталкивались с техническими трудностями?

Чжан Лэй: Да. Около 2018 года я попытался использовать слабо контролируемые данные для обнаружения объектов, работая только с метками классов изображений, чтобы избежать необходимости помечать рамки для каждого объекта. Этот метод звучал очень привлекательно, и я потратил на него довольно много времени, но так и не решил проблему полностью.

Позже, работая над IDEA с Grounding DINO, мы объединили понимание языка и возможности обнаружения, тем самым решив проблему с другой стороны. Этот прорыв во многом основан на инновациях в модели обнаружения DINO, заложивших прочную основу, а также значительно обусловлен развитием языковых моделей. Прорыв Grounding DINO произошел в конце 2022 — начале 2023 года, как раз в момент появления ChatGPT. Существует мнение: «Когда данных достаточно, интеллект возникает естественным образом» — при достаточном объеме данных алгоритмы могут быть достаточно простыми.

Считаю, что столкновение с трудностями — это нормально; ключевое — иметь упорство, чтобы бороться с очень сложными проблемами. Если один подход не срабатывает, попробуйте другой — думайте об этом за едой, во сне, постоянно вращаясь вокруг неё. Настоящие хорошие вопросы будут волновать вас много лет, и в какой-то момент прорыв качественного уровня возникнет сам собой.

Комментарий по ИИ: Сейчас многие молодые люди также занимаются стартапами в области мировых моделей, например, Чэнь Боюань и Цзя Цзямин из Inverse Matrix, Бай Инци из Baize Technology — они даже еще студенты. Мы считаем это довольно интересным; как вы относитесь к таким «последним волнам»?

Чжан Лэй: Это говорит о том, что барьеры для входа в исследовательскую сферу действительно снизились. До всплеска глубокого обучения новичкам требовалось несколько лет, чтобы заложить основы. Сейчас открытые технологии упростили технику — достаточно понять Transformer, чтобы войти в эту область. Преимущество молодежи заключается в отсутствии багажа: они легче принимают новые парадигмы, исходя из первых принципов. Однако настоящие сложные проблемы требуют от опытных исследователей проницательности, понимания и способности контролировать направление.

Социальные тренды постоянно меняются, но если вы просто гонитесь за ними ради гонки, вы их не догоните. Суть в том: как бы ни менялись направления, каждая команда всегда нуждается в самых способных людях. Если вы будете сохранять стремление к обучению и прочную базу, самые передовые направления сами придут к вам.

Одно откровение

Самым трогательным в этом интервью стало не то, что Чжан Лэй достиг в технической сфере, и даже не те талантливые молодые специалисты, которых он воспитал — стажеры Хуан Чжэн, Ли Сюэлун, а также члены команды, работавшие над первым проектом по распознаванию лиц в Microsoft: Чжу Лун, Сяо Рун и Янь Шуичэн.

Самым трогательным для нас было его постоянное упоминание одного слова: «полное понимание».

Это слово Чжан Лэй записывал тридцать лет.

В начале 1990-х годов в кампусе Циньхуа искусственный интеллект был еще непопулярной дисциплиной, о которой никто не заботился; Чжан Лэй был студентом-бакалавром компьютерного отделения, экспериментировавшим с AGV-роботами в лаборатории. Тогда руководитель лаборатории занимался с аспирантами проектами, связанными с робототехникой, что произвело на него глубокое впечатление, и позже он также стал его учеником.

Руководитель лаборатории зовут Чжан Бо, один из основоположников искусственного интеллекта в Китае. Каждый раз, когда Чжан Лэй приглашает его посмотреть результаты эксперимента, он с энтузиазмом садится рядом с Чжан Лэем, некоторое время смотрит на экран и протягивает палец: «Измени это немного и посмотри, что получится». Это не проверка домашнего задания — он действительно хочет знать, что произойдет, если ты изменишь параметры.

То, чему Чжан Бо научил Чжан Лэя, позже было сведено к трём словам: «Понять до конца».

Не поймешь — обманут, поймешь — узнаешь, как устроены базовые принципы.

Дух китайских поколений исследователей передается через такие мелкие детали.

В 2018 году Чжан Лэй работал над слабо контролируемым обнаружением объектов в Microsoft, но не смог добиться успеха, и он не сменил тему.

Если не получается с этой стороны, попробуйте другой подход — думайте об этом даже во время еды и сна, постоянно кружите вокруг него.

Это не риторика, а его повседневность.

Позже, работая над Grounding DINO в IDEA, он решил проблему с другой точки зрения. Прорыв произошел в конце 2022 года, когда появился ChatGPT — возможности языковых моделей значительно выросли, а данных стало достаточно.

Чжан Лэй использовал описание: «естественно возникает».

От изменения параметров AGV-роботов до решения проблемы построения мировой модели прошло тридцать лет. За эти тридцать лет он от масштабного поиска изображений до универсального понимания визуальной информации стремился к полному пониманию и наилучшему решению каждой задачи, пока снова не вернулся к направлению «построение мировой модели для роботов». Как сказал Джобс: «связать точки» — каждое дело, выполненное серьезно, не пропадает зря.

В конце 2025 года 90-летний Чжан Бэй прилетел в Шэньчжэнь читать лекции. После утренней лекции он сразу отправился в офис ShiQi Weilai. Семь или восемь молодых людей окружили его, и он рассказывал им целый послеобеденный час, а вечером вместе поужинали, рассказывая о своих студенческих годах и своих прогнозах по этому направлению. Его мышление было ясным, логика — безупречной, он ничем не уступал молодым. Чжан Лэй также рассказал своему учителю о том, чем он сейчас занимается.

Диалог с Чжан Лэем из IDEA: «Если действие не является условием ввода, это не называется мировой моделью»

Профессор Чжан Бо на мероприятии «Взгляд в будущее»; Чжан Лэй рассказывает учителю о прогрессе исследований

Тридцать лет назад, в кампусе Циньхуа, учитель сидел рядом со студентом и сказал: «Измени это и посмотри, как получится».

Тридцать лет спустя, в офисе Шэньчжэня, студент рассказывает своему 90-летнему учителю о своей модели мира.

Какая трогательная сцена воссоздана.

Люди стареют, приливы отступают, горячие темы остывают, но у китайских исследователей никогда не менялось стремление полностью понять каждую мировую проблему. Leifeng.com

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.