Сектор даних з ембодід інтелекту в Китаї зростає, 25 стартапів отримали понад 17 млрд у 2026 році

icon MarsBit
Поділитися
AI summary iconКороткий зміст
Індустриальні тенденції Китаю у сфері даних про втілену інтелігентність демонструють сильний імпульс: до середини 2026 року 25 стартапів отримали фінансування на суму понад 17 мільярдів юанів. Компанії, такі як LiberAI та Guanglun Intelligence, лідирують у постачанні даних для навчання роботів на тлі зростаючого попиту. Сектор поділено на п’ять підходів: дані з реальних роботів, симуляція, дані на основі UMI, відеодистиляція та інфраструктурні платформи. Дані про інфляцію та інвестиційні потоки залишаються тісно пов’язаними, оскільки фінансування на нижньому етапі забезпечує значну частину попиту на дані, формуючи симбіотичний, але хрупкий ринок.

Кінець липня LiberAI завершила раунд фінансування Pre-A+, сума якого становить сотні мільйонів юанів. Серед інвесторів — група 360, China Development Bank Capital, Innovation Works, CMC Capital, BinFu Capital, Sequoia Capital China.

Ця компанія була заснована 8 грудня 2025 року під назвою «Цзянсіан Технології», що означає «Бажання відпочити — це перша продуктивність»; статутний капітал становить 1,46 мільйона юанів, команда налічує менше 30 осіб.

IT 桔子 виявило, що це вже п’яте раунд фінансування з моменту заснування; за останні півроку компанія активно збирала кошти з надзвичайно високою швидкістю — успішно пройшовши чотири раунди: сім’я, ангельський, ангельський+ та Pre-A. За повідомленнями, остання оцінка досягла 5 мільярдів юанів.

Засновник Лю Суньмін — представник покоління 00, лауреат спеціальної стипендії Тсінхуа з інформатики, перший у профілі, учень професора Чжу Цзюнь, отримав докторський ступінь у 23 роки і відразу заснував бізнес. Раніше він керував розробкою RDT-1B — першої великої дифузійної Transformer-моделі, розробленої спеціально для керування роботами з двома руками, з кількістю параметрів 1,2 мільярда.

LiberAI спрямована на дані UMI людей та світову модель — іншими словами, вона продає дані, які подаються роботам, та мозок, який їх обробляє.

За даними IT Juzi, у першій половині 2026 року 25 китайських стартапів у сфері ембодієд-інтелекту зібрали понад 17 мільярдів юанів фінансування, що свідчить про те, що «дані» стали найбільш визначеною справою в секторі ембодієд-технологій. (Не враховано окремі компанії, які одночасно розробляють як моделі ембодієд-даних, так і робототехнічні системи, наприклад, Xinghai Tu та Qianxun Intelligence)

Світова модель

Щоб отримати повний список компаній та дані про фінансування у секторі ембодімент-даних, перегляньте та завантажте дані на сторінці альбому IT桔子: https://www.itjuzi.com/album/766 (наразі включено 42 компанії)

При цьому Guanglun Intelligence отримала не лише велике зовнішнє фінансування, але й у I кварталі отримала замовлення на 550 мільйонів юанів.

Поки рудокопи ще не знайшли золото, продавці лопат вже заробили гроші.

I. Нерозв’язана проблема: пустеля даних у робототехніці

Чому величезні мовні моделі здатні до вибухового росту? Тому що в інтернеті є нескінченна кількість мовних даних.

Але навчання робота засноване не на текстовій мові, а на тривимірних фізичних даних дій, таких як піднімати, кладти, ходити, хапати, крутити, підкидати сковороду — таких даних майже не існує в Інтернеті.

У всьому індустрії недостатність ембоді-даних є великою перешкодою.

Grand View Research передбачає, що глобальний ринок збору та анотації даних до 2030 року досягне 17,1 мільярда доларів США.

Наразі галузь загалом визнає, що дані про ембодімент мають пірамідальну структуру: на вершині — дані реальних пристроїв, які мають високу якість і можуть бути безпосередньо впроваджені, але є найбільш дорогими; на середньому рівні — синтетичні дані симуляції та дані UMI, які мають помірну вартість і можуть вироблятися без обмежень, але існує «сим-до-реального» розрив (похибки наближення тертя/деформації); на основі — відео з інтернету та дані про людську поведінку, які мають найширший джереловий охоплення, але відсутні деталі взаємодії та інформація є розрідженою.

Потім кожен рівень має серію компаній, які спеціалізуються на цьому — це координатна система для розуміння сьогоднішньої хвилі стартапів у галузі ембоді-даних.

Друге: Панорама п’яти великих шкіл і понад тридцяти компаній

Напрямок 1: Керування через реальний пристрій / тактильний напрямок — обробляйте дані як конвеєр

Цей підхід ґрунтується на найпростішій логіці: будівництво заводів, розміщення роботів, встановлення систем захоплення руху та масове виробництво високоточних даних за допомогою конвеєрної лінії.

Найбільш агресивним є відчуття Пасіні.

Компанія має найбільший обсяг поставок тактильних датчиків у світі; у 2025 році Pascin побудує у Тяньцзині найбільшу у світі фабрику збору ембоді-даних Super EID Factory з річною продуктивністю 2 мільярди даних; після завершення B-раунду на суму понад 1 млрд юанів та оцінки понад 10 млрд юанів, компанія оголосила про будівництво ще чотирьох суперфабрик даних у Суцзянь, Ухані, Цзиньго та Ганчжоу.

Захисник із динамічним відстеженням — це ще одна гілка цієї лінії.

Засновник роботів Nuoyiteng Дай Жоулі раніше привів компанію Nuoyiteng Technology до частки 70% на глобальному ринку професійного захоплення руху, а потім заснував нову компанію — Nuoyiteng Robotics. У червні було завершено серію Pre-A++ на кілька мільярдів юанів, оцінка склала близько 3 мільярдів юанів. Інвестиційні фонди з Пекіна та Шанхаю з фокусом на ІІ, Shenzhen Chuangtou, CICC та Kunlun Capital вклалися разом, і було представлено платформу повнолітніх даних ModalityNet.

Цинтун Віжн вибрав шлях відкритого коду та екосистеми, у травні випустивши найбільший у світі відкритий набір даних з оптичним захопленням руху людини — 1000 годин високоточної інформації, з прогнозом щорічного виробництва 500 000 годин. Дані про бойові мистецтва, використані у виставі робота «ВУБОТ» на Січневому святі Yuyu Technology, були зібрані за допомогою системи Project Decode.

Такі нові гравці в галузі тактильних технологій, як Lingsheng Technology, також займають позиції.

Другий напрямок: симуляційний синтез — «друкування» даних у віртуальному світі

Якщо справжні дані занадто дорогі, чи можна створити у комп’ютері віртуальний світ, достатньо реалістичний з фізичної точки зору, і масово «друкувати» навчальні дані?

Цей маршрут став домом для першого у світі унікорна ембоді-даних: Guanglun Intelligence.

У березні цього року було завершено фінансування серії A++ на 1 млрд юанів, у травні отримано інвестиції з лідерством Ant Group, а в червні залучено ще 1 млрд юанів, після чого оцінка компанії перевищила 2 млрд доларів США (приблизно 15 млрд юанів).

Доходи Guanglun Intelligence збільшився в 10 разів у 2025 році, нові замовлення за перший квартал 2026 року склали 550 мільйонів юанів — більше, ніж за весь минулий рік.

CrossDimension Intelligence є представником «генеративного симулювання»: власний симуляційний двигун DexVerse автоматично генерує величезний обсяг даних сцен у віртуальному світі; у липні цього року було оголошено фінансування на 1 мільярд юанів, оцінка перевищила 10 мільярдів юанів, розпочато IPO, дохід за перше півріччя склав 100 мільйонів юанів, вже було комерційно доставлено понад 1500 моделей.

У списку публічно торгуємих компаній, Qunxue Technology, яка дебютувала на гонконгській біржі в квітні цього року як «перша у світі компанія з глобального просторового інтелекту», розширює свої накопичені масштабні 3D-дані хмарного дизайну в напрямку ембоді-інтелекту.

Фірми-партнери з симуляційної платформи Songying Technology отримали збір коштів у розмірі сотень мільйонів юанів у лютому та липні на етапах Pre-A та Pre-A+, і разом із державними та місцевими органами створили інноваційний центр з розробки роботів-андроїдів та синтетичні набори даних.

Третій напрямок: UMI без онтології / портативна збірка — обхід онтології, «відтворення» людини

У дистанційно керованого робота є недолік — він збирає не справжні здібності людини, а дії, які були скомпромісовані, щоб робот міг слідувати за ними. Тож цей підхід повністю минує тіло, дозволяючи людині працювати безпосередньо в рукавичках, захопах та носимих пристроях.

Це найбільш капіталомісткий маршрут цього року.

1 червня компанія Цзяньчжи Роботікс офіційно оголосила про серію інвестицій на сума понад сотні мільйонів юанів, які очолили Ant Group, Didi та Delian Capital, а також супроводжувалися Shunwei та BV Baidu Ventures — це найбільше фінансування в галузі даних без тіла на сьогоднішній день.

Засновник Чен Цзяньсін — колишній старший директор з алгоритмів у Momenta. За рік існування компанія вже охопила тисячі реальних сценаріїв та уклала стратегічну співпрацю з Ant Lingbo.

Та Шіхан запропонував парадигму збору даних, орієнтовану на людину, і представив рішення SenseHub для носіння; у квітні було завершено пре-серію A фінансування на суму 455 мільйонів доларів США, що стало найбільшим окремим інвестиційним раундом у сфері ембодірованого штучного інтелекту в Китаї, при цьому лідерами інвестицій стали Hillhouse, Sequoia та Meituan, а також було розпочато ініціативу «Запал ембодірованих даних» з метою збору 1 мільярда годин даних.

Система FastUMI від робота Lu Ming, пов’язаного з Цинхуа, збільшила ефективність збору даних у три рази та знизила витрати до п’ятої частини, отримавши постійне фінансування від Mitsubishi Electric та угоди з провідними клієнтами.

У лютому цього року Zhiyuan Robotics відділила свої дані в окрему компанію Mifeng Technology, яка за десять днів зібрала сотні мільйонів юанів у серії seed-та ангельських інвестицій, з лідером у вигляді Sequoia Capital China, і планує до 2026 року досягти виробничої потужності даних у мільйони годин.

Також з’являється молодше покоління: StarMemory Technology, виведена з комп’ютерного відділу Цинхуа, орієнтується на шлях NVIDIA EgoScale, розробляючи перший відсоток носимих пристроїв для збору даних з високою свободою та міліметровою точністю; вона завершила перший раунд фінансування та отримала пре-А раунд у липні; професор Пекінського університету Лу Цзунцін використовує відео з інтернету для попереднього навчання універсальної моделі дій.

Навчена Non夕 компанія Qiongche Intelligence отримала майже сто замовлень на свою систему збору даних CoMiner з принципом «виробництво з супроводом», у червні отримала додаткове фінансування в розмірі кількох сотень мільйонів юанів і збирається запустити власну світову модель.

Ще одна дуже нова компанія — Yuanchè Taichu (OriginFlow), яка використовує парадигму NeuroScale, за допомогою власно розробленого набору для збору електроміографічних сигналів фіксує електричні сигнали скорочення м’язів людини, кодує та реконструює позу руки, зусилля та тактильну відповідь за допомогою базової моделі PULSE; інтегрується з первинною ланкою «намір — м’яз — дія», щоб усунути обмеження UMI, пов’язані з втратою візуального сигналу та відсутністю силових та тактильних даних.

За рік існування компанія зібрала понад 500 мільйонів юанів у рамках ангельського, стратегічного та Pre-A1 раундів фінансування. Засновник Цин Шентао — доктор Тсінхуа у віці 20 років, бакалавр Харбінського технологічного інституту.

Напрямок 4: Відеодистиляція / Моделі світу — навчання ШІ «розуміти» фізичний світ

Цей підхід вирішує проблему «перетворення відходів у цінність» на найнижчому рівні ієрархії даних: у Інтернеті є безліч відео з людськими діями — приготуванням їжі, ремеслами, ремонтом, але ці відео не містять інформації про сили, дотик та тривимірні траєкторії, які потрібні роботам, і тому залишаються «видимими, але непридатними» даними.

Ідея відеодистиляції полягає у використанні алгоритмів для відновлення траєкторій руху та фізичних взаємодій з двовимірного відео, перетворюючи мертві дані на «втілені» дані, придатні для навчання, при цьому витрати знижуються до тисячної частки від витрат на збір даних за допомогою реальних пристроїв.

Прихильники світових моделей діють більш прямо: спочатку дають ШІ зрозуміти закони функціонування фізичного світу, а потім генерують у «мозку» безліч тренувальних даних.

Лінійка SynaData компанії Shu Tu Technology може масово витягувати з інтернет-відео багатомодальні ембоді-дані, такі як траєкторії рук та шляхи руху об’єктів, при цьому загальні витрати на збір даних дуже низькі. Компанія отримала інвестиції в кілька мільйонів юанів від Dongfang Fuhai; її дані використовуються такими основними відкритими моделями, як清华RDT та 智元UniVLA.

Jiexia Shijie використовує світову модель GigaWorld для генерації навчальних даних, що дозволяє збільшити продуктивність моделі VLA майже на 300% за трьома узагальнювальними вимірами; у червні було завершено серію B+ на 1 млрд юанів, а за три місяці загальний обсяг залучених коштів склав 3,5 млрд юанів.

Глибоке розуміння також інвестує у дані відео з першої особи, у першій половині цього року залучило три раунди фінансування на суму понад сотні мільйонів юанів; у травні глибоке розуміння Z-WM світова модель посіла перше місце у світі за результатами оцінки WorldArena.

У статті згаданий LiberAI — це також гібрид цього напрямку та гонки з моделями світу.

Напрямок 5: Інфраструктура/платформа даних — це платформа даних, а також «нафтопереробний завод»

Ця позиція вважає, що обмеження ембодірованих даних — це не лише «як збирати», але й «як використовувати».

Різні роботи мають різну конструкцію, сенсори та формати даних, тому сирові дані, що збираються, нагадують сирову нафту зі змішаними компонентами — пряме введення їх у модель призведе лише до погіршення навчання — хто займатиметься очищенням, вирівнюванням, анотуванням та оцінкою, перетворюючи сирову нафту на стандартний бензин?

Тим більше, тренувальний центр, збірні пристрої та системи захоплення руху — це важкі активи, які малим командам взагалі не під силу. Тому потрібно створювати спільні тренувальні центри, встановлювати стандарти даних та пропонувати інструменти та платформенні сервіси. Вони не ставлять на те, який напрямок технологій даних виграє, а замість цього ставлять на те, що будь-хто, хто виграє, змушений буде пройти через шлях, який вони побудували.

Wuwen Zhike використовує датасет для збору та навчання у Дэчжэнь, що забезпечує замкнений цикл віртуально-реального злиття, щодня збираючи тисячі годин даних; у квітні отримала фінансування на суму понад 100 мільйонів юанів, а в першому кварталі уклала контракти на суму кількох сотень мільйонів юанів з ByteDance, Wujie Power тощо.

Yiren Technology у квітні успішно завершила два етапи фінансування на рівні сотень мільйонів юанів і оголосила, що в 2025 році досягне доходу в один мільярд юанів та отримає прибуток, ставши, ймовірно, першою компанією у цьому сегменті, яка оголосила про прибуток.

Також у грудні минулого року було засновано «Чжіюй Цзіші», яка спеціалізується на очищенні, зв’язуванні та управлінні даними на середньому етапі перетворення, і всі ці компанії — «Лінчучжі», «Цюньчє», «Чжіквадрат» — інвестували в цей «верхній» етап.

До гри підключилися публічні компанії: лідер у сфері послуг з обробки даних Haitian Ruisheng спільно з Центром з навчання даних для роботів-андроїдів у районі Шицзиншань, Пекін, створюють «Поле для навчання даних ембоді-інтелекту».

Також до гри підключилися великі компанії: JD.com запустив інфраструктуру повного циклу для експліцитних даних, плануючи залучити 600 000 кур’єрів і водіїв-кур’єрів для збору даних у режимі краудсорсингу, з метою накопичити 10 мільйонів годин відео у реальних умовах протягом двох років; Baidu ж створює «ринок даних».

Три: Затихніть — чи є попит на дані жорстким?

2026 рік стає роком масштабування ембоді-даних; згідно з даними, станом на кінець квітня 2026 року щонайменше 90 центрів збору даних перебували у статусі «використання або планування»; з них 64 вже введені в експлуатацію, решта — у будівництві або на етапі планування.

Але чим жарчіше вітер, тим більше потрібно охолодити.

У сфері ембодірованих даних існує структурна проблема, яку рідко згадують: і попит, і пропозиція фінансуються тими самими капіталами.

Досить подивитися на список покупців — команди великих моделей, стартапи-роботи, виробники онтологій у процесі трансформації: більшість із цих покупців ще не отримали прибутку, а бюджет на закупівлю даних походить від недавно отриманих інвестицій.

Іншими словами, дохід компаній, що працюють з даними, суттєво є повторним розподілом фінансування з боку нижчих ланок: компанії з ембоді-інтелектуальними роботами отримують фінансування, а потім купують дані, щоб розповісти історію; якщо історія вдається, вони отримують наступне фінансування.

Якщо реалізація компанії-виробника роботів не відповідає очікуванням, замовлення даних і фінансування одночасно зникають. Це взаємозалежні стосунки, де все залежить від попиту на ринку з боку нижчої ланки.

Тільки тоді, коли компанії-роботи зможуть постійно отримувати прибуток, цей бізнес стане більш надійним і відповідатиме логіці.

У галузі існує загальна думка, що довгостроково виживуть лише два типи компаній, що працюють з ембоді-даними: одна стає індустриальним стандартним платформом, контролюючи екосистемні інструменти, такі як симуляція, обробка даних та оцінка; інша має здатність до об’єднання та очищення даних між різними виробниками, забезпечуючи постійну поставку якісних, довгочастотних даних після того, як роботи увійдуть у реальні сценарії.

Цей матеріал зі сторінки WeChat «IT Juzi» (ID: itjuzi521), автор: У Меймей

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.