ByteDance, як повідомляється, готується до попереднього навчання моделі ШІ з приблизно 10 трильйонами параметрів — масштаб, який перевищить усі відомі китайські системи ШІ та поставить компанію в пряму конкуренцію з найбільш просунутими західними лабораторіями. Цей проект вимагатиме приблизно 30 000 GPU та оцінених 3–6 місяців безперервного попереднього навчання.
Щоб зрозуміти масштаб 10 трильйонів параметрів, це більше, ніж утричі більше, ніж у моделі Moonshot AI Kimi K3, яка має 2,8 трильйона параметрів і зараз входить до числа найбільших моделей, створених у Китаї. Параметри — це, за суттю, регулятори, які модель ШІ налаштовує під час навчання, щоб вивчати закономірності в даних.
Що насправді будує ByteDance
Модель, про яку йде мова, використовує архітектуру Mixture of Experts (MoE). Замість активації всіх параметрів для кожного запиту, моделі MoE направляють кожен вхід до підмножини спеціалізованих підмереж «експертів». Це робить їх набагато ефективнішими під час висновку порівняно з щільною моделлю того ж загального розміру.
Команда Seed AI ByteDance, яка, за повідомленнями, налічує близько 2000 співробітників, керує цим зусиллям. Команда має досвід масштабування тренувальних процесів, раніше навчаючи моделі з кількістю параметрів до 175 мільярдів за допомогою приблизно 12 000 GPU. ByteDance опублікувала дослідження щодо інфраструктури MegaScale, створеної для управління розподіленими тренувальними системами, що перевищують 10 000 GPU.
Етап попереднього навчання — це лише перший крок. Після початкового запуску модель пройде доналаштування перед будь-яким потенційним публічним випуском. Засновник ByteDance Чжан Їмін, за повідомленнями, наказав команді Seed AI зосередитися на справжніх технологічних проривах, а не на залежності від дистиляції з західних штучних інтелектуальних систем.
Чому ByteDance вважає, що зможе це зробити
У ByteDance є кілька структурних переваг, які роблять це більше, ніж просто проект для показу. Компанія володіє TikTok, яким користується понад мільярд користувачів по всьому світу, та Doubao — одним із найбільш використовуваних AI-асистентів у Китаї. Цей споживчий охоплення генерує величезний обсяг даних про взаємодію, які можуть допомогти у прийнятті рішень щодо навчання та доналаштування.
Великий слон у кімнаті, звичайно ж, — це американські експортні обмеження на передові чіпи для ШІ. Вашингтон поступово підсилював контроль над продажем високопродуктивних GPU Nvidia та інших прискорювачів китайським компаніям. ByteDance не публічно розкривала, які саме моделі GPU вона планує використовувати для цього навчання, але здатність компанії зібрати 30 000 з них свідчить про те, що вона знайшла працездатний шлях обходу цих обмежень.
Конкурентний ландшафт, який це змінює
ByteDance — не єдина китайська лабораторія ШІ з великими амбіціями. Команди Alibaba Qwen, Baidu та стартапи, такі як DeepSeek і Moonshot AI, усі прагнуть розширити межі масштабу моделей. Але модель з 10 трильйонами параметрів стала б значним стрибком далеко за межі того, що будь-хто з них публічно оголосив або запустив.
Ціль також включає ByteDance до розмови з західними лабораторіями передньої лінії. Найновіші системи Anthropic, які, як повідомляється, ByteDance прагне відтворити, є поточним верховним рівнем відомих публічно можливостей ШІ.
Протягом 3–6 місяців передтренувального періоду результати або ускладнення можуть почати проявлятися до кінця 2026 року.
