Сообщается, что ByteDance готовится предварительно обучить ИИ-модель с примерно 10 триллионами параметров — масштаб, который превзойдет все известные китайские ИИ-системы и поставит компанию в прямую конкуренцию с наиболее передовыми западными лабораториями. Для этого потребуется примерно 30 000 GPU и оценочные 3–6 месяцев непрерывного предварительного обучения.
Чтобы представить 10 триллионов параметров, это более чем в три раза больше, чем у модели Moonshot AI Kimi K3, которая имеет 2,8 триллиона параметров и в настоящее время относится к одним из самых крупных моделей, созданных в Китае. Параметры — это essentially «ручки», которые модель ИИ настраивает во время обучения для выявления закономерностей в данных.
Что на самом деле строит ByteDance
Используемая модель имеет архитектуру Mixture of Experts (MoE). Вместо активации всех параметров для каждого запроса модели MoE направляют каждый вход на подмножество специализированных подсетей-экспертов. Это делает их значительно более эффективными при выводе по сравнению с плотной моделью того же общего размера.
Команда Seed AI ByteDance, которая, как сообщается, насчитывает около 2000 сотрудников, возглавляет эти усилия. У команды есть опыт масштабирования тренировочных запусков: ранее она обучала модели до 175 миллиардов параметров с использованием примерно 12 000 GPU. ByteDance опубликовала исследования своей инфраструктуры MegaScale, разработанной для управления распределенными системами обучения, превышающими 10 000 GPU.
Этап предварительного обучения — это только первый шаг. После первоначального запуска модель пройдет дообучение перед любым потенциальным публичным выпуском. Основатель ByteDance Чжан Имин, по сообщениям, поручил команде Seed AI сосредоточиться на настоящих технологических прорывах, а не полагаться на дистилляцию из западных ИИ-систем.
Почему ByteDance считает, что сможет это реализовать
У ByteDance есть несколько структурных преимуществ, делающих этот проект чем-то большим, чем просто показуха. Компания управляет TikTok, который обслуживает более миллиарда пользователей по всему миру, и Doubao — одним из самых популярных ИИ-ассистентов в Китае. Этот потребительский охват генерирует огромный объем данных о взаимодействиях, которые могут помочь в принятии решений по обучению и тонкой настройке.
Самый очевидный вопрос, конечно, — это американские экспортные ограничения на передовые чипы ИИ. Вашингтон постепенно ужесточал контроль над продажей высокопроизводительных GPU Nvidia и других ускорителей китайским компаниям. ByteDance не публично раскрыла, какие именно модели GPU она планирует использовать для этого цикла обучения, но способность компании собрать 30 000 из них говорит о том, что ей удалось найти работоспособный путь обхода этих ограничений.
Конкурентная среда, которую это перестраивает
ByteDance — не единственная китайская лаборатория ИИ с большими амбициями. Команды Alibaba Qwen, Baidu и стартапы, такие как DeepSeek и Moonshot AI, также продвигают границы масштаба моделей. Однако модель с 10 триллионами параметров означала бы значительный скачок по сравнению с тем, что любая из них публично объявила или внедрила.
Цель также вовлекает ByteDance в разговор с западными лабораториями передовой области. Последние системы Anthropic, с которыми, как сообщается, ByteDance стремится сравниться, представляют собой текущий потолок известных публично возможностей ИИ.
Предварительный период обучения в 3–6 месяцев означает, что результаты или осложнения могут начать проявляться до конца 2026 года.
