ByteDance планирует создать ИИ-модель с 10 триллионами параметров с использованием 30 000 GPU

iconCryptoBriefing
Поделиться
AI summary iconСводка
ByteDance проводит предварительное обучение ИИ-модели с 10 триллионами параметров, используя около 30 000 GPU, что превышает существующие китайские ИИ-системы. Команда Seed AI, ранее создавшая модель с 175 миллиардами параметров, использует архитектуру Mixture of Experts (MoE). Предварительное обучение займет от 3 до 6 месяцев, за которыми последует тонкая настройка. В это время BTC продолжает выступать в качестве хеджа против инфляции на фоне глобальных макроэкономических изменений. Регулирование CFT также набирает популярность в секторах разработки ИИ.

Сообщается, что ByteDance готовится предварительно обучить ИИ-модель с примерно 10 триллионами параметров — масштаб, который превзойдет все известные китайские ИИ-системы и поставит компанию в прямую конкуренцию с наиболее передовыми западными лабораториями. Для этого потребуется примерно 30 000 GPU и оценочные 3–6 месяцев непрерывного предварительного обучения.

Чтобы представить 10 триллионов параметров, это более чем в три раза больше, чем у модели Moonshot AI Kimi K3, которая имеет 2,8 триллиона параметров и в настоящее время относится к одним из самых крупных моделей, созданных в Китае. Параметры — это essentially «ручки», которые модель ИИ настраивает во время обучения для выявления закономерностей в данных.

Что на самом деле строит ByteDance

Используемая модель имеет архитектуру Mixture of Experts (MoE). Вместо активации всех параметров для каждого запроса модели MoE направляют каждый вход на подмножество специализированных подсетей-экспертов. Это делает их значительно более эффективными при выводе по сравнению с плотной моделью того же общего размера.

Реклама

Команда Seed AI ByteDance, которая, как сообщается, насчитывает около 2000 сотрудников, возглавляет эти усилия. У команды есть опыт масштабирования тренировочных запусков: ранее она обучала модели до 175 миллиардов параметров с использованием примерно 12 000 GPU. ByteDance опубликовала исследования своей инфраструктуры MegaScale, разработанной для управления распределенными системами обучения, превышающими 10 000 GPU.

Этап предварительного обучения — это только первый шаг. После первоначального запуска модель пройдет дообучение перед любым потенциальным публичным выпуском. Основатель ByteDance Чжан Имин, по сообщениям, поручил команде Seed AI сосредоточиться на настоящих технологических прорывах, а не полагаться на дистилляцию из западных ИИ-систем.

Почему ByteDance считает, что сможет это реализовать

У ByteDance есть несколько структурных преимуществ, делающих этот проект чем-то большим, чем просто показуха. Компания управляет TikTok, который обслуживает более миллиарда пользователей по всему миру, и Doubao — одним из самых популярных ИИ-ассистентов в Китае. Этот потребительский охват генерирует огромный объем данных о взаимодействиях, которые могут помочь в принятии решений по обучению и тонкой настройке.

Самый очевидный вопрос, конечно, — это американские экспортные ограничения на передовые чипы ИИ. Вашингтон постепенно ужесточал контроль над продажей высокопроизводительных GPU Nvidia и других ускорителей китайским компаниям. ByteDance не публично раскрыла, какие именно модели GPU она планирует использовать для этого цикла обучения, но способность компании собрать 30 000 из них говорит о том, что ей удалось найти работоспособный путь обхода этих ограничений.

Конкурентная среда, которую это перестраивает

ByteDance — не единственная китайская лаборатория ИИ с большими амбициями. Команды Alibaba Qwen, Baidu и стартапы, такие как DeepSeek и Moonshot AI, также продвигают границы масштаба моделей. Однако модель с 10 триллионами параметров означала бы значительный скачок по сравнению с тем, что любая из них публично объявила или внедрила.

Цель также вовлекает ByteDance в разговор с западными лабораториями передовой области. Последние системы Anthropic, с которыми, как сообщается, ByteDance стремится сравниться, представляют собой текущий потолок известных публично возможностей ИИ.

Предварительный период обучения в 3–6 месяцев означает, что результаты или осложнения могут начать проявляться до конца 2026 года.

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.