ByteDance начинает обучение языковой модели с 10 триллионами параметров, приближаясь к масштабу Anthropic

icon MarsBit
Поделиться
AI summary iconСводка
ByteDance начала предварительное обучение огромной языковой модели с до 10 триллионов параметров, согласно сообщениям в новостях об ИИ и криптовалюте. Если модель будет завершена на верхнем пределе, она превзойдет Kimi K3 более чем в три раза и сойдется по параметрам с предполагаемой моделью Mythos 5 от Anthropic с 8 триллионами параметров. Этап предварительного обучения, как ожидается, продлится от 3 до 6 месяцев, за которыми последует дополнительное обучение. Генеральный директор Чжан Имин настаивает на внутренних исследованиях, стремясь конкурировать в глобальной гонке ИИ. Криптовалютные издания рассматривают этот шаг как важное событие в технологическом секторе.

Согласно наблюдениям Beating, издание Financial Times со ссылкой на трёх осведомлённых лиц сообщило, что ByteDance начала предварительное обучение крупнейшей модели с параметрами до 10 триллионов. Проект всё ещё находится на ранней стадии, и окончательный размер не определён. Если модель будет обучена до максимального предела, её размер превысит в три раза параметры Kimi K3 и станет самой крупной моделью среди известных китайских команд. ByteDance напрямую подняла размер модели до уровня флагманской модели Anthropic. Anthropic никогда не раскрывала количество параметров Mythos 5, но Financial Times со ссылкой на отраслевые оценки указала, что Mythos 5 составляет около 8 триллионов параметров, а Fable 5 — около 5 триллионов. Если новая модель ByteDance достигнет 10 триллионов параметров, она по крайней мере по масштабу параметров войдёт в тот же уровень, что и самые передовые закрытые модели США. Эта модель пока находится на стадии предварительного обучения (обучение базовых возможностей модели на огромных объёмах данных). Financial Times отмечает, что этот этап обычно занимает от 3 до 6 месяцев, после чего требуется дополнительное пост-обучение, и только при успешном завершении модель будет выпущена. Более высокое количество параметров не означает автоматически более высокую производительность — конечные результаты зависят от архитектуры, обучающих данных и методов обучения. Чжан Имин недавно в рамках Seed явно выступил против дистилляции моделей конкурентов и потребовал от команды принять временное отставание, сосредоточившись на собственной разработке для выхода в первую мировую лигу. Эта новая модель с максимальным размером в 10 триллионов параметров — самая агрессивная ставка ByteDance по масштабу на сегодняшний день.

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.