GPT-6 Astra открыто сообщила, что для обучения использовалось более 100 000 GPU Grace Blackwell, что означает, что конкуренция передовых моделей перешла в эпоху сверхмасштабных кластеров.Автор и источник статьи: ME News

Коротко:
- GPT-6 Astra открыто сообщила, что для обучения использовалось более 100 000 GPU Grace Blackwell, что означает, что конкуренция передовых моделей перешла в эпоху сверхмасштабных кластеров.
- Китайские ведущие компании по разработке моделей не лишены крупномасштабных вычислительных ресурсов, однако открытые данные показывают, что значительный разрыв сохраняется в отношении передовых поколений GPU и масштаба одновременной централизованной развертки.
- Компании ByteDance, Kimi, DeepSeek и другие расширяют свои вычислительные мощности, но в настоящее время они в основном сосредоточены на архитектуре Hopper или отечественных альтернативах, что все еще отстает от кластеров уровня Blackwell.
- Ключевой аспект конкуренции в области ИИ сместился с вопроса «есть ли GPU» на вопрос «можно ли получить GPU нового поколения и эффективно организовать десятки тысяч乃至 сотни тысяч чипов».
- Даже если Blackwell уже не является последней архитектурой NVIDIA, тенденция к дальнейшему снижению затрат на обучение с помощью Rubin означает, что лидерство может продолжать концентрироваться в области инфраструктурных возможностей.
За 100 000 чипами Blackwell крупные модели выходят на эпоху инфраструктуры вычислительных ресурсов
Когда Хуан Ренсюнь раскрыл масштабы обучения GPT-6 Astra, внимание общественности привлек не только сам цифровой показатель «100 000 GPU», а то, что за этим числом стоит новая парадигма конкуренции в области ИИ.
В последние годы конкуренция крупных моделей часто воспринималась как соревнование в алгоритмах, данных и инженерных возможностях. Инновации в архитектуре моделей, оптимизация методов обучения и повышение эффективности вывода действительно определяли конечные возможности AI-продуктов. Однако после 2026 года формируется все более очевидная тенденция: по мере постоянного увеличения масштаба моделей сами возможности инфраструктуры становятся важным фактором, определяющим технологические ограничения.
Согласно публичным данным Хуань Рэньсюня, для обучения GPT-6 Astra было использовано более 100 000 GPU Grace Blackwell, объединённых в высокоскоростную кластерную сеть с помощью NVLink72. Он также отметил, что следующая партия из 400 000 GPU будет запущена, но не раскрыла конкретные модели и принадлежность.
Независимо от дальнейших деталей развертывания, этот сигнал ясно указывает: обучение самых передовых моделей переходит от конкуренции в десятки триллионов параметров и тысячи GPU к конкуренции между кластерами из десятков тысяч и даже сотен тысяч передовых GPU.
Здесь ключевым является не только количество.
Если сравнивать только количество GPU, китайские компании не лишены крупных вычислительных ресурсов. Реальное различие заключается в возможности получить GPU новейшего поколения высокой производительности и обеспечить эффективное взаимодействие этих GPU в рамках одной задачи обучения.
Для крупных моделей пиковая производительность одного GPU — это лишь основа. Для обучения крупной модели требуется постоянный обмен параметрами и данными между большим количеством GPU. Если эффективность взаимосвязи недостаточна, даже наличие большого количества чипов не позволит сформировать эффективную вычислительную мощность.
Таким образом, конкуренция в области ИИ-инфраструктуры по сути перешла от «сколько карт купить» к «какую вычислительную систему построить».
Китайские ведущие компании по разработке моделей сталкиваются с поколенческим разрывом в распределении вычислительных мощностей по сравнению с эрой Blackwell
Согласно текущей открытой информации, вычислительные мощности ведущих китайских компаний, разрабатывающих модели, быстро растут, но по-прежнему значительно уступают тренировочным кластерам уровня Blackwell, представленным GPT-6 Astra.
Bytedance является одной из компаний в Китае, чья распределённая вычислительная мощность наиболее близка к международному уровню. В этом году Bytedance подключила около 36 000 GPU B200 через Малайзию. Эти чипы относятся к архитектуре NVIDIA Blackwell и принадлежат к тому же поколению, что и GB200, используемые в Astra.
Однако следует отметить, что эти B200 развернуты за рубежом. При публичном представлении инфраструктуры ИИ в Китае ByteDance в основном использует китайскую версию H20 на архитектуре Hopper, а также ранее полученные чипы H800.
Здесь проявляется не просто количественное различие, а разрыв в цепочке поставок и среде развертывания.
Blackwell по сравнению с Hopper получил улучшения в вычислительной мощности, объеме видеопамяти и способности к взаимосвязи. Особенно это касается GB200 — он представляет собой не просто отдельную GPU, а сочетание Grace CPU и Blackwell GPU, соединенных в системе NVL72, которая объединяет 72 GPU в единую высокоскоростную сеть.
Для обучения крупных моделей важность такой системной архитектуры постоянно растет, поскольку с увеличением размера модели доля коммуникации между GPU возрастает, и эффективность взаимодействия между чипами напрямую влияет на производительность обучения.
За Kimi стоящая Moonshot AI также была раскрыта как получившая около 20 000 GPU Hopper через Alibaba. По данным Bloomberg, конкретная модель — H200, но Alibaba опровергла упоминание модели H200.
Если рассматривать H200, он всё ещё относится к архитектуре Hopper предыдущего поколения, тогда как B200 уже перешёл в эпоху Blackwell. Между ними существует не простое соотношение нового и старого, а различие в уровнях возможностей инфраструктуры ИИ на разных этапах.
Ситуация с DeepSeek еще более специфична.
DeepSeek в начале 2025 года привлекла мировое внимание благодаря высокоэффективным моделям, чья технологическая направленность доказала, что оптимизация алгоритмов и инженерная эффективность могут частично снизить потребность в вычислительных ресурсах. Однако согласно открытой информации, компания не раскрыла полные аппаратные конфигурации для обучения V4.
Расшифровка встречи с инвесторами Лян Вэньфэна показывает, что в мае компания имела около 20 000 эквивалентных H вычислительных мощностей, большинство из которых только что поступили, и в будущем закупки будут «в основном NVIDIA». Huawei предоставила DeepSeek производственную мощность 950, составляющую около 16 000 единиц. Лян Вэньфэн отметил, что эта партия отечественных чипов примерно эквивалентна 4 000 чипам Nvidia серии B и достаточна только для обучения текущей модели.
Эти данные отражают реальность: несмотря на то, что китайские компании уже обладают значительным объемом вычислительных мощностей ИИ, между ними и необходимостью сосредоточить использование 100 000 современных GPU одного поколения для одной тренировочной задачи все еще существует масштабный разрыв.
Настоящим слабым местом китайских ИИ-вычислительных мощностей является не отсутствие чипов, а нехватка передовых кластерных возможностей
При обсуждении китайских вычислительных мощностей ИИ легко попасть в два крайности.
Одна точка зрения утверждает, что Китай полностью не имеет передовых ИИ-чипов и поэтому не может участвовать в конкуренции; другая точка зрения считает, что достаточно увеличить количество отечественных чипов, чтобы быстро догнать NVIDIA.
На самом деле, ситуация сложнее.
Возможности обучения ИИ определяются несколькими факторами, включая производительность чипов, передовые технологические процессы, объем видеопамяти, высокоскоростную интерконнекцию, дизайн серверов, электроснабжение центров обработки данных, программную экосистему и способность к масштабному управлению.
GPU — это лишь одна из самых важных составляющих, но не все.
Долгосрочные преимущества NVIDIA созданы не только благодаря аппаратному обеспечению GPU, но и благодаря экосистеме CUDA, технологиям сетевого взаимодействия, серверным решениям и полной системе, сформированной с поставщиками облачных вычислений.
В эпоху Blackwell преимущества такой системы еще больше усиливаются.
Когда для обучения одной модели требуется 100 000 GPU, проблема уже не в том, чтобы приобрести несколько десятков тысяч чипов, а в том, как построить крупный вычислительный завод, способный работать стабильно.
Это также является основной причиной, почему в открытых источниках китайские компании еще не раскрыли случаи использования 100 000 одновременных передовых GPU для обучения одной модели.
Китайские компании повышают свои возможности различными способами, включая увеличение развертывания вычислительных мощностей за рубежом, расширение масштабов адаптации отечественных чипов, оптимизацию архитектуры моделей и повышение эффективности обучения. Все эти подходы имеют ценность, но в краткосрочной перспективе они вряд ли смогут полностью заменить базовые преимущества, предоставляемые самыми передовыми GPU-кластерами.
За последние несколько лет китайская индустрия ИИ доказала один факт: инновации в алгоритмах могут значительно сократить часть разрыва.
Появление таких компаний, как DeepSeek, демонстрирует, что отличные инженерные команды могут достичь прорыва при ограниченных вычислительных ресурсах за счет оптимизации архитектуры модели, корректировки стратегий обучения и повышения эффективности использования ресурсов.
Но другая реальность также существует: когда глобальная конкуренция перейдет на следующий этап базовых моделей, значение масштаба вычислительных мощностей продолжит расти.
Оптимизация эффективности может снизить затраты, но трудно полностью изменить границы возможностей, обусловленные передовыми аппаратными средствами и сверхмасштабными кластерами.
После Blackwell эра Rubin может еще больше расширить разрыв в инфраструктуре
Более важно то, что Blackwell — это не конец текущей технологической линии NVIDIA.
Следующее поколение архитектуры NVIDIA Vera Rubin уже перешло в фазу серийного производства. Согласно публичным оценкам NVIDIA, при обучении крупных MoE-моделей количество необходимых GPU Rubin сокращается примерно до четверти от количества GPU Blackwell.
Это означает, что в будущем конкуренция в области ИИ может войти в новый цикл.
Лидеры отрасли обладают новейшей архитектурой, что позволяет им проводить более масштабное обучение с использованием меньшего количества чипов; более низкая стоимость обучения стимулирует компании проводить больше экспериментов, что дополнительно повышает возможности моделей.
Если компании отстают и могут получать только оборудование предыдущего поколения, они могут столкнуться с двумя проблемами: с одной стороны, низкая эффективность обучения, а с другой — трудности в участии в конкуренции за самые крупные модели.
Конечно, это не означает, что китайские компании в области ИИ не имеют возможностей.
История ИИ неоднократно доказывала, что технологическая конкуренция не определяется исключительно одним аппаратным обеспечением. Инновации в моделях, сценарии применения, способности к коммерциализации и инженерная эффективность также могут привести к новым прорывам.
Однако, если взглянуть на инфраструктуру, событие использования GPT-6 Astra 100 000 GPU Blackwell действительно демонстрирует происходящие изменения: центральной ареной глобальной конкуренции в области ИИ становится все больше не сама модель, а инфраструктура вычислительных ресурсов.
В ближайшие годы конкурентоспособность AI-компаний будет определяться не только способностью обучить качественную модель, но и способностью создавать устойчивую систему для постоянного обучения следующего поколения моделей.
Для китайской индустрии ИИ настоящей целью для достижения является не отдельная модель или отдельный релиз, а вся система способностей — от получения чипов и строительства центров обработки данных до управления кластерами и программной экосистемы.
Значение 100 000 чипов Blackwell заключается не в создании впечатляющего числа, а в напоминании рынку: искусственный интеллект вступает в фазу индустриализации, а конкуренция в индустрии в конечном итоге сводится к инфраструктуре.
Источник:
- Official NVIDIA materials on Blackwell, GB200 NVL72, Vera Rubin architecture, and AI infrastructure.
- Информация о публичных выступлениях и медиа-интервью Хуан Ренсюна.
- Bloomberg о закупке вычислительных мощностей Kimi и связанной с H200 информации.
- Публично раскрытая информация о инфраструктуре ИИ и развертывании вычислительных ресурсов за рубежом компанией ByteDance.
- Материалы транскрипции, связанные с публичной информацией DeepSeek и встречей с инвесторами Лян Вэньфэна.
- Открытая информация Alibaba Cloud о сотрудничестве в области инфраструктуры ИИ и вычислительных мощностей для крупных моделей.
