GPT-6 Astra використовує понад 100 000 GPU Blackwell, що підкреслює розрив у розвитку кластерів у Китаї

iconMetaEra
Поділитися
AI summary iconКороткий зміст
Новини про ШІ та криптовалюту: GPT-6 Astra використав понад 100 000 GPU Blackwell для навчання, що свідчить про новий етап розвитку ШІ. Китайські компанії, такі як ByteDance та DeepSeek, масштабують використання GPU, але залишаються позаду у впровадженні Blackwell та ефективності кластерів. Основна проблема для Китаю — не кількість GPU, а створення високоефективних систем. Останні новини про криптовалюту показують, що ШІ та інфраструктура залишаються ключовими полями битви.
GPT-6 Astra публічно розкрила, що для навчання використовувалося понад 100 000 GPU Grace Blackwell, що означає, що конкуренція передових моделей вступила в еру надвеликих кластерів.

Автор статті, джерело: ME News



Коротко:

  • GPT-6 Astra публічно розкрила, що для навчання використовувалося понад 100 000 GPU Grace Blackwell, що означає, що конкуренція передових моделей вступила в еру надвеликих кластерів.
  • У китайських лідерів у сфері моделей немає недостатку у великих обчислювальних потужностях, але відкриті дані свідчать про наявність значних розбіжностей у поколіннях передових GPU та масштабі одноразового централізованого розгортання.
  • Компанії ByteDance, Kimi, DeepSeek та інші розширюють свої потужності обчислень, але наразі вони більше зосереджені на архітектурі Hopper або на вітчизняних альтернативах, ще не досягаючи рівня кластерів Blackwell.
  • Ключовим фактором конкуренції в ІО стало не наявність GPU, а здатність отримувати GPU найновішого покоління та ефективно організовувати десятки тисяч або навіть сотні тисяч чіпів.
  • Навіть якщо Blackwell уже не є найновішою архітектурою NVIDIA, тенденція Rubin щодо подальшого зниження витрат на навчання означає, що лідируючий розрив може продовжувати концентруватися в інфраструктурних здібностях.

За 100 000 чипів Blackwell великомасштабні моделі входять у еру інфраструктури обчислювальних потужностей

Коли Хуан Ренсюнь розкрив масштаб навчання GPT-6 Astra, зовнішній світ цікавився не лише цифрою «100 000 GPU», а тим, що ця цифра символізує нову парадигму конкуренції в галузі ШІ.

Протягом останніх кількох років конкуренція між великими моделями часто сприймалася як боротьба за алгоритми, дані та інженерні здібності. Інновації в архітектурі моделей, оптимізація методів навчання та підвищення ефективності висновків дійсно визначали кінцеві можливості продуктів ШІ. Але після 2026 року формується все більш помітна тенденція: коли розміри моделей продовжують зростати, здатності інфраструктури самі по собі стають важливим фактором, що визначає технічний потенціал.

Згідно з публічною інформацією від Хуань Ренсюня, для навчання GPT-6 Astra використовувалося понад 100 000 GPU Grace Blackwell, з’єднаних у високoshвидкісну кластерну мережу за допомогою NVLink72. Він також зазначив, що наступна партія складатиметься з 400 000 GPU, але не розкрила конкретну модель та власника.

Незалежно від подальших деталей розгортання, ця інформація чітко свідчить: навчання найсучасніших моделей переходить від конкуренції з використанням десятків трильйонів параметрів та тисяч GPU до конкуренції між кластерами з десятків тисяч і навіть сотень тисяч сучасних GPU.

Ключовим тут є не лише кількість.

Якщо порівнювати лише кількість GPU, китайські компанії не мають повного відсутності масштабних обчислювальних ресурсів. Справжня різниця полягає в тому, чи можна отримати GPU найновішого покоління з високою продуктивністю, а також чи можна забезпечити ефективну співпрацю цих GPU в одній і тій самій тренувальній задачі.

Для великих моделей пікове виконання однієї GPU — це лише основа. Для навчання великої моделі необхідно постійне обмін параметрами та даними між великою кількістю GPU. Якщо ефективність зв’язку недостатня, навіть наявність великої кількості чіпів не зможе сформувати ефективну обчислювальну потужність.

Тому конкуренція в сфері інфраструктури ШІ суттєво еволюціонувала від питання «скільки карток купити» до питання «яку обчислювальну систему побудувати».

Розподіл обчислювальних ресурсів китайських лідерів у галузі моделей має поколінську різницю з епохою Blackwell

За наявною інформацією, обчислювальні потужності провідних китайських компаній з моделей штучного інтелекту швидко зростають, але все ще значно поступаються тренувальним кластерам рівня Blackwell, які представляє GPT-6 Astra.

ByteDance є однією з компаній, які в Україні найближчі до міжнародного рівня в розгортанні обчислювальних потужностей. Цього року ByteDance підключила приблизно 36 000 GPU B200 через Малайзію. Ці чіпи належать до архітектури NVIDIA Blackwell і належать до того ж покоління, що і GB200, використовувані Astra.

Однак слід звернути увагу, що ці B200 розгорнуті за кордоном. При публічному описі інфраструктури штучного інтелекту в Китаї ByteDance все ще в основному використовує китайську версію H20 на архітектурі Hopper, а також раніше отримані чіпи H800.

Це не просто різниця в кількості, а різниця в ланцюжку поставок та середовищі розгортання.

Blackwell порівняно з Hopper отримав покращення в обчислювальній потужності, об’ємі відеопам’яті та здатності до взаємозв’язку. Особливо GB200 — це не просто GPU, а поєднання Grace CPU та Blackwell GPU, яке за допомогою системи NVL72 з’єднує 72 GPU в одній високoshвидкісній мережі.

Для навчання великих моделей значення такої системної архітектури постійно зростає. Чим більший розмір моделі, тим більший відсоток часу займає зв’язок між GPU; ефективна взаємодія між чіпами безпосередньо впливає на ефективність навчання.

За Kimi стоять «Місячна темна сторона», яка, як повідомляється, отримала приблизно 20 000 GPU Hopper через Alibaba. За даними Bloomberg, конкретна модель — H200, але Alibaba заперечує цю інформацію щодо моделі H200.

Якщо розраховувати за H200, він все ще належить до попереднього покоління архітектури Hopper, тоді як B200 вже перейшов у еру Blackwell. Між ними існує не просто відношення заміни старого на нове, а позначає різні етапи потужності інфраструктури для штучного інтелекту.

Ситуація з DeepSeek ще більш особлива.

DeepSeek на початку 2025 року викликав глобальний інтерес завдяки своїм ефективним моделям, і його технічний підхід довів, що оптимізація алгоритмів та інженерна ефективність можуть частково зменшити вимоги до обчислювальних ресурсів. Однак згідно з відкритою інформацією, компанія не розкрила повну конфігурацію обладнання для навчання V4.

Розсіяний транскрипт зустрічі інвесторів із Лян Веньфеном показує, що компанія мала близько 20 000 еквівалентів H у травні, більшість з яких тільки що надійшли, а майбутні закупівлі «будуть майже виключно NVIDIA». Huawei надала DeepSeek потужність 950, що становить близько 16 000 карт. Лян Веньфен зазначив, що ця партія китайських карт приблизно еквівалентна 4 000 картам Nvidia серії B і достатня лише для навчання поточного покоління моделей.

Ці дані відображають реальність: хоча китайські компанії вже мають значну кількість AI-обчислювальних потужностей, вони все ще мають розмірну різницю щодо здатності зосередити 100 000 сучасних GPU для одного навчального завдання.

Справжнім слабким місцем китайських AI-обчислень є не відсутність чіпів, а відсутність передових кластерних можливостей

При обговоренні китайських AI-обчислювальних потужностей легко потрапити у два екстремуми.

Одна думка стверджує, що Китай повністю відсутній у передових чіпах для ШІ, тому не може брати участь у конкуренції; інша думка вважає, що достатньо збільшити кількість китайських чіпів, щоб швидко наздогнати NVIDIA.

Насправді, ситуація складніша.

Здатність до навчання ШІ визначається кількома етапами, включаючи продуктивність чіпів, передові технологічні процеси, обсяг відеопам’яті, високоскоростне з’єднання, дизайн серверів, енергопостачання центрів обробки даних, програмне забезпечення та здатність до масштабного планування.

GPU — це лише одна з найважливіших складових, але не всі.

Довгострокові переваги NVIDIA походять не лише від апаратного забезпечення GPU, але й від екосистеми CUDA, технологій мережевого з’єднання, серверних рішень та повної системи, сформованої з провайдерами хмарних обчислень.

У епоху Blackwell переваги цієї системи ще більше збільшилися.

Коли навчання однієї моделі вимагає 100 тисяч GPU, проблема вже не в тому, щоб купити кілька тисяч чіпів, а в тому, як побудувати велику обчислювальну фабрику, яка зможе стабільно працювати.

Це також пояснює, чому у відкритих даних китайські компанії ще не розкривали випадків навчання моделі за допомогою 100 000 однотипних передових GPU.

Китайські компанії підвищують свою потужність різними способами, включаючи збільшення розгортання обчислювальних потужностей за кордоном, розширення масштабів адаптації чипів власного виробництва, оптимізацію архітектури моделей та підвищення ефективності навчання. Усі ці шляхи мають цінність, але в короткостроковій перспективі важко повністю замінити базову перевагу, яку надають найсучасніші кластери GPU.

Протягом останніх кількох років китайська галузь ШІ довела факт: інновації в алгоритмах можуть значно скоротити частину розриву.

З’явлення таких компаній, як DeepSeek, свідчить про те, що видатні інженерні команди можуть досягти прориву за обмежених обчислювальних ресурсів завдяки оптимізації архітектури моделі, налаштуванню стратегій навчання та підвищенню ефективності використання ресурсів.

Але інший факт також існує: коли глобальна конкуренція перейде на наступний етап базових моделей, значення масштабу обчислювальних потужностей продовжить зростати.

Оптимізація ефективності може знизити витрати, але важко повністю змінити межі можливостей, що надаються передовим обладнанням та супермасштабними кластерами.

Після Blackwell ера Rubin може ще більше збільшити розрив у інфраструктурі

Ще більш важливо, що Blackwell не є кінцевою точкою поточної технологічної доріжки NVIDIA.

Наступна архітектура NVIDIA Vera Rubin вже перейшла до серійного виробництва. За оцінками NVIDIA, для навчання великих моделей MoE кількість GPU, необхідних для Rubin, зменшується приблизно до чверті від кількості, необхідної для Blackwell.

Це означає, що в майбутньому конкуренція в галузі ШІ може вступити в новий цикл.

Лідери галузі мають найсучаснішу архітектуру, тому зможуть проводити більш масштабне навчання за допомогою меншої кількості чіпів; нижчі витрати на навчання сприяють проведення більшої кількості експериментів і подальшому підвищенню здатностей моделей.

Якщо відстаючі компанії можуть отримувати лише обладнання попереднього покоління, вони можуть стикнутися з двома проблемами: з одного боку, низька ефективність навчання, з іншого — складнощі у участі у конкуренції з найбільшими моделями.

Звичайно, це не означає, що китайські AI-компанії не мають можливостей.

Історія штучного інтелекту неодноразово доводила, що технологічна конкуренція не визначається виключно однією апаратною платформою. Інновації в моделях, застосування, здатність до комерціалізації та інженерна ефективність також можуть призвести до нових проривів.

Але якщо дивитися з точки зору інфраструктури, подія використання GPT-6 Astra 100 000 GPU Blackwell дійсно виявляє зміну, що відбувається: головна битва за глобальну конкуренцію в галузі ШІ переміщується з рівня моделей на рівень інфраструктури обчислювальних потужностей.

У найближчі роки конкурентоспроможність компаній у сфері ШІ визначатиметься не лише здатністю навчати чудову модель, а здатністю створювати постійний процес навчання наступного покоління моделей.

Для китайської галузі штучного інтелекту справжнім викликом є не відстачання від окремої моделі чи одного запуску, а цілісна система здібностей — від отримання чіпів, побудови центрів обробки даних, планування кластерів до розробки програмного екосистеми.

Значення 100 тисяч чіпів Blackwell полягає не в тому, що вони створили вражаюче число, а в тому, що вони нагадують ринку: штучний інтелект входить у фазу індустріалізації, а індустріальна конкуренція в кінцевому підсумку визначається інфраструктурою.

Джерело:

  1. Офіційні матеріали NVIDIA щодо Blackwell, GB200 NVL72, архітектури Вери Рубін та інфраструктури ШІ.
  2. Інформація про публічні виступи та інтерв’ю з ЗМІ Хуан Ренсюна.
  3. Bloomberg про закупівлю обчислювальних потужностей Kimi та пов’язані з H200 матеріали.
  4. Інформація про інфраструктуру ШІ та розгортання обчислювальних ресурсів за кордоном, опублікована ByteDance.
  5. Дані транскрипції щодо публічної інформації DeepSeek та зустрічі з інвесторами Лян Венфенга.
  6. Офіційна інформація Alibaba Cloud щодо співпраці в галузі інфраструктури ШІ та обчислювальних потужностей для великих моделей.
Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.