NVIDIA відновлює проект Rubin CPX AI inference prefill accelerator для запуску у 2027 році

iconMetaEra
Поділитися
AI summary iconКороткий зміст
NVIDIA оголосила про проект, відновивши розробку Rubina CPX — прискорювача AI-висновків для попередньої обробки — з планом запуску у 2027 році. Розроблений на основі MetaEra, Rubin CPX оптимізований для етапів попередньої обробки з довгим контекстом, оснащений 168 ГБ HBM4, майже Rubina-рівневою продуктивністю та споживанням потужності 2300 Вт. Він буде випущений у першому кварталі 2027 року за допомогою модульної конструкції MGX ETL, що підтримує від 64 до 256 GPU. Система використовує NVLink всередині трейвів та Ethernet між трейвами, забезпечуючи баланс між вартістю та швидкістю. Rubin CPX буде працювати 1:1 зі стандартними GPU Rubin, виконуючи попередню обробку та KV Cache, тоді як інші GPU займуться декодуванням. Це оновлення входить до категорії новин AI + криптовалюта, що підкреслює зосередження NVIDIA на спеціалізованій інфраструктурі для AI.
NVIDIA відновила проект AI-інференс-прискорювача Rubin CPX, плануючи почати виробництво в першому кварталі 2027 року. Цей продукт розроблений для сценаріїв довгого контексту з пропуском, оснащений 168 ГБ HBM4, має обчислювальну потужність, близьку до стандартного GPU Rubin, і споживає до 2300 Вт на одиницю. Використовує незалежну конструкцію MGX ETL, що дозволяє гнучко розгорнути від 64 до 256 GPU. Архітектура з’єднань побудована за ієрархічним принципом: NVLink використовується всередині одного трейу, а між трейами — Ethernet, що забезпечує баланс між продуктивністю та витратами. Rubin CPX буде працювати разом із стандартним GPU Rubin у співвідношенні 1:1 — CPX відповідає за попереднє заповнення та генерацію KV Cache, а Rubin GPU — за декодування, оптимізовано для сценаріїв довгого контексту.

Автор статті, джерело: Wall Street Journal

NVIDIA тихо відновила проект чіпа, який ринок вважав відміненим, з метою зменшення витрат на підготовку (Prefill) для AI-висновків.

NVIDIA знову запустила проект AI-інференс-препідготовки з прискоренням на GPU під назвою «Rubin CPX» і значно змінила дизайн продукту. За поточним планом, нова версія Rubin CPX має почати виробництво в першому кварталі 2027 року.

Цей запуск проекту відправляє чіткий сигнал: NVIDIA активно працює над вирішенням обмежень продуктивності та витрат на попереднє заповнення на етапі висновку штучного інтелекту. Зі збільшенням довжини контексту великих моделей, етап попереднього заповнення повинен обробляти великий обсяг вхідних даних та генерувати KV Cache, а його ефективність безпосередньо впливає на загальні витрати та економічну доцільність розгортання штучного інтелекту.

Го Мінчі вказує, що зараз понад 50% навантаження на AI-висновування припадає на обробку вхідного контексту та побудову KV Cache.

Значна зміна специфікацій чіпа, потужність близька до стандартного Rubin

Щодо продуктивності та споживання енергії, нова версія CPX наближається до стандартної GPU Rubin, а максимальне споживання енергії на одній картці також досягає 2300 Вт. Щодо пам’яті, нова версія CPX перейшла на 168 ГБ HBM4, що є значним покращенням порівняно з попереднім рішенням на 128 ГБ GDDR7, але все ще нижче, ніж у стандартної GPU Rubin з 288 ГБ HBM4.

За словами Го Мінцзі, загальна ємність HBM4 у вісімкарточному CPX-тракті становить приблизно 1,34 ТБ, чого достатньо для покриття більшості завантажень довгого контексту та відповідних потреб KV Cache. Це означає, що Rubin CPX не просто прагне до більшої загальної обчислювальної потужності, а був перероблений з метою оптимізації ємності відеопам’яті та ефективності попереднього заповнення для сценаріїв з довгим контекстом.

Перехід від спільного стелажу до окремого розгортання забезпечує більш гнучку конфігурацію

Розташування стелажів також є ключовим аспектом цієї корекції.

У попередньому плані CPX мала планувати спільне використання стелажів із Rubin GPU; у новій версії використовуються окремі стелажі MGX ETL, що дозволяє клієнтам окремо масштабувати потужність CPX згідно з реальними потребами.

Зокрема, клієнти можуть вибрати масштаб розгортання з 64, 128, 192 або 256 GPU CPX. Кожні 64 GPU CPX утворюють один стійковий модуль, що включає 8 обчислювальних трейвів, кожен з яких оснащений 8 GPU CPX, а також один трейві комутатора.

Модульна конструкція означає, що клієнти можуть гнучко додавати CPX-потужність залежно від реальних потреб у попередньо заповненій нагрузці, не обов’язково купуючи фіксовані великомасштабні стойки Rubin.

Розробка зі шаруванням і з’єднанням, щоб знизити витрати на попереднє заповнення та розгортання

У інтерконектній архітектурі Rubin CPX використовує шаровий дизайн, здійснюючи компроміс між продуктивністю та витратами.

Усередині одного обчислювального трейу 8 GPU CPX розширюються за допомогою NVLink. Пропускна здатність NVLink для кожного GPU CPX становить 1–1,5 ТБ/с, що менше, ніж 3,6 ТБ/с у стандартних GPU Rubin.

На рівні Scale-out між піддонами та всередині модулів стелажів CPX використовує Spectrum-6 Ethernet з повністю мідними L1 з’єднаннями; для з’єднання між модулями стелажів використовуються OSFP оптичні лінії через комутатори Spectrum-6 кожного модуля.

У порівнянні з рішеннями, що повністю залежать від GPU-з’єднань з високою пропускною здатністю, ця шарова архітектура більше зосереджена на оптимізації витрат для сценаріїв попереднього заповнення.

Спільно з Rubin GPU спрямовано на довгі висновки контексту

Rubin CPX не є самостійно працюючим універсальним GPU, а використовується разом із Vera Rubin NVL72 як прискорювач попереднього заповнення.

За словами Го Мінцзі, NVIDIA рекомендує розгортати CPX та Rubin GPU у співвідношенні 1:1: CPX виконує обчислення на етапі попереднього заповнення та генерує KV Cache, після чого KV Cache передається через Ethernet RDMA на Rubin GPU, який виконує подальше декодування.

З точки зору позиціонування продукту, основна мета Rubin CPX — не замінити стандартну Rubin GPU, а розділити процес AI-виведення, щоб різні GPU виконували завдання попереднього заповнення та декодування.

Го Мінчі визначає його як «найкраще співвідношення ціни та якості для довгих контекстів з попереднім заповненням». Зі збільшенням вікна контексту моделей ШІ обчислювальна потужність на етапі попереднього заповнення та розмір KV Cache безперервно зростають, і, ймовірно, саме через це NVIDIA знову запустила проект CPX, щоб додатково знизити витрати на виведення довгих контекстів за допомогою спеціалізованого обладнання та гетерогенних схем розгортання.

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.