NVIDIA відновила проект AI-інференс-прискорювача Rubin CPX, плануючи почати виробництво в першому кварталі 2027 року. Цей продукт розроблений для сценаріїв довгого контексту з пропуском, оснащений 168 ГБ HBM4, має обчислювальну потужність, близьку до стандартного GPU Rubin, і споживає до 2300 Вт на одиницю. Використовує незалежну конструкцію MGX ETL, що дозволяє гнучко розгорнути від 64 до 256 GPU. Архітектура з’єднань побудована за ієрархічним принципом: NVLink використовується всередині одного трейу, а між трейами — Ethernet, що забезпечує баланс між продуктивністю та витратами. Rubin CPX буде працювати разом із стандартним GPU Rubin у співвідношенні 1:1 — CPX відповідає за попереднє заповнення та генерацію KV Cache, а Rubin GPU — за декодування, оптимізовано для сценаріїв довгого контексту.Автор статті, джерело: Wall Street Journal
NVIDIA тихо відновила проект чіпа, який ринок вважав відміненим, з метою зменшення витрат на підготовку (Prefill) для AI-висновків.
NVIDIA знову запустила проект AI-інференс-препідготовки з прискоренням на GPU під назвою «Rubin CPX» і значно змінила дизайн продукту. За поточним планом, нова версія Rubin CPX має почати виробництво в першому кварталі 2027 року.
Цей запуск проекту відправляє чіткий сигнал: NVIDIA активно працює над вирішенням обмежень продуктивності та витрат на попереднє заповнення на етапі висновку штучного інтелекту. Зі збільшенням довжини контексту великих моделей, етап попереднього заповнення повинен обробляти великий обсяг вхідних даних та генерувати KV Cache, а його ефективність безпосередньо впливає на загальні витрати та економічну доцільність розгортання штучного інтелекту.
Го Мінчі вказує, що зараз понад 50% навантаження на AI-висновування припадає на обробку вхідного контексту та побудову KV Cache.
Значна зміна специфікацій чіпа, потужність близька до стандартного Rubin
Щодо продуктивності та споживання енергії, нова версія CPX наближається до стандартної GPU Rubin, а максимальне споживання енергії на одній картці також досягає 2300 Вт. Щодо пам’яті, нова версія CPX перейшла на 168 ГБ HBM4, що є значним покращенням порівняно з попереднім рішенням на 128 ГБ GDDR7, але все ще нижче, ніж у стандартної GPU Rubin з 288 ГБ HBM4.
За словами Го Мінцзі, загальна ємність HBM4 у вісімкарточному CPX-тракті становить приблизно 1,34 ТБ, чого достатньо для покриття більшості завантажень довгого контексту та відповідних потреб KV Cache. Це означає, що Rubin CPX не просто прагне до більшої загальної обчислювальної потужності, а був перероблений з метою оптимізації ємності відеопам’яті та ефективності попереднього заповнення для сценаріїв з довгим контекстом.
Перехід від спільного стелажу до окремого розгортання забезпечує більш гнучку конфігурацію
Розташування стелажів також є ключовим аспектом цієї корекції.
У попередньому плані CPX мала планувати спільне використання стелажів із Rubin GPU; у новій версії використовуються окремі стелажі MGX ETL, що дозволяє клієнтам окремо масштабувати потужність CPX згідно з реальними потребами.
Зокрема, клієнти можуть вибрати масштаб розгортання з 64, 128, 192 або 256 GPU CPX. Кожні 64 GPU CPX утворюють один стійковий модуль, що включає 8 обчислювальних трейвів, кожен з яких оснащений 8 GPU CPX, а також один трейві комутатора.
Модульна конструкція означає, що клієнти можуть гнучко додавати CPX-потужність залежно від реальних потреб у попередньо заповненій нагрузці, не обов’язково купуючи фіксовані великомасштабні стойки Rubin.
Розробка зі шаруванням і з’єднанням, щоб знизити витрати на попереднє заповнення та розгортання
У інтерконектній архітектурі Rubin CPX використовує шаровий дизайн, здійснюючи компроміс між продуктивністю та витратами.
Усередині одного обчислювального трейу 8 GPU CPX розширюються за допомогою NVLink. Пропускна здатність NVLink для кожного GPU CPX становить 1–1,5 ТБ/с, що менше, ніж 3,6 ТБ/с у стандартних GPU Rubin.
На рівні Scale-out між піддонами та всередині модулів стелажів CPX використовує Spectrum-6 Ethernet з повністю мідними L1 з’єднаннями; для з’єднання між модулями стелажів використовуються OSFP оптичні лінії через комутатори Spectrum-6 кожного модуля.
У порівнянні з рішеннями, що повністю залежать від GPU-з’єднань з високою пропускною здатністю, ця шарова архітектура більше зосереджена на оптимізації витрат для сценаріїв попереднього заповнення.
Спільно з Rubin GPU спрямовано на довгі висновки контексту
Rubin CPX не є самостійно працюючим універсальним GPU, а використовується разом із Vera Rubin NVL72 як прискорювач попереднього заповнення.
За словами Го Мінцзі, NVIDIA рекомендує розгортати CPX та Rubin GPU у співвідношенні 1:1: CPX виконує обчислення на етапі попереднього заповнення та генерує KV Cache, після чого KV Cache передається через Ethernet RDMA на Rubin GPU, який виконує подальше декодування.
З точки зору позиціонування продукту, основна мета Rubin CPX — не замінити стандартну Rubin GPU, а розділити процес AI-виведення, щоб різні GPU виконували завдання попереднього заповнення та декодування.
Го Мінчі визначає його як «найкраще співвідношення ціни та якості для довгих контекстів з попереднім заповненням». Зі збільшенням вікна контексту моделей ШІ обчислювальна потужність на етапі попереднього заповнення та розмір KV Cache безперервно зростають, і, ймовірно, саме через це NVIDIA знову запустила проект CPX, щоб додатково знизити витрати на виведення довгих контекстів за допомогою спеціалізованого обладнання та гетерогенних схем розгортання.
