NVIDIA возобновила проект AI-ускорителя предзаполнения для инференса под названием «Rubin CPX», с планами начать производство в первом квартале 2027 года. Продукт разработан для сценариев предзаполнения с длинным контекстом, оснащен 168 ГБ HBM4 памяти, производительность близка к стандартному GPU Rubin, а энергопотребление одной карты достигает 2300 Вт. Продукт использует отдельную конструкцию стойки MGX ETL и поддерживает гибкие конфигурации развертывания от 64 до 256 GPU. Архитектура соединения выполнена по иерархическому принципу: внутри одного лотка используется NVLink, а между лотками — Ethernet, что обеспечивает баланс между производительностью и стоимостью. Rubin CPX будет использоваться в паре со стандартным GPU Rubin в пропорции 1:1, где CPX отвечает за предзаполнение и генерацию KV Cache, а Rubin GPU — за декодирование, оптимизировано специально для сценариев инференса с длинным контекстом.Автор статьи, источник: Wall Street Journal
NVIDIA тихо возобновила проект чипа, который рынок считал заброшенным, нацелившись на этап предзаполнения (Prefill), где стоимость AI-выводов высока.
NVIDIA снова запустила проект ускорителя GPU для предзаполнения AI-вывода «Rubin CPX» и значительно изменила дизайн продукта. Согласно текущему плану, новая версия Rubin CPX начнет производиться в первом квартале 2027 года.
Перезапуск этого проекта отправляет четкий сигнал: NVIDIA активно работает над решением проблем производительности и затрат на предзаполнение на этапе вывода ИИ. По мере постоянного увеличения длины контекста крупных моделей, этап предзаполнения должен обрабатывать огромные объемы входных данных и генерировать KV Cache, эффективность которого напрямую влияет на общую стоимость и экономическую целесообразность развертывания ИИ-вывода.
Го Миньци утверждает, что сегодня более 50% нагрузки на AI-выводы приходится на обработку входного контекста и построение KV Cache.
Спецификации чипа значительно изменены, производительность близка к стандарту Rubin
По производительности и энергопотреблению новая версия CPX приблизилась к стандартной GPU Rubin, максимальное энергопотребление одной карты также достигло 2300 Вт. В плане памяти новая версия CPX перешла на 168 ГБ HBM4, что является значительным улучшением по сравнению с предыдущей версией на 128 ГБ GDDR7, но все еще ниже, чем 288 ГБ HBM4 у стандартной GPU Rubin.
Согласно Го Миньцзи, общая емкость HBM4 на вычислительной платформе с 8 картами CPX составляет около 1,34 ТБ, чего достаточно для покрытия большинства рабочих нагрузок длинного контекста и соответствующих потребностей в KV Cache. Это означает, что Rubin CPX не просто нацелен на достижение более высокой универсальной вычислительной мощности, а был перепроектирован с акцентом на емкость видеопамяти и эффективность предзаполнения для сценариев с длинным контекстом.
Переход от совместного стеллажа к отдельному развертыванию обеспечивает более гибкую настройку
Размещение в стойках также является ключевым аспектом этого изменения.
В предыдущем варианте CPX планировало совместное использование стойки с Rubin GPU; в новой версии используется отдельная стойка MGX ETL, что позволяет клиентам отдельно масштабировать вычислительную мощность CPX в соответствии с реальными потребностями.
Конкретно клиент может выбрать масштаб развертывания с 64, 128, 192 или 256 GPU CPX. Каждые 64 GPU CPX образуют один стоечный модуль, включающий 8 вычислительных лотков, каждый из которых оснащен 8 GPU CPX, а также один лоток коммутатора.
Модульная архитектура позволяет клиентам гибко увеличивать вычислительную мощность CPX в соответствии с фактическими потребностями в предварительно заполненной нагрузке, не покупая фиксированные крупные стойки Rubin.
Слоистая интерконнект-архитектура снижает стоимость предварительного заполнения и развертывания
На архитектуре интернет-соединений Rubin CPX использует многоуровневый дизайн, балансируя между производительностью и стоимостью.
Внутри одного вычислительного поддона 8 GPU CPX масштабируются с помощью NVLink. Пропускная способность NVLink каждого GPU CPX составляет от 1 до 1,5 ТБ/с, что ниже, чем у стандартных GPU Rubin — 3,6 ТБ/с.
На уровне масштабирования между лотками и внутри модулей стойки CPX использует медные L1-связи Ethernet Spectrum-6; для соединения между модулями стойки применяются оптоволоконные OSFP-связи через коммутаторы Spectrum-6 каждого модуля.
По сравнению с решениями, полностью зависящими от высокополосного соединения GPU, эта иерархическая архитектура больше ориентирована на оптимизацию затрат для сценариев предварительного заполнения.
Совместно с Rubin GPU нацелены на длинные контекстные вычисления
Rubin CPX не является самостоятельным универсальным GPU, а используется в комплекте с Vera Rubin NVL72 в качестве ускорителя предварительной заполнки.
Согласно Го Миньци, NVIDIA рекомендует развертывать CPX и Rubin GPU в соотношении 1:1: CPX отвечает за вычисления на этапе предзаполнения и генерацию KV Cache, после чего KV Cache передается через Ethernet RDMA на Rubin GPU, который выполняет последующее декодирование.
С точки зрения позиционирования продукта, основная цель Rubin CPX — не заменить стандартную Rubin GPU, а разбить процесс AI-выводов на более мелкие этапы, позволяя разным GPU выполнять задачи предзаполнения и декодирования отдельно.
Го Миньци называет его «наилучшим решением по соотношению цены и производительности для предварительной заполнки с длинным контекстом». По мере постоянного расширения окна контекста моделей ИИ вычислительная нагрузка на этапе предварительной заполнки и объем KV Cache продолжают расти; возобновление NVIDIA проекта CPX, вероятно, направлено на дальнейшее снижение стоимости инференса с длинным контекстом за счет использования специализированного оборудования и гетерогенной архитектуры.
