NVIDIA возобновляет проект Rubin CPX AI inference prefill accelerator для запуска в 2027 году

iconMetaEra
Поделиться
AI summary iconСводка
NVIDIA объявила о запуске проекта, возобновив разработку ускорителя Rubin CPX для предзаполнения AI-выводов с запуском в 2027 году. Разработанный на основе MetaEra, Rubin CPX оптимизирован для этапов предзаполнения с длинным контекстом, оснащен 168 ГБ HBM4, производительностью, близкой к Rubin, и потреблением мощности 2300 Вт. Он будет поставляться в первом квартале 2027 года в модульной конструкции MGX ETL-стеллажа, поддерживающей от 64 до 256 GPU. Система использует NVLink внутри лотков и Ethernet между лотками, обеспечивая баланс между стоимостью и скоростью. Rubin CPX будет работать в паре 1:1 со стандартными GPU Rubin, обрабатывая предзаполнение и KV Cache, в то время как остальные GPU занимаются декодированием. Это обновление относится к новостям AI + криптовалюта и демонстрирует фокус NVIDIA на специализированной инфраструктуре для ИИ.
NVIDIA возобновила проект AI-ускорителя предзаполнения для инференса под названием «Rubin CPX», с планами начать производство в первом квартале 2027 года. Продукт разработан для сценариев предзаполнения с длинным контекстом, оснащен 168 ГБ HBM4 памяти, производительность близка к стандартному GPU Rubin, а энергопотребление одной карты достигает 2300 Вт. Продукт использует отдельную конструкцию стойки MGX ETL и поддерживает гибкие конфигурации развертывания от 64 до 256 GPU. Архитектура соединения выполнена по иерархическому принципу: внутри одного лотка используется NVLink, а между лотками — Ethernet, что обеспечивает баланс между производительностью и стоимостью. Rubin CPX будет использоваться в паре со стандартным GPU Rubin в пропорции 1:1, где CPX отвечает за предзаполнение и генерацию KV Cache, а Rubin GPU — за декодирование, оптимизировано специально для сценариев инференса с длинным контекстом.

Автор статьи, источник: Wall Street Journal

NVIDIA тихо возобновила проект чипа, который рынок считал заброшенным, нацелившись на этап предзаполнения (Prefill), где стоимость AI-выводов высока.

NVIDIA снова запустила проект ускорителя GPU для предзаполнения AI-вывода «Rubin CPX» и значительно изменила дизайн продукта. Согласно текущему плану, новая версия Rubin CPX начнет производиться в первом квартале 2027 года.

Перезапуск этого проекта отправляет четкий сигнал: NVIDIA активно работает над решением проблем производительности и затрат на предзаполнение на этапе вывода ИИ. По мере постоянного увеличения длины контекста крупных моделей, этап предзаполнения должен обрабатывать огромные объемы входных данных и генерировать KV Cache, эффективность которого напрямую влияет на общую стоимость и экономическую целесообразность развертывания ИИ-вывода.

Го Миньци утверждает, что сегодня более 50% нагрузки на AI-выводы приходится на обработку входного контекста и построение KV Cache.

Спецификации чипа значительно изменены, производительность близка к стандарту Rubin

По производительности и энергопотреблению новая версия CPX приблизилась к стандартной GPU Rubin, максимальное энергопотребление одной карты также достигло 2300 Вт. В плане памяти новая версия CPX перешла на 168 ГБ HBM4, что является значительным улучшением по сравнению с предыдущей версией на 128 ГБ GDDR7, но все еще ниже, чем 288 ГБ HBM4 у стандартной GPU Rubin.

Согласно Го Миньцзи, общая емкость HBM4 на вычислительной платформе с 8 картами CPX составляет около 1,34 ТБ, чего достаточно для покрытия большинства рабочих нагрузок длинного контекста и соответствующих потребностей в KV Cache. Это означает, что Rubin CPX не просто нацелен на достижение более высокой универсальной вычислительной мощности, а был перепроектирован с акцентом на емкость видеопамяти и эффективность предзаполнения для сценариев с длинным контекстом.

Переход от совместного стеллажа к отдельному развертыванию обеспечивает более гибкую настройку

Размещение в стойках также является ключевым аспектом этого изменения.

В предыдущем варианте CPX планировало совместное использование стойки с Rubin GPU; в новой версии используется отдельная стойка MGX ETL, что позволяет клиентам отдельно масштабировать вычислительную мощность CPX в соответствии с реальными потребностями.

Конкретно клиент может выбрать масштаб развертывания с 64, 128, 192 или 256 GPU CPX. Каждые 64 GPU CPX образуют один стоечный модуль, включающий 8 вычислительных лотков, каждый из которых оснащен 8 GPU CPX, а также один лоток коммутатора.

Модульная архитектура позволяет клиентам гибко увеличивать вычислительную мощность CPX в соответствии с фактическими потребностями в предварительно заполненной нагрузке, не покупая фиксированные крупные стойки Rubin.

Слоистая интерконнект-архитектура снижает стоимость предварительного заполнения и развертывания

На архитектуре интернет-соединений Rubin CPX использует многоуровневый дизайн, балансируя между производительностью и стоимостью.

Внутри одного вычислительного поддона 8 GPU CPX масштабируются с помощью NVLink. Пропускная способность NVLink каждого GPU CPX составляет от 1 до 1,5 ТБ/с, что ниже, чем у стандартных GPU Rubin — 3,6 ТБ/с.

На уровне масштабирования между лотками и внутри модулей стойки CPX использует медные L1-связи Ethernet Spectrum-6; для соединения между модулями стойки применяются оптоволоконные OSFP-связи через коммутаторы Spectrum-6 каждого модуля.

По сравнению с решениями, полностью зависящими от высокополосного соединения GPU, эта иерархическая архитектура больше ориентирована на оптимизацию затрат для сценариев предварительного заполнения.

Совместно с Rubin GPU нацелены на длинные контекстные вычисления

Rubin CPX не является самостоятельным универсальным GPU, а используется в комплекте с Vera Rubin NVL72 в качестве ускорителя предварительной заполнки.

Согласно Го Миньци, NVIDIA рекомендует развертывать CPX и Rubin GPU в соотношении 1:1: CPX отвечает за вычисления на этапе предзаполнения и генерацию KV Cache, после чего KV Cache передается через Ethernet RDMA на Rubin GPU, который выполняет последующее декодирование.

С точки зрения позиционирования продукта, основная цель Rubin CPX — не заменить стандартную Rubin GPU, а разбить процесс AI-выводов на более мелкие этапы, позволяя разным GPU выполнять задачи предзаполнения и декодирования отдельно.

Го Миньци называет его «наилучшим решением по соотношению цены и производительности для предварительной заполнки с длинным контекстом». По мере постоянного расширения окна контекста моделей ИИ вычислительная нагрузка на этапе предварительной заполнки и объем KV Cache продолжают расти; возобновление NVIDIA проекта CPX, вероятно, направлено на дальнейшее снижение стоимости инференса с длинным контекстом за счет использования специализированного оборудования и гетерогенной архитектуры.

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.