NVIDIA, AI çıkarım ön-doldurma hızlandırma GPU projesi "Rubin CPX"i yeniden başlatmış ve 2027 birinci çeyrekte üretim başlatmayı planlamaktadır. Bu ürün, uzun bağlam ön-doldurma senaryoları için tasarlanmıştır ve 168 GB HBM4 bellek ile donatılmıştır; performansı standart Rubin GPU'ya yakındır ve tek bir kartta 2300 watt güç tüketimine sahiptir. Ürün, 64 ila 256 GPU arasında esnek dağıtım yapılandırması sağlayan bağımsız MGX ETL raf tasarımı kullanır. Bağlantı mimarisi katmanlıdır; tek bir palet içinde NVLink, paletler arası ise Ethernet kullanılır, bu da performans ve maliyet arasında denge kurar. Rubin CPX, standart Rubin GPU'larla 1:1 oranında işbirliği yapacak şekilde ön-doldurma hızlandırıcı olarak kullanılacaktır; CPX, ön-doldurma ve KV Cache üretimiyle görevli olurken, Rubin GPU, uzun bağlam çıkarımı için optimize edilmiş dekodlama işlemini üstlenecektir.Yazan, Kaynak: Wall Street Journal
NVIDIA, bir zamanlar piyasa tarafından terk edildiğine inanılan bir çip projesini sessizce yeniden başlatıyor ve hedefi, AI çıkarımı için yüksek maliyetli olan ön doldurma (Prefill) aşaması.
NVIDIA, AI çıkarım ön doldurma hızlandırma GPU projesini "Rubin CPX" olarak yeniden başlatmış ve ürün tasarımında büyük değişiklikler yapmıştır. Şu anda planlara göre, yeni Rubin CPX versiyonunun üretimi 2027 birinci çeyrekte başlayacaktır.
Bu proje yeniden başlatılması, NVIDIA'nın AI çıkarım aşamasının ön doldurma performansı ve maliyet darboğazlarını çözmeye yönelik yatırımlarını artırma yönünde net bir sinyal vermektedir. Büyük modellerin bağlam uzunluğu arttıkça, ön doldurma aşaması büyük miktarda giriş bilgisi işleme ve KV Cache oluşturma gerektirmekte; bu verimlilik, AI çıkarımının toplam maliyetini ve dağıtım ekonomisini doğrudan etkilemektedir.
Guo Mingji, şu anda AI çıkarım iş yüklerinin %50'sinden fazlasının giriş bağlamı işleme ve KV Önbelleği oluşturmaya kaynaklandığını belirtti.
Çip specifikasyonları büyük ölçüde değiştirildi, hesaplama gücü standart Rubin'e yaklaştı
Yeni CPX, hesaplama gücü ve güç tüketimi açısından standart Rubin GPU'ya yaklaşmış durumda ve tek bir kartta maksimum güç tüketimi 2300 watt'a ulaşmaktadır. Bellek açısından, yeni CPX önceki çözümdeki 128 GB GDDR7 yerine 168 GB HBM4 bellek kullanmaktadır; bu, önceki çözüme göre açıkça bir yükseliştir, ancak standart Rubin GPU'nun 288 GB HBM4 bellek kapasitesinden hâlâ düşüktür.
Guo Mingqi'ye göre, 8 kartlı CPX hesaplama paletinin toplam HBM4 kapasitesi yaklaşık 1,34 TB'dir ve çoğu uzun bağlam ön-doldurma iş yükünü ve ilgili KV Cache ihtiyaçlarını karşılayabilir. Bu, Rubin CPX'in sadece daha yüksek genel hesaplama gücüne odaklanmadığını, uzun bağlam senaryoları için bellek kapasitesini ve ön-doldurma verimliliğini yeniden tasarladığını gösterir.
Paylaşımlı raf yerine bağımsız dağıtımla daha esnek yapılandırma
Raf yapısı da bu ayarlamanın odak noktasıdır.
Önceki tasarımda, CPX, Rubin GPU ile paylaşımlı bir raf kullanıyordu; yeni versiyonda ise CPX hesaplama gücü, müşterilerin gerçek ihtiyaçlarına göre ayrı ayrı ölçeklendirilebilmek üzere bağımsız bir MGX ETL rafına geçiş yapmıştır.
Ayrıntılı olarak, müşteri 64, 128, 192 veya 256 CPX GPU'dan oluşan bir dağıtım ölçeği seçebilir. Her 64 CPX GPU, 8 adet hesaplama paletini ve her bir paletin 8 adet CPX GPU'yu barındırdığı, aynı zamanda bir anahtar paletiyle birlikte bir raf modülünü oluşturur.
Modüler tasarım, müşterilerin sabit büyük ölçekli Rubin rafı satın almak zorunda kalmadan, önceden doldurulan yükün gerçek ihtiyaçlarına göre CPX hesaplama gücünü esnek bir şekilde artırmasını sağlar.
Katmanlı bağlantı tasarımı, ön doldurma dağıtım maliyetlerini azaltır
İnterconnect mimarisinde Rubin CPX, performans ve maliyet arasında bir denge kurmak için katmanlı bir tasarım kullanır.
Tek bir hesaplama tray içinde, 8 adet CPX GPU, NVLink ile ölçeklendirilmiştir. Her CPX GPU'nun NVLink bant genişliği 1 ile 1,5 TB/s arasındadır ve bu, standart Rubin GPU'nun 3,6 TB/s değerinden düşüktür.
CPX, kasetler arasında ve raf modülleri içindeki ölçeklenebilir düzeyde Spectrum-6 Ethernet tamamen bakır L1 bağlantılarını kullanır; raf modülleri arasında bağlantılar, her modülün Spectrum-6 anahtarları aracılığıyla OSFP fiber bağlantıları ile sağlanır.
Tamamen yüksek bant genişliğine sahip GPU bağlantılarına dayalı çözümlerle karşılaştırıldığında, bu katmanlı mimari, ön doldurma senaryolarına yönelik maliyet optimizasyonuna daha fazla odaklanır.
Rubin GPU ile birlikte uzun bağlam çıkarımını hedefleyin
Rubin CPX, bağımsız olarak çalışan genel amaçlı bir GPU değildir; Vera Rubin NVL72 ile birlikte ön doldurma hızlandırıcı olarak kullanılır.
Guo Mingqi'ye göre, NVIDIA, CPX ile Rubin GPU'yu 1:1 oranında dağıtmayı öneriyor: CPX, ön doldurma aşamasının hesaplamalarını yürütür ve KV Önbelleğini oluşturur; ardından KV Önbelleği, Ethernet RDMA aracılığıyla Rubin GPU'ya aktarılır ve bu GPU, sonraki dekodlamayı tamamlar.
Ürün pozisyonlamasına göre, Rubin CPX'nin temel amacı standart Rubin GPU'yu değiştirmek değil, AI çıkarım sürecini daha da bölerek farklı GPU'ların ön doldurma ve dekodlama görevlerini üstlenmesini sağlamaktır.
Guo Mingji, bunu "uzun bağlam önceden doldurma için en iyi maliyet-verim oranı çözümü" olarak tanımlıyor. AI modellerinin bağlam penceresi genişledikçe, önceden doldurma aşamasındaki hesaplama yükü ve KV Cache boyutu sürekli artıyor; NVIDIA'nın bu CPX projesini yeniden başlatması, uzun bağlam çıkarımı maliyetini daha da düşürmek amacıyla özel donanım ve heterojen dağıtım yöntemlerini kullanmayı amaçlıyor olabilir.
