NVIDIA telah melancarkan semula projek GPU akselerasi pra-pengisian AI bernama "Rubin CPX", dengan perancangan untuk memulakan penghasilan pada Kuartal Pertama 2027. Produk ini direka khas untuk skenario pra-pengisian konteks panjang, dilengkapi memori HBM4 sebanyak 168GB, dengan kekuatan pengiraan hampir setara dengan GPU Rubin standard, dengan penggunaan kuasa sebanyak 2300 watt per kad. Produk ini menggunakan reka bentuk rak MGX ETL bebas, menyokong konfigurasi pelabuhan fleksibel dari 64 hingga 256 GPU. Arsitektur perhubungan menggunakan reka bentuk bertingkat, dengan NVLink digunakan di dalam satu baki dan Ethernet digunakan antara baki, mencapai keseimbangan antara prestasi dan kos. Rubin CPX akan berfungsi sebagai akselerator pra-pengisian bersama dengan GPU Rubin standard, bekerjasama mengikut nisbah 1:1, di mana CPX bertanggungjawab atas pra-pengisian dan penghasilan KV Cache, manakala GPU Rubin bertanggungjawab atas dekod, dioptimakan khusus untuk skenario inferens konteks panjang.Penulis artikel, sumber: Wall Street Journal
NVIDIA secara diam-diam memulakan semula projek cip yang sebelumnya dianggap telah ditinggalkan oleh pasaran, dengan fokus langsung pada bahagian prefill yang mempunyai kos inferens AI yang tinggi.
NVIDIA telah memulakan semula projek GPU akselerasi pra-pengisian inferensi AI "Rubin CPX" dan membuat penyesuaian besar terhadap reka bentuk produk. Mengikut perancangan semasa, versi baharu Rubin CPX dijangka mula dihasilkan pada kuartal pertama 2027.
Pemulihan projek ini mengeluarkan isyarat yang jelas: NVIDIA sedang memperkuat usaha untuk menyelesaikan bottleneck prestasi dan kos pada peringkat pra-pengisian dalam inferensi AI. Seiring panjang konteks model besar terus meningkat, peringkat pra-pengisian perlu mengendalikan sejumlah besar maklumat input dan menghasilkan KV Cache, di mana kecekapan secara langsung mempengaruhi kos keseluruhan dan keekonomian pelaksanaan inferensi AI.
Guo Mingji mengatakan, kini lebih daripada 50% beban kerja inferensi AI datang dari pemprosesan konteks input dan pembinaan KV Cache.
Spesifikasi cip disesuaikan secara besar-besaran, kuasa pengiraan hampir setara dengan Rubin standard
Dari segi kuasa pengiraan dan penggunaan tenaga, prestasi CPX versi baharu telah hampir setara dengan GPU Rubin standard, dengan penggunaan tenaga maksimum sebanyak 2300 watt untuk satu kad. Dari segi memori, CPX versi baharu kini menggunakan memori HBM4 168GB, yang merupakan peningkatan ketara berbanding 128GB GDDR7 pada penyelesaian sebelumnya, tetapi masih lebih rendah berbanding 288GB HBM4 pada GPU Rubin standard.
Menurut Guo Ming-chi, kapasiti HBM4 pada baki pengiraan 8-CPX berjumlah sekitar 1.34TB, yang mampu menutupi kebanyakan beban kerja pra-isian konteks panjang dan keperluan KV Cache yang sepadan. Ini bermakna Rubin CPX bukan sekadar mengejar kekuatan pengiraan umum yang lebih tinggi, tetapi telah direka semula khusus untuk konteks panjang dengan penekanan pada kapasiti memori video dan kecekapan pra-isian.
Beralih dari rak berkongsi ke penghuraian berasingan, konfigurasi lebih fleksibel
Rangka rak juga merupakan fokus utama dalam penyesuaian ini.
Dalam pelan sebelum ini, CPX merancang untuk berkongsi rak dengan Rubin GPU; versi baharu pula telah ditukar kepada rak MGX ETL yang berasingan, membolehkan pelanggan mengembangkan kuasa pengiraan CPX secara berasingan mengikut keperluan sebenar.
Secara terperinci, pelanggan boleh memilih saiz penghantaran sebanyak 64, 128, 192, atau 256 keping CPX GPU. Setiap 64 keping CPX GPU membentuk satu modul rak, yang termasuk 8 baki pengiraan, setiap baki membawa 8 keping CPX GPU, serta satu baki suis.
Reka bentuk modular bermaksud pelanggan tidak perlu membeli rak Rubin berskala besar yang tetap, tetapi boleh menambahkan daya komputasi CPX secara fleksibel mengikut keperluan beban pra-isian.
Reka bentuk saling berhubung bertingkat, mengurangkan kos penghantaran pra-isian
Dalam arsitektur terhubung, Rubin CPX menggunakan reka bentuk bertingkat untuk mencapai keseimbangan antara prestasi dan kos.
Di dalam satu baki pengiraan, 8 GPU CPX diperluaskan melalui NVLink. Lebar pita NVLink setiap GPU CPX adalah 1 hingga 1.5 TB/s, lebih rendah daripada 3.6 TB/s pada GPU Rubin standard.
Di aras scale-out antara baki dan di dalam modul rak, CPX menggunakan pautan L1 tembaga Ethernet Spectrum-6; bagi sambungan antara modul rak, ia dilakukan melalui suis Spectrum-6 setiap modul menggunakan pautan serat OSFP.
Berbanding dengan penyelesaian yang bergantung sepenuhnya pada penghubung GPU berpemandu tinggi, arsitektur bertingkat ini lebih menekankan pengoptimuman kos bagi skenario pra-isian.
Bekerjasama dengan Rubin GPU, fokus pada inferensi konteks panjang
Rubin CPX bukan GPU universal yang beroperasi secara berasingan, tetapi digunakan bersama Vera Rubin NVL72 sebagai akselerator pra-isian.
Menurut Guo Mingji, NVIDIA merekomendasikan penyebaran CPX dan Rubin GPU dalam nisbah 1:1: CPX bertanggung jawab atas pengiraan fasa pra-isian dan menghasilkan KV Cache, kemudian menghantar KV Cache melalui Ethernet RDMA ke Rubin GPU, yang akan menyelesaikan dekod seterusnya.
Dari segi penentuan produk, inti Rubin CPX bukanlah menggantikan Rubin GPU piawai, tetapi memecahkan proses inferensi AI lebih lanjut, membolehkan GPU yang berbeza mengambil alih tugas pra-pengisian dan dekod.
Guo Mingji mengekalkannya sebagai "penyelesaian terbaik dari segi nilai untuk pra-isian konteks panjang". Seiring dengan pemekaran tetingkap konteks model AI, beban pengiraan dan skala KV Cache pada peringkat pra-isian terus meningkat; pelancaran semula projek CPX oleh NVIDIA mungkin bertujuan untuk mengurangkan kos inferensi konteks panjang melalui peranti khas dan cara penghuraian heterogen.
