NVIDIA memulai kembali proyek Rubin CPX AI inference prefill accelerator untuk peluncuran 2027

iconMetaEra
Bagikan
AI summary iconRingkasan
NVIDIA telah mengumumkan proyek, melanjutkan pengembangan accelerator Rubin CPX AI inference prefill untuk peluncuran pada 2027. Diambil dari MetaEra, Rubin CPX dirancang khusus untuk tahap prefill konteks panjang, dilengkapi 168GB HBM4, kinerja mendekati Rubin, dan konsumsi daya 2300W. Sistem ini akan dikirim pada Q1 2027 menggunakan desain rak modular MGX ETL, yang mendukung 64 hingga 256 GPU. Sistem ini menggunakan NVLink di dalam tray dan Ethernet antar tray, menyeimbangkan biaya dan kecepatan. Rubin CPX akan dipasangkan 1:1 dengan GPU Rubin standar, menangani prefill dan KV Cache sementara yang lain mengelola decoding. Pembaruan ini termasuk dalam berita AI + crypto, menunjukkan fokus NVIDIA pada infrastruktur AI khusus.
NVIDIA telah melanjutkan proyek GPU akselerasi pre-fill inferensi AI bernama "Rubin CPX", dengan rencana mulai produksi pada kuartal pertama 2027. Produk ini dirancang khusus untuk skenario pre-fill konteks panjang, dilengkapi memori HBM4 sebesar 168GB, dengan daya komputasi mendekati GPU Rubin standar, dan konsumsi daya per kartu mencapai 2300 watt. Produk ini menggunakan desain rak MGX ETL independen, mendukung konfigurasi penyebaran fleksibel dari 64 hingga 256 GPU. Arsitektur interkoneksi menggunakan desain bertingkat, dengan NVLink di dalam satu tray dan Ethernet antar-tray, mencapai keseimbangan antara kinerja dan biaya. Rubin CPX akan digunakan bersama GPU Rubin standar sebagai akselerator pre-fill, bekerja secara berbagi tugas dengan rasio 1:1—CPX menangani pre-fill dan generasi KV Cache, sementara GPU Rubin bertanggung jawab atas decoding, dioptimalkan khusus untuk skenario inferensi konteks panjang.

Penulis artikel, sumber: Wall Street Journal

NVIDIA diam-diam menghidupkan kembali proyek chip yang sebelumnya dianggap telah ditinggalkan pasar, dengan fokus langsung pada tahap prefille yang biayanya tinggi dalam inferensi AI.

NVIDIA telah melanjutkan proyek GPU akselerasi prefill inference AI bernama "Rubin CPX" dan melakukan penyesuaian besar pada desain produk. Menurut rencana saat ini, versi baru Rubin CPX diharapkan mulai diproduksi pada kuartal pertama 2027.

Pengaktifan kembali proyek ini mengirimkan sinyal jelas: NVIDIA sedang memperkuat upaya untuk mengatasi hambatan kinerja dan biaya pada tahap prefilling dalam inferensi AI. Seiring dengan terus meningkatnya panjang konteks model besar, tahap prefilling memerlukan pemrosesan sejumlah besar informasi input dan pembuatan KV Cache, di mana efisiensinya secara langsung memengaruhi biaya keseluruhan dan ekonomi penyebaran inferensi AI.

Guo Mingchi menyatakan bahwa saat ini lebih dari 50% beban kerja inferensi AI berasal dari pemrosesan konteks input dan pembangunan KV Cache.

Spesifikasi chip disesuaikan secara signifikan, daya komputasi mendekati Rubin standar

Dalam hal daya komputasi dan konsumsi daya, kinerja CPX versi baru telah mendekati GPU Rubin standar, dengan konsumsi daya maksimum per kartu juga mencapai 2300 watt. Dari segi memori, CPX versi baru kini menggunakan memori GPU HBM4 168GB, yang merupakan peningkatan signifikan dibandingkan solusi sebelumnya dengan GDDR7 128GB, tetapi masih lebih rendah daripada HBM4 288GB pada GPU Rubin standar.

Menurut Guo Mingqi, total kapasitas HBM4 pada baki komputasi 8-CPX sekitar 1,34 TB, yang mampu mencakup sebagian besar beban kerja pre-filling konteks panjang dan kebutuhan KV Cache terkait. Ini berarti Rubin CPX tidak hanya mengejar daya komputasi umum yang lebih tinggi, tetapi telah dirancang ulang khusus untuk meningkatkan kapasitas memori grafis dan efisiensi pre-filling dalam skenario konteks panjang.

Beralih dari rak bersama ke deploy mandiri, konfigurasi lebih fleksibel

Rack architecture juga menjadi fokus utama dalam penyesuaian ini.

Dalam rencana sebelumnya, CPX berencana berbagi rak dengan Rubin GPU; versi baru mengganti ini dengan menggunakan rak MGX ETL terpisah, sehingga memungkinkan pelanggan untuk mengembangkan daya komputasi CPX secara terpisah sesuai kebutuhan nyata mereka.

Secara rinci, pelanggan dapat memilih skala penyebaran dengan 64, 128, 192, atau 256 GPU CPX. Setiap 64 GPU CPX membentuk satu modul rak, yang mencakup 8 baki komputasi, masing-masing dilengkapi dengan 8 GPU CPX, serta satu baki switch.

Desain modular berarti pelanggan tidak perlu membeli rak Rubin besar yang tetap, tetapi dapat secara fleksibel menambahkan daya komputasi CPX sesuai kebutuhan beban yang sudah diisi sebelumnya.

Desain terhubung bertingkat, mengurangi biaya penyebaran pra-isian

Pada arsitektur terhubung, Rubin CPX menggunakan desain berlapis, menyeimbangkan antara kinerja dan biaya.

Di dalam satu pelat komputasi, delapan GPU CPX diperluas secara scale-up melalui NVLink. Bandwidth NVLink setiap GPU CPX adalah 1 hingga 1,5 TB/s, lebih rendah dari 3,6 TB/s pada GPU Rubin standar.

Di tingkat scale-out antar tray dan di dalam modul rak, CPX menggunakan tautan L1 Ethernet copper penuh Spectrum-6; untuk koneksi antar modul rak, interkoneksi dilakukan melalui switch Spectrum-6 di masing-masing modul, menggunakan tautan serat OSFP.

Dibandingkan dengan solusi yang sepenuhnya bergantung pada interkoneksi GPU berbandwidth tinggi, arsitektur berlapis ini lebih menekankan optimasi biaya untuk skenario pre-filling.

Bekerja sama dengan Rubin GPU, fokus pada inferensi konteks panjang

Rubin CPX bukan GPU umum yang berjalan mandiri, melainkan digunakan bersama Vera Rubin NVL72 sebagai akselerator pre-fill.

Menurut Guo Mingqi, NVIDIA merekomendasikan penempatan CPX dan Rubin GPU dalam rasio 1:1: CPX bertanggung jawab atas komputasi tahap pre-fill dan menghasilkan KV Cache, yang kemudian ditransmisikan ke Rubin GPU melalui Ethernet RDMA untuk menyelesaikan dekoding selanjutnya.

Dari segi positioning produk, inti Rubin CPX bukanlah menggantikan Rubin GPU standar, tetapi membagi lebih lanjut proses AI inference, memungkinkan GPU yang berbeda masing-masing menangani tugas prefill dan decoding.

Guo Mingji menempatkannya sebagai solusi dengan nilai terbaik untuk pre-filling konteks panjang. Seiring dengan terus membesarnya jendela konteks model AI, beban komputasi dan ukuran KV Cache pada tahap pre-filling terus meningkat; peluncuran kembali proyek CPX oleh NVIDIA ini kemungkinan bertujuan untuk lebih menurunkan biaya inferensi konteks panjang melalui perangkat keras khusus dan pendekatan pengaturan hibrida.

Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini. Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.