Nvidia sedang mempertimbangkan perubahan spesifikasi yang signifikan terhadap GPU Rubin Ultra yang akan datang, berpotensi menghantar cip dengan jumlah memori berpemandu tinggi yang jauh lebih rendah daripada sasaran asal syarikat. Penyesuaian ini, dilaporkan oleh TrendForce pada awal Ogos 2026, merupakan tindakan langsung terhadap pengetatan bekalan HBM daripada tiga pengeluar utama: SK Hynix, Samsung, dan Micron.
Visi asal untuk Rubin Ultra adalah ambisius. Semasa Nvidia pertama kali memperkenalkan cip itu pada konferens pembangun GTC pada 2025, konfigurasi yang dipertimbangkan termasuk sehingga 1 TB memori HBM4E. GPU Vera Rubin semasa, yang sudah dalam penghasilan berskala besar, dihantar dengan sehingga 288 GB HBM4 dalam tumpukan 12-Hi, memberikan lebar pita memori kira-kira 22 TB/s. Rubin Ultra sepatutnya mendorong melebihi itu.
Sekarang, Nvidia sedang menguji sekurang-kurangnya tiga varian dengan pengurangan memori yang bermakna. Satu konfigurasi yang sedang dikaji menggunakan tumpukan HBM4 8-Hi yang membawa kira-kira 192 GB memori. Berbanding dengan 288 GB pada Vera Rubin semasa ini, itu adalah pengurangan 33% dalam memori di atas cip yang seharusnya mewakili lompatan generasi ke hadapan.
Mengapa memori adalah segalanya untuk beban kerja AI
Memori berpemandu tinggi bukan hanya tentang kapasiti. Bahagian “pemandu” merujuk kepada kelajuan pergerakan data antara memori dan teras pemprosesan cip. Pada 22 TB/s, Vera Rubin semasa ini beroperasi pada kelajuan yang jauh melebihi memori server konvensional dengan beberapa peringkat.
Peralihan daripada tumpukan 12-Hi kepada 8-Hi mengurangkan kapasiti dan, berpotensi, lebar jalur. Nvidia dilaporkan sedang menguji pelbagai varian untuk memastikan prestasi puncak terpelihara walaupun terdapat pengurangan memori, tetapi fizik tumpukan memori yang lebih sedikit menetapkan had sebenar kepada apa yang boleh dipulihkan oleh pengoptimuman kejuruteraan.
Laporan TrendForce pada 4 Ogos mencatat bahawa Nvidia sedang menilai empat konfigurasi HBM yang berbeza untuk Rubin Ultra, dengan peralihan daripada HBM4E 12-Hi disebabkan oleh kekurangan DRAM dan HBM yang dijangka semakin teruk pada 2027. Cabaran hasil dan pengeluaran di ketiga-tiga pembekal HBM utama telah mencipta bottleneck pengagihan wafer yang tidak dapat diselesaikan oleh Nvidia secara berseorangan.
Kos tersembunyi melakukan lebih banyak dengan lebih sedikit
Jika Rubin Ultra dilengkapi dengan memori kurang per GPU, perusahaan yang menjalankan model AI sangat besar kemungkinan besar memerlukan lebih banyak GPU untuk menangani beban kerja yang sama. Satu model yang muat pada empat GPU bermemori tinggi mungkin memerlukan enam atau lapan GPU bermemori rendah, dengan peralatan tambahan ini membawa kos sendiri: lebih banyak penggunaan kuasa, lebih banyak ruang rak, lebih banyak infrastruktur antarhubung, dan lebih banyak beban lisensi.
Terdapat perbezaan halus dalam gambaran pendapatan Nvidia. HBM4E, memori spesifikasi lebih tinggi yang asalnya dirancang untuk Rubin Ultra, menghasilkan margin lebih tinggi sepanjang rantai bekalan. Perpindahan ke arah konfigurasi HBM kelas lebih rendah mempengaruhi permintaan untuk produk memori yang paling menguntungkan, yang seterusnya mempengaruhi bagaimana SK Hynix, Samsung, dan Micron mengutamakan peta jalan pengeluaran mereka.
Bekalan HBM sudah cukup ketat sehingga keputusan pengagihan oleh pembuat memori membawa berat geopolitik dan persaingan yang sebenar. Nvidia adalah pembeli utama, tetapi ia bersaing untuk kapasiti wafer melawan AMD, Google, dan senarai semakin panjang program cip AI tersuai daripada hyperscaler seperti Amazon, Microsoft, dan Meta.
Apa yang bermaksud ini kepada pasaran cip AI
HBM terkini memerlukan penumpukan die DRAM yang sangat tepat, dan kadar hasil untuk konfigurasi 12-Hi lebih rendah berbanding tumpukan 8-Hi yang lebih mudah, mencipta bottlenecks pengeluaran yang tidak boleh diselesaikan dengan cepat.
Pembekal memori, sementara itu, menghadapi pengiraan strategik mereka sendiri. Bekalan HBM yang ketat hingga 2027 mengekalkan harga tetap tinggi dan permintaan kuat, tetapi pelanggan yang dipaksa membeli lebih banyak GPU untuk mengimbangi pengurangan memori mencipta tekanan untuk akhirnya menutup jurang bekalan. Syarikat yang berjaya menghasilkan penimbunan 12-Hi atau 16-Hi dengan hasil lebih tinggi terlebih dahulu akan memiliki leveraj yang signifikan dalam perundingan reka bentuk GPU seterusnya.
