NVIDIA Meluncurkan Vera Rubin NVL72, Meningkatkan Throughput DeepSeek hingga 30x

icon MarsBit
Bagikan
AI summary iconRingkasan
NVIDIA merilis berita on-chain yang menunjukkan hasil uji coba Vera Rubin NVL72, dengan throughput DeepSeek-V4-Pro meningkat 30 kali. Biaya token turun 35 kali dibandingkan GB300 NVL72. Platform ini mencakup Vera CPU dan Groq 3 LPX, yang kini digunakan oleh SpaceXAI. Pencatatan token baru mungkin menyusul karena peningkatan kinerja menunjukkan penerapan AI yang lebih luas.

Sangat luar biasa.

Baru saja, NVIDIA secara resmi mengungkapkan data uji coba pertama di-chip untuk kabinet unggulan generasi berikutnya, Vera Rubin NVL72.

Dan, uji coba ini langsung menarik DeepSeek -V4-Pro, jalankan tugas «kode agen cerdas» yang paling realistis!

Hasilnya mengejutkan: dibandingkan dengan flagship utama saat ini, GB300 NVL72, throughput per megawatt Vera Rubin meningkat hingga 30 kali lipat, dan biaya token turun hingga 35 kali lipat!

Agen

Seseorang berseru: "Saya bahkan tidak berani menulis PPT penipuan investor sebegitu rupa!"

Masih ada netizen yang memberikan komentar jenius: "Dulu menganggap H200 seharga tiga puluh ribu dolar terlalu mahal, sekarang melihat kembali, H200 bahkan tidak sampai level versi dasar."

Agen

Mari kita bahas secara mendalam.

Dari H200 hingga GB300, throughput beban kerja Agent nyata meningkat hingga 30 kali lipat, dengan biaya sekitar dua kali lipat.

Dari GB300 hingga Vera Rubin, throughput kembali melonjak hingga 30 kali lipat, dan harga seluruh rak secara perkiraan kembali berlipat ganda.

Menurut hukum Moore versi Old Huang, selama dua tahun terakhir, terobosan teknologi terbesar NVIDIA bukanlah GPU itu sendiri, melainkan membuat harganya naik 4 kali lipat, namun mendapatkan peningkatan kecepatan hingga 900 kali lipat!

Agen

Kali ini, NVIDIA mengumumkan kepada semua orang sebuah kebenaran yang bertentangan dengan intuisi: Era LLM berakhir, Era Agent tiba, dan semua benchmark AI sebelumnya menjadi tidak berlaku!

Agen

Sementara itu, Vera CPU yang dirancang khusus untuk agen telah dipasang semalaman oleh SpaceXAI milik Musk, bahkan siap diluncurkan ke luar angkasa.

Hari ini juga, NVIDIA Groq 3 LPX mulai diproduksi secara massal.

Gemma 4 31B berjalan di atasnya, kecepatannya luar biasa, langsung mencapai 3.400 token per detik. Throughput model parameter triliunan, melaju 35 kali lebih cepat.

Agen

Agen

Rekor-rekor baru ini langsung menulis ulang tata kelola bisnis ekosistem Agent, mulai malam ini!

Mengapa NVIDIA harus meluncurkan Vera Rubin?

Data terbaru dari OpenRouter memberikan jawabannya: di dunia nyata, jumlah Token yang dikonsumsi untuk tugas Agent AI adalah 15 kali lebih banyak daripada percakapan chat biasa!

Misalnya, jika meminta sebuah Agent untuk meneliti perusahaan demi pengambilan keputusan investasi, dalam proses ini, agen dan sub-agen terus melakukan penalaran, dan token yang terakumulasi menjadi input untuk langkah berikutnya, sehingga penanganan konteks panjang menjadi elemen paling kritis yang membatasi AI agen.

Agen

Semakin banyak interaksi agen, semakin tinggi throughput—jumlah agen meningkat 10 kali, pemanggilan alat meningkat 2 kali, kontradiksi antara daya komputasi dan algoritma menciptakan kebutuhan baru.

Agen

Jangan gunakan obrolan sebagai agen, semua benchmark lama sudah ditiadakan!

Pada saat ini, pengujian benchmark AI tradisional (seperti pengujian urutan tetap panjang 8K/1K) benar-benar tidak berlaku lagi.

NVIDIA resmi menyatakan: Pengukuran kinerja harus berkembang! Tidak lagi cukup mengukur permintaan inferensi tunggal, harus menangkap alur kerja Agent yang lengkap.

Untuk ini, mereka menggunakan benchmark AgentX milik SemiAnalysis.

Tes ini bukan lagi pertanyaan dan jawaban kaku, melainkan rekaman ulang sesi "penulisan kode" nyata dengan pertumbuhan konteks, pemanggilan alat, dan generasi agen sub.

Agen

Inilah mengapa H200 terasa kurang mampu di medan pertempuran Agent baru, Vera Rubin ditakdirkan untuk menjadi raja.

Vera Rubin NVL72 × DeepSeek-V4-Pro:

Mesin penambang dengan daya komputasi tinggi telah tiba

Untuk membuktikan kekuatan Vera Rubin NVL72, NVIDIA langsung menggunakan raja open-source— DeepSeek Melakukan pengujian on-chip untuk V4-Pro (1.6T).

Setelah data dirilis, hasilnya mengejutkan—

Di bawah beban kerja AgentX, throughput per megawatt Vera Rubin NVL72 meningkat hingga 30 kali lipat dibandingkan GB300 NVL72!

Agen

Harap dicatat bahwa perbandingan ini bukan terhadap H200 lama, melainkan terhadap GB300 yang sedang populer sebagai produk utama.

GB300 di yang sama DeepSeek Dalam pengujian V4-Pro, throughput per megawatt telah meningkat 15 kali dibandingkan H200.

Namun Vera Rubin berdiri di atas bahu GB300 dan meningkatkan lagi 30 kali lipat, sehingga meningkatkan keseluruhan kurva Pareto!

What does this mean?

Bagi pabrik AI yang terbatas oleh pasokan listrik, ini secara langsung memperluas batas-batas hukum fisika.

Dengan anggaran listrik yang sama, Vera Rubin dapat melakukan 30 kali pekerjaan agen.

Bagi pusat data berkapasitas megawatt bahkan gigawatt, ini setara dengan menciptakan aset komputasi 30 kali lipat secara tiba-tiba.

Selain itu, teknologi NVIDIA DSX MaxLPS memungkinkan pengelolaan daya pada tingkat GPU, rak, dan beban kerja, memungkinkan pemasangan hingga 40% lebih banyak GPU dalam anggaran megawatt yang sama, sehingga meningkatkan throughput per megawatt pabrik AI!

Agen

Biaya token turun drastis hingga 35 kali lipat! "Buku besar" industri Agent sepenuhnya ditulis ulang

Setiap megawatt throughput secara langsung memengaruhi biaya setiap token yang dihasilkan. Lonjakan kinerja membawa konsekuensi paling langsung berupa ledakan bisnis model.

NVIDIA mengumumkan bahwa produksi Vera Rubin NVL72 menurunkan biaya per juta Token hingga 35 kali lebih rendah dibandingkan GB300 NVL72!

Agen

Ketika biaya inferensi anjlok 35 kali lipat, karyawan digital yang beroperasi 24 jam sehari akan menjadi kenyataan, dan aplikasi super di sisi ToC akan mengalami ledakan besar.

Lao Huang's move has directly opened the door to the era of agent applications.

Agen

Desain kolaborasi ekstrem: Bagaimana Huang melakukannya?

Anda mungkin bertanya: Mengapa bisa mempercepat 30 kali? Apakah karena proses chip tunggal?

Tentu tidak.

Peningkatan kinerja luar biasa Vera Rubin NVL72 didukung oleh "desain sinergis ekstrem".

Agen

Misalnya layanan terpisah, cache KV terdistribusi, routing yang menyadari KV, MegaMoE, dll.

Agen

Selain itu, NVFP4 kuantisasi secara langsung mengompres bobot model ke presisi 4 bit, secara signifikan mengurangi penggunaan memori tanpa mengorbankan kualitas output, sehingga throughput meningkat drastis.

Sedangkan NVLink generasi keenam dengan model besar MoE menyediakan jaringan interkoneksi yang 10 kali lebih cepat dan latensi 3 kali lebih rendah dibandingkan Ethernet siap pakai, memungkinkan DeepSeek Model besar berbasis arsitektur MoE ini dapat secara lancar memanggil berbagai sub-jaringan «ahli» di antara 72 GPU.

Ini sudah lama bukan lagi menjual kartu grafis; Huang menjual seluruh "pembangkit listrik AI".

Agen

NVIDIA Groq 3 LPX mulai diproduksi secara massal:

3400 token/detik, Agent kode berubah!

Pada acara Hot Chips 2026 ini, NVIDIA juga mengumumkan kejutan besar: Groq 3 LPX mulai diproduksi secara massal!

Agen

Groq 3 LPX, ekstensi eksklusif untuk platform pusat data Vera Rubin NVL72.

Ini dirancang khusus untuk sistem ini, dengan fokus utama pada akselerasi inferensi latensi rendah.

Teknologi gelap ini dibeli oleh NVIDIA pada Desember tahun lalu dengan menghabiskan $20 miliar dari perusahaan rintisan Groq.

Agen

Agen AI mengalami masalah penundaan decoding; untuk mengakhiri masalah ini, Groq 3 LPX secara cerdas memisahkan pemrosesan konteks besar dari generasi token.

Solusi NVIDIA adalah membiarkan GPU Rubin menangani konteks skala besar, sementara tugas generasi Token ultra-cepat diserahkan ke Groq 3 LPX.

Satu mengurus 「membaca」, satu mengurus 「menulis」, masing-masing fokus pada yang paling mereka kuasai.

Agen

Dalam penyebaran tingkat rak penuh, hingga 256 accelerator LP30 dapat bekerja sama dengan GPU melalui interkoneksi berbandwidth sangat tinggi untuk membangun mesin inferensi skala perusahaan.

Agen

Dengan demikian, Groq 3 LPX langsung mencapai kecepatan output yang memecahkan rekor.

Dalam pengujian benchmark Artificial Analysis, Groq 3 LPX menjalankan Gemma 4 31B dengan jendela konteks panjang 100.000 Token, mencapai kecepatan output menakjubkan 3.400 Token/detik!

Ini membuatnya merespons empat kali lebih cepat dibandingkan pesaing dalam beban kerja yang sangat sensitif terhadap latensi.

Agen

Tugas agen multi-langkah yang sebelumnya memakan waktu beberapa jam sekarang bisa diselesaikan dalam beberapa menit!

Agen

Groq 3 LPX mengurangi waktu yang diperlukan untuk menghasilkan 5000 Token dari 50 detik menjadi 1,5 detik, selisih 34 kali.

Agen

Selain itu, dalam tugas pengkodean, Groq 3 LPX mencapai kecepatan output maksimum 6981 token/detik.

Agen

Huang Renxun secara terbuka menyatakan bahwa melalui LPX, generasi Token ultra-cepat telah mencapai "lompatan besar lainnya" dalam throughput dan kemampuan respons AI.

Agen

Nebius telah mengimplementasikan chip tersebut di Nebius Token Factory, memberikan pengalaman respons instan pada setiap langkah siklus agen.

Agen

Diikuti oleh Groq sendiri.

Agen

Pertama kali CPU khusus Agent dirilis,

Musk langsung "pergi ke luar angkasa" semalaman!

Langkah paling ambisius dalam pengumuman ini adalah Vera CPU.

Untuk Agent, NVIDIA secara khusus merancang sebuah CPU.

Vera CPU ini dirancang khusus untuk memenuhi kebutuhan agen cerdas,

Ini dilengkapi dengan 88 inti Olympus buatan sendiri, memori LPDDR5X berbandwidth tinggi, dengan bandwidth langsung mencapai 1,2 TB/s.

Agen

Mengapa diperlukan CPU baru di era model besar?

Di acara Hot Chips, manajer senior NVIDIA Vera CPU secara langsung menyatakan, "Agentic AI adalah tugas komputasi paling kompleks sepanjang sejarah."

Agen

Satu tugas, agen harus menjalankan ratusan langkah: memanggil alat, menjalankan kode Python, menggulir konteks, memproses sejumlah besar data....

Semua tugas penjadwalan pengiriman ini dipikul secara langsung oleh CPU. Oleh karena itu, NVIDIA harus membuat CPU khusus untuk Agent.

Mengingat hal ini, SpaceXAI milik Musk secara resmi mengumumkan penerapan skala besar CPU NVIDIA Vera semalaman!

Pada Mei tahun ini, NVIDIA secara diam-diam mengirimkan sampel pertama Vera ke perusahaan A, OpenAI, dan SpaceXAI untuk 'uji coba' terlebih dahulu.

Hanya tiga bulan kemudian, SpaceXAI dengan antusias memindahkannya ke tahap peluncuran penuh.

Yang lebih gila lagi, SpaceXAI sedang membangun pabrik komputasi gigawatt berdasarkan platform Vera Rubin untuk menggerakkan Grok.

Selain itu, daya komputasi ini juga akan langsung dikirim ke luar angkasa.

Musk menyatakan, "Dua perusahaan besar bekerja sama, merancang versi teroptimalkan dari Vera Rubin NVL72 yang akan dideploy secara massal pada 2028."

Agen

Generasi pertama satelit AI «Starmind» dari SpaceXAI direncanakan menggunakan sistem rak Vera Rubin NVL72.

Agen

Dari satu GPU, hingga seluruh pabrik Agent

Pada hari yang sama, dua chip utama, Vera CPU dan Groq 3 LPX, mulai diproduksi secara massal.

This is significant for NVIDIA.

Agen

Di era model besar, NVIDIA menguasai pelatihan dan inferensi melalui GPU.

Di era Agent, jangkauannya telah meluas ke CPU, accelerator inferensi, NVLink, dan lainnya.

Yang dijual oleh Lao Huang sudah bukan lagi sekadar satu GPU.

Dia ingin menjual sebuah pabrik AI yang dapat terus memproduksi Token.

Kali ini, Lao Huang ingin meletakkan kembali fondasi seluruh "Era Agent".

Referensi:

https://x.com/MinLiBuilds/status/2091915873661686204

https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/

https://developer.nvidia.com/blog/inside-nvidia-groq-3-lpx-the-low-latency-inference-accelerator-for-the-nvidia-vera-rubin-platform/

https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/

Artikel ini berasal dari akun WeChat "Sinzhiyuan", penulis: ASI Revelation

Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini. Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.