Sangat hebat.
Baru sahaja, NVIDIA mengumumkan data ujian pertama di atas cip untuk rak puncak generasi seterusnya, Vera Rubin NVL72, untuk pertama kalinya dalam sejarahnya.
Dan, ujian sebenar ini secara langsung membawa DeepSeek -V4-Pro, jalankan tugas "kod pengekodan agen" yang paling sebenar!
Keputusan mengejutkan: Berbanding dengan peneraju semasa GB300 NVL72, throughput setiap megawatt Vera Rubin meningkat sehingga 30 kali ganda, dan kos token turun sehingga 35 kali ganda!

Seseorang berseru: "Saya pun tidak berani menulis PPT yang menipu pelabur sebegini!"
Ada juga ulasan netizen yang hebat: "Dulu rasa H200 harga tiga puluh ribu dolar AS mahal, sekarang tengok balik, H200 pun tak sampai tahap versi asas."

Mari kita periksa dengan teliti.
Dari H200 hingga GB300, throughput beban kerja Agent sebenar meningkat sehingga 30 kali ganda, dengan kos lebih kurang ganda.
Dari GB300 hingga Vera Rubin, throughput sekali lagi meningkat sehingga 30 kali ganda, dan harga keseluruhan rak hampir dua kali ganda.
Menurut Hukum Moore versi Lao Huang, terbukti bahwa terobosan teknologi terbesar NVIDIA dalam dua tahun terakhir bukanlah GPU itu sendiri, tetapi membuat harganya naik empat kali lipat sambil mendapatkan peningkatan kecepatan sebesar 900 kali!

Kali ini, NVIDIA mengumumkan kepada semua orang satu kebenaran yang bertentangan dengan akal sehat: Era LLM berakhir, Era Agen tiba, dan semua tolok ukur AI sebelumnya telah dinyatakan tidak berlaku!

Sementara itu, Vera CPU yang direka khas untuk agen telah dipasang semalaman oleh SpaceXAI milik Musk, bahkan bersedia dilancarkan ke luar angkasa.
Pada hari yang sama, NVIDIA Groq 3 LPX juga telah memulakan pengeluaran penuh.
Gemma 4 31B berjalan di atasnya, kelajuan benar-benar luar biasa, langsung mencapai 3400 token per saat. Throughput model parameter triliunan, meningkat 35 kali ganda.


Rekod-rekod baru ini secara langsung menulis semula kerangka perniagaan ekosistem Agent bermula malam ini!
Mengapa NVIDIA perlu melancarkan Vera Rubin?
Data terkini dari OpenRouter memberikan jawapannya: Dalam dunia nyata, tugas AI Agent menghabiskan 15 kali lebih banyak Token daripada perbualan chat biasa!
Sebagai contoh, jika seorang agen ditugaskan untuk menyelidiki syarikat bagi membuat keputusan pelaburan, proses ini melibatkan agen dan sub-agen yang terus ber推理, di mana token yang terkumpul menjadi input untuk langkah seterusnya, dan pemprosesan konteks panjang menjadi elemen paling kritikal yang membatasi AI agen.

Semakin banyak interaksi agen, semakin tinggi throughput—jumlah agen meningkat 10 kali, pemanggilan alat meningkat 2 kali, konflik antara kekuatan komputasi dan algoritma menciptakan keperluan baru.

Jangan gunakan perbualan sebagai agen, semua tolok ukur lama dibatalkan!
Pada masa ini, ujian piawai AI tradisional (seperti ujian urutan 8K/1K panjang tetap) benar-benar tidak berkesan.
NVIDIA rasmi nyatakan: Pengukuran prestasi mesti berkembang! Tidak lagi boleh mengukur permintaan inferens tunggal, mesti menangkap alur kerja Agent yang lengkap.
Untuk ini, mereka menggunakan ujian rujukan AgentX milik SemiAnalysis.
Ujian ini bukan lagi soal jawaban kaku, tetapi pemutaran semula « sesi penulisan kod » yang sebenar, dengan pertumbuhan konteks, pemanggilan alat, dan penghasilan agen anak.

Inilah sebabnya H200 kelihatan tidak mampu di medan pertempuran Agent yang baru, Vera Rubin ditakdirkan untuk menjadi raja.
Vera Rubin NVL72 × DeepSeek-V4-Pro:
Mesin pengiraan kuat telah tiba
Untuk membuktikan kekuatan Vera Rubin NVL72, NVIDIA terus menggunakan raja open-source— DeepSeek Melakukan ujian dalam cip untuk V4-Pro (1.6T).
Setelah data dikeluarkan, hasilnya mengejutkan—
Di bawah beban kerja AgentX, throughput per megawatt Vera Rubin NVL72 meningkat sehingga 30 kali ganda berbanding GB300 NVL72!

Harap diperhatikan, perbandingan di sini bukan terhadap H200 lama, tetapi terhadap GB300 yang sedang populer sebagai produk utama.
GB300 pada yang sama DeepSeek Dalam pengujian V4-Pro, throughput per megawatt telah meningkat 15 kali ganda berbanding H200.
Namun Vera Rubin pula meningkatkan 30 kali ganda di atas bahu GB300, meningkatkan keseluruhan lengkung Pareto!
What does this mean?
Bagi "pabrik AI" yang terbatas oleh bekalan elektrik, ini secara langsung memperluas sempadan hukum fizikal.
Dengan bajet elektrik yang sama, Vera Rubin boleh melakukan 30 kali ganda kerja agen.
Bagi pusat data berkuasa megawatt atau gigawatt, ini setara dengan menciptakan aset pengiraan 30 kali ganda dari tiada apa-apa.
Selain itu, teknologi NVIDIA DSX MaxLPS memungkinkan pengurusan kuasa pada aras GPU, rak, dan beban kerja, membolehkan pemasangan hingga 40% lebih banyak GPU dalam anggaran megawatt yang sama, meningkatkan lagi throughput setiap megawatt bagi pabrik AI!

Kos token turun 35 kali ganda! Buku besar industri Agent ditulis semula sepenuhnya
Setiap megawatt throughput secara langsung mempengaruhi kos setiap token yang dihasilkan. Peningkatan prestasi membawa kesan paling langsung iaitu letupan商业模式.
NVIDIA mengumumkan bahawa Vera Rubin NVL72 mengurangkan kos penghasilan setiap juta Token sehingga 35 kali ganda berbanding GB300 NVL72!

Apabila kos penghujahan turun mendadak sebanyak 35 kali, pekerja digital 24 jam sehari akan menjadi kenyataan, dan aplikasi super di sisi ToC akan mengalami ledakan besar.
Lao Huang's move has directly opened the door to the era of agent applications.

Reka bentuk kerjasama ekstrem: Bagaimana Huang mencapainya?
Anda mungkin bertanya: Apa yang membuatnya boleh mempercepat 30 kali ganda? Adakah ia bergantung pada proses cip tunggal?
Tidak jelas.
Vera Rubin NVL72 mencapai peningkatan prestasi yang menakjubkan melalui 'reka bentuk sinergi ekstrem'.

Contohnya perkhidmatan terpisah, cache KV terdistribusi, penghalaan sedar KV, MegaMoE, dan sebagainya.

Selain itu, NVFP4 mengkompresi bobot model secara langsung kepada ketepatan 4 bit, mengurangkan penggunaan memori secara besar-besaran tanpa mengorbankan kualiti output, menjadikan throughput meningkat secara drastis.
Sementara NVLink generasi keenam bersama model besar MoE, menyediakan jaringan antar-koneksi yang 10 kali lebih cepat dan latensi 3 kali lebih rendah berbanding Ethernet siap pakai, membolehkan DeepSeek Model besar berdasarkan arsitektur MoE ini boleh memanggil pelbagai sub-jaringan 「pakar」 dengan lancar di antara 72 GPU.
Ini bukan lagi tentang menjual kad grafik; Huang menjual satu set lengkap "pembangkit listrik AI".

NVIDIA Groq 3 LPX siap untuk pengeluaran penuh:
3400 token/detik, Agent kod berubah!
Pada perjumpaan Hot Chips 2026 ini, NVIDIA juga mengumumkan berita mengejutkan: Groq 3 LPX telah bermula pengeluaran penuh!

Groq 3 LPX, merupakan ekspansi eksklusif untuk platform pusat data Vera Rubin NVL72.
Ia direka khas untuk sistem ini, dengan fokus utama pada akselerasi inferensi latensi rendah.
Teknologi gelap ini dibeli oleh NVIDIA pada bulan Disember tahun lepas dengan perbelanjaan sebanyak US$20 bilion daripada syarikat permulaan Groq.

Agen AI mungkin mengalami masalah penundaan dekod, dan untuk mengakhiri masalah ini, Groq 3 LPX memisahkan secara cekap pengurusan konteks besar dengan penghasilan Token.
Penyelesaian NVIDIA ialah membiarkan GPU Rubin mengendalikan konteks berskala besar, sambil menyerahkan tugas penghasilan Token pantas kepada Groq 3 LPX.
Satu bertanggungjawab atas「membaca», satu lagi bertanggungjawab atas「menulis», masing-masing fokus pada apa yang paling mereka kuasai.

Dalam pelaksanaan penuh berperingkat rak, sehingga 256 akselerator LP30 boleh bekerjasama dengan GPU melalui antaramuka berpemandu ultra-tinggi untuk membina enjin inferens berskala perniagaan.

Dengan ini, Groq 3 LPX secara langsung mencapai kelajuan output yang memecahkan rekod.
Dalam ujian rujukan Artificial Analysis, Groq 3 LPX menjalankan Gemma 4 31B dengan jendela konteks panjang 100,000 token, mencapai kelajuan output yang menakjubkan sebanyak 3,400 token/detik!
Ini menjadikannya empat kali lebih pantas dalam menanggapi beban kerja yang sangat sensitif terhadap latensi.

Tugasan agen berbilang langkah yang sebelumnya memakan masa beberapa jam kini boleh diselesaikan dalam beberapa minit!

Groq 3 LPX mengurangkan masa yang diperlukan untuk menghasilkan 5000 Token dari 50 saat kepada 1.5 saat, sebanyak 34 kali ganda.

Selain itu, dalam tugas pengkodan, kelajuan output maksimum Groq 3 LPX ialah 6981 token/s.

Huang Renxun secara terus terang mengatakan bahawa pemajuan penghasilan Token ultra-cepat melalui LPX telah mencapai "lompatan besar sekali lagi" dalam throughput dan kemampuan respons AI.

Nebius telah menghantar cip tersebut di Nebius Token Factory, membolehkan setiap langkah kitaran agen mendapatkan pengalaman respons segera yang maksimum.

Diikuti oleh Groq sendiri.

Pertama kali CPU khas Agent dilancarkan,
Musk terus ke luar angkasa semalaman!
Langkah paling ambisius dalam pengumuman ini ialah Vera CPU.
Untuk Agent, NVIDIA telah membina sebuah CPU khas.
CPU Vera ini khusus diperuntukkan untuk memenuhi keperluan agen pintar,
Ia dilengkapi dengan 88 inti Olympus buatan sendiri, memori LPDDR5X berpemandu tinggi, dengan lebar pita langsung mencapai 1,2 TB/s.

Mengapa diperlukan CPU baharu di era model besar?
Di acara Hot Chips, pengurus CPU Vera NVIDIA secara terus terang mengatakan, "Agentic AI adalah tugas pengiraan paling kompleks sepanjang sejarah."

Satu tugas, agen perlu menjalankan ratusan langkah: memanggil alat, menjalankan kod Python, menggulir konteks, memproses data dalam jumlah besar....
Semua tugas pengurusan kurir ini dipikul sepenuhnya oleh CPU. Oleh itu, NVIDIA perlu menciptakan CPU khas untuk Agent.
Memperhatikan titik ini, SpaceXAI milik Musk mengumumkan secara mendadak pelaksanaan berskala besar CPU NVIDIA Vera!
Pada Mei tahun ini, NVIDIA telah menghantar contoh Vera pertama secara diam-diam kepada A Corp, OpenAI, dan SpaceXAI untuk 'uji coba' terlebih dahulu.
Hanya tiga bulan kemudian, SpaceXAI dengan bersemangat memindahkannya ke pelaksanaan penuh.
Yang lebih gila lagi, SpaceXAI sedang membina pabrik pengiraan gigawatt berdasarkan platform Vera Rubin untuk menggerakkan Grok.
Selain itu, pengiraan kuasa ini juga akan dihantar terus ke angkasa.
Musk menyatakan, "Dua pihak kuat bekerjasama, mereka sebuah versi teroptimumkan Vera Rubin NVL72, yang akan dideploy secara besar-besaran pada 2028."

Satelit AI generasi pertama SpaceXAI, "Starmind", dirancang untuk menggunakan sistem rak Vera Rubin NVL72.

Dari satu GPU, ke seluruh pabrik Agent
Pada hari yang sama, dua cip utama, Vera CPU dan Groq 3 LPX, mulai produksi besar-besaran.
This is significant for NVIDIA.

Di era model besar, NVIDIA menguasai latihan dan inferensi melalui GPU.
Pada era agen, jangkauannya telah meluas ke CPU, penguat inferens, NVLink, dan sebagainya.
Yang dijual oleh Lao Huang bukan lagi sekadar sekeping GPU.
Dia ingin menjual sebuah pabrik AI yang boleh menghasilkan Token secara berterusan.
Kali ini, Lao Huang ingin membina semula tapak asas bagi seluruh "Zaman Agen".
Rujukan:
https://x.com/MinLiBuilds/status/2091915873661686204
https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/
https://developer.nvidia.com/blog/inside-nvidia-groq-3-lpx-the-low-latency-inference-accelerator-for-the-nvidia-vera-rubin-platform/
https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/
Artikel ini berasal daripada akaun微信公众号 "Sinzhiyuan", penulis: Apokalips ASI
