Ipinakilala ng NVIDIA ang Vera Rubin NVL72, dinagdagan ang throughput ng DeepSeek ng 30x

icon MarsBit
I-share
AI summary iconSummary
Ipinahayag ng NVIDIA ang on-chain na balita na nagpapakita ng mga resulta ng pagsusuri ng Vera Rubin NVL72, na may pagtaas ng 30x sa throughput ng DeepSeek-V4-Pro. Bumaba ang mga gastos sa token ng 35x kumpara sa GB300 NVL72. Ang platform ay kasama ang Vera CPU at Groq 3 LPX, na ngayon ay ginagamit ng SpaceXAI. Maaaring sumunod ang mga bagong listing ng token dahil sa mga pag-unlad sa performance na nagpapahiwatig ng mas malawak na paggamit ng AI.

Sobrang galing.

Kasalukuyang ipinakita ng NVIDIA ang unang on-chip test data ng kanilang susunod na flagship cabinet, ang Vera Rubin NVL72, para sa unang pagkakataon sa kasaysayan nito.

At, ang ganitong pagsusuri ay direktang dinala ang DeepSeek -V4-Pro, patakbuhin ang pinakatotoo na gawain ng “agent encoding”!

Ang resulta ay nakakagulat: Kumpara sa kasalukuyang top-tier server na GB300 NVL72, ang bawat megawatt throughput ng Vera Rubin ay tumaas ng hanggang 30 beses, habang ang bawat token cost ay bumaba ng hanggang 35 beses!

Agent

Isinigaw ng isang tao: “Hindi ko pa man nagagawa na isulat ang ganitong PPT para manlinlang sa mga investor!”

Mayroon pang komento ng netizen: "Noong una, iniisip kong mahal ang H200 sa $30,000 per unit, ngunit ngayon, tingnan ko naman—ang H200 ay kahit hindi pa naman basic edition."

Agent

Magtatalakay tayo nang mabuti.

Mula sa H200 hanggang sa GB300, tumataas ang throughput ng totoong Agent workload ng hanggang 30 beses, habang ang gastos ay halos dumoble.

Mula sa GB300 hanggang sa Vera Rubin, umabot muli sa pinakamataas na 30 beses ang throughput, at halos dumoble ang presyo ng buong rack.

Ayon sa Moore’s Law ni Lao Huang, ang pinakamalaking teknikal na pag-usbong ni NVIDIA sa dalawang taong ito ay hindi ang GPU mismo, kundi ang pagpapalaki ng presyo ng apat na beses, na nagdulot ng isang pagtaas ng bilis na 900 beses!

Agent

Sa pagkakataong ito, ipinahayag ng NVIDIA ang isang hindi karaniwang katotohanan sa lahat: natapos na ang panahon ng LLM, dumating na ang panahon ng Agent, at lahat ng dating benchmark para sa AI ay naging walang kwenta!

Agent

Sambil noon, ang Vera CPU na espesyal na disenyo para sa mga agent, ay na-install ng SpaceXAI ni Musk sa gabi, at handa na itong iwasan sa kalawakan.

Sa parehong araw, ang NVIDIA Groq 3 LPX ay nagsimula na rin sa full-scale production.

Ang Gemma 4 31B ay tumatakbo sa itaas, at ang bilis ay talagang nakakapanlilipad—direktang nakakamit ang 3,400 Token bawat segundo. Ang throughput ng modelong may trilyon na parameter, tumataas ng 35 beses.

Agent

Agent

Ang mga bagong rekord na ito ay diretso ring isusulat muli ang komersyal na landscape ng Agent ecosystem, mula sa gabi na ito!

Bakit kailangan ng NVIDIA na ilabas ang Vera Rubin?

Ang pinakabagong data mula sa OpenRouter ang nagbibigay ng sagot: Sa totoong buhay, ang bilang ng Token na ginagamit ng isang Agent AI task ay 15 beses ang dami ng isang karaniwang usapang chat!

Halimbawa, kung ipapagawa sa isang Agent ang pag-aaral ng isang kumpanya para sa desisyon sa pag-invest, sa proseso na ito, patuloy na magrerehas ang agent at mga sub-agent, at ang nakumpunang Token ay magiging input para sa susunod na hakbang; ang pagproseso ng mahabang konteksto ay naging pinakamahalagang limitasyon sa AI ng agent.

Agent

Mas maraming pag-interact ng agent, mas malaki ang throughput—nagdami ng 10 beses ang bilang ng agent, nagdami ng 2 beses ang paggamit ng mga tool, at ang kontradiksiyon sa computing power at algorithm ay naglikha ng bagong pangangailangan.

Agent

Huwag gamitin ang chat bilang agent, lahat ng lumang benchmark ay nalikas na!

Sa panahong ito, ang mga tradisyonal na benchmark ng AI (tulad ng pagsubok sa mga sequence ng 8K/1K na may fixed length) ay lubos na hindi na epektibo.

Pinapakilala ng NVIDIA: Dapat mag-evolve ang pagmamarka ng performance! Hindi na sapat ang pagmamarka ng isang pahinga sa pag-iisip; kailangan makuha ang buong workflow ng Agent.

Para sa layuning ito, ginamit nila ang AgentX benchmark mula sa SemiAnalysis.

Hindi na ito isang pagsusulit na may mga tanong at sagot na pampasigla, kundi isang pag-uulit ng totoong “seshyon sa paggawa ng code” na may paglago sa konteksto, pagtawag sa mga kasangkapan, at pagbuo ng mga sub-agent.

Agent

Dito nagkakaroon ng kahinaan ang H200 sa bagong battlefield ng Agent, at ang Vera Rubin ay destinadong maging hari.

Vera Rubin NVL72 × DeepSeek-V4-Pro:

Ang hash power monster ay dumating

Upang patunayan ang kapasidad ng Vera Rubin NVL72, ginamit nang direkta ng NVIDIA ang open-source na hari— DeepSeek Ginagawa ang on-chip testing sa V4-Pro (1.6T).

Agad na nakakagawa ng nakakagulat na resulta ang paglabas ng datos—

Sa ilalim ng AgentX workload, ang bawat megawatt throughput ng Vera Rubin NVL72 ay tumataas ng 30 beses kumpara sa GB300 NVL72!

Agent

Paalala, ang binabasehan dito ay hindi ang lumang H200, kundi ang sikat na pangunahing GB300.

GB300 sa parehong DeepSeek Sa pagsubok ng V4-Pro, ang bawat megawatt ng throughput ay nagsabay na 15 beses na mas mataas kaysa sa H200.

Ngunit ang Vera Rubin ay umakyat pa ng 30 beses sa balikat ng GB300, at itinataas pa ito sa buong kurba ng Pareto!

What does this mean?

Para sa mga “AI factory” na nakakasalalay sa pagkakaroon ng kuryente, ito ay diretso nang ipinapalawig ang mga hangganan ng pisikal na batas.

Sa parehong budget ng kuryente, kayang gawin ni Vera Rubin ang 30 beses na dami ng mga gawain ng agent.

Para sa mga data center na may kapasidad sa megawatt o gigawatt, ito ay katumbas ng pagkakaroon ng 30 beses na mas maraming asset sa computing power.

Dagdag pa, ang teknolohiyang NVIDIA DSX MaxLPS ay nagpapahintulot sa pagpapamahala ng kapangyarihan sa antas ng GPU, rack, at workload, na nagpapahintulot sa pagkakaroon ng hanggang 40% higit pang GPU sa parehong budget ng megawatt, na nagpapataas pa ng throughput bawat megawatt ng AI factory!

Agent

Bumaba ang gastos ng token ng 35 beses! Ang 'ledger' ng industriya ng Agent ay buong-binago

Bawat megawatt ng throughput, direktang nakakaapekto sa bawat gastos sa pagbuo ng token. Ang pagtaas ng performance, ang pinakadirektang epekto ay ang nuclear explosion ng business model.

Ipinahayag ng NVIDIA na ang paggawa ng Vera Rubin NVL72 ay nagbabawas ng hanggang 35 beses ang gastos bawat milyong token kumpara sa GB300 NVL72!

Agent

Kapag bumaba ang gastos sa pagpapatakbo ng 35 beses nang biglaan, magiging totoo ang mga digital na empleyado na nagtatrabaho 24/7, at magkakaroon ng malaking paglago ang super app sa ToC side.

Ang pagkakasira ni Lao Huang ay diretso nang bukas ang pinto ng panahon ng mga aplikasyon ng Agent.

Agent

Extreme collaborative design: Paano ni Huang ito ginawa?

Maaari mong tanungin: Bakit maaaring mapabilis ng 30 beses? Batay sa proseso ng isang chip lamang ba ito?

Hindi naman.

Ang nakakagulat na pagpapabuti ng performans ng Vera Rubin NVL72 ay dahil sa "extreme co-design".

Agent

Halimbawa ang mga hiwalay na serbisyo, distributed KV cache, KV-aware routing, MegaMoE, atbp.

Agent

Bukod dito, ang NVFP4 ay direktang kinasusukat ang weights ng model sa 4-bit precision, na nagpapaliit nang malaki sa paggamit ng memorya nang hindi nagpapababa sa kalidad ng output, at nagpapabilis nang malaki sa throughput.

Samantalang ang ikapitong henerasyon ng NVLink at ang malalaking modelo na MoE ay nagtataguyod ng isang network na 10 beses na mas mabilis at may 3 beses na mas mababang latency kaysa sa ready-made Ethernet, na nagpapahintulot sa DeepSeek Ang malaking modelo batay sa arkitekturang MoE ay maaaring magtawag nang walang hadlang sa iba't ibang mga «eksperto» na sub-network sa pagitan ng 72 na GPU.

Hindi na ito pagbebenta ng mga graphics card; ibinebenta ni Huang ang buong “AI power plant”.

Agent

Full-scale production of NVIDIA Groq 3 LPX:

3400 na Token/s, nagbago ang code ng Agent!

Sa Hot Chips 2026 na konperensya, ibinunyag ng NVIDIA ang isang nakakagulat na balita: ang Groq 3 LPX ay nagsisimula na sa kompletong produksyon!

Agent

Groq 3 LPX, isang eksklusibong pagpapalawak ng Vera Rubin NVL72 data center platform.

Ito ay espesyal na disenyo para sa sistema na ito, na nagtatampok ng pagpapabilis sa pagpapatakbo na may mababang latency.

Ang teknolohiyang ito ay binili ni NVIDIA noong Disyembre taong nakaraan sa halagang $20 bilyon mula sa startup na Groq.

Agent

Ang mga AI agent ay maaaring makaranas ng delay sa decoding; upang wakasan ang problema na ito, ang Groq 3 LPX ay nagsasagawa ng malinaw na paghihiwalay sa malaking pagproseso ng konteksto at pagbuo ng token.

Ang solusyon ni NVIDIA ay ang paggamit ng Rubin GPU para sa malalaking konteksto, at ang pagbibigay ng gawain na mabilis na pagbuo ng Token sa Groq 3 LPX.

Isang nagtatrabaho sa «pagbasa», isang nagtatrabaho sa «pagsusulat», bawat isa ay nagtatrabaho sa kanyang pinakamahusay.

Agent

Sa isang buong deployment ng rack, hanggang 256 na LP30 accelerators ay maaaring magtrabaho kasama ang GPU sa pamamagitan ng ultra-high bandwidth interconnect upang bumuo ng isang enterprise-scale inference engine.

Agent

Dahil dito, ang Groq 3 LPX ay direktang nakamit ang rekord na bilis ng output.

Sa pagsubok ng Artificial Analysis, ang Groq 3 LPX ay nagpapatakbo ng Gemma 4 31B sa 100,000 Token na mahabang window ng konteksto, na nagtataglay ng bilis ng output na nakakagulat na 3,400 Token/s!

Nagpapahintulot ito sa mas mabilis na pagtugon na apat na beses na mas mabilis kaysa sa mga kalaban.

Agent

Ang mga task na nagkukuha ng ilang oras sa nakaraan ay maaari na ngayong tapusin sa ilang minuto!

Agent

Ang Groq 3 LPX ay bawas ang oras mula sa 50 segundo hanggang 1.5 segundo para sa pagbuo ng 5,000 na Token, isang 34-fold na pagkakaiba.

Agent

At sa mga gawain sa pag-encode, ang pinakamalaking bilis ng output ng Groq 3 LPX ay 6981 token/s.

Agent

Sinabi ni Huang Renxun na ang pagpapalawak ng super-fast token generation sa pamamagitan ng LPX ay nagdulot ng “isa pang malaking paglalakbay” sa AI throughput at responsiveness.

Agent

Nebius ay nagsagawa ng chip sa Nebius Token Factory upang bigyan ang bawat hakbang ng agent loop ng ekstrang responsive na karanasan.

Agent

Susunod sa iyo, ang sarili ng Groq.

Agent

Ipinakilala ang unang CPU na espesyal para sa Agent,

Masquerade agad na “nagpunta sa kalawakan”!

Ang pinakamalaking hakbang sa pormal na pahayag na ito ay ang Vera CPU.

Para sa Agent, binuo ng NVIDIA ang isang CPU.

Ang CPU na ito, ang Vera, ay espesyal na ginawa para sa pagpapalakas ng mga agent,

Nakakapag-iskedyul ito ng 88 self-developed Olympus cores, mataas na bandwidth na LPDDR5X memory, na direktang nagdadala ng 1.2 TB/s na bandwidth.

Agent

Bakit kailangan ng bagong CPU sa panahon ng malalaking modelo?

Sa Hot Chips, direktang sinabi ng executive ng NVIDIA Vera CPU, "Ang Agentic AI ay ang pinakakomplikadong compute task sa kasaysayan."

Agent

Isang gawain, maaaring magdulot ng higit sa isang daan na hakbang sa likod ng Agent: paggamit ng mga kasangkapan, pagpapatupad ng Python code, pagbabalik-balik sa konteksto, pagproseso ng malaking dami ng data....

Ang lahat ng mga gawain sa pagdudulot ng mga messenger ay pinipigilan ng CPU. Kaya kailangan ng NVIDIA na gumawa ng isang ок hiwalay na CPU para sa Agent.

Tama ang pagtingin sa puntos na ito, kinuha ng SpaceXAI ni Musk agad at inanunsyong ipinapalabas nang malawakan ang NVIDIA Vera CPU!

Noong Mayo ng taong ito, ipinadala na ni NVIDIA ang mga unang sample ng Vera sa Company A, OpenAI, at SpaceXAI para sa unang pagsubok.

Talagang tatlo lang buwan, nagmamadali na ang SpaceXAI na ilipat ito sa kompletong pag-deploy.

Mas kawawa pa, binubuo ng SpaceXAI ang gigawatt-scale computing factory batay sa Vera Rubin platform para i-drive ang Grok.

Hindi lang iyon, ang computing power na ito ay dadalhin nang direkta sa kalawakan.

Sinabi ni Musk, "Ang dalawang malakas na kumpanya ay nagtutulungan upang disenyo ang isang pinabuting bersyon ng Vera Rubin NVL72, na magiging malawakang ipapalabas noong 2028."

Agent

Ang unang henerasyon ng SpaceXAI na "Starmind" AI satellite ay plano na gamitin ang Vera Rubin NVL72 rack-level system.

Agent

Mula sa isang GPU, hanggang sa buong Agent factory

Sa parehong araw, ang dalawang chip na Vera CPU at Groq 3 LPX ay nagsimula na sa komersyal na produksyon.

This is significant for NVIDIA.

Agent

Sa panahon ng malalaking model, nakakuha ang NVIDIA ng pag-train at pag-infer sa pamamagitan ng GPU.

Sa panahon ng Agent, ang kanyang teritoryo ay nagsasaklaw na sa CPU, inference accelerators, NVLink, atbp.

Hindi na lang isang GPU ang ibinebenta ni Lao Huang.

Ang ipinagbibili niya ay isang AI factory na kayang mag-produce ng Token nang walang katapusan.

Ito ngayon ni Lao Huang ay magpapalit muli ng mga pundasyon ng buong “Panahon ng Agent”.

Mga sanggunian:

https://x.com/MinLiBuilds/status/2091915873661686204

https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/

https://developer.nvidia.com/blog/inside-nvidia-groq-3-lpx-the-low-latency-inference-accelerator-for-the-nvidia-vera-rubin-platform/

https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/

Ang artikulong ito ay galing sa WeChat public account na “New Intelligence Yuan”, may-akda: ASI Revelation

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.