Ang NVIDIA ay muli nagsimula ang proyektong GPU para sa pagpapabilis ng pre-fill sa AI inference, ang “Rubin CPX”, na plano ay magsisimula sa produksyon noong unang quarter ng 2027. Ang produkto ay disenyo para sa mga skenaryo ng mahabang konteksto sa pre-fill, na may 168GB na HBM4 memory, at may computing power na malapit sa standard na Rubin GPU, na may power consumption na 2300W per card. Gumagamit ito ng independiyenteng MGX ETL rack design na nag-ooffer ng flexible deployment configuration mula sa 64 hanggang 256 GPU. Ang interconnect architecture ay may hierarchical design, kung saan ang NVLink ay ginagamit sa loob ng isang tray, habang ang Ethernet ay ginagamit sa pagitan ng mga tray upang makamit ang balance sa performance at cost. Ang Rubin CPX ay gagamitin bilang pre-fill accelerator kasama ang standard na Rubin GPU sa proporsyon na 1:1, kung saan ang CPX ay responsable sa pre-fill at pagbuo ng KV Cache, habang ang Rubin GPU ay responsable sa decoding, na espesyal na optimizado para sa mga long-context inference scenarios.May-akda ng artikulo, pinagmulan: Wall Street Journal
Si NVIDIA ay tahimik na nagmula muli sa isang chip project na dating itinuturing na itinigil ng merkado, na may layuning direktang tugon sa mataas na gastos sa AI inference sa prefill phase.
Ang NVIDIA ay muli nang pinagsimulan ang proyektong GPU para sa pagpapabilis ng pre-fill sa AI inference na tinatawag na "Rubin CPX" at nag-gawa ng malaking pagbabago sa disenyo ng produkto. Ayon sa kasalukuyang plano, inaasahang magsisimula ang produksyon ng bagong bersyon ng Rubin CPX noong unang quarter ng 2027.
Ang pagpapalit muli ng proyektong ito ay naglalabas ng malinaw na signal: nagpapalakas ang NVIDIA sa paglutas ng mga bottleneck sa performance at gastos sa pre-filling phase ng AI inference. Habang patuloy na tumataas ang haba ng konteksto ng malalaking modelo, ang pre-filling phase ay kailangang magtrabaho sa malaking dami ng input at magbuo ng KV Cache, at ang kanyang epekto ay diretso sa kabuuang gastos at ekonomiya ng pag-deploy ng AI inference.
Sinabi ni Guo Mingqi na kasalukuyan, higit sa 50% ng AI inference workload ay galing sa pagproseso ng input context at pagbuo ng KV Cache.
Malaki ang pagbabago sa mga spesipikasyon ng chip, malapit sa standard na Rubinstein
Sa aspeto ng computing power at power consumption, ang performance ng bagong bersyon ng CPX ay malapit na sa standard na Rubin GPU, at ang pinakamataas na power consumption ng isang card ay umabot din sa 2300 watts. Sa aspeto ng memory, ang bagong bersyon ng CPX ay gumamit na ng 168GB HBM4 memory, na isang malinaw na pag-upgrade kumpara sa dating 128GB GDDR7, ngunit mas mababa pa rin kaysa sa 288GB HBM4 ng standard na Rubin GPU.
Ayon kay Guo Ming-qi, ang kabuuang kapasidad ng HBM4 sa 8-GPU CPX compute tray ay humigit-kumulang 1.34 TB, na kayang suportahan ang karamihan sa mga habang kontekstong prefill workload at ang mga kaukulang KV Cache na pangangailangan. Ibig sabihin, ang Rubin CPX ay hindi lamang naglalayong makamit ang mas mataas na pangkalahatang computing power, kundi re-design ito para sa mga habang kontekstong scenario sa pamamagitan ng pagpapalaki ng kapasidad ng VRAM at pagpapabuti ng prefill efficiency.
Mula sa shared rack patungo sa independent deployment, mas flexible ang configuration
Ang rack architecture ay ang isang pangunahing bahagi ng pagbabagong ito.
Sa dating plano, plano ng CPX na ibahagi ang rack kay Rubin GPU; sa bagong bersyon, ginagamit na independiyenteng MGX ETL rack upang payagan ang mga customer na i-extend ang CPX computing power ayon sa kanilang aktwal na pangangailangan.
Sa detalye, maaaring piliin ng mga kliyente ang mga sukat ng deployment na 64, 128, 192, o 256 na CPX GPU. Bawat 64 na CPX GPU ay bumubuo ng isang rack module, na binubuo ng 8 na compute trays, bawat isa ay may 8 na CPX GPU, kasama ang isang switch tray.
Ang modular na disenyo ay nangangahulugan na ang mga customer ay hindi kailangang bumili ng nakakapigil na malaking Rubin rack; maaari nilang flexibly dagdagan ang CPX computing power batay sa aktwal na pangangailangan ng pre-loaded load.
Layered interconnection design, nagbabawas sa gastos ng pre-fill deployment
Sa pamamagitan ng interconnect architecture, ginagamit ni Rubin CPX ang layered design upang makamit ang balanse sa pagitan ng performance at gastos.
Sa loob ng isang solong compute tray, ang 8 na CPX GPU ay sincale-up gamit ang NVLink. Ang NVLink bandwidth ng bawat CPX GPU ay 1 hanggang 1.5 TB/s, na mas mababa kaysa sa 3.6 TB/s ng karaniwang Rubin GPU.
Sa scale-out level sa pagitan ng mga tray at sa loob ng mga rack module, gumagamit ang CPX ng Spectrum-6 Ethernet full-copper L1 links; habang sa pagkonekta sa pagitan ng mga rack module, ginagamit ang mga Spectrum-6 switch sa bawat module para sa pag-uugnay sa pamamagitan ng OSFP fiber links.
Kumpara sa mga solusyon na nakasalalay lamang sa high-bandwidth GPU interconnect, mas nagbibigay-diin ang layered architecture sa cost optimization para sa pre-fill scenarios.
Kasama ang Rubin GPU, nakatutok sa mahabang kontekstwal na pag-iisip
Hindi ang Rubin CPX isang independiyenteng general-purpose GPU, kundi ito ay ginagamit bilang pre-fill accelerator kasama ang Vera Rubin NVL72.
Ayon kay Ming-Chi Kuo, inirerekomenda ng NVIDIA ang pag-deploy ng CPX at Rubin GPU sa proporsyon na 1:1: ang CPX ay nagtatrabaho sa pag-compute ng pre-fill phase at pagbuo ng KV Cache, at pagkatapos ay ipinapadala ang KV Cache sa Rubin GPU sa pamamagitan ng Ethernet RDMA, na kung saan ang huli ay nagtatapos sa susunod na decoding.
Mula sa pagkakakilanlan ng produkto, ang pangunahing layunin ng Rubin CPX ay hindi ang pagpalit sa standard na Rubin GPU, kundi ang paghahati-hati ng proseso ng AI inference upang magkakahiwalay ang mga GPU sa paggawa ng pre-filling at decoding.
Ipinapakita ni Guo Mingqi ito bilang “pinakamahusay na solusyon sa halaga para sa long-context prefilling.” Habang lumalawig ang context window ng AI models, tumataas ang compute load at sukat ng KV Cache sa prefilling phase; ang pagpapalit muli ng CPX project ni NVIDIA ay maaaring isang pagtatangka na bawasan ang gastos sa long-context inference sa pamamagitan ng espesyalisadong hardware at heterogenous deployment.
