Nagkakaroon ng pagkakaiba ang OpenAI, NVIDIA, at Google sa disenyo ng AI chip para sa LLM inference

iconMetaEra
I-share
AI summary iconSummary
AI + crypto news show na nagkakaroon ng pagkakaiba ang mga pangunahing player sa disenyo ng chip para sa LLM inference. Tinutukoy ng OpenAI ang Jalapeño para sa inference, binubuo ng NVIDIA ang mga GPU kasama ang LPU ng Groq, at hihiwalay ng Google ang TPU 8t at 8i para sa training at inference. Kailangan ng inference ng mas mataas na HBM bandwidth, mas malaking SRAM, at mas malapit na network paths. Habang lumalaki ang pagkakaiba-iba ng workload ng mga chip, tumataas ang kahalagahan ng token cost kasama ang FLOPS. Isang pagpapabuti sa network na nagbabago sa estratehiya ng disenyo ang nagpapabago sa kompetisyon sa hardware ng AI.
Nagkakaroon ng malalim na pagbabago sa kompetisyon sa mga chip ng AI. Ipinakilala ng OpenAI ang chip na Jalapeño na nakatuon sa LLM inference, habang pinagsasama ng NVIDIA ang GPU at Groq LPU para sa heterogenous computing, at hinati ng Google ang pag-train at pag-inference sa dalawang chip na TPU 8t at TPU 8i. Ang tatlong direksyong ito ay nagpapakita ng iba’t ibang pangangailangan sa hardware resources ng pag-train at pag-inference: ang pag-train ay nakatuon sa matrix computation at malawakang koneksyon, samantalang ang pag-inference ay nangangailangan ng mas mataas na HBM bandwidth, mas malaking SRAM, at mas maikling network path. Habang lumalalim ang pagkakaiba sa chip configuration para sa dalawang uri ng workload, hindi na lamang ang FLOPS ang pangunahing pamantayan—naging bagong talaan sa kompetisyon sa AI hardware ang token cost.

May-akda ng artikulo, pinagkukunan: Leifeng.com

Ang gastos sa token ay naging bagong tuntunin sa kompetisyon ng hardware para sa malalaking modelo

Embodied AI, sumisiklab sa mainit at may usok na kusina

Mga kuwento ng robot sa ilalim ng isang milyong traffic

Ang dating pangalawang pangulo ng Covariant AI, Zhoupu Shuzhong, ay direktang isinaklaw ang papel ng LPU bilang pagpuno sa kakulangan ni Vera Rubin sa rehiyon ng low-latency decode.

Ang Jalapeño ay sumabog sa paghahati, nagkakaroon na ba ng pagkakasplit sa ruta ng GPU inference?

Ang disenyo ng chip ng Groq ay malapit na nakabatay sa bagay na ito. Isang LPX rack ay may 256 LPU, na may kabuuang 128 GB SRAM, na ang kapasidad ay hindi maaaring ikumpara sa HBM sa mga GPU rack, ngunit ang pinagsamang bandwidth ng SRAM ay maaaring makamit ang 40 PB/s.

Ang pagdidisenyo na ito ay nagtataglay ng "malapit". Ang HBM ay maaaring maglalaman ng maraming estado ng modelo, ngunit mas malayo sa mga unit ng pagkalkula; ang SRAM ay mahal at mahirap palakasin ang kapasidad, ngunit ang data ay nasa loob ng chip mismo, na nagbibigay ng napakataas na bandwidth at napakababang latency sa pag-access.

Ang Jalapeño ay sumabog sa paghahati, nagkakaroon na ba ng pagkakasplit sa ruta ng GPU inference?

Limitado ang bawat kalkulasyon na ginagawa, at madalas na kinukuha ang data; ang pagpapalapit ng data sa ALU ay magdudulot ng direkta at malaking epekto sa pag-antay sa susunod na Token.

Pinababa pa ni Groq ang dinamikong kontrol sa hardware. Ang LPU ay isang arkitektura ng deterministikong pagpapatupad, kung saan ang pagjadwal ng mga utos ay karamihan ay natatapos na sa software. Parehong nagiging processor at router bawat chip, at ang compiler ay nagjadwal ng mga yunit ng computation at network nang sabay-sabay, kaya naiwasan ang mga mekanismo tulad ng tradisyonal na hardware flow control at virtual channels.

Ang Jalapeño ay sumabog sa paghahati, nagkakaroon na ba ng pagkakasplit sa ruta ng GPU inference?

Ang gastos ay malinaw: ang arkitekturang ito ay hindi ganap na maaaring gamitin tulad ng GPU, at ang on-chip SRAM ay hindi sapat para i-store ang buong estado ng malaking modelo. Kaya hindi pinahintulutan ng NVIDIA ang Groq 3 na magpapatakbo nang mag-isa ng buong modelo, kundi isinagawa nito ang isang mas kumplikadong heterogenous na sistema.

Ang Jalapeño ay sumabog sa paghahati, nagkakaroon na ba ng pagkakasplit sa ruta ng GPU inference?

Pre-filled sa GPU, karamihan sa Decode ay isinasaayos sa LPU; ang Attention sa Decode ay maaaring bumalik sa GPU. Nagmamaintain ang GPU at LPU ng kanilang sariling KV Cache, at ang pangunahing pagbabago ay ang draft Tokens, habang ginagamit ang micro-batch upang i-overlap ang computation at communication. Dahil ang LPU ay isang synchronous domain, samantalang ang GPU at external KV Cache ay bahagi ng asynchronous system, kinuha ng NVIDIA ang FPGA bilang asynchronous bridge sa pagitan ng dalawa.

Ang istrukturang ito ay nagpapakita nang malinaw kung saan naabot na ang pagkakahati-hati ng mga chip para sa AI. Hindi na lang ito naghihiwalay sa “mga chip para sa pagtuturo” at “mga chip para sa pagpapaliwanag,” kundi kahit ang iba’t ibang bahagi ng isang Decode ay maaaring isagawa sa iba’t ibang arkitektura.

Gayon naman, ang mga datos na ipinakita ng NVIDIA ay nagbibigay ng hangganan sa ruta na ito: kapag ang negosyo ay naglalayon lamang sa pangkabuuang throughput at handa tumanggap ng mas mataas na latency, ang Rubin GPU ay patuloy na epektibo; habang tumataas ang pangangailangan sa bilis ng Token bawat user, unti-unting lumalabas ang kahusayan ng LPX, at pagkatapos gamitin ang mas maraming LPU, bababa rin ang pangkabuuang throughput efficiency.

Ang Jalapeño ay sumabog sa paghahati, nagkakaroon na ba ng pagkakasplit sa ruta ng GPU inference?

Kaya ang paglitaw ng Groq 3 ay hindi nangangahulugan na tinanggal na ng inference ang GPU. Ito ay nagpapakita ng isang ibang bagay: mahirap magkaroon ng iisang GPU na magpapatakbo nang epektibo sa parehong mataas na throughput at napakababang latency; mas madali para sa sistema na i-optimze ang performance curve kung ang dalawang uri ng hardware ay gagamitin sa kanilang sariling mas mahusay na saklaw.

Ang Google ay isinabuhay ang cut sa mas mataas na antas.

Ang Jalapeño ay sumabog sa paghahati, nagkakaroon na ba ng pagkakasplit sa ruta ng GPU inference?

Training at at inference, gamit ang dalawang set ng chip recipe

Google sa henerasyon ng TPU 8 ay gumawa ng TPU 8t at TPU 8i,t para sa pag-train,i para sa pag-infer. Ang lohika sa likod ng pagkakahati na ito ay direktang isinulat sa konfigurasyon ng memorya ng chip.

Hot Chips ay nasa live demonstration, ang TPU 8t ay gumagamit ng 6 mga grupo ng HBM, samantalang ang TPU 8i ay gumagamit ng 8 mga grupo. Ang paliwanag ng Google ay ang pag-iisip ay nangangailangan ng higit pang HBM bawat yunit ng computation, kasama na rin ang mas mataas na proporsyon ng SRAM, kaya ang 8i ay nagbigay ng higit pang mga yaman sa SRAM, kapasidad ng memorya, at bandwidth.

Ang Jalapeño ay sumabog sa paghahati, nagkakaroon na ba ng pagkakasplit sa ruta ng GPU inference?

Ang pagkakaiba ay medyo mahalagang pag-isipan. Kung ang AI chip ay nagpapalaban lamang sa pagkalkula ng matrix, walang dahilan kung bakit ang inference version ay mag-aalok ng maraming chip area at packaging resources sa memorya. Ang pagdidisenyo ng TPU 8i ay nagpapakita na ang bottleneck na nakikita ng Google ay nasa pagbibigay ng data na.

Sa pag-train, ang malaking Batch ay nakakapag-ambag ng gastos sa pagbasa ng weights sa maraming Token; sa decode, ang bawat generadong Token ay maliit, ngunit ang weights at KV Cache ay patuloy na ina-access. Kaya, ang dami ng HBM bandwidth na kailangan bawat unit ng FLOPS ay iba-iba sa dalawang uri ng gawain.

Google ay nagawa ang pagkakaiba na ito sa network topology. Ang 3D Torus na karaniwang ginagamit sa TPU ay mas angkop para sa pag-train, na nagbibigay-diin sa kabuuang throughput sa malalaking cluster. Ang TPU 8i ay sumusuporta sa BoardFly, na mas maikli ang network path: ang limitasyon ng path sa BoardFly ay 7 hops, habang ang 3D Torus ay nakakarating sa 16 hops.

Ang Jalapeño ay sumabog sa paghahati, nagkakaroon na ba ng pagkakasplit sa ruta ng GPU inference?

Para sa pagtatrain, pagkatapos ng ilang karagdagang network hops, karaniwang may malaking matrix computation na natitira, kaya ang communication time ay maaaring i-amortize. Ang compute window sa bawat hakbang ng decode ay maikli, kaya mas madaling mababawasan ang network latency sa pagitan ng mga token.

Pinapalakas ng MoE ang problema na ito. Ang MoE ay nagpapahintulot sa isang Token na aktibuhin ang isang bahagi lamang ng Expert, na maaaring maging mas murang kalkulasyon, ngunit ang Router ay magpapadala ng Token sa iba’t ibang Expert. Kapag ang mga Expert na ito ay nasa iba’t ibang chip, habang bumababa ang pagkalkula, tumataas ang All-to-All communication.

Ang Jalapeño ay sumabog sa paghahati, nagkakaroon na ba ng pagkakasplit sa ruta ng GPU inference?

Kaya idinagdag ng TPU 8i ang Collective Acceleration Engine, na nagpapaproseso ng ilang collective operations sa I/O Die na malapit sa network interface. Hindi na kailangang ilipat ang data sa Compute Die bago maisagawa ang operasyon sa HBM, kaya masasave ang ilang internal data movement sa chip.

Ang pagkakaalok ng mga yaman para sa TPU 8t training version ay malinaw na nakatuon sa kabilang panig. Ang pagtatraining ay nangangailangan ng malaking FLOPS at malaking Scale-Up domain upang i-synchronize ang mga parameter at gradient. Ang Superpod ng TPU 8t ay maaaring i-scale hanggang 9600 mga chip, na may halos 2 PB na shared HBM at 121 EFLOPS FP4 na aggregated computing capacity, at ipinakilala ng Google ang Virgo network upang gawing espesyalisadong sistema ang pagkonekta ng mas malawak na pagtatraining.

Ang Jalapeño ay sumabog sa paghahati, nagkakaroon na ba ng pagkakasplit sa ruta ng GPU inference?

Binanggit din ng Google ang isang praktikal na problema sa disenyo ng chip: dark silicon.

Limitado ang sukat ng chip at ang budget para sa pagkakagastos ng enerhiya. Kung isasama sa isang chip ang malaking bilang ng mga yunit para sa matrix computation na kailangan sa pag-train, kasama na ang mas maraming SRAM, HBM, at low-latency network na kailangan sa inference, magiging walang ginagawa ang ilang bahagi ng circuit habang nagpapatakbo ang isang uri ng workload.

Ang Jalapeño ay sumabog sa paghahati, nagkakaroon na ba ng pagkakasplit sa ruta ng GPU inference?

Kasi ang dalawang gawain ay nangangailangan ng iba't ibang proporsyon ng mga yaman, mas maayos na gawin ang dalawang chip.

Mula sa FLOPS hanggang Token Economics

Isama ang tatlong ruta, at malinaw ang mga pagkakaiba.

Ginagawa ng OpenAI ang Jalapeño, na nagdededicate ang mga chip sa antas ng LLM inference, ngunit nananatiling fleksible ang scheduling ng prefills at decode sa parehong homogenous hardware; patuloy ni NVIDIA ang paghihiwalay pababa, na nagbibigay ng iba’t ibang bahagi ng isang inference sa GPU at Groq LPU; habang hinahati ni Google pataas, na direktang ginagawa ang training at inference bilang dalawang TPU.

Hindi may nakatagong bagong prinsipyo ng pagkalkula sa likod ng mga ruta na ito; ang pagbabago ay ang proporsyon ng mga mapagkukunan. Ang pag-train ay naghahanap na ilagay ang mas maraming transistor sa matrix computation at malawakang pag-uugnay, dahil ang malaking Batch ay nakakapagpapalawig ng gastos sa paghahatid ng data; ang low-latency inference naman ay nangangailangan ng mas mataas na HBM bandwidth, mas malaking SRAM, mas mahusay na lokalidad ng KV Cache, at mas maikling mga network path, dahil maraming oras ay ginugugol sa paghihintay sa data.

Kasagutan: Kapag lumalayo ang mga “recipe ng chip” na kailangan ng dalawang uri ng load, ang paggamit ng isang pangkalahatang chip upang suportahan ang pareho ay magdudulot ng lalong malaking pagkawala ng efficiency.

Ito ang dahilan kung bakit ang mga pangunahing numero sa round na ito ng hardware competition ay nagbabago. Ang FLOPS ay patuloy na mahalaga, ngunit nagkakaroon na ng Tokens/s/user, TBT, TTFT, Tokens/kW, HBM bandwidth, at network latency.

Ito ay naglalarawan sa parehong bagay: ang hashing power ay nasa loob na, at ang tanong ay kung kayang ng sistema na patuloy na magbigay ng data at ilabas ang mga natatapos na Token nang maaga.

Hindi pa nagkakasundo ang OpenAI, NVIDIA, at Google kung saan dapat ilagay ang hangganan, at maaaring magbago pa ang tunay na posisyon ng hangganan sa hinaharap.

Ang pagtuturo at pagpapatakbo ay maaaring hiwalayin, ang Prefill at Decode ay maaaring hiwalayin, at ang Attention sa loob ng Decode at iba pang mga kalkulasyon ay maaari ring hatiin pa. Mas malaki ang paghihiwalay, mas madaling pataasin ang efficiency ng bawat sangkap, ngunit mas kumplikado ang pagpaplano ng mga yunit, ang paghahatid ng KV Cache, at ang komunikasyon sa pagitan ng mga hardware.

Kaya ang hamon sa susunod na yugto ng kompetisyon sa AI chip ay maaaring hindi na lamang ang paggawa ng isang mas malakas na chip.

Mas mahirap ay magdesisyon: aling mga gawain ang dapat gawin sa isang espesyalisadong chip, at aling mga gawain ay dapat manatili sa parehong hardware upang mabawasan ang kabuuang token cost ng sistema.

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.