Ipinaglaban ng NVIDIA ang AI Inference Guide, 6x na lossless speedup na pinamunuan ng mga Chinese team

icon MarsBit
I-share
AI summary iconSummary
Ipinakilala ni NVIDIA ang isang AI inference guide noong Setyembre 2, na nagpapakita ng anim na paraan ng pagpapabilis. Pinangunahan ng mga Tsino ang mga pangunahing inobasyon tulad ng speculative decoding at DFlash, na nag-aalok ng 6x lossless speedup. Patuloy na mataas ang fear and greed index habang tumatanggap ng suporta ang mga altcoin na dapat subaybayan. Ang mga limitasyon sa hardware tulad ng GPU tile sizes ay nagpapabuo sa disenyo ng modelo. Ang MTP method ng DeepSeek-V3 at iba pang teknik ay binanggit para sa kahusayan. Detalyado ng gabay ang mga gastos at mga use case para sa bawat paraan.

Kamakalawa, ang NVIDIA ay naglabas ng opisyal na gabay sa pag-iisip ng malalaking modelo, at habang binabasa mo ito, parang isang koleksyon ng mga papel ng isang team ng mga Tsino.

Ganito ang sitwasyon.

Setyembre 2, isinampa ng tech blog ng NVIDIA ang isang mahabang artikulo na may pamagat na “Decoding Co-Design of AI Models with Speculation”.

Ang puso ng artikulo ay isang talahanayan ng pagpili na isinasaayos ang mga pinakamalawakang ginagamit na 6 uri ng pagpapabilis ng pagpapahalaga, at inilalantad nang malinaw ang gastos sa pagtatrain at mga angkop na escenario.

DeepSeek

Ang kahalagahan nito ay ang pagiging lubos na kakaunti ng chip na tagapag-ugnay na naglalabas ng opisyal na pahayag na isinusulat ang "paano dapat disenyo ang modelo upang sumunod sa mga pisikal na limitasyon ng hardware" bilang isang pamantayan.

At habang tinataya nila ang paligid upang hanapin ang pinakamabisang solusyon na makakalikha ng sayaw sa mga hangganan ng silicon, ang mga pangunahing solusyon sa gabay ay halos lahat ay pinamumunuan ng mga team mula sa mga Tsino.

Ito ay nagsasampa na sa isang karaniwang pagsusuri ng algorithm. Ano ang mga lihim na inilalabas ng tsart na ito? Tingnan natin ang bawat linya.

Halos pure profit na transaksyon: Ano ang ginagawa ng Speculation Decode?

Upang maunawaan ang talahanayan na ito, kailangan mong maunawaan muna kung ano ang "speculative decoding".

Ang malaking modelo ay naglalabas ng mga salita, isang isa. Bawat salitang ilalabas, ang mga parametrong几百GB ay kailangang pumasa nang buo sa GPU memory. Sa katotohanan, sa karamihan ng oras, ang computing power ay naghihintay lamang habang ang memory ay nagdadala ng data.

Ang solusyon sa “Decoding Speculation” ay napakasimple at direktang-pasok—

Una, gamitin ang isang maliit na lightweight na modelo para sa pangunahing paghula, at hulaan agad ang 7 na titik; pagkatapos, i-verify ng malaking modelo ang 7 na titik nang isang beses.

Ang pag-verify ng 7 na titik at ang pagsulat ng 1 na titik ay magkakatulad sa oras, dahil ang weights ay kailangang i-move pareho.

Sakop ng tamang sagot, kung mali, magsimula muli mula sa breakpoint. Dahil ang malalaking modelo ay nagtatanggap lamang ng mga titik na karaniwang isusulat nito, ang final output ay hindi kailangang baguhin ang anumang bantas. Ito ang tinatawag na “lossless acceleration”.

DeepSeek

Sa larong ito, ang lahat ng pagmamalupit sa computing power ay nakabatay sa isang pangunahing pormula ng mathematical expectation:

Speedup = 𝔼[L] × TtargetTdraft + Tverify

Ang numerator ay ang inaasahang halaga 𝔼[L], na kumakatawan sa inaasahang haba ng pagtanggap (ang average na bilang ng mga titik na natutukoy ng malaking modelo bawat round).

Ang denominator ay ang karagdagang gastos na iyong ginawa, ang oras na ginugol ng maliit na modelo para gumawa ng pagtataya (Tdraft) plus ang oras ng pag-verify ng malaking modelo (Tverify).

Upang mapabilis ang speedup, may dalawang paraan lamang: o iataas ang numerator (mas tama ang paghula), o i-press ang denominator nang maksimo (mas mabilis ang paghula).

Sumasakay sa balikat ng mga kasama sa industriya, nagtataguyod ng ikaapat na evolusyon

Sa pagbabalik-tanaw sa tabla ng NVIDIA mula sa itaas pababa, makikita mo ang malinaw na pangunahing pakikidigma.

Ang unang linya ay ang pinakamatandang "external draft model," kailangan ng hiwalay na maliit na modelo bilang tulong.

Direktang ipinakita ng NVIDIA ang sobrang mataas na bill: Ang pag-train mula sa simula ay kailangang mag消耗 1T hanggang 10T na token, at ang gastos ay sobrang mataas.

Ngunit nananatili pa ito sa listahan dahil binigyan ito ng espesyal na kapalaran ni NVIDIA—ang Groq chip (LPU) na kinuha nila sa halagang $20 bilyon.

Ang huling linya ay ang n-gram lookup method na walang pagtuturo, na nagtatrabaho sa pamamagitan ng direkta na paghahanap at pagkopya ng mga paulit-ulit na fragment mula sa nakaraang teksto, at angkop lamang sa mga mahigpit na sitwasyon na nangangailangan ng malaking pagkopya at pagtempo.

Ang mga sumusunod na apat na linya ang tunay na nagpapakita ng pag-unlad ng teknolohiya.

DeepSeek

Pangalawang linya: EAGLE-3.

Mula sa team ni Yuhui Li mula sa Peking University, Hongyang Zhang mula sa University of Waterloo, at iba pa.

Mula sa ICML at EMNLP papunta sa NeurIPS, tatlong taon ng paglalabas ng tatlong henerasyon, pinagdala ang tradisyonal na paraan ng “paghula nang isang salita sa isang beses” hanggang sa pisikal na limitasyon.

Naging absolute na dominante ito sa larangan, ngunit sa bagong listahan ng NVIDIA, pinagpapalit ito sa "reference position" para lang sa isang maikling dahilan: ang accepted length ay napatalsik na ng susunod na henerasyon.

Ikatlong linya: MTP (Multi-Token Prediction).

Ang ideya ay unang ipinakilala ni Meta noong 2024, ngunit ang tunay na nagpapalakas nito bilang standard sa pag-iisip ng malalaking modelo ay DeepSeek -V3.

Nakakatanggap ng mataas na pagpapahalaga ang NVIDIA—ang pinakamahusay na pagpipilian sa GPU para sa malalaking modelo. Ang pangunahing punto ay na ang solusyong ito ay kailangang itinuturo kasama ang pangunahing modelo mula sa pagpaprepara.

Ikaapat na linya: DFlash. Ang makapagpapabilis ng 6x nang walang pagkawala.

Ang mga may-akda ay Jian Chen, Yesheng Liang, at Zhijian Liu. Ito ay nagtatanggal ng ganap sa paraan ng serial na "isang titik sa isang titik" na ginagamit ng EAGLE at MTP, at kinasusunod ang diffusion models, kung saan isang forward pass lamang ang kailangan upang agad na lumikha ng sequence ng 7 na Token, na pinapaliit ang denominator (oras) sa pinakamababang antas.

By the way, the advisor, Zhijian Liu, is an assistant professor at UCSD, but he is also a research scientist at NVIDIA Research.

Panglimang linya: DSpark. Ginawa ng 24-kataong tim na binuo ng DeepSeek at Pambansang Unibersidad ng Peking.

Kahit mabilis ang paralel na arkitektura ng DFlash, mayroon itong isang patayong punto: mas mali ang paghula habang lumalayo. Upang pataasin ang numerator (haba ng pagtanggap), naglagay ang DSpark ng isang napakamaliit na seriyal na module sa ibabaw ng paralel na base.

Ang mga resulta ng pagsusulit ay napakalinaw: mas mataas ang accepted length ng 30% kumpara sa EAGLE-3 at ng 18% kumpara sa DFlash. Sa DeepSeek Sa online production environment ng V4, mas mabilis ng 60% hanggang 85% kaysa sa MTP.

Hardware constants, reverse lock model architecture

Ang mga teknolohiyang ito sa apat na henerasyon ay nakakapagpapahintulot sa pagpapakita ng ganitong antas ng computing power, at hindi lamang dahil sa mga mapagkakatiwalaang disenyo sa algoritmo.

Marami ang naniniwala na mas kumikita ka kung mas marami ang iyong hula sa isang draft, ngunit ito ay buong pagkakalimot sa mga pisikal na patakaran ng silicon.

Kapag ang attention mechanism ang nagsisilbing pangunahing bahagi ng decoding time, ang kabuuang bilang ng mga token na kailangang penanawin sa yugto ng pag-verify ng malaking modelo ay 1+D (1 totoong input + D mga draft prediction).

Upang ipasa ang bahaging ito ng data sa GPU, ang hardware ay magpapangkat ng mga query head at KV head sa ilalim, at ang laki ng bawat bloke ng attention kernel ay dapat na mahigpit na sumunod sa mga hangganan ng pisikal na matrix ng GPU (Tile Size, karaniwan ay 128 sa kasalukuyang arkitektura).

Nakakuha na ng pormula para sa pagkakasunod-sunod sa ilalim: G × (1 + D) ≤ 128

Sa isang maliit na pagtataya, natuklasan ang panghuling patnubay na konstante sa gabay ni NVIDIA:

D = 128G − 1

Kung saan, G ay ang bilang ng mga grupo ng atensyon (ang ratio ng mga head ng Query at KV).

Ito ay nangangahulugan na kung paano mo inilagay ang pagkakabahagi ng atensyon sa orihinal na disenyo ng iyong modelo, diretso ito ang magdedetermine kung ilan ang mga titik na dapat ipaghula ng draft upang mabuo nang perpekto ang mga bloke ng GPU.

Kung ang G=8, maaari mong hulaan ang 15 na draft; kung ang G=32, maaari mong hulaan ang 3 lang. Hindi makakalampas ang hardware sa hangganan, kahit na gamitin mo ang kalahati lamang ng huling Tile, ang computing power ay babayaran pa rin bilang isang buong bloke.

Kahit noon, ang speculative decoding ay isang additional acceleration package na idinagdag ng engineering team pagkatapos matapos ang pag-train ng model. Ngayon, sinasabi sa iyo ng mga pundamental na pisikal na batas: ang isang konstanteng hardware matrix ay diretso na binalik sa mga parameter ng disenyo ng model.

Sa aming alaala, rare ang mga manufacturer ng chip na gawin ito—isulat ang mga equation ng pagkakabawas ng pana-panahong hardware sa disenyo ng malalaking modelo.

Wakas

Ang pagkakasunod-sunod ng kompetisyon sa efisiyensiya ng pagpapatakbo ng modelo ay nagbago nang buo.

Ang panahon ng pagpupuno ng malalaking parameter ay nasa dulo na; ngayon, ang talo at panalo ay nakasalalay kung sino ang mas maunawaan ang pisikal na limitasyon ng silikon na base.

Sa bagong larangan kung saan ang mga pangunahing kumpanya ng chip ay nagbabalik ng mga patakaran, ang mga team ng mga Tsino ay naging default na sagot sa pagbuwis.

Ang mga pangunahing tagapagbigay ng computing power tulad ng NVIDIA ay naturally hindi magmumura kung anong algorithm ang nakalagay sa shelf.

Ngunit sino ang gumawa ng pinakamahusay na solusyon na ito na nagpapahintulot sa mga wafer ng silikon na makamit ang kanilang pinakamataas na potensyal, malinaw na nakasulat sa papel at tinta.

Nakuha mula sa WeChat public account na “Xin Zhi Yuan”, may-akda: ASI Revelation

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.