Ang paggawa ng isang bagay na mas maliit at mas mabuti nang sabay ay tila paglabag sa mga pangunahing batas ng pisika. Ngunit ang mga siyentipiko sa University of Edinburgh, na nagtrabaho kasama ang NVIDIA, ay nakamit ito sa mga malalaking language model. Ang kanilang teknik, na tinatawag na Dynamic Memory Sparsification (DMS), ay nag-compress ng isang kritikal na bahagi ng AI infrastructure ng 8x habang para kong nagpapataas ng marka ng mga model sa mahihirap na benchmark.
Kung maaaring mag-run ang mga AI model nang magkasing-bisa o mas mabuti na may isang maliit na bahagi ng memorya, buksan ang daan para sa pag-deploy ng mga seriyosong kakayahan sa pag-iisip sa mga device na kasalukuyang hindi kayang handle ang mga ito, kabilang ang wearable, smart home hardware, at edge devices.
Paano talaga gumagana ang DMS
Upang maunawaan ang pagbubukas, kailangan mong malaman tungkol sa key-value (KV) cache. Kapag nag-iisip ang isang AI model sa isang problema, ito ay nag-iimbak ng intermediate results sa cache na ito, isang uri ng working memory na nagpapahintulot sa model na sundan ang sariling proseso ng pag-iisip. Mas mahaba at mas kumplikado ang reasoning chain, mas lalaki ang cache, at mas maraming computational resources ang kailangan.
Ginagamit ng DMS ang isang scalpel sa prosesong ito. Sa halip na panatilihin ang bawat token sa cache, ito ay piliing pinapanatili ang mga token na pinakamahalaga at tinatanggal ang iba. Ang resulta ay isang KV cache na napapaliit sa isang-walong bahagi ng orihinal na laki. Sa paglinis ng ingay, ang mga modelo ay makakapag-explor ng mas malalim at mas kumplikadong mga landas ng pag-iisip sa loob ng parehong computational budget.
Ang mga resulta ng benchmark
Sa AIME 24, isang pagsusulit para sa kwalipikasyon ng math olympiad, ang mga compressed na modelo na gumagamit ng DMS ay nakakuha ng average na 12 puntos mas mataas kaysa sa kanilang uncompressed na mga katumbas.
Sa GPQA Diamond, isang benchmark na binuo mula sa mga problema sa antas ng gradwado sa pisika, kimika, at biyolohiya, ang mga modelong DMS-compressed ay nakapag-post ng mga marka na 8 puntos pa higit sa average.
Sa LiveCode Bench, na nagtatala ng praktikal na kakayahan sa pagprograma, nakakuha ang mga compressed na model ng 10 puntos kumpara sa kanilang mga full-cache na katumbas habang binabasa ang parehong amount ng KV cache data.
Ang pangunahang siyentipiko, Dr. Edoardo Ponti, ay nag-summarize ng dobleng benepisyo nang simple.
Mas mabilis ang pag-iisip ng mga modelo ngunit may parehong kalidad.
Sa loob ng isang fixed time window, ang isang LLM na gumagamit ng DMS ay maaaring masuri ang higit pang mga reasoning thread at makarating sa mas malakas na mga konklusyon.
Higit na mahabang trend, umuunlad
Ang larangan ng AI ay naglalayon sa pagpapahusay ng modelo mula sa gitna ng 2010s, nang magsimula ang mga teknik tulad ng knowledge distillation, pruning, at quantization na patunayan na ang mas maliit na mga modelo ay maaaring makipagkumpetensya sa mas malalaking modelo sa mga partikular na gawain. Ang idinadagdag ng DMS sa pagsusunod na ito ay ang pagtutok sa memorya sa panahon ng inference, ang mga mapagkukunan na ginagamit hindi nang ang modelo ay tinuturuan, kundi nang ito ay aktibong ginagamit. Ang pagpapaliit ng memorya sa inference ng 8x ay nangangahulugan na ang bawat deployment ay naging mas malaki ang pagkakamit ng gastos.
Ipinakita ang pananaliksik sa konperensya ng NeurIPS at detalyado sa isang papel na may pamagat na “Inference-Time Hyper-Scaling with KV Cache Compression.” Ang mga pagtataya ay ginawa gamit ang mga modelo na Llama at Qwen.
