Proposes ng NVIDIA ang Cross-Model KV Cache Reuse upang mapabuti ang efficiency

iconChainthink
I-share
AI summary iconSummary
Ipinakilala ng NVIDIA ang paggamit ng cross-model KV Cache para pataasin ang efficiency, na may potensyal na aplikasyon sa mga cross-chain environment. Ang paraan ay nagpapahintulot sa pag-transfer ng cache sa pagitan ng mga model na may magkakaparehong istruktura, kahit sa iba’t ibang laki. Pagkatapos ng pagsubok sa 500 text segments, nailapat ng team ang cache sa pagitan ng mga model na Qwen3-14B at 32B. Bumaba ang prefill time para sa 32K context mula sa 7 segundo hanggang 0.28 segundo. Maaaring makatanggap ng benepisyo ang mga cross-chain bridges mula sa pagpapabuti na ito.

Ang ChainThink ay nagpapahayag na noong Agosto 10, ang pinakabagong papel ng NVIDIA ay nagmungkahi ng isang paraan para gamitin muli ang KV Cache sa pagitan ng mga modelo, upang subukan lutasin ang problema na karaniwang maaaring gamitin muli ang cache lamang sa loob ng iisang modelo.

Ang KV Cache ay ang intermediate computation result ng model pagkatapos basahin ang konteksto, at ang mahabang konteksto ay makakasagabal nang malaki sa VRAM at bandwidth.

Nakabawas ang DeepSeek-V2 sa KV Cache ng 93.3% kumpara sa DeepSeek 67B gamit ang MLA, habang ang Kimi Linear ay maaaring bawasan ang KV Cache ng hanggang 75% kumpara sa buong MLA.

Ayon sa papel, may malinaw na linyar na ugnayan sa cache sa pagitan ng iba’t ibang sukat ng modelo na may parehong pamilya at pagkakatugma sa istruktura ng KV.

Pagkatapos ng pag-calibrate ng team gamit ang 500 na segment, bawat isa ay may 1024 na token, maaaring ma-fitting ang pagkakasunod-sunod upang ilipat ang KV Cache na kalkuladong ng isang modelo para gamitin ng ibang modelo.

Sa pagpapalit ng Qwen3-14B patungo sa 32B, ang pag-recalculate ng 32K context ay nangangailangan ng humigit-kumulang 7 segundo, habang ang pag-convert ng cache ay nangangailangan ng 0.28 segundo, na nagdudulot ng pagtaas ng bilis na humigit-kumulang 25 beses.

Kung matatag na ang paraan na ito, maaaring mas maraming maliit na modelo ang magawa ang mahabang konteksto na prefill sa model routing, habang ang malalaking modelo ay direktang magpapatuloy sa pagbuo kapag kinakailangan.

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.