Ang ChainThink ay nagpapahayag na noong Agosto 10, ang pinakabagong papel ng NVIDIA ay nagmungkahi ng isang paraan para gamitin muli ang KV Cache sa pagitan ng mga modelo, upang subukan lutasin ang problema na karaniwang maaaring gamitin muli ang cache lamang sa loob ng iisang modelo.
Ang KV Cache ay ang intermediate computation result ng model pagkatapos basahin ang konteksto, at ang mahabang konteksto ay makakasagabal nang malaki sa VRAM at bandwidth.
Nakabawas ang DeepSeek-V2 sa KV Cache ng 93.3% kumpara sa DeepSeek 67B gamit ang MLA, habang ang Kimi Linear ay maaaring bawasan ang KV Cache ng hanggang 75% kumpara sa buong MLA.
Ayon sa papel, may malinaw na linyar na ugnayan sa cache sa pagitan ng iba’t ibang sukat ng modelo na may parehong pamilya at pagkakatugma sa istruktura ng KV.
Pagkatapos ng pag-calibrate ng team gamit ang 500 na segment, bawat isa ay may 1024 na token, maaaring ma-fitting ang pagkakasunod-sunod upang ilipat ang KV Cache na kalkuladong ng isang modelo para gamitin ng ibang modelo.
Sa pagpapalit ng Qwen3-14B patungo sa 32B, ang pag-recalculate ng 32K context ay nangangailangan ng humigit-kumulang 7 segundo, habang ang pag-convert ng cache ay nangangailangan ng 0.28 segundo, na nagdudulot ng pagtaas ng bilis na humigit-kumulang 25 beses.
Kung matatag na ang paraan na ito, maaaring mas maraming maliit na modelo ang magawa ang mahabang konteksto na prefill sa model routing, habang ang malalaking modelo ay direktang magpapatuloy sa pagbuo kapag kinakailangan.
