ChainThink संदेश, 8 अगस्त, 10, निवेडिया द्वारा हाल की पेपर में क्रॉस-मॉडल KV Cache पुनः उपयोग की विधि प्रस्तावित की गई है, जो आमतौर पर कैश केवल एक ही मॉडल के भीतर पुनः उपयोग किए जाने की समस्या को हल करने का प्रयास करती है।
KV कैश मॉडल द्वारा संदर्भ पढ़ने के बाद का मध्यवर्ती गणना परिणाम है, लंबा संदर्भ स्मृति और बैंडविड्थ को उल्लेखनीय रूप से घेरता है।
पहले, DeepSeek-V2 ने MLA के माध्यम से DeepSeek 67B की तुलना में KV Cache को 93.3% तक कम किया, जबकि Kimi Linear ने पूर्ण MLA की तुलना में अधिकतम 75% तक कम किया।
अध्ययन के अनुसार, एक ही परिवार और KV संरचना मेल वाले विभिन्न आकारों के मॉडल के बीच कैश में स्पष्ट रैखिक संबंध होता है।
टीम ने 500 खंडों, प्रत्येक 1024 टोकन के पाठ के साथ कैलिब्रेशन किया, जिससे एक मॉडल द्वारा गणना किए गए KV Cache को दूसरे मॉडल में जारी रखने के लिए मैप किया जा सकता है।
Qwen3-14B से 32B पर स्विच करने के दौरान, 32K संदर्भ के पुनः गणना में लगभग 7 सेकंड लगते हैं, और कैश का स्विच करने में लगभग 0.28 सेकंड लगते हैं, जिससे गति लगभग 25 गुना बढ़ जाती है।
यदि यह विधि परिपक्व हो जाती है, तो मॉडल रूटिंग में लंबे संदर्भ के prefill को छोटे मॉडल अधिक से अधिक पूरा कर सकते हैं, और बड़े मॉडल केवल आवश्यकता पड़ने पर सीधे जारी उत्पादन कर सकते हैं।
