ایک چیز کو ایک ساتھ چھوٹا اور بہتر بنانا بنیادی فزکس کے قانون کی خلاف ورزی لگتا ہے۔ لیکن ایڈنبرگ یونیورسٹی کے محققین، جو NVIDIA کے ساتھ کام کر رہے ہیں، نے بڑے زبانی ماڈلز کے ساتھ اسے کامیابی سے حاصل کر لیا ہے۔ ان کی تکنیک، جسے ڈائنامک میموری اسپارسیفکیشن (DMS) کہا جاتا ہے، AI کی ایک اہم بنیادی ڈھانچہ کو 8 گنا تک دبائے بغیر ماڈلز کو مشکل بینچ مارکس پر زیادہ اسکور دینے میں کامیاب ہو گئی ہے۔
اگر AI ماڈلز صرف ایک حصہ کی یادداشت کے ساتھ بھی اتنے ہی اچھے یا بہتر طریقے سے چل سکتے ہیں، تو اس سے ایسے ڈیوائسز پر سنگین استدلال کی صلاحیتیں ڈیپلوی کرنے کا دروازہ کھل جاتا ہے جو ابھی انہیں سنبھال نہیں پاتے، جیسے پہننے والے ڈیوائسز، اسمارٹ ہوم ہارڈویئر، اور ایج ڈیوائسز۔
DMS کیسے کام کرتا ہے
بریک ٹھرو کو سمجھنے کے لیے، آپ کو کی-ولیو (KV) کیش کے بارے میں جاننا ہوگا۔ جب ایک AI ماڈل کسی مسئلے کے ذریعے استدلال کرتا ہے، تو وہ درمیانی نتائج کو اس کیش میں محفوظ کرتا ہے، جو ایک عملی یادداشت کے طور پر کام کرتی ہے اور ماڈل کو اپنے خود کے سوچنے کے عمل کو ٹریک رکھنے کی اجازت دیتی ہے۔ جتنا لمبا اور پیچیدہ استدلال سلسلہ ہوگا، اتنا ہی بڑا وہ کیش بڑھے گا، اور اتنا ہی زیادہ کمپوٹیشنل وسائل کی ضرورت ہوگی۔
DMS اس عمل پر ایک سکیلر کا استعمال کرتا ہے۔ اس کا مقصد ہر ٹوکن کو کیش میں رکھنا نہیں، بلکہ صرف وہی ٹوکنز محفوظ رکھنا جو سب سے زیادہ اہم ہیں، اور باقی کو ختم کرنا۔ نتیجہ یہ ہے کہ KV کیش اپنے اصل سائز کا ایک آٹھواں حصہ ہو جاتا ہے۔ شور کو ختم کرنے سے ماڈلز ایک جیسے کمپیوٹیشنل بجٹ کے اندر زیادہ گہرے اور پیچیدہ ترین استدلالی راستوں کا جائزہ لے سکتے ہیں۔
بینچ مارک کے نتائج
AIME 24، ایک ریاضی اولمپیڈ کوالیفائینگ امتحان پر، DMS کا استعمال کرتے ہوئے کمپریسڈ ماڈلز نے اپنے غیر کمپریسڈ مقابلہ جوں کے مقابلہ سے اوسطاً 12 نمبر زیادہ حاصل کیے۔
GPQA ڈائمنڈ پر، جو فزکس، کیمیا اور زندگیات کے گریجویٹ لیول کے سائنس مسائل سے بنایا گیا ایک بینچ مارک ہے، DMS کمپریسڈ ماڈلز نے اوسطاً 8 پوائنٹس سے زیادہ اسکور حاصل کیا۔
لائیوکوڈ بینچ پر، جہاں عملی پروگرامنگ کی صلاحیت کا امتحان لیا جاتا ہے، کمپریسڈ ماڈلز نے ایک جیسی مقدار میں KV کیش ڈیٹا پڑھتے ہوئے اپنے مکمل کیش والے ماڈلز کے مقابلے میں 10 نمبر حاصل کیے۔
لیڈ ریسرچر ڈاکٹر ایڈوارڈو پونٹی نے دونوں فوائد کو آسانی سے خلاصہ کیا۔
ماڈلز تیزی سے استدلال کر سکتے ہیں لیکن ایک جیسی معیار کے ساتھ۔
ایک مخصوص وقت کے دوران، DMS استعمال کرنے والا LLM زیادہ تر استدلالی شاخوں کا جائزہ لے سکتا ہے اور زیادہ مضبوط نتائج تک پہنچ سکتا ہے۔
ایک لمبا رجحان، تیز ہوتا جا رہا ہے
AI کے شعبے میں مڈ 2010 کی دہائی سے ماڈل کی کارکردگی کی تلاش جاری رہی ہے، جب جانکاری کی تقلید، پرانا کرنا اور کوانتائزیشن جیسے طریقے یہ ثابت کرنے لگے کہ چھوٹے ماڈلز خاص کاموں پر بڑے ماڈلز کے ساتھ مقابلہ کر سکتے ہیں۔ DMS اس سلسلے میں اس بات پر زور دیتا ہے کہ انفرنس ٹائم میموری، وہ وسائل جو ماڈل کے تربیت دینے کے بجائے اس کے حقیقی استعمال کے دوران استعمال ہوتے ہیں۔ انفرنس میموری کو 8 گنا کم کرنا ہر ڈپلومنٹ کو چلانا بہت زیادہ سستا بناتا ہے۔
یہ تحقیق NeurIPS کانفرنس میں پیش کی گئی اور “Inference-Time Hyper-Scaling with KV Cache Compression” عنوان سے ایک مقالہ میں تفصیل سے بیان کی گئی۔ جائزہ Llama اور Qwen ماڈلز کے استعمال سے کیا گیا۔
