একই সময়ে কিছুকে ছোট এবং ভালো করে তোলা মৌলিক পদার্থবিদ্যার বিরুদ্ধে মনে হতে পারে। কিন্তু এডিনবরা বিশ্ববিদ্যালয়ের গবেষকরা, NVIDIA-এর সাথে কাজ করে, বড় ভাষা মডেলগুলির সাথে এটি সফলভাবে করেছেন। তাদের পদ্ধতিটির নাম ডাইনামিক মেমোরি স্পারসিফিকেশন (DMS), যা AI-এর একটি গুরুত্বপূর্ণ অংশকে 8x পর্যন্ত সংকুচিত করে, এবং কিছুটা অদ্ভুতভাবে, মডেলগুলিকে কঠিন বেঞ্চমার্কগুলিতে বেশি স্কোর দেয়।
যদি এআই মডেলগুলি শুধুমাত্র মেমোরির এক অংশ ব্যবহার করে একইভাবে বা আরও ভালোভাবে চলে, তাহলে বর্তমানে এগুলি পরিচালনা করতে অক্ষম ডিভাইসগুলিতে—যেমন ওয়ারেবলস, স্মার্ট হোম হার্ডওয়্যার এবং এজ ডিভাইসগুলিতে—গুরুত্বপূর্ণ যুক্তিসঙ্গত ক্ষমতা চালু করার দরজা খুলে যায়।
DMS কিভাবে কাজ করে
ব্রেকথ্রুটি বুঝতে, আপনাকে কী-ভ্যালু (KV) ক্যাশে সম্পর্কে জানতে হবে। যখন একটি এআই মডেল একটি সমস্যার মধ্যে যুক্তি দেয়, তখন এটি এই ক্যাশেতে মধ্যবর্তী ফলাফলগুলি সংরক্ষণ করে, যা মূলত একটি কার্যকরী মেমোরি যা মডেলকে তার নিজস্ব চিন্তার প্রক্রিয়াটি ট্র্যাক রাখতে সক্ষম করে। যতই যুক্তির শৃঙ্খলটি দীর্ঘতর এবং জটিলতর হয়, ক্যাশেটি ততই বড় হয়, এবং ততই কম্পিউটেশনাল সম্পদের প্রয়োজন হয়।
DMS এই প্রক্রিয়ার উপর একটি স্ক্যালপেলের মতো কাজ করে। প্রতিটি টোকেনকে ক্যাশেতে রাখার বদলে, এটি শুধুমাত্র সবচেয়ে গুরুত্বপূর্ণ টোকেনগুলিকেই বজায় রাখে এবং বাকিগুলিকে বাদ দেয়। ফলাফল হলো একটি KV ক্যাশ যা মূল আকারের এক-অষ্টমাংশে সংকুচিত। শব্দ দূর করে, মডেলগুলি একই কম্পিউটেশনাল বাজেটের মধ্যে গভীরতর এবং জটিলতর যুক্তির পথগুলি অন্বেষণ করতে পারে।
বেঞ্চমার্ক ফলাফল
AIME 24-এ, একটি গণিত অলিম্পিয়াড যোগ্যতা পরীক্ষায়, DMS ব্যবহার করে সংকুচিত মডেলগুলি তাদের অসংকুচিত প্রতিপক্ষের চেয়ে গড়ে 12 পয়েন্ট বেশি স্কোর করেছে।
জিপিকিএ ডায়মন্ডে, যা পদার্থবিদ্যা, রসায়ন এবং জীববিদ্যার স্নাতক স্তরের বিজ্ঞান সমস্যাগুলি থেকে তৈরি একটি বেঞ্চমার্ক, ডিএমএস-সংপীড়িত মডেলগুলি গড়ে 8 পয়েন্টের বেশি স্কোর অর্জন করেছে।
লাইভকোড বেঞ্চে, যেখানে ব্যাবহারিক প্রোগ্রামিং দক্ষতা পরীক্ষা করা হয়, সমান পরিমাণ KV ক্যাশ ডেটা পড়ার সময় সংকুচিত মডেলগুলি তাদের পূর্ণ-ক্যাশ সমতুল্যগুলির চেয়ে 10 পয়েন্ট বেশি পেয়েছে।
প্রধান গবেষক ডা. এডোয়ার্ডো পন্টি দ্বৈত সুবিধাটি সহজে সারসংক্ষেপ করেছেন।
মডেলগুলি দ্রুততার সাথে যুক্তি দিতে পারে কিন্তু একই মানের সাথে।
একটি নির্দিষ্ট সময়ের মধ্যে, DMS ব্যবহার করে একটি LLM বেশি যুক্তির সূত্র অন্বেষণ করতে পারে এবং শক্তিশালী সিদ্ধান্তে পৌঁছাতে পারে।
একটি দীর্ঘ প্রবণতা, ত্বরান্বিত
মধ্য-2010-এর দিক থেকেই এআই ক্ষেত্রটি মডেলের দক্ষতা নিয়ে চলেছে, যখন জ্ঞান বিকিরণ, প্রুনিং এবং কোয়ান্টাইজেশনের মতো পদ্ধতিগুলি প্রমাণ করেছে যে ছোট মডেলগুলি নির্দিষ্ট কাজগুলিতে বড় মডেলগুলির সাথে প্রতিদ্বন্দ্বিতা করতে পারে। DMS এই ধারায় যা যোগ করে তা হলো ইনফারেন্স-টাইম মেমোরির উপর ফোকাস, অর্থাৎ যেসব সম্পদ ব্যবহৃত হয় যখন মডেলটি প্রশিক্ষণের সময় নয়, বরং বাস্তবিকভাবে ব্যবহার করা হচ্ছে। ইনফারেন্স মেমোরি 8x চাপা দেওয়ার মানে হলো, প্রতিটি ডিপ্লয়মেন্টকে চালানোর খরচ অনেকটাই কমে যায়।
গবেষণাটি NeurIPS কনফারেন্সে উপস্থাপন করা হয়েছিল এবং “Inference-Time Hyper-Scaling with KV Cache Compression” শিরোনামে একটি পেপারে বিস্তারিতভাবে বর্ণনা করা হয়েছে। মূল্যায়ন করা হয়েছে Llama এবং Qwen মডেল ব্যবহার করে।
