باحثو إدنبرة يضغطون نماذج الذكاء الاصطناعي 8 مرات مع تحسين درجات المعايير

iconCryptoBriefing
مشاركة
AI summary iconملخص
أخبار إدنبرة حول الذكاء الاصطناعي والعملات المشفرة: طور باحثون من جامعة إدنبرة وNVIDIA طريقة تسمى "النُدرة الديناميكية للذاكرة" (DMS)، وهي تقنية تضغط نماذج الذكاء الاصطناعي بنسبة 8 مرات مع تحسين درجات المعايير. تُقلل هذه التقنية من حجم ذاكرة المفتاح-القيمة (KV) عن طريق الاحتفاظ بالرموز الأهم فقط، مما يسمح للنماذج بالتفكير بشكل أسرع. وفي اختبارات AIME 24 وGPQA Diamond وLiveCode Bench، تفوقت نماذج DMS على الإصدارات الكاملة بـ 12 و8 و10 نقاط على التوالي. وتستمر الأخبار على السلسلة في تسليط الضوء على تقدمات الذكاء الاصطناعي مع مكاسب عملية حقيقية.

جعل شيء أصغر وأفضل في نفس الوقت يبدو كمخالفة لقوانين الفيزياء الأساسية. لكن الباحثين في جامعة إدنبرة، بالتعاون مع NVIDIA، نجحوا في تحقيق ذلك مع نماذج اللغة الكبيرة. تقنيتهم، المُسمّاة "التفريغ الديناميكي للذاكرة" (DMS)، تضغط قطعة حاسمة من البنية التحتية للذكاء الاصطناعي بمقدار 8 مرات، بينما تجعل النماذج تحقق درجات أعلى في المعايير الصعبة.

إذا كان بإمكان نماذج الذكاء الاصطناعي العمل بنفس الكفاءة، أو أفضل، باستخدام جزء صغير من الذاكرة، فهذا يفتح الباب أمام نشر قدرات استدلال جادة على الأجهزة التي لا تستطيع حاليًا التعامل معها، بما في ذلك الأجهزة القابلة للارتداء، وأجهزة المنزل الذكي، والأجهزة الحافة.

كيف يعمل DMS فعليًا

لفهم هذه القفزة النوعية، عليك أن تعرف عن ذاكرة التخزين المؤقت للمفاتيح والقيم (KV). عندما تقوم نموذج الذكاء الاصطناعي بالتفكير في مشكلة، فإنه يخزن النتائج الوسيطة في هذه الذاكرة المؤقتة، وهي بمثابة ذاكرة عمل تسمح للنموذج بتتبع عملية تفكيره الخاصة. وكلما طال سلسلة التفكير وزادت تعقيدًا، زاد حجم هذه الذاكرة المؤقتة وازدادت الموارد الحسابية المطلوبة.

يستخدم DMS مشرطًا في هذه العملية. بدلاً من الاحتفاظ بكل الرموز في الذاكرة المؤقتة، فإنه يحتفظ انتقائيًا فقط بالرموز الأكثر أهمية ويتخلص من الباقي. النتيجة هي تقليل حجم ذاكرة KV إلى ثمن حجمها الأصلي. من خلال تطهير الضوضاء، يمكن للنماذج استكشاف مسارات استدلال أعمق وأكثر تعقيدًا ضمن نفس الميزانية الحسابية.

إعلان

نتائج المعيار

في امتحان AIME 24 التأهيلي لمسابقة الرياضيات، حصلت النماذج المضغوطة باستخدام DMS على متوسط 12 نقطة أعلى من نظيراتها غير المضغوطة.

على GPQA Diamond، وهو معيار مبني من مشكلات علمية على مستوى الدراسات العليا في الفيزياء والكيمياء والأحياء، سجّلت النماذج المضغوطة بواسطة DMS درجات أعلى بمتوسط أكثر من 8 نقاط.

في LiveCode Bench، الذي يختبر القدرة البرمجية العملية، اكتسبت النماذج المضغوطة 10 نقاط مقارنة بإصداراتها الكاملة للذاكرة المؤقتة أثناء قراءة نفس كمية بيانات ذاكرة KV.

لخص الباحث الرئيسي الدكتور إدواردو بونتي الفائدة المزدوجة ببساطة.

يمكن للنماذج التفكير بشكل أسرع ولكن بنفس الجودة.

في نافذة زمنية ثابتة، يمكن لنموذج لغوي كبير يستخدم DMS استكشاف مزيد من سلاسل التفكير والوصول إلى استنتاجات أقوى.

اتجاه أطول، يتسارع

لقد سعت مجال الذكاء الاصطناعي إلى تحسين كفاءة النماذج منذ منتصف العقد 2010، عندما بدأت تقنيات مثل التخفيف المعرفي، والتقليم، والكمية في إثبات أن النماذج الأصغر يمكنها التنافس مع النماذج الأكبر في مهام محددة. ما يضيفه DMS إلى هذا التسلسل هو التركيز على ذاكرة الاستنتاج، أي الموارد المستهلكة ليس أثناء تدريب النموذج، بل أثناء استخدامه فعليًا. إن تقليل ذاكرة الاستنتاج بمقدار 8 مرات يعني أن كل نشر يصبح أرخص بكثير في التشغيل.

تم عرض البحث في مؤتمر NeurIPS وتم تفصيله في ورقة بعنوان “Inference-Time Hyper-Scaling with KV Cache Compression”. أُجريت التقييمات باستخدام نماذج Llama و Qwen.

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.