نفيديا تنشر دليل الاستنتاج الذكي، مع تسريع 6 مرات بدون فقدان بقيادة فرق صينية

icon MarsBit
مشاركة
AI summary iconملخص
أصدرت NVIDIA دليلاً للاستنتاجات الذكية في 2 سبتمبر، يعرض ست طرق للتسريع. قادت الفرق الصينية الابتكارات الرئيسية مثل التنبؤ بالفك وDFlash، التي توفر تسريعًا بدون فقدان بنسبة 6 أضعاف. لا يزال مؤشر الخوف والطمع مرتفعًا مع اكتساب العملات البديلة التي يجب مراقبتها زخمًا. تُشكّل الحدود المادية مثل أحجام شرائح GPU تصميم النماذج. ويتم تسليط الضوء على طريقة MTP الخاصة بـ DeepSeek-V3 وتقنيات أخرى من أجل الكفاءة. ويُفصّل الدليل التكاليف وحالات الاستخدام لكل نهج.

في الآونة الأخيرة، نشرت NVIDIA دليلاً رسمياً لاستنتاج النماذج الكبيرة، فبينما كنت أقرأ، شعرت وكأنني أقرأ مجموعة أوراق بحثية من فرق صينية.

هكذا هي الأمور.

في 2 سبتمبر، نُشر مقال طويل على مدونة تقنية NVIDIA بعنوان "فك تشفير التصميم التعاوني لنماذج الذكاء الاصطناعي باستخدام المضاربة".

جوهر المقال هو جدول مقارنة يعرض ستة حلول رئيسية حاليًا لتسريع الاستنتاج، ويكشف لك تمامًا تكاليف التدريب والسيناريوهات المناسبة.

DeepSeek

إن قيمته تكمن في أن عملاق الرقائق نادرًا ما يُصدر معيارًا رسميًا يُحدد "كيفية تصميم النموذج بحيث يتوافق مع الحدود الفيزيائية للعتاد".

وأثناء بحثهم عن الحل الأمثل الذي يمكنه الرقص على حدود شريحة السيليكون، فإن الحلول الأساسية المدرجة في الدليل تقودها تقريبًا جميعًا فرق صينية.

لقد تجاوز هذا بالفعل نطاق مراجعة الخوارزميات العادية. ما الذي كشفته هذه الجدول بالضبط؟ دعونا نحلله سطرًا سطرًا.

صفقة تحقق أرباحًا شبه خالصة: ما الذي يفعله Speculation Decode

لفهم هذه الجدول، يجب أولاً فهم ما هو "التفسير الطموح".

يُنتج النموذج الكبير الكلمات واحدة تلو الأخرى. وكلما أنتج كلمة، يجب أن تمر جميع المعلمات التي تبلغ مئات الجيجابايت عبر ذاكرة الرسوميات بالكامل. في الواقع، في معظم الوقت، يكون أداء الحوسبة في انتظار نقل البيانات من الذاكرة.

حل "التفسير الطموح" بسيط وقاسي للغاية—

ابدأ بنموذج خفيف لعمل تنبؤ أولي، وافترض سبعة أحرف دفعة واحدة؛ ثم تحقق النموذج الكبير من هذه الأحرف السبعة دفعة واحدة.

التحقق من سبعة أحرف يستغرق وقتًا مشابهًا لكتابة حرف واحد بنفسك، نظرًا لأن الوزن يجب نقله بالكامل على أي حال.

من يخمن بشكل صحيح يأخذها مباشرة، ومن يخمن بشكل خاطئ يعود من نقطة التوقف. لأن النموذج الكبير لا يتقبل سوى الكلمات التي كان سيكتبها بنفسه، لذا لا داعي لتغيير أي علامة ترقيم في الإخراج النهائي. هذا ما يُعرف بـ "تسريع بدون فقدان".

DeepSeek

في هذه اللعبة، يتمحور كل استغلال للقوة الحسابية حول صيغة رياضية أساسية واحدة:

التسريع = 𝔼[L] × TtargetTdraft + Tverify

البسط هو العائد 𝔼[L]، والذي يمثل الطول المتوقع المقبول (عدد الحروف التي يمكن للنموذج الكبير اختيارها في كل جولة في المتوسط).

The denominator is the additional cost you incur: the time for the small model to make a prediction (Tdraft) plus the time for the large model to perform final verification (Tverify).

لتحقيق زيادة هائلة في نسبة التسارع، هناك طريقان فقط: إما رفع البسط (التخمين الأكثر دقة)، أو ضغط المقام إلى أقصى حد (التخمين الأسرع).

بالاستناد إلى أكتاف المنافسين، نحقق تطورًا من الجيل الرابع

بمتابعة هذا الجدول من نيفيديا من الأعلى إلى الأسفل، ستلاحظ خطًا واضحًا للتنافس.

السطر الأول هو أقدم "نموذج مسودة خارجي"، ويجب تدريب نموذج صغير منفصل كمساعد.

كشفت نيفيديا عن فاتورة ضخمة: التدريب من الصفر يتطلب استهلاك ما بين 1 تريليون و10 تريليونات من الرموز، وهو أمر مكلف للغاية.

لكنه لا يزال مدرجًا على الجدول لأن نفيديا خصصت له مصيرًا محددًا — لقد أنفقت 20 مليار دولار لشراء شرائح Groq (LPU).

أما السطر الأخير فهو طريقة جدول n-gram دون تدريب، تعتمد على البحث اليدوي عن تكرارات من النص السابق والنسخ المباشر، وهي مناسبة فقط للسيناريوهات الثابتة التي تتطلب نسخًا ولصقًا طويلاً.

الأشياء التي تمثل حقًا تطور التكنولوجيا هي هذه السطور الأربعة الوسطى.

DeepSeek

السطر الثاني: EAGLE-3.

فريق من يوهوي لي من جامعة بكين وهانغ يانغ زhang من جامعة واترلو وغيرها.

من ICML و EMNLP حتى NeurIPS، أطلقت ثلاث إصدارات على مدار ثلاث سنوات، ووصلت إلى الحد الأقصى الفيزيائي لطريقة التخمين التسلسلية "التخمين الحرفي تدريجيًا".

كانت سابقًا المهيمنة المطلقة في هذا المجال، لكن في قائمة نيفيديا الجديدة، تم دفعها إلى "الموقع المرجعي" بسبب سبب موجز جدًا: طول القبول قد تجاوزه الموجة الجديدة.

الصف الثالث: MTP (متعدد التوكنات التنبؤية).

على الرغم من أن الفكرة كانت مبتكرة من قبل Meta في عام 2024، إلا أن من جعلها معيارًا أساسيًا في استنتاج النماذج الكبيرة هو DeepSeek -V3.

تُقدّر نفيديا تقييمها بشكل عالٍ — أفضل خيار للنماذج الكبيرة على وحدات معالجة الرسوميات. الجوهر الأساسي هو أن هذا الحل يجب أن يُدرَّب مع النموذج الرئيسي منذ مرحلة التدريب المسبق.

السطر الرابع: DFlash. الشخص الذي يحقق تسريعًا بمضاعفات 6 دون خسارة.

المؤلفون الثلاثة: جيان تشين، ييشينغ ليانغ، زهي جيان ليو. إنه يتخلص تمامًا من أسلوب "التخمين الحرفي تلو الحرفي" المستخدم في EAGLE وMTP، وبدلاً من ذلك يستلهم نماذج الانتشار لإنشاء تسلسل التنبؤات السبعة دفعة واحدة في حساب تقدمي واحد، مما يقلل المقام (الوقت المستهلك) إلى أقصى حد.

بالمناسبة، المُرشد الأكاديمي Zhijian Liu هو أستاذ مساعد في UCSD، لكنه أيضًا عالم بحث في معهد NVIDIA.

الصف الخامس: DSpark. تم تطويره من قبل فريق مكون من 24 شخصًا من DeepSeek و جامعة بكين.

على الرغم من أن بنية DFlash المتوازية سريعة، إلا أنها تواجه عيبًا قاتلًا: كلما تقدمت في التخمين، قلّت دقتها. لزيادة طول الجزيء (الطول المقبول) بشكل قسري، أضاف DSpark وحدة تسلسلية خفيفة جدًا على أساس متوازٍ.

البيانات التجريبية واضحة جدًا: طول القبول أعلى بنسبة 30% تقريبًا مقارنةً بـ EAGLE-3 وأعلى بنسبة 18% مقارنةً بـ DFlash. في DeepSeek في بيئة الإنتاج عبر الإنترنت V4، يكون السرعة أسرع بـ 60% إلى 85% مقارنةً بـ MTP.

Hardware constants, reverse lock model architecture

هذه الأجيال الأربعة من التقنيات لا تستطيع استنزاف قوة الحوسبة إلى هذا الحد فقط بفضل التفكير الذكي في الخوارزميات.

يعتقد الكثيرون أن كلما تخمنوا المزيد من المسودات في مرة واحدة، زاد ربحهم، لكن هذا يتجاهل تمامًا القواعد الفيزيائية للشرائح.

عندما تستهلك آلية الانتباه معظم وقت الترميز، فإن إجمالي عدد الرموز التي يجب معالجتها في مرحلة التحقق للنموذج الكبير هو 1+D (إدخال حقيقي واحد + D تنبؤًا مسودة).

لإدخال هذه البيانات إلى وحدة معالجة الرسومات (GPU)، تقوم الأجهزة في المستوى الأساسي بتجزئة رؤوس الاستعلام ورؤوس KV إلى مجموعات، ويجب أن تكون حجم كتل نواة الانتباه لكل مجموعة محدودة بدقة بحدود المصفوفة الفيزيائية للـ GPU (حجم الكتلة، والذي يكون عادةً 128 في البنية الحالية).

تم الحصول على الصيغة الأساسية المتماثلة: G × (1 + D) ≤ 128

بعد استنتاج بسيط، نصل إلى المبدأ الثابت النهائي في دليل نيفيديا:

D = 128G − 1

حيث G هو عدد مجموعات الانتباه (نسبة رؤوس الاستعلام إلى رؤوس KV).

هذا يعني أن طريقة توزيع الانتباه التي تم بها تصميم نموذجك من البداية تحدد مباشرة عدد الحروف التي يجب على المسودة توقعها لملء كتل GPU بدقة تامة.

إذا كان G=8، يمكنك التخمين بدقة 15 مسودة؛ إذا كان G=32، يمكنك التخمين فقط بـ 3 مسودات. لا يمكن للعتاد تجاوز الحدود، حتى إذا استخدمت نصف Tile فقط في آخر Tile، فسيتم خصم قوة الحوسبة كأنك استخدمت Tile كاملًا.

في السابق، كان التخمين التحليلي هو حزمة تسريع تُضاف من الخارج من قبل فريق الهندسة بعد اكتمال تدريب النموذج. لكن الآن، تخبرك القوانين الفيزيائية الأساسية أن ثابت مصفوفة الأجهزة يُعاد توجيهه مباشرة إلى معلمات تصميم النموذج.

في ذاكرتنا، نادرًا ما تقوم شركات تصنيع الرقائق بمثل هذا الأمر، حيث تُدخل معادلة قيود العتاد الأساسي في مخطط تصميم النموذج الكبير.

الخاتمة

مركز سباق كفاءة تشغيل النموذج تغير تمامًا.

عصر تراكم المعلمات الكبيرة فقط ي nearing نهايته، والآن يعتمد الفوز والخسارة الحقيقيان على من يفهم حدود الفيزياء للشريحة السيليكونية تحت أقدامهم.

في هذا الميدان الجديد الذي تُعيد فيه شركات رائدة في الرقائق تعريف القواعد، أصبح فريق صيني يُعدّ بالفعل الحلّ التلقائي للكسر.

بالطبع، لا يهتم العمالقة مثل نيفيديا بوجود خوارزميات أي شركة على الرف.

لكن من هو صاحب هذا الحل الأمثل الذي يستغل حدود الشرائح السيليكونية بالكامل، فالأمر مكتوب بوضوح على الورق الأبيض.

هذا المقال من حساب WeChat "New Intelligence Yuan"، الكاتب: ASI Revelation

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.