إعادة تشغيل NVIDIA لمشروع مُسرّع Rubin CPX لاستنتاج الذكاء الاصطناعي للإطلاق عام 2027

iconMetaEra
مشاركة
AI summary iconملخص
أعلنت NVIDIA عن مشروع جديد، بإعادة تشغيل مُسرّع Rubin CPX لاستنتاج الذكاء الاصطناعي في مرحلة ما قبل التعبئة، بموعد إطلاق مخطط له عام 2027. مستمدًا من MetaEra، تم تصميم Rubin CPX خصيصًا لمرحلتي ما قبل التعبئة ذات السياق الطويل، ويتضمن 168 جيجابايت من ذاكرة HBM4، وأداء قريبًا من Rubin، واستهلاك طاقة قدره 2300 واط. وسيتم شحنه في الربع الأول من عام 2027 باستخدام تصميم رف MGX ETL قابل للتعديل، ويدعم من 64 إلى 256 وحدة معالجة رسومية. يستخدم النظام NVLink داخل الصواني، والإيثرنت بين الصواني، لتحقيق توازن بين التكلفة والسرعة. سيقترن Rubin CPX بنسبة 1:1 مع وحدات Rubin القياسية، ليتولى مهام ما قبل التعبئة وذاكرة KV Cache، بينما تُدير الوحدات الأخرى عملية التحليل. يقع هذا التحديث ضمن أخبار الذكاء الاصطناعي + التشفير، ويُظهر تركيز NVIDIA على البنية التحتية المتخصصة للذكاء الاصطناعي.
أعادت نيفيديا تشغيل مشروع GPU لتسريع التمهيد الاستنتاجي للذكاء الاصطناعي "Rubin CPX"، المخطط لبدء الإنتاج في الربع الأول من عام 2027. تم تصميم هذا المنتج لسيناريوهات التمهيد الطويلة السياقية، ويتضمن ذاكرة HBM4 بسعة 168 جيجابايت، مع أداء يقارب وحدة Rubin القياسية، مع استهلاك طاقة يبلغ 2300 واط لكل بطاقة. يستخدم المنتج تصميم رف MGX ETL مستقل، ويدعم تكوينات نشر مرنة تتراوح بين 64 و256 وحدة GPU. يستخدم هيكل الاتصال تصميمًا هرميًا، حيث تستخدم وحدات التخزين الداخلية NVLink، بينما تستخدم الوحدات بينها Ethernet لتحقيق توازن بين الأداء والتكلفة. ستُستخدم Rubin CPX كمحفز تمهيد بالتعاون مع وحدات Rubin القياسية بنسبة 1:1، حيث تتحمل CPX مهام التمهيد وتوليد KV Cache، بينما تُخصص وحدات Rubin لل декودينغ، مُحسّنة خصيصًا لسيناريوهات الاستنتاج ذات السياق الطويل.

كاتب المقال، المصدر: Wall Street Journal

أعادت نيفيديا بشكل هادئ تشغيل مشروع شريحة كان يُعتقد أن السوق قد تخلّى عنه، بهدف استهداف مرحلة التمهيد (Prefill) التي تتميز بتكلفة عالية في استنتاج الذكاء الاصطناعي.

أعادت نفيديا تشغيل مشروع GPU المُسرّع لملء مُقدّمات الاستنتاجات الخاصة بالذكاء الاصطناعي "Rubin CPX"، وأجرت تعديلات كبيرة على تصميم المنتج. ووفقًا للخطة الحالية، من المتوقع أن يبدأ إنتاج الإصدار الجديد من Rubin CPX في الربع الأول من عام 2027.

إعادة تشغيل هذا المشروع تُرسل إشارة واضحة: إن نيفيديا تُعزز جهودها لحل مشكلات الأداء والتكلفة في مرحلة التمهيد للاستدلال الذكي. مع استمرار زيادة طول سياق النماذج الكبيرة، تتطلب مرحلة التمهيد معالجة كميات كبيرة من المعلومات المدخلة وإنشاء KV Cache، حيث يؤثر كفاءتها مباشرة على التكلفة العامة للاستدلال الذكي وجدواه الاقتصادية.

يقول غو مينغتشي إن أكثر من 50% من عبء عمل الاستدلال الخاص بالذكاء الاصطناعي يأتي من معالجة سياق الإدخال وبناء KV Cache.

تم تعديل مواصفات الشريحة بشكل كبير، ليصبح الأداء قريبًا من Rubin القياسي

من حيث القوة الحسابية والاستهلاك الطاقي، تقارب أداء CPX الإصدار الجديد أداء GPU Rubin القياسي، مع وصول الاستهلاك الأقصى للبطاقة الواحدة إلى 2300 واط. من حيث الذاكرة، انتقل الإصدار الجديد من CPX إلى ذاكرة HBM4 بسعة 168 جيجابايت، وهي ترقية واضحة مقارنة بسعة 128 جيجابايت من GDDR7 في الحلول السابقة، لكنها لا تزال أقل من سعة 288 جيجابايت من HBM4 في GPU Rubin القياسي.

وفقًا لغو مينغ تشي، فإن سعة HBM4 في منصة الحوسبة CPX المكونة من 8 بطاقات تبلغ حوالي 1.34 تيرابايت، وهي كافية لتغطية معظم أحمال التمهيد الطويلة للسياق والمتطلبات المقابلة لذاكرة KV. هذا يعني أن Rubin CPX لا يسعى فقط إلى زيادة القدرة الحسابية العامة، بل أُعيد تصميمه خصيصًا لتحسين سعة الذاكرة وفعالية التمهيد في سيناريوهات السياق الطويل.

الانتقال من الرف المشترك إلى النشر المستقل، مع مرونة تكوين أكبر

The rack architecture is also a key focus of this adjustment.

في الخطة السابقة، كانت CPX تخطط لمشاركة الرف مع Rubin GPU؛ أما في الإصدار الجديد، فقد تم التحول إلى استخدام رف MGX ETL مستقل، مما يسمح للعملاء بتوسيع قوة الحوسبة لـ CPX بشكل منفصل وفقًا لاحتياجاتهم الفعلية.

من حيث التفاصيل، يمكن للعملاء اختيار أحجام نشر تشمل 64 أو 128 أو 192 أو 256 وحدة CPX GPU. كل مجموعة من 64 وحدة CPX GPU تشكل وحدة رف، وتشمل 8 أرصفة حسابية، وكل رف يحتوي على 8 وحدات CPX GPU، بالإضافة إلى رف مبادل.

يعني التصميم المعياري أن العملاء لا يحتاجون إلى شراء أرفف Rubin الضخمة الثابتة، بل يمكنهم زيادة قوة الحوسبة CPX بشكل مرن وفقًا لاحتياجاتهم الفعلية للحمل المسبق.

تصميم متصل طبقي، يقلل من تكلفة النشر المسبق

على البنية التحتية المتصلة، يستخدم Rubin CPX تصميمًا طبقيًا لتحقيق توازن بين الأداء والتكلفة.

داخل لوحة حسابية واحدة، يتم توسيع 8 وحدات معالجة رسومية CPX عبر NVLink. يبلغ عرض النطاق الترددي لـ NVLink لكل وحدة معالجة رسومية CPX بين 1 و1.5 تيرابايت/ثانية، وهو أقل من 3.6 تيرابايت/ثانية لوحدات معالجة الرسومات Rubin القياسية.

في مستوى التوسع بين الألواح وداخل وحدات الرف، تستخدم CPX روابط Ethernet كاملة النحاس من المستوى L1 من Spectrum-6؛ وعند الربط بين وحدات الرف، يتم تحقيق الاتصال عبر مفاتيح Spectrum-6 في كل وحدة باستخدام روابط ألياف OSFP.

بالمقارنة مع الحلول التي تعتمد بالكامل على اتصالات GPU ذات عرض نطاق عالي، فإن هذا الهيكل الطبقي يركز أكثر على تحسين التكلفة لسيناريوهات التعبئة المسبقة.

بالتعاون مع Rubin GPU، استهدف الاستدلال الطويل في السياق

Rubin CPX ليس وحدة معالجة رسومية عامة تعمل بشكل مستقل، بل تُستخدم كمُسرّع مسبق للتعبئة مع Vera Rubin NVL72.

وفقًا لغو مينغ تشي، توصي نيفيديا بتجهيز CPX و Ruben GPU بنسبة 1:1: حيث يتحمل CPX حسابات مرحلة التعبئة المسبقة وينشئ KV Cache، ثم يُنقل KV Cache عبر Ethernet RDMA إلى Rubin GPU لإنجاز عملية التحليل اللاحق.

من حيث التحديد المنتج، لا يهدف Rubin CPX إلى استبدال Rubin GPU القياسي، بل إلى تقسيم عملية استنتاج الذكاء الاصطناعي بشكل أعمق، بحيث تتحمل وحدات GPU المختلفة مهام التعبئة المسبقة والفك.

يُعرّف غو مينغتشي هذا الحل بأنه "أفضل خيار من حيث القيمة مقابل التكلفة للتعبئة المسبقة ذات السياق الطويل". مع استمرار توسيع نافذة السياق للنماذج الذكية الاصطناعية، فإن كمية الحسابات وحجم ذاكرة KV في مرحلة التعبئة المسبقة تستمر في النمو، وقد يكون إعادة تشغيل نيفيديا لمشروع CPX محاولة للحد من تكلفة الاستدلال ذات السياق الطويل من خلال استخدام أجهزة متخصصة وطرق نشر غير متجانسة.

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.