يعمل كود CUDA على معالج Apple M3 Pro مع زيادة في السرعة تصل إلى 10 أضعاف

icon MarsBit
مشاركة
AI summary iconملخص
تُظهر تقارير الأخبار على السلسلة أن برنامجًا حسابيًا مبنيًا على CUDA نُفّذ بنجاح على جهاز Apple M3 Pro مع تغييرات طفيفة في الكود. وقد عمل البرنامج، الذي عالج محاكاة سائل ثلاثية الأبعاد حقيقية، أسرع بحوالي 10 مرات على وحدة معالجة الرسومات Metal الخاصة بـ Apple مقارنةً بالوحدة المركزية. واستخدم الإعداد خطوة تحويل تضم Clang/HIP وSPIR-V وVulkan وMoltenVK، وتجنب استخدام واجهات برمجة التطبيقات الخاصة بـ Metal. ساعد GPT-5.6 Sol في حل مشكلات التوافق. وأظهر الاختبار استخدامًا عاليًا لوحدة معالجة الرسومات ودقة عالية، مما يثبت أن خوارزميات CUDA/HIP يمكن أن تعمل على شرائح Apple Silicon. وتشير أخبار الأصول الواقعية (RWA) إلى إمكانات أدوات الحوسبة متعددة المنصات.

برنامج حسابي مصمم أصلاً لـ NVIDIA CUDA، تم تشغيله مباشرة على جهاز Apple مزود بـ M3 Pro دون الحاجة إلى تعديل شبه كامل لرمز النواة.

CUDA

هذا تقدم أعلنه مستخدم X @Abhinav أمس. والأمر الأكثر إثارة للدهشة أنه ليس مجرد عرض توضيحي بسيط لعمليات "جمع وطرح وضرب وقسمة المتجهات"، بل حقق تحسينًا في السرعة بنسبة تقارب 10 مرات في مهمة محاكاة سائل ثلاثية الأبعاد حقيقية.

CUDA

خلف هذا الأمر، هناك مشارك خاص — GPT-5.6 Sol.

حدثت الحادثة على منصة الحوسبة العلمية المفتوحة المصدر OpenFPM. كان الباحثون يفعلون شيئًا يعتقده الكثيرون "غير ممكن": جعل برامج الحوسبة عالية الأداء المصممة أصلاً لـ CUDA/HIP GPU تعمل عبر حواجز المنصات على بنية Metal GPU الخاصة بشركة Apple.

لماذا هذا صعب؟ على مدار العقد الماضي، كان مجال حسابات GPU مجزأًا بشدة — فلدي NVIDIA CUDA، وعند AMD HIP، وعند Apple Metal. هذه البيئات تشبه لغات مختلفة غير متوافقة مع بعضها البعض. عادةً ما يتطلب برنامج مكتوب بـ CUDA إعادة كتابة كبيرة ليتم تشغيله على منصات أخرى.

لكن هذه المرة، لم يختر المطورون تطوير إصدار Metal من الصفر، بل أنشأوا قناة تحويل: حيث يمر البرنامج أولاً عبر Clang/HIP، ثم عبر طبقات وسيطة مثل SPIR-V وVulkan وMoltenVK، ليتمكن أخيراً معالجات GPU الخاصة بـ Apple Metal من فهمها وتنفيذها بكفاءة.

الأهم من ذلك، أنهم لم يضيفوا أي واجهات برمجة تطبيقات جسيمات مخصصة لـ Metal. لا تزال مكالمات النواة على نمط CUDA/HIP محفوظة في طبقة التطبيق، مما يحقق شفافية الأجهزة الحقيقية.

في هذه العملية، لعب GPT-5.6 Sol دورًا محوريًا. فقد ساعد في إكمال بناء تخطيط الذاكرة على الجهاز، واكتشف مشكلات التوافق في MoltenVK وSPIR-V خلال حوالي 6 ساعات، وصمم حلولًا بديلة مناسبة.

CUDA

رابط المشروع: https://github.com/mosaic-group/openfpm/pull/18

الاختبار الحقيقي لهذا العمل هو حالة اختبار معقدة: محاكاة انهيار سد SPH ثلاثي الأبعاد. تتطلب هذه المهمة معالجة متزامنة لعدة وحدات معقدة، بما في ذلك المسح، والفرز وإعادة الترتيب، وبناء خلايا وقوائم الجيران، وتبادل الجسيمات الغريبة، وعمليات التقليل، وعمليات الذرية؛ وأي خلل في أي مرحلة سيؤدي إلى انخفاض في الأداء أو انحراف في النتائج الفيزيائية.

لكن النتائج التجريبية كانت غير متوقعة. على أجهزة Apple المزودة بمعالج M3 Pro، استغرق التنفيذ باستخدام Metal GPU حوالي 6 ثوانٍ، بينما استغرق الحساب التسلسلي باستخدام CPU حوالي 60 ثانية. أي أن نفس البرنامج، عند تغيير معدات الحساب فقط، حقق تحسينًا في السرعة بنسبة تقارب 10 مرات، مع استخدام接近 100% للـ GPU (مما يدل على كفاءة تحويل عالية).

الأهم من ذلك، أن تحسين السرعة لم يتم على حساب الدقة. قام المطورون بمراجعة نتائج المحاكاة بشكل إضافي، ووجدوا أن النتائج الفيزيائية النهائية التي حصل عليها إصدار GPU الخاص بشركة Apple متوافقة تمامًا مع الإصدار الحسابي الأصلي، حيث كانت المعلمات الرئيسية ومسارات المحاكاة قريبة جدًا من بعضها البعض. وهذا يعني أن GPU الخاص بشركة Apple لم يُشغّل فقط، بل أكمل فعليًا مهام الحساب العلمي.

أشار المطورون أيضًا إلى أن تخزين الجسيمات ينمو خطيًا مع عدد الجسيمات N، بينما تبلغ كمية العمل المطلوبة للبحث عن الجيران وما شابه ذلك تقريبًا O(N·k) (حيث k هو عدد الجيران عند كثافة ثابتة). إن تسريع الـ10 مرات المُعرض حاليًا هو نتيجة مقارنة خلفية واحدة. في المستقبل، يمكن تحقيق توازن ديناميكي للحمل بين أجهزة متعددة باستخدام تقنية RDMA المدعومة من Apple Thunderbolt، مما يسمح بتوسيع المحاكاة عبر عدة أجهزة.

بالطبع، هذا الإنجاز لا يزال بعيدًا عن تغيير صناعة GPU بأكملها. أحد أكبر القيود الحالية على GPU الخاص بـ Apple Metal هو دعمه المحدود للحسابات العائمة عالية الدقة، والتي تعتمد عليها العديد من مجالات الحساب العلمي المتقدم على العمليات المزدوجة الدقة. وبالتالي، لا تزال وحدات معالجة الرسومات الاحترافية من NVIDIA تحتفظ بميزة في سيناريوهات الحوسبة الفائقة مثل التنبؤ بالطقس ومحاكاة الطيران والفضاء.

ومع ذلك، هناك من يشكك في معنى هذا الاستكشاف، حيث قال أحد المستخدمين: "هناك العديد من الأنظمة الأكثر ملاءمة في السوق، فما فائدة تشغيل هذا المحاكاة الصغيرة على Mac؟" وهذا يوحي بأن جهاز MacBook، مهما كان جهاز GPU الخاص به سريعًا، فإنه لم يُصمم أصلاً للحوسبة العلمية، ويبدو الأمر وكأنه مجرد عرض تقني.

رد المطور كان صريحًا للغاية: "الاستخدام الأكبر هو المتعة وسهولة العمل." وأوضح أن محاكاة الفريق الواسعة النطاق كانت بالفعل تعمل على تجمعات، وأن نجاح تشغيلها على بنية Apple يؤكد صحة تصميم طبقة تجريد الأجهزة. السبب الأكثر عملية مخفي في التطوير اليومي — قبل تشغيل المحاكاة الكبيرة، يجب دائمًا اختبارها أولاً بمحاكاة صغيرة، لكن التصحيح المحلي باستخدام المعالج بطيء جدًا؛ نتائج المحاكاة غالبًا ما تصل إلى عدة غيغابايت، ولا يمكن إعادتها عبر SSH، والسطح المكتبي البعيد ثقيل وصعب الاستخدام، لذا من الأفضل تشغيلها محليًا. أجمل نقطة هي أن الكود الذي تم تصحيحه بنجاح على جهاز الكمبيوتر المحمول يمكن نقله دون تغيير إلى تجمع GPU، حيث يتوسع تلقائيًا.

CUDA

أثبتت هذه المراجعة أيضًا أنه يمكن تشغيل نفس مجموعة الخوارزميات بأسلوب CUDA/HIP بشكل شفاف نسبيًا على خلفيات أجهزة مختلفة مثل Apple Silicon. في المستقبل، قد لا يُقيّد مطورو البرمجيات ببيئة GPU واحدة.

CUDA

علاوة على ذلك، فإن هذا يُظهر أن الذكاء الاصطناعي (GPT-5.6 Sol) ينتقل من مرحلة "مساعدة كتابة الكود" إلى مرحلة "المشاركة في تصميم الأنظمة الأساسية، وتحسينها، وتصحيح الأخطاء عبر المنصات".

هذه الخطوة من Apple GPU لتجاوز فجوة CUDA قد تكون مجرد بداية.

رابط المرجع: https://x.com/Abhinavsns/status/2079774018748694696

هذا المقال من حساب ويشات الرسمي "ماشين سينس" (ID: almosthuman2014)، الكاتب: ماشين سينس

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.