يحدد Meta AI التحديات في التعلم المعزز لتحسين سرعة الكود

iconCryptoBriefing
مشاركة
AI summary iconملخص
تشير أخبار الذكاء الاصطناعي والعملات المشفرة من فريق FAIR التابع لـ Meta AI إلى أن التعلم المعزز يواجه عقبات في تحسين سرعة الكود بسبب التوقيت الضوضائي والمكافآت النادرة وعدم الاستقرار. أطلق الفريق DMC-Optim، وهو معيار يجمع بين الدقة والسرعة، مما عزز معدلات النجاح للنماذج مثل Qwen 2.5 7B و CWM 32B. تظل إدراجات الرموز الجديدة محورًا رئيسيًا للتجار الذين يتبعون تطورات الذكاء الاصطناعي.

تعليم الذكاء الاصطناعي على كتابة كود يعمل هو شيء واحد. تعليمه على كتابة كود يعمل بسرعة هو، على ما يبدو، أمر مختلف تمامًا.

ورقة جديدة من فريق FAIR في Meta AI، نُشرت في 29 يوليو، تكشف أن توسيع التعلم المعزز من صحة الكود إلى تحسين سرعة الكود مليء بالمشكلات التي لا تستطيع الأساليب القياسية التعامل معها. المُذنبون: قياسات زمنية ضوضائية، مكافآت نادرة، وخوارزميات تنهار عندما تُطلب منها الاهتمام بالأداء، وليس فقط الدقة.

المشكلة مع السرعة

عندما تقاس ما إذا كان الكود ينتج الإجابة الصحيحة، تحصل على إشارة ثنائية نظيفة. لكن قياس سرعة تشغيل الكود أمر غير نظيف. قم بتشغيل نفس الكود مرتين على نفس الجهاز وستحصل على أوقات تنفيذ مختلفة قليلاً. إن العمليات الخلفية، وجدولة وحدة المعالجة المركزية، وتخصيص الذاكرة، كلها تُدخل ضوضاء في قياسات الوقت.

إعلان

وجد فريق ميتا أن تحسين سياسة التعزيز المعمم، أو GRPO، وهو خوارزمية قياسية في مجموعة أدوات تعلم التعزيز، يصبح غير مستقر عندما تُزوَّد بقياسات السرعة الضوضائية من هذا النوع.

ندرة المكافآت تُفاقم المشكلة. معظم تحسينات الكود تؤدي إلى تحسينات طفيفة في السرعة، مما يعني أن النموذج نادرًا ما يتلقى إشارة إيجابية قوية تخبره: "نعم، هذا التغيير جعل الأمور أسرع."

DMC-Optim: معيار جديد لمشكلة جديدة

لمعالجة هذه التحديات، قام الباحثون ببناء DMC-Optim، وهو معيار يضم بيئة محاكاة مُعايرة وخطوة تدريب متخصصة. يجمع النظام بين المكافآت لكل من الدقة وسرعة التنفيذ داخل محاكي غير متصل، مما يخلق بيئة خاضعة للرقابة يمكن فيها إدارة الضوضاء الزمنية بدلاً من تجاهلها.

النتائج صعبة الجدل. ارتفع معدل النجاح لـ Qwen 2.5 7B من 18.0% إلى 31.3%, أي تحسن نسبي يقارب 74%. وارتفع معدل النجاح لـ CWM 32B من 30.7% إلى 50.4%, أي مكسب نسبي قدره 64%. وفي معيار LCB، تفوق نموذج CWM 32B المدرب بهذه الطريقة على المقارنات المتوسطة للسرعة في 83% من الحالات، مقارنة بالنماذج المدربة باستخدام التعلم المعزز القياسي من المكافآت القابلة للتحقق.

في ظل ظروف توقيت متدهورة، حيث يتم تضخيم الضوضاء القياسية بشكل مقصود، أظهر معيار DMC-Optim تحسينات في الأداء تتراوح بين 100% و200% مقارنة بالطرق القياسية.

تم تأليف الورقة من قبل بيير شامبون وكوهاو زينغ وجوليت ديكوجيس وبنوا ساغو وغابرييل سيناييف، جميعهم من ميتا أيه آي.

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.