ورقة Google DeepMind تكشف أن طريقة إعادة التدوير تعزز أداء Transformer

iconCryptoBriefing
مشاركة
AI summary iconملخص
أطلقت Google DeepMind ورقة بحثية جديدة تقدم طريقة تُسمى "إعادة التدوير" لتحسين نماذج الترانسفورمر. تُرسل هذه التقنية تنشيطات الطبقات الأعمق مرة أخرى إلى الطبقات الأقل عمقًا أثناء الاستنتاج، مما يعزز الأداء دون الحاجة لإعادة التدريب. تُظهر تقارير الأخبار على السلسلة أن الطريقة خفّضت الإرباك بنسبة 23% وحسّنت دقة الاستدلال بنسبة 21% على معيار GSM8K. ومع ذلك، فإنها تزيد من تكاليف المعالجة الأولية. وتشير وسائل إعلام التشفير إلى الإمكانات الكبيرة لتحسين كفاءة الذكاء الاصطناعي في تطبيقات البلوكشين.

نشرت Google DeepMind للتو ورقة بحثية قد تغير هدوءًا طريقة معالجة نماذج اللغة للنصوص. تُسمى هذه التقنية "إعادة التدوير"، وتأخذ المُنشطات من الطبقات الأعمق في محول وتخلطها مرة أخرى في الطبقات الأقل عمقًا أثناء الاستدلال. تُظهر الورقة، التي كُتبت بالتعاون مع باحثين من جامعة تكساس في أوستن، أن هذا الاتصال التكراري الخفيف يحقق مكاسب في الأداء توازي، وفي بعض الحالات تتفوق على، الضبط الكامل. لا حاجة لإعادة التدريب. لا حاجة لجراحة هندسية كبيرة.

ما الذي يفعله إعادة التدوير فعليًا

تُكسر إعادة التدوير التدفق أحادي الاتجاه لمعالجة المحولات. يتم إرجاع جزء من التنشيطات المحسوبة في الطبقات الأعمق في النموذج إلى الطبقات الأقل عمقًا أثناء توليد الرموز. يحصل النموذج جوهرًا على جولة ثانية لفهم تمثيلاته الداخلية الخاصة، مما يسمح له بتحسين ما تسميه الورقة "حالات اعتقاده" عبر خطوات متعددة.

التمييز الأساسي عن النُهج الحالية مثل التحفيز بسلسلة التفكير أو هياكل المحولات المتكررة هو أن إعادة التدوير لا تتطلب رموز استدلال إضافية أو عمقًا هيكليًا مضافًا. إنها تعديل إضافي على طريقة تشغيل الاستدلال، وليست إعادة تصميم للنموذج نفسه.

إعلان

الأرقام صعبة تجاهلها

قام فريق DeepMind باختبار إعادة التدوير عبر عائلة نموذج Gemma3، بما في ذلك الإصدارات ذات 1 مليار و4 مليارات و12 مليار معلمة. وقد حققت إعادة التدوير الأساسية تخفيضًا تقريبيًا بنسبة 8.5% في مستوى الإرباك عبر تسعة مجموعات بيانات لنمذجة اللغة، مع عدم إضافة أي تأخير أثناء التوليد.

تم دفع إعادة التدوير التكيفي أبعد، مما أدى إلى خفض متوسط في التعقيد بنسبة 23% عبر نفس مجموعات البيانات التسعة. كمرجع، لم تتمكن التهذيب الكامل من تحقيق سوى خفض بنسبة 21.6%. في مهام الاستدلال، شهد معيار GSM8K زيادة نسبية بنسبة 21% في الدقة مع إعادة التدوير التكيفية.

هناك توازن. معالجة التعبئة المسبقة، وهي المرحلة التي تُهضم فيها النموذج المطالبة الأولية، تصبح متسلسلة تحت إعادة التدوير، مما يزيد من التكلفة الأولية لمعالجة المطالبة.

لماذا تهتم مجتمع الذكاء الاصطناعي

تمت إعادة إنتاج الورقة، المدرجة كـ arXiv:2608.17981، بشكل مستقل بالفعل. وقد أكدت تنفيذات GitHub على المكاسب في النماذج خارج عائلة Gemma، بما في ذلك Llama 3.2 1B. انتشرت المناقشات عبر مجتمعات البحث على منصات X ووسائل الإعلام التقنية الصينية.

يعمل إعادة التدوير على مستوى التفعيل، أسفل سطح توليد الرموز، مما يجعله مكملًا لتقنيات التحفيز مثل الاستدلال السلسلي، التي تستهلك رموز الإخراج وتضيف تأخيرًا.

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.