source avatarsleepy.md

مشاركة

في الواقع، قامت ByteDance بالفعل بعرض هذا "الابتكار" من OpenAI Astra العام الماضي. تسمى هذه الطريقة "العمق التكراري". ببساطة، لا تعتمد فقط على توليد CoT أطول للتفكير لفترة أطول، بل تجعل نفس مجموعة كتل Transformer تدور مرارًا وتكرارًا على الحالة المخفية، لدفع المزيد من الحسابات إلى مساحة الكامنة. للمشاكل الصعبة، تُجري عدة جولات؛ للمشاكل البسيطة، تخرج مبكرًا. لا تحتاج المعلمات إلى التوسع مع عمق الاستدلال، ويمكن توزيع حسابات وقت الاختبار بشكل أكثر مرونة. في أكتوبر من العام الماضي، أطلقت ByteDance Seed وفتحت مصدر Ouro، وهي نموذج لغوي متكرر. Ouro-1.4B و2.6B أضافتا مباشرة التفكير الكامن التكراري أثناء التدريب المسبق، حيث يُجري 2.6B احتسابات تكرارية متعددة افتراضيًا، مع دعم الخروج التكيفي، مما يسمح لكل سؤال بتحديد عدد الجولات التي يحتاجها بنفسه. في ذلك الوقت، كانت هذه مجرد فرعية صغيرة تحققها ByteDance بنماذج صغيرة، لكنها الآن أُدخلت في أحدث نماذج OpenAI. هذا يعني أن العمق التكراري لم يعد مجرد تصميم "مثير للاهتمام" من الناحية الأكاديمية، بل بدأ يدخل في مسار هندسي حقيقي للنماذج الكبيرة من الجيل التالي. والمشاكل التي تطرحها أكثر تعقيدًا من مقاييس الأداء. في الماضي، كان توسيع قدرة النماذج على الاستدلال يعتمد كثيرًا على الحسابات المكتوبة في CoT. كلما طال تفكير النموذج، زاد عدد رموز الاستدلال التي يُنتجها. وعلى الرغم من أن CoT لا يعادل الحالة الداخلية الكاملة للنموذج، إلا أنه على الأقل كان نافذة مراقبة آمنة. العمق التكراري سيستمر في نقل المزيد من الحسابات إلى مساحة الكامنة. يمكن لمجموعة واحدة من المعلمات أن تدور مرارًا وتكرارًا داخل الحالة المخفية، حيث يكتمل جزء كبير من الحسابات الداخلية للنموذج، ثم يُنتج فقط فقرة قصيرة في النهاية. وهنا تظهر مشكلة واقعية جدًا: مكان إتمام الاستدلال الحقيقي للنموذج يبتعد تدريجيًا عن اللغة الطبيعية. وهذا بالضبط ما يقلق الباحثين بشأن Astra. لقد كانت OpenAI دائمًا تولي اهتمامًا كبيرًا لمراقبة سلسلة التفكير، لأن النموذج إذا كان يخطط للغش أو استغلال المكافآت أو تجاوز القواعد، غالبًا ما يُظهر نواياه أولًا في CoT. لكن إذا حدث越来越多 من الاستدلال داخل الحالة الكامنة، فماذا يمكنك مراقبته؟ يُقال إن OpenAI تقيّد حاليًا بشكل متعمد درجة استخدام Astra للعمق التكراري، بهدف الحفاظ على المزيد من CoT القابلة للقراءة، مع توظيف إضافي لمراقبة الحالة والسلوك الداخلية. هذه المسألة مثيرة حقًا. على مدار السنوات القليلة الماضية، كان مسار توسيع قدرة النماذج الكبيرة على الاستدلال واضحًا جدًا: أعطه المزيد من الرموز، واجعله يقول المزيد. قد يصبح المسار القادم: أعطه المزيد من الدورات الداخلية، لكنه لن يحتاج إلى إخبارك بهذه العمليات.

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.