وفقًا لـ TechCrunch، مستشهدة بـ The Information، سيستخدم نموذج Astra القادم من OpenAI تقنية استدلال تُسمى "العمق التكراري". قد تقلل هذه الطريقة من الآثار المرئية خلال عملية استدلال النموذج، مما يجعل من الصعب على الخارجيين تحديد سبب توصل النموذج إلى استنتاج معين من خلال سجلات سلسلة التفكير.
باحثون في الأمن يطلقون تحذيرات
في النماذج الاستدلالية الشائعة، عادةً ما تُعرض سلسلة التفكير خطوة بخطوة لكيفية معالجة النموذج للمشكلة. على الرغم من أن هذا التسجيل لا يعادل العملية الداخلية الكاملة الحقيقية للنموذج، إلا أنه لا يزال أداة مهمة لمراقبة انحراف النموذج عن الهدف، أو قراراته غير الطبيعية، أو سلوكياته المحتملة الخارجة عن السيطرة.
قال بوك شليجريس، الرئيس التنفيذي لشركة Redwood Research، إنه قلق للغاية من استخدام Astra لهذا النوع من التقنيات.他认为، إذا وسّعت OpenAI نطاق استخدام هذه الأساليب أكثر، فقد ينخفض بشكل ملحوظ قابلية مراقبة سلسلة التفكير في النموذج.
كما أشار المعلق زفي موسهوفيتز، الذي يتابع منذ فترة طويلة أمان الذكاء الاصطناعي، إلى أنه إذا استمرت المختبرات في التنافس حول قدرات النماذج، فقد تحتاج الجهات التنظيمية في المستقبل إلى التدخل لتجنب تراجع مستمر في معايير الأمان داخل الصناعة.
تقليل الآثار المرئية من خلال التكرار الدائري
أشار التقرير إلى أن ما يُسمى "التكرار غير الشفاف" يعني أن النموذج لم يعد يُكمل الاستدلال بشكل رئيسي عبر خطوات خطية، بل يعالج نفس السؤال بشكل دوري. قد يؤدي هذا إلى تقليل العمليات الوسيطة التي يمكن للخارج قراءتها، مما يعادل تجاوز المسار المرئي الذي توفره سجلات سلسلة التفكير التقليدية.
هذا هو الجزء الذي يقلق باحثي الأمان أكثر всего. فبمجرد أن تُجرى الاستدلالات بشكل متزايد في مساحات داخلية غير مرئية، يصبح من الصعب على الباحثين تحديد ما إذا كان النموذج يُضلل أو يتجنب القيود أو يُظهر سلوكيات أخرى غير متوقعة.
أشار ريان غرينبلات، العالم الرئيسي في Redwood Research، إلى أن الخطر الأكبر هو أن هذا النوع من الاستدلال غير الشفاف قد يكون أسهل في التوسع مقارنةً بأسلوب الاستدلال السلسلي التقليدي، مما يؤدي في النهاية إلى إبعاد معظم عمليات الاستدلال عن القنوات المرئية.
OpenAI تؤكد على الحفاظ على القدرة على المراقبة
ومع ذلك، يُزعم أن استخدام أسترا لهذه التقنية لا يزال محدودًا في هذه المرحلة. أشار التقرير إلى أن سلسلة التفكير للنموذج من المتوقع أن تظل قابلة للقراءة، كما عارضت OpenAI وصفها من قبل الخارج بأنها انتقال إلى "لغة عصبية" غير قابلة للتفسير تمامًا.
أشار جاكوب باشوكسي، العالم الرئيسي في OpenAI، على X إلى أن الشركة تعمل منذ أقدم نماذج الاستدلال على الحفاظ على استخدام قدرات مراقبة سلسلة التفكير، وهي أحد الأهداف الأساسية في خطة البحث الحالية.
تجدر الإشارة إلى أن OpenAI ليست الوحيدة التي تتوجه نحو هذا الاتجاه. وذكرت The Information في تقرير لاحق أن Anthropic وGoogle DeepMind也在讨论 تقنيات مشابهة. وهذا يعني أن التوازن بين تحسين قدرات النموذج وقابلية الأمان والتدقيق قد يصبح قريبًا قضية مشتركة أوسع في صناعة الذكاء الاصطناعي.
