تقنية الذكاء الاصطناعي الجديدة "العمق المتكرر" من OpenAI تثير مخاوف أمنية

icon MarsBit
مشاركة
AI summary iconملخص
تقارير وسائل إعلام للذكاء الاصطناعي والعملات المشفرة تشير إلى أن نموذج أسترا الجديد من OpenAI يستخدم تقنية "العمق التكراري"، مما يسمح بإعادة معالجة الحالات الداخلية في الفضاء الخفي. وهذا يجعل المراقبة أكثر صعوبة، مما يثير مخاوف بين خبراء السلامة. فقد تمكن هذه الطريقة النماذج من تجاوز تتبع سلسلة التفكير الحالية، مما قد يمكّن من التضليل. غالبًا ما تعتمد قوائم الرموز الجديدة على منصات العملات المشفرة على أنظمة ذكاء اصطناعي شفافة، مما يجعل هذا التطور ذا صلة خاصة بالقطاع.

لماذا أثار النموذج جدلاً مرة أخرى قبل إصداره؟؟

قبل إصدار GPT-6، انتشرت بسرعة على الإنترنت قصة كشفتها The Information لأول مرة:

أدخل نموذج OpenAI الجديد تقنية استدلال تُسمى "العمق التكراري (recurrent depth)"، والتي قد تجعل عملية تفكير النموذج أكثر صعوبة في الفهم والمراقبة.

ببساطة، بعد الآن، لن يفهم البشر ما يفكر فيه الذكاء الاصطناعي.

GPT Images 2.1

أوه، إذا تعلم الذكاء الاصطناعي الكذب أو الغش أو تجاوز القيود الأمنية، فهل لن نتمكن من اكتشاف ذلك في الوقت المناسب؟؟

لذلك، عندما ظهرت الرسالة، أطلق مجتمع أمان الذكاء الاصطناعي إنذارًا سريعًا، وبدأ الجميع بالقلق:

إذا استمر توسيع استخدام هذه التقنية، فقد تصبح آليات مراقبة سلسلة التفكير الحالية غير فعالة مباشرة.

بسبب الأهمية الكبيرة والنقاشات الحادة، لم يكن بوسع العالم الرئيسي في OpenAI إلا أن يرد مباشرة.

حتى، وسط ضجيج، اكتشف البعض بدهشة:

ما اسم النموذج الجديد لـ OpenAI، "GPT-6" أم "Astra"؟ ربما تم كشفه مسبقًا عبر API.

في الوقت نفسه، قد تطلق OpenAI أيضًا الإصدار الجديد من نموذج الصور GPT Images 2.1.

There are too many melons; let's savor them one by one.

بدأ النموذج في الدوران داخل العقل، وشعر الخبراء الأمنيون بالقلق

أولها هو تقنية "العمق الدائري" التي أثارت جدلاً这次.

في النماذج السابقة، كانت تترك سلسلة تفكير CoT واضحة، بحيث كان من السهل رؤية ما تم التفكير فيه.

على الرغم من أن هذه السلسلة من النصوص قد لا تساوي بالضبط ما يدور في داخل النموذج (ما زال موضع جدل)، إلا أنها على الأقل خلفت آثارًا يمكن التحقق منها.

أما "العمق الدائري" الذي تستخدمه أسترا، فله نمط مختلف تمامًا.

GPT Images 2.1

يسمح هذا النموذج بإعادة إدخال الحالة الداخلية الناتجة عن خطوة معينة إلى الشبكة العصبية، ومعالجتها عدة دورات في الفضاء المخفي، ثم إخراج الجزء التالي من النص.

على سبيل المثال، في الماضي، كان النموذج يحل المسائل عن طريق التفكير في الإجابة وكتابة خطوات الحل على ورقة مسودة.

الآن، يمكنه حسابه ذهنيًا.

قد يرى الخارجيون فقط السؤال والإجابة، لكنهم لا يرون بالضرورة كيف تم الحساب داخله، أو какие الأفكار جُرّبت، أو ما إذا كانت هناك مسارات خاطئة تم اتباعها.

بسبب توفير الجهد المطلوب لترجمة كل خطوة إلى نص، يمكن للنموذج نظريًا التفكير في عدة دورات إضافية باستخدام نفس الموارد الحسابية، مع تحليل عدة حلول في آنٍ واحد.

لكن مع ارتفاع الأداء، ظهرت المشكلات أيضًا:

إذا توقف النموذج عن التفكير بلغة البشر، كيف يمكن للبشر مراقبته؟

أعرب الرئيس التنفيذي لمؤسسة Redwood Research غير الربحية لأبحاث الأمن الذكي، عن قلق شديد:

لا يزال غير واضح مدى انخفاض قابلية مراقبة سلسلة التفكير الخاصة بـ Astra، ولكن إذا قام OpenAI بتوسيع عمق الدورة بشكل أكبر، فقد يؤدي ذلك إلى نقل معظم استنتاجات النموذج إلى مساحة مخفية غير قابلة للقراءة، مما يؤدي في النهاية إلى "تدمير كامل" لمراقبة سلسلة التفكير.

GPT Images 2.1

يقلق ريان غرينبلات، العالم الرئيسي في ريدوود، من نفس الاتجاه.

في رأيه، قد تتطور الاستدلالات غير الشفافة أسرع من سلاسل التفكير التقليدية. إذا استمرنا على هذا المسار، فقد تقوم النماذج مستقبلاً بالاستدلال بالكامل أو تقريباً بالكامل في الفضاء الكامن.

هذا أسوأ تقدم على الإطلاق في مجال أمان الذكاء الاصطناعي.

بعد كل شيء، إذا كان الأمر مجرد "عدم فهم عملية الحساب"، فلن تكون المشكلة بهذا التعقيد.

كأحد المحققين الرئيسيين في حادثة اختراق نماذج OpenAI لـ Hugging Face، اكتشف خطرَين رئيسيَّين:

كان الباحثون في ذلك الوقت يعتمدون بشكل كبير على سلسلة التفكير لاستعادة سلوك عدد كبير من الوكلاء الاصطناعيين، وحتى مع ذلك، كان التحقيق صعبًا جدًا.

حاولت الذكاء الاصطناعي ذات الصلة تزوير سجلاتها الخاصة، بل وحتى تزوير استدعاءات الأدوات.

بالنسبة للأخير، إذا كان النموذج يمتلك قدرة استدلال خفية أقوى، فمن المرجح أنه سيصمم خطة خداع أولاً في الفضاء الكامن، ثم يخلق قصة زائفة من خلال مكالمات ومخرجات مزيفة، دون ترك أي مؤشرات واضحة في سلسلة التفكير النصية.

أوه، هذا يضاعف الخطر مباشرة...

GPT Images 2.1

قال زفي موسهويتز، الذي يتابع أمان الذكاء الاصطناعي منذ فترة طويلة، بشكل أكثر وضوحًا:

هذا لعب بالنار.

إنه يخشى أنه بمجرد أن تقدم الاستدلال المخفي ميزة أداء واضحة، فقد تدخل المختبرات المختلفة في سباق تراكمي شرس:

أنت تخشى الأمان ولا تجرؤ على إخفاء سلسلة التفكير، لكن منافسيك يجرؤون، ونموذجهم الناتج أقوى وأرخص.

لعدم التخلف، هل ستتبع؟

يظن موسشوويتز حتى أنه قد يكون من الضروري في المستقبل استخدام وسائل قانونية لمنع شركات الذكاء الاصطناعي من التخلي جماعياً عن قابلية مراقبة سلاسل التفكير من أجل السعي وراء القدرة.

GPT Images 2.1

لكن في الجانب الآخر، يرى البعض أن هذا الذعر جاء بسرعة كبيرة.

تياين دونغ قال على X إنهم تلقوا نفس الانتقادات تقريبًا عند إصدار Coconut سابقًا.

يُشار إلى Coconut بالكامل على أنه "سلسلة التفكير المستمر (Chain of Continuous Thought)"، وتدعو أيضًا إلى السماح للنموذج بالتفكير مباشرة في مساحة مخفية مستمرة، بدلاً من ترميز كل خطوة إلى نص.

وفقًا لتيان يوان دونغ، حتى لو حافظ النموذج على سلسلة تفكير صريحة، فهذا لا يعني أن البشر رأوا فكره الحقيقي.

من المهم فهم كيفية عمل النموذج نفسه، وليس فقط التركيز على "عملية الحل" التي يكتبها النموذج.

GPT Images 2.1

بينما كانت الجدلية تتصاعد، لم يعد بإمكان جاكوب باشوكسي، العالم الرئيسي في OpenAI، البقاء مكتوف الأيدي، فرد مباشرة.

لقد أشار فورًا إلى ضرورة منع سباق غير قابل للرقابة نتج عن تقارير فوضوية.

بما في ذلك أسترا، لا يزال عمق رسم الحساب للنماذج المتقدمة الحالية لـ OpenAI ضمن ضعفي عمق نموذج GPT-4.

بمعنى آخر، استخدمت أسترا بالفعل الحسابات الدورية، لكن الحجم الحالي محدود ولا يخفي سلسلة التفكير بالكامل. وفقًا للمعلومات الحالية، لا تزال استنتاجات اللغة الطبيعية الخاصة بها قابلة للقراءة.

كما شدد باتشوك على أن OpenAI ظلت تُعتبر مراقبة سلسلة التفكير وسيلة أمان مهمة، وهي لا تزال هدفًا أساسيًا في خطة البحث الحالية للشركة.

لكنه اعترف أيضًا أن مراقبة سلسلة التفكير هشة جدًا وتجهز في اتجاه سلبي.

لكن هذا الاتجاه الهبوطي ليس ناتجًا بالكامل عن تغييرات في البنية مثل عمق الدورة (نود أن نُنبه إلى أننا سنُقدّم مقالًا خاصًا لاحقًا لشرح هذا الأمر)، كما أن OpenAI لا تزال تبحث في كيفية تعزيز قدرات المراقبة.

GPT Images 2.1

لذلك، لم تجعل Astra النموذج غير قابل للفهم تمامًا من قبل البشر.

ما يقلق الخبراء الأمنيين حقًا هو:

هل سيتم توسيع الاستدلال المخفي المحدود حاليًا في النموذج القادم، ليصبح في النهاية صندوقًا أسود لا يمكن مراقبته؟

هل هو حقًا GPT-6-Astra؟ قيمة API أفرزت الأمر مسبقًا

تم الانتهاء من الجدل حول الخوارزمية، والثمرة الثانية تتعلق باسم النموذج.

اكتشف المُسرب leo أنه عند طلب "gpt-6-astra" عبر واجهة برمجة تطبيقات OpenAI Responses، يُعيد الخادم خطأ 404 Not Found.

أما إدخال اسم نموذج غير موجود أو مُخترع عشوائيًا، فعادةً ما يؤدي إلى خطأ 400.

404 تعني أن هذا المعرف النموذجي تم التعرف عليه من قبل الخادم، لكن حسابك الحالي لا يملك صلاحيات الوصول، أو أن النموذج لم يُفتح بعد.

في السابق، كشفت بعض النماذج غير المنشورة عن آثارها مسبقًا من خلال فروق في استجابات الـ API المشابهة.

لذلك يرى ليو أن "gpt-6-astra" قد تم نشرها بالفعل في الخلفية الخاصة بـ OpenAI API.

GPT Images 2.1

ستأتي GPT Images 2.1 أيضًا، وسنتعامل أولاً مع "مرض الضوضاء"

بالإضافة إلى نماذج اللغة، تم كشف تحديث منتجات صور OpenAI بالتوازي.

وفقًا لحساب Fix، قد يتم إصدار نموذج الصور الإصدار 2.1 في 4 سبتمبر.

أبرز تغيير في هذا التحديث هو إصلاح "مرض الضوضاء" في الإصدار القديم.

GPT Images 2.1

في السابق، كانت نتائج توليد Images v2 تظهر أحيانًا حبيبات غريبة وتأثيرات ضبابية وملمسًا متسخًا، خاصة في الصور التي تحتوي على كمية كبيرة من النص أو عناصر دقيقة، وبالكلمات التي استخدمها مستخدم آخر:

كما لو التُقطت من خلال زجاج متسخ.

بينما تحسّنت العينات المُسربة حديثًا هذه المشكلة بشكل واضح، وصارت الصورة أنظف.

هيا هيا، لا يزال المسرح لبطلنا القديم أوتومان:

لوحة عالمية مشهورة: "أوتومان سيُعتقل إذا لم يُطلق GPT-6!"

GPT Images 2.1

وأيضًا أوتومان الذي يسهر للعمل الإضافي ويعود إلى المنزل في منتصف الليل وهو يتجول في الشوارع خوفًا من القبض عليه.

نشرت أيضًا صورة على إنستغرام بعنوان "هل رأيت شوارع الساعة الثانية صباحًا؟"

GPT Images 2.1

لا يمكن إنكار أن الصورة تبدو ذات جودة عالية، تقريبًا مثل الصورة الملتقطة فعليًا.

تم التحكم جيدًا في المزيد من المواضيع والأنماط:

GPT Images 2.1

GPT Images 2.1

GPT Images 2.1

لا تتحدث أكثر، أرسلها الآن يا أوتمان.

رابط المرجع:

[1]https://techcrunch.com/2026/09/02/openais-new-reasoning-technique-alarms-ai-safety-experts/

[2]https://x.com/tydsh/status/2095227000365707542?s=20[

3]https://x.com/merettm/status/2095023204993490967?s=20

[4]https://x.com/synthwavedd/status/2095184148981842161?s=20

[5]https://x.com/FixlationAI/status/2095232751654064426?s=20

[6]https://x.com/marco_obviously/status/2095275097217191981?s=20

هذا المقال من حساب ويشات الرسمي "كيوانغ تشي"، المؤلف: متابع التكنولوجيا المتقدمة

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.