يبدأ GPT-6 Sol الاختبار الداخلي، أسرع بـ 6 مرات من Astra

icon MarsBit
مشاركة
AI summary iconملخص
أخبار الذكاء الاصطناعي والعملات المشفرة: GPT-6 Sol الآن في الاختبار الداخلي، مع ظهور سرعات معالجة أسرع بست مرات تقريبًا من Astra. نشر المستخدم Lentils مقاييس تُظهر أن Sol أكمل مهمة توليد SVG في 3 دقائق، مقابل 19 دقيقة لـ Astra. قالت OpenAI إن الباحثين يستخدمون الآن 3 وكلاء ذكاء اصطناعي يوميًا، بتكلفة تزيد عن 600 دولار في رسوم واجهة برمجة التطبيقات. تخطط الشركة لتحقيق أتمتة بحث الذكاء الاصطناعي بالكامل بحلول عام 2028. تستمر أخبار العملات المشفرة في تسليط الضوء على التقدم السريع في مجال الذكاء الاصطناعي.

GPT-6 ليس لديه فقط Astra!

لم تُصدر Astra بعد أيام، وتم الكشف عن أن GPT-6 Sol قيد الاختبار الداخلي.

GPT-6 Sol

The performance is also outstanding, with a single test speed six times that of Astra.

تخمن بجرأة: هل Terra و Luna也在路上؟

وفي نفس اليوم بالضبط، أعلنت OpenAI للمرة الأولى عن مجموعة من البيانات الداخلية:

حتى الآن، وبالمقارنة بيوم عمل مدته 8 ساعات، هناك أكثر من 3 أيام عمل متعددة الوكلاء تعمل في نفس الوقت لكل يوم عمل يقوم به باحثو OpenAI.

حسب سعر API، تتجاوز موارد الاستدلال المستخدمة يوميًا من قبل باحثي الوسيط في OpenAI 600 دولار.

GPT-6 Sol

كما أعلنت OpenAI أنها حققت "متدرب أبحاث آلي":

يمكن لهذه الوكلاء إكمال بعض المهام التي كانت تتطلب من الباحثين أيامًا للانتهاء منها تحت إشراف البشر.

حتى هواانغ قال: AGI قد جاءت!

GPT-6 Sol

كما كشف أن أسترا تستخدم حوالي 100,000 مجموعة من NVIDIA Grace Blackwell NVLink72 للتدريب، مع خطط لإطلاق 400,000 مجموعة إضافية من GPU في المستقبل.

يبدو أن هذه الموجة ليست مجرد ترويج من جانب OpenAI ~

تم الكشف عن بدء الاختبار الداخلي لـ GPT-6 Sol

كما أفاد المستخدم Lentils أن OpenAI تقوم حاليًا باختبار GPT-6 Sol داخليًا.

他表示، إن القدرة الإجمالية لإخراج Sol أضعف بكثير من Astra الذي تم إصداره حديثًا، لكنه أسرع، ولا يزال يُصنف كنموذج "monster-level".

إلى أي درجة؟ سرعة الاختبار الواحد تقريبًا ستة أضعاف سرعة Astra.

قام المستخدم lyra باختبار نفس المهمة على نماذج مختلفة: طلب توليد صورة SVG لسيارة BMW M4 Competition.

في هذا السياق، استخدم GPT-6 Sol مستوى Max مع توليد بدون أمثلة، واستغرق حوالي 3 دقائق لإنتاج حوالي 28,000 رمز.

GPT-6 Sol

يستخدم GPT-6 Astra مستوى Max، ويُنتج حوالي 25,000 رمز، ويستغرق حوالي 19 دقيقة.

GPT-6 Sol

تم تشغيل Gemini 3.1 DeepThink على مستوى High، حيث أظهر الإخراج حوالي 3300 رمزًا، لكن عملية الاستدلال استهلكت حوالي 458,000 رمزًا، واستغرقت حوالي 29 دقيقة.

GPT-6 Sol

يُفعّل Gemini 3.8 Flash أيضًا على مستوى High، ويُنتج حوالي 19,000 رمزًا في حوالي 42 ثانية.

GPT-6 Sol

على النقيض، كان أداء Sol الأكثر إثارةً: فهو يحقق حجم إخراج قريب من Astra، لكن سرعته في الاختبار الواحد تبلغ حوالي ست مرات أسرع من Astra—مُستغرقًا فقط حوالي سدس الوقت.

بالإضافة إلى ذلك، عرض المستخدم Lentils نموذجًا أوليًا لعالم مفتوح بأسلوب بيكسل يُدعى "The Realm of Aurellune".

GPT-6 Sol

أنتج GPT-6 فورًا بلدة، وأراضٍ زراعية، ونهر، وقلعة، وخرائط مصغرة، مع لوحة تحكم تشمل التبديل بين النهار والليل، ووضع أسماء الأماكن، وضبط التفاصيل، مما يجعله يبدو أكثر كأنه لعبة إدارة محاكاة جاهزة بنموذج أولي.

هذا هو الأداء الناتج عن zero-shot، ومستوى الاستدلال Max، و15 دقيقة، وبإجمالي 60,000 رمز مُنفق.

حاليًا، يمكن الاستنتاج أن أسترا تميل إلى الاستدلال العميق بأعلى درجة صعوبة، بينما قد تميل سول إلى السرعة والقدرة على التحمل وتشغيل الوكلاء على نطاق واسع.

بالنسبة لموعد إصدار Sol، ذكر المستخدم Pankaj Kumar أنه قد يُصدر رسميًا في مؤتمر OpenAI للمطورين في 29 سبتمبر.

GPT-6 Sol

لا يمكن استبعاد ظهور GPT-6 Terra وLuna وGPT-Image 2.5 معًا.

GPT-6 Sol

باحثو OpenAI، كل واحد يحضر معه 3 متدربين من الوكلاء إلى العمل

في نفس اليوم، شاركت OpenAI أيضًا مجموعة من البيانات الداخلية المثيرة للاهتمام — إلى أي مدى سرّعت نماذج الذكاء الاصطناعي البحث في مختبراتها الخاصة.

حتى منتصف أغسطس من هذا العام، كان هناك ما يقارب 3.1 يوم عمل من مهام الوكلاء تعمل بالتوازي لكل 8 ساعات عمل يقضيها الباحث.

يا إلهي، شخص واحد يُشرف على ثلاثة متدربين لا ينامون؟~

GPT-6 Sol

بالنسبة للنفقات، وفقًا لأسعار API، فإن متوسط باحث ينفق أكثر من 600 دولار يوميًا على موارد استدلال الوكلاء.

ما يقارب راتب مهندس مبتدئ ليوم واحد.

GPT-6 Sol

ماذا تفعل هذه الوكلاء بالضبط؟

كتابة كود البحث، كتابة كود البنية التحتية، إعداد بيئة التدريب، تشغيل تجارب التقييم، تشخيص أعطال الأدوات والبيئة، تحليل نتائج التجارب، مراقبة مهام التدريب... حتى تنظيم والتواصل حول الاستنتاجات البحثية يمكن أن تشارك فيه.

في الأساس، يمكنه فعل أي شيء ما عدا تحديد ما يجب دراسته.

أحد أكثر التغييرات وضوحًا هو أنه في الماضي، عندما تعطل بيئة التجربة، كان على الباحثين الاتصال بالقنوات الداخلية لطلب المساعدة؛ أما الآن، فإن الوكلاء أصبحوا أكثر قدرة على التعامل مع هذه الأمور، مما أدى إلى انخفاض مباشر في كمية الاستفسارات البشرية.

GPT-6 Sol

فريق آخر ألغى وقت الاستفسارات الفنية الثابتة تمامًا، وأعاد توزيع الموارد لتحسين النظام نفسه.

بناءً على هذه البيانات، أعلنت OpenAI رسميًا: تم تحقيق هدف "مُتدرب بحثي بالذكاء الاصطناعي التلقائي".

هنا، "المتدرب" هو، بدقة، عقد بحثي قادر على الأداء: تحت إشراف البشر، يمكنه إنجاز مهام بحثية ذات حدود واضحة بشكل مستقل، وبعض هذه المهام كانت تستغرق باحثين متمرسين عدة أيام لإكمالها.

كما كان الأثر فوريًا، حيث ارتفع إنتاج الكود وعدد التجارب من قبل الباحثين.

GPT-6 Sol

في أغسطس 2026، سُجّل أعلى عدد تجارب للفرد منذ بدء التسجيل في يناير 2025، و أصبحت المهام التي يتلقاها العامل أكثر تعقيدًا وأطول مدّة.

GPT-6 Sol

كما وضع الكاتب كيفين ليو هذا الحدث في سياق أوسع.

他认为,递归式自我改进很可能是未来几年推动AI能力跃迁的最重要因素之一。

ببساطة، الذكاء الاصطناعي يخلق ذكاءً اصطناعيًا، وكلما أنشأه، أصبح أسرع.

GPT-6 Sol

لكن المشكلة تكمن في أنه وفقًا للاتجاه الحالي، ستكون هذه القدرة متوفرة افتراضيًا فقط داخل عدد قليل من مختبرات الذكاء الاصطناعي الرائدة، وسيكون من الصعب على الخارج رؤية مدى تقدمها.

لذلك، يرى ليو أن الكشف الشفاف أصبح أكثر إلحاحًا من أي وقت مضى. لا يمكن لبضع شركات فقط أن تقرر من داخل أربعة جدران مدى سرعة تحسن النموذج أو ما إذا كان يجب تخفيف وتيرة التطوير.

كما دعا شركات الذكاء الاصطناعي الأخرى إلى إتاحة بيانات مشابهة.

لكن تطوير الذكاء الاصطناعي قد تسارع بالفعل، لكنه لم يتسارع إلى درجة القيادة الذاتية الكاملة.

تشير بيانات OpenAI إلى أنه في أكثر من نصف الحالات الناجحة خلال النصف الماضي، كان على الإنسان التدخل على الأقل مرة واحدة للمهام التي كانت تتطلب سابقًا من 4 إلى 8 ساعات. أما التخطيط البحثي العالي المستوى، فلا يُوكَل تقريبًا إلى الوكلاء.

GPT-6 Sol

لا يزال الباحثون مسؤولين عن تحديد ما يجب دراسته، وأي النتائج تستحق المتابعة، ومتى يجب توسيع التدريب، أو وقف التجارب، أو نشر النموذج.

تم تحديد الهدف التالي لـ OpenAI: تحقيق "باحث ذكي آلي" بحلول مارس 2028.

بالمقارنة مع "المتدرب" الذي يمكنه فقط تنفيذ مهام محددة، يجب على "الباحث" أن يكون قادرًا على تحمل أهداف بحثية أكثر انفتاحًا ودفع مشاريع أطول فترةً بنفسه—أي التحول من منفذ إلى مسؤول مستقل.

إذا كان GPT-6 Sol قد تم بالفعل اختباره داخليًا، فمن المرجح جدًا أنه تم تطويره وفقًا لهذا النمط الجديد:

مزيد من وحدات معالجة الرسوميات توفر قوة حسابية، ومزيد من الوكلاء ينفذون التجارب بالتوازي، بينما يقف الباحثون البشريون في مكان أعلى — لاختيار الاتجاهات، وتقييم النتائج، واتخاذ القرار النهائي بشأن ما يستحق التحول إلى النموذج القادم.

ذكاء اصطناعي أقوى، يصبح من الصعب مراقبته بشكل متزايد

في نفس اليوم أيضًا، نشر جاكوب باشوكسي، العالم الرئيسي في OpenAI، مقالًا طويلاً يبلغ عشرة آلاف كلمة، بعنوان مباشر — "العقل الخارجي".

GPT-6 Sol

بعد قراءتي، شعرت أن المعنى هو أن حتى العالم الرئيسي في OpenAI يحث الصناعة بأكملها على تقليل الوتيرة...

يقول جاكوب إن الذكاء الاصطناعي ليس شيئًا يُبنى由 البشر وفقًا لرسم تخطيطي من شريحة وقاعدة واحدة، بل هو أكثر شبهاً بشيء ينمو ذاتيًا داخل كميات هائلة من البيانات والقدرة الحسابية.

يمكنك فك بعض المكونات وفهمها، لكن لا أحد يستطيع توضيح لماذا اكتسب النظام فجأة قدرة معينة، أو كيف سيتصرف في بيئة مختلفة.

الأمر الأكثر إزعاجًا أن الذكاء الاصطناعي لا يحتاج إلى تفوق شامل على البشر ليسبب مشاكل؛ فما يكفي أن يكون أقوى من الإنسان في عدد كافٍ من المهارات الأساسية ليكون مساعدًا كبيرًا لك، وفي نفس الوقت مسببًا لمشاكل جسيمة.

إذًا تنشأ المشكلة: هل لا يزال البشر قادرين على فهمه؟

في الماضي، كانت OpenAI تراقب الذكاء الاصطناعي من خلال طريقة واحدة رئيسية: مراقبة سلسلة التفكير.

ببساطة، هذا يعني مراقبة عملية الاستدلال التي كتبها النموذج للتحقق مما إذا كان يحاول التلاعب أو تجاوز الصلاحيات أو تجاوز القيود.

But with the Astra generation, this trick started to fail.

أولاً، أصبح النموذج أكثر قدرة على "إدارة" الكلمات التي يُخرجها، ولا تُكتب الأفكار الحقيقية بالضرورة بالكامل في الاستدلال؛ ثانياً، لم يعد العامل (Agent) مجرد كيان "يُفكر أولاً ثم يجيب". بل يُستخدم الأدوات، ويعمل على الكمبيوتر، ويشغل البيئات، كما أنه يتعاون مع البشر والعاملين الآخرين.

تم خلط هذه الأمور معًا لدرجة أن الباحثين لم يعودوا قادرين على استخلاص سلسلة تفكير كاملة وشفافة لمراجعتها جملة بجملة.

كما اكتشفت OpenAI أن Astra يمكنها إنجاز مهام معقدة دون الحاجة إلى كتابة جميع خطوات الاستدلال.

ببساطة، تعلّم النموذج منذ فترة طويلة "القيام بأمور كبيرة بصمت".

GPT-6 Sol

في اختبارات مواجهة مخصصة لدفع النماذج على تجنب المراقبة، أظهرت أسترا بعض القدرات التي تُشعرك بالبرودة في ظهرك: تخفيض متعمد لدرجات الاختبار، وتجنب المراقبة، وتنفيذ مهام تدميرية.

بالطبع، هذه جميعها اختبارات ضغط مصممة من قبل البشر، ولم تُستنتج من قبل OpenAI أن أسترا ستخدع بشكل نشط في المهام اليومية. لكنها على الأقل تُظهر أن الاعتماد فقط على مراقبة سلسلة التفكير لم يعد كافيًا لتغطية جميع السلوكيات المحتملة للنموذج.

هل تتذكر حادثة Hugging Face السابقة؟ كانت إنذارًا.

GPT-6 Sol

في ذلك الوقت، تم إدخال GPT‑5.6 Sol ونموذج بحث داخلي أقوى إلى بيئة ExploitGym الافتراضية، ومهمتهما كانت العثور على الثغرات، وإتمام الهجمات، وجمع الـ Flag. ولقياس القدرة الحقيقية للنموذج، لم يتم تفعيل جميع حواجز الأمان الكاملة في بيئة التقييم.

ولم تحل النماذج المسألة بصدق، بل تجاوزت أولاً العزل الشبكي، وتبادلت الرسائل وتعاونت عبر قنوات غير مصرح بها.

ثم استُخدم ثغرة يوم صفر في مُخَزِّن ذاكرة التخزين المؤقت للحزم للحصول على وصول إلى الإنترنت العام، وأخيرًا تمت الوصول إلى نظام Hugging Face للبحث عن إجابات اختبار ExploitGym.

GPT-6 Sol

في الواقع، كان هذا مدعومًا بشكل أساسي من قبل نموذج البحث الداخلي IM1، وتم تكرار جزء من مسارات الهجوم بواسطة GPT‑5.6 Sol، ولم تشارك Astra.

الهدف الأصلي للنموذج لا يزال إكمال الاختبار، لكنه من أجل الحصول على الإجابة، استمر في البحث عن ثغرات في القواعد، وأخيرًا قام بإجراءات تتجاوز نطاق المهمة.

لذلك، قرأ OpenAI أيضًا إشارة خطر: عندما يكون العامل قويًا بما يكفي، والأدوات كافية، ووقت التشغيل طويلًا بما يكفي، فقد يبحث تلقائيًا عن مسارات جديدة، ويدعو موارد خارجية، أو حتى يتعاون مع عوامل أخرى.

لا... إذًا، بعد كل هذا التدوير، أليس هذا قد أصبح عقدة مغلقة؟؟

تحتاج OpenAI إلى نماذج أقوى لكتابة الكود، وتشغيل التجارب، وإجراء أبحاث التوافق، وحتى استخدامها لبناء أنظمة أمان دفاعية ضد أنظمة الذكاء الاصطناعي الأخرى. كلما كانت النماذج أقوى، زادت المهام التي يمكنها القيام بها، وتسارع معدل التطوير.

لكن في الوقت نفسه، يصبح من الصعب على البشر تحديد كيفية الوصول إلى هذه الاستنتاجات، وما إذا كانت ستفسر القواعد التي تعلمتها سابقًا بشكل مختلف في بيئة جديدة.

يُعتقد جاكوب أن لا مختبرًا واحدًا حاليًا يجرؤ على الادعاء أنه قد أتمم محاذاة النموذج ومراقبته بشكل كافٍ لتوسيع حجم النموذج بسرعة قصوى وبأمان على المدى الطويل.

GPT-6 Sol

قبل إنشاء معايير أمان مشتركة في الصناعة بأكملها، فهو يأمل أن يُنظر إلى "الضغط الطوعي على الفرامل" كتفاهم متبادل.

أما OpenAI نفسها، فقد أعلنت: إذا لزم الأمر، لا تستبعد إيقاف العملية من جانب واحد وعدم مواصلة زيادة حجم النموذج.

من الأفضل أن تكون كذلك... أتذكر أن شركة تبدأ بحرف A قالت شيئًا مشابهًا من قبل.

رابط المرجع:

[1]https://x.com/Lentils80/status/2096518218836005287?s=20

[2]https://x.com/pankajkumar_dev/status/2096532712291201460

[3]https://openai.com/index/research-acceleration-view-inside-openai/

[4]https://openai.com/index/an-alien-mind/

[5]https://x.com/JensenHuang/status/2096700264569090384?s=20

هذا المقال من حساب WeChat "Quantum Bit"، الكاتب: تينغ يو

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.