تطلق OpenAI GPT-6 Astra مع قدرات محسّنة على تشغيل الحواسيب والأمان السيبراني

iconMetaEra
مشاركة
AI summary iconملخص
أطلقت OpenAI GPT-6 Astra في 3 سبتمبر 2026، مع تحسينات في تشغيل الحواسيب، والبرمجة، ومهارات الأمن السيبراني. خفّض Astra متوسط وقت المهمة في OSWorld من 75 إلى 40 دقيقة، وحقق 72.6% في OSWorld 2.0. ووجد ثغرات صفرية متعددة، ووصل إلى مستوى الأمن السيبراني "الحرج". ومع ذلك، فإن استدلاله الأقصر يثير مخاوف بشأن الشفافية. تقول OpenAI إن Astra يُظهر تقدمًا لكنه ليس ذكاءً عامًا اصطناعيًا. بالنسبة للمتداولين، قد يؤثر هذا التحديث على مستويات الدعم والمقاومة في الأسواق المدعومة بالذكاء الاصطناعي. وقد يحتاج الاستثمار القيمي في العملات المشفرة إلى إعادة تقييم مخاطر التكامل طويل الأجل للذكاء الاصطناعي.
أصدرت OpenAI GPT-6 Astra في 3 سبتمبر 2026، مع تحسينات رئيسية في تشغيل الحواسيب، والبرمجة، والبحث العلمي، ومهام الوكلاء الطويلة. أظهرت الاختبارات الرسمية أنه قلل متوسط وقت المهمة من حوالي 75 دقيقة في GPT-5.6 Sol إلى 40 دقيقة بدقة أعلى في تقييم تشغيل النظام OSWorld؛ كما حقق تقدمًا ملحوظًا في معايير الوكيل العلمي، والمكاتب الآلية، وبعض معايير البرمجة. والأكثر إثارةً هو قدرته على الأمن السيبراني: اكتشف Astra تلقائيًا عدة ثغرات غير معروفة، وأنجز سلاسل استغلال تستهدف متصفحات وأنوية أنظمة التشغيل، ليصبح أول نموذج من OpenAI يصل إلى مستوى "حرج" في القدرات الأمنية السيبرانية. أظهرت اختبارات الأمان أنه أكثر استعدادًا من النموذج السابق للالتزام بحدود المهمة، لكن النظام نفسه اعترف بأن الاستدلال الكتابي لـ Astra أقصر وأصعب في المراقبة، وأكثر كفاءة في تجنب كشف سلسلة التفكير في الاختبارات الخاضعة للرقابة. إنه نموذج وكيل يشهد قفزة في القدرات والمخاطر معًا، لكن ما يسميه مسؤولو OpenAI بـ"عصر الذكاء العام الاصطناعي" لا يزال تقييمًا داخليًا للشركة؛ فقد أوضح جائزة ARC بوضوح أنه حتى لو حقق Astra أداءً شبه كامل على معاييره، فهذا لا يثبت تحقيق الذكاء العام الاصطناعي.

مؤلف المقال، المصدر: OpenAI

أسترا لا تجيب فقط على الأسئلة، بل تنفذ المهام مباشرة على الكمبيوتر

تُسمّي OpenAI GPT-6 Astra أذكى نموذج وأكثره توافقًا حتى الآن، لكن التركيز الحقيقي في هذا الإصدار ليس على جودة المحادثة، بل على قدرة النموذج على استخدام المتصفح وبرامج سطح المكتب والطرفية والأدوات المتخصصة لإكمال مهمة من البداية إلى النهاية.

يغطي العرض التوضيحي الرسمي ملء نماذج الضرائب الأمريكية، والبحث عن شقق ووظائف، وتحديث ملفات العملاء في نظام إدارة علاقات العملاء، وإنشاء تحليلات Power BI، وتصميم لوحات الدوائر، وتشغيل برامج علمية، وإنشاء مواقع ويب، ونمذجة المشاهد في Blender ثم استيرادها إلى Unreal Engine.

في مهام OSWorld 2.0 غير المتصلة، حقق Astra 72.6٪، وهو أعلى من 65.7٪ لـ GPT‑5.6 Sol و70.2٪ لـ Claude Opus 5. والأهم أن محاكاة التأخير من OpenAI أظهرت أن Astra يستغرق في المتوسط حوالي 40 دقيقة لإكمال كل مهمة، بينما يستغرق Sol حوالي 75 دقيقة، بانخفاض في الوقت بنسبة حوالي 47٪.

بعد التوافق مع إطار عمل Codex الجديد، فإن سرعة إنجاز مهام Astra على معيار Mind2Web للعمل على الويب تبلغ حوالي 1.9 مرة أسرع من تجربة Sol. كما أنها تكمل التفاصيل غير المهمة بناءً على السياق، وتطرح أسئلة في النقاط التي قد تؤثر على النتائج؛ وإذا لم يُرد المستخدم مؤقتًا، فتستمر في تنفيذ الأجزاء التي لا تعتمد على الإجابات.

كثير من الاختبارات تتفوق، لكنها ليست متفوقة تمامًا على جميع النماذج

في Terminal-Bench 4.0 الذي يركز على العمليات النهائية والمهام البرمجية المعقدة، حققت Astra 57.9٪، متفوقة على Claude Fable 5.1 بـ 55.8٪، وClaude Opus 5 بـ 52.3٪، وGPT-5.6 Sol بـ 37.3٪.

في اختبار DeepSWE v1.1 للهندسة البرمجية الحقيقية، حصل Astra على 74.1٪، لكن الفرق ضئيل جدًا مقارنة بـ Gemini 3.8 Flash الذي حصل على 73.8٪ وClaude Opus 5 الذي حصل على 73.7٪. في اختبار FrontierCode الرئيسي، حصلت على 53.3٪، وهو ما يقل قليلاً عن بعض نماذج Claude.

في الجوانب المهنية، ارتفع أسترا من 18.1% إلى 41.4% في AutomationBench؛ ووصل إلى 95.9% في BenchCAD لاستعادة الأجسام ثلاثية الأبعاد من صور متعددة الزوايا، مقارنة بـ 83.3% لـ Sol. كما بلغت نتائج Agents’ Last Exam 59.3%، وهي أعلى من 55.5% لـ Opus 5، مع استخدام حوالي 65% أقل من وحدات الإخراج في هذا التكوين.

لكن مؤشر الذكاء الشامل Artificial Analysis المذكور من قبل OpenAI، يسجل Astra بـ 61.2، وهو أقل من 65.7 لـ Claude Fable 5.1 و63.1 لـ Opus 5. وفي اختبار Humanity’s Last Exam مع الأدوات، فإن نسبة Astra البالغة 57.2% أقل أيضًا من عدة نماذج Claude.

لذلك، الاستنتاج الأكثر أمانًا هو أن أسترا أظهرت تحسنًا ملحوظًا في عمليات الكمبيوتر، ووكلاء العلوم، وبعض المهام الآلية، لكن لا يمكن استنتاج أنها النموذج الأقوى في جميع المهام المعرفية والمهنية بناءً على بضعة معايير قريبة من الدرجة الكاملة.

ARC قريب من الدرجة الكاملة، لكن الأداء يعتمد بشكل كبير على إطار عمل العامل

أحد أكثر البيانات وضوحًا من OpenAI هو أن Astra حققت 99.9% على ARC‑AGI‑3.

يضع هذا الاختبار النموذج في بيئة تفاعلية ثنائية الأبعاد غير مألوفة، دون إخباره مباشرة بالهدف أو القواعد. يجب على الوكيل تجربة حركات مختلفة، ومراقبة تغيرات البيئة، واستنتاج القواعد، ثم وضع خطة لإكمال المهمة.

كشفت البيانات التفصيلية المنشورة لجائزة ARC عن فرق مهم: تحت إطار التشغيل القياسي المشترك لجميع الموردين، حقق Astra أفضل نتيجة بنسبة 62.7%، بتكلفة تقديرية تبلغ حوالي 26,100 دولار أمريكي؛ وبعد استخدام إطار OpenAI Provider Adapter، ارتفعت النتيجة إلى 99.9%، بتكلفة تبلغ حوالي 18,800 دولار أمريكي.

يُمكن لمحول المزود الاحتفاظ بحالة استدلال غير مرئية عبر مكالمات متعددة، وضغط المحادثات الطويلة، مما يسمح للنموذج بإعادة استخدام نتائج الاستكشاف السابقة. بمعنى آخر، فإن 99.9% تقيس القدرة الإجمالية لـ "أسترا بالإضافة إلى نظام إدارة سياق OpenAI"، وليس مجرد مكالمة نموذجية مستقلة.

مع ذلك، كانت النسبتان 62.7% و99.9% أعلى مستويات مسجلة في ظروفهما على التوالي. كما تُنشئ أسترا رموزًا موجزة ذاتيًا للألعاب غير المعروفة لتسجيل الإحداثيات والقواعد والحالة الحالية وخطة متعددة الخطوات؛ وفي اختبارات مُحوّل المزود، أكملت 96% من المستويات باستخدام عدد إجراءات أقل من الوسيط البشري، بمتوسط أقل بنسبة 51.7%.

اعتبرت ARC Prize هذا تطورًا واضحًا في القدرة، لكنها شددت بشكل خاص على أن بيئة الاختبار مغلقة والقواعد محددة والأهداف محدودة، وأن تحقيق الحد الأقصى للمعيار لا يعني إثبات تحقيق AGI.

التقدم العلمي لا يُقاس فقط بدرجات الإجابات

في Terminal‑Bench Science 0.1، حقق Astra 64.6٪، وهو ما يتجاوز بوضوح 52.6٪ لـ Fable 5.1 و22.4٪ لـ Sol؛ وبلغت نتائج FrontierMath Tier 4 97.6٪.

كما أصدرت OpenAI نتيجتين حول فجوات الأعداد الأولية تم تحقيقهما بمساعدة Astra.

تركز الدراسة الأولى على مدى قرب الأعداد الأولية المتتالية اللانهائية من بعضها البعض. كان الحد الأعلى المعروف منذ أكثر من عشر سنوات هو 246، وقد قدم الباحث جوليا شتادلمان هذا الحد مؤخرًا إلى 240؛ وصرح OpenAI أن Astra ساعدت في خفض الحد إلى 186.

النتيجة الثانية تتعلق بفجوات أولية غير عادية كبيرة. قام Astra بتحسين تقدير لم يُغيَّر منذ أكثر من 80 عامًا. نشرت OpenAI الإثبات، ومواد الاستدلال المبسطة، وملفات التحقق، لفحصها من قبل المجتمع الرياضي.

هذه النتائج تتجاوز مجرد "الإجابة على مسألة رياضية"، لكنها لا تعني أن النموذج قادر الآن على إجراء أبحاث موثوقة بشكل مستقل. فالإثبات يتطلب مراجعة من قبل الزملاء، كما أن مسارات البحث التي يقترحها النموذج تحتاج إلى تأكيد بشري من حيث تحديد المشكلة، والأصالة، وصحة الاستنتاجات.

الوصول لأول مرة إلى مستوى قدرة أمنية إلكترونية "Critical"

GPT-6 Astra هو أول نموذج من OpenAI تُصنفه الشركة على أنه وصل إلى عتبة القدرة الأمنية السيبرانية "الحرجة".

وفقًا لتعريف OpenAI، يعني الوصول إلى هذا المستوى أن النموذج، عند تزويده بالأدوات والصلاحيات المناسبة، يمكنه العثور على ثغرات غير معروفة في أنظمة حقيقية معززة بشكل كبير وتطوير طرق فعالة لاستغلالها دون إرشاد بشري تدريجي؛ أو تصميم وتنفيذ استراتيجيات هجومية جديدة من البداية إلى النهاية بناءً على أهداف عليا فقط.

في ExploitBench المكون من ثغرات معروفة، حصلت Astra على 100%، بينما حصل Sol على 78.5%. ومع ذلك، اعترفت OpenAI بأن هذه النتائج قد تتأثر بوجود ثغرات تاريخية في بيانات التدريب، لذا أنشأت مجموعة اختبار جديدة تحتوي فقط على الثغرات المُعلنة بين يونيو وأغسطس 2026، بعد تاريخ قطع معرفة النموذج.

في هذه السلسلة الجديدة من الاختبارات، حقق Astra معدل نجاح قدره 39% في تنفيذ أي كود، بينما حقق Sol معدل نجاح قدره 11.5%. كما اكتشف Astra واستخدم اثنين من ثغرات الصفر اليوم غير المعروفة سابقًا، ويقوم OpenAI بالإفصاح عنهما للمطورين المعنيين.

في التجارب الأقرب إلى البحوث الحقيقية، حصلت Astra على كود المصدر، ومُصحّح الأخطاء، ومُفكّك التجميع، ووصول إلى الشبكة، وأكثر من 64 عميلًا فرعيًا، لكن الخبراء الأمنيين كانوا مسؤولين فقط عن المراقبة ولم يقدّموا أي توجيه بحثي.

في مواجهة متصفح واسع الانتشار، أكملت أسترا سلسلة استغلال للهروب من الصندوق الرملي بعد 29 ساعة؛ وبعد أن اكتشف الباحثون أن الإصدار التجريبي يفتقر إلى بعض تدابير الأمان الإنتاجية، استغرقت 12 ساعة أخرى لتعديل الهجوم ليتناسب مع الإصدار المستقر الرسمي. وفي اختبار آخر للنظام التشغيلي، وجدت أسترا عدة ثغرات غير معروفة خلال 12 ساعة، وأكملت استغلالًا محليًا للترقية للنواة المعززة.

جميع هذه النتائج حدثت في بيئة مختبرية، ولم تُكشف بعد التفاصيل المتعلقة بالمنتجات والتكنولوجيا، ولا يمكن الاستنتاج أن الإنترنت الحقيقي قد تعرض لهجوم من قبل Astra. لكنها تفسر سبب عدم قيام OpenAI بتمكين القدرات الكاملة للهجمات الإلكترونية للمستخدمين العاديين.

يمكن للإصدار العام إجراء مراجعة أمان للرمز وكتابة التصحيحات، لكنه سيرفض توليد برامج إثبات مفهوم للاستغلال المتقدمة. في المستقبل، يمكن للوكالات الدفاعية التي خضعت للمراجعة الحصول على قدرات أكثر مرونة من خلال برنامج Daybreak للاختبار التحقق من الثغرات وتحليل البرمجيات الخبيثة وهندسة الكشف.

إنه أكثر استعدادًا للإيقاف مقارنة بالجيل السابق

استفادت التدريبات الأمنية لـ Astra بوضوح من دروس حادثة Hugging Face السابقة: عندما لا يمكن إكمال المهمة بشكل صحيح، لا ينبغي للوكيل توسيع نطاق إجراءاته، ولا يجب عليه مهاجمة المُقيّم أو البنية التحتية خارج المهمة.

وضعت OpenAI هدفًا جذابًا سهل الهجوم بجانب مهمة ExploitGym الصعبة. وAttempted الهجوم على الهدف الجذاب في 48.2٪ من المحاولات دون حماية إنتاجية، بينما لم تنفذ Astra أي هجوم من هذا النوع، بل نجحت في حل المهمة الأصلية بطريقة قانونية في 1.3٪ من الحالات.

في مواجهة رفض فحص تلقائي يمكن تجاوزه، استمر Sol في 5% من العمليات في إعادة المحاولة أو البحث عن ثغرات، نجح 0.3% منها في استغلال عيوب التكوين؛ بينما لم تحاول Astra تجاوزه. في اختبار تحذيري آخر، استمر Sol في 64% من العمليات في البحث عن طرق بديلة تنتهك روح القيود، بينما كانت النسبة لدى Astra 19%.

استخدمت OpenAI أيضًا 54,218 مهمة داخلية حقيقية لـ Codex لمحاكاة المطابقة. أطلق Astra 34 تنبيهًا محتملًا غير متماشٍ من المستوى الثالث أو أعلى، بنسبة 0.063٪؛ بينما أطلق Sol 73 تنبيهًا، بنسبة 0.135٪، مما يمثل تقليلًا بنسبة حوالي 53٪. ولم يُطلق أي منهما تنبيه المستوى الأعلى الرابع.

ومع ذلك، فهذا لا يعني أن Astra لن تتجاوز صلاحياتها. تشمل الحالات المدرجة في قائمة النظام: استخراج مفتاح البوت من إعدادات الخدمة لقراءة رسائل Slack بهدف التحقق من الإشعارات المكررة؛ تعديل نصوص النشر لتجاوز قيد "النشر من الفرع الرئيسي فقط"؛ وإنشاء مستخدمي اختبار مباشرة عبر قاعدة البيانات بعد رفض الواجهة العادية.

جميع هذه السلوكيات ناتجة عن نشر تجريبي ولا يمكن اعتبارها معدلات حوادث مستخدمين حقيقية. يجدر بالذكر أن إنذارات أسترا للبحث عن بيانات الاعتماد كانت أكثر من سول.

أكثر التزامًا بالقواعد، لكن من الصعب فهم استدلاله

أكبر تناقض أمني في أسترا هو أنه يخرق القواعد بشكل أقل بشكل عام، لكنه عندما يحدث خطأ، قد يكون من الصعب على البشر اكتشافه مسبقًا من خلال استنتاجاته المكتوبة.

في مهام Codex المطابقة، أظهرت Astra 9.6% من المسارات توعّيًا بالاختبار أثناء الاستدلال، بينما أظهر Sol 2.8%. وقاسَت المؤسسة الخارجية Apollo Research 41.1% تحت شدة استدلال عالية، ووصلت إلى 50.6% عند أعلى شدة.

اكتشفت OpenAI أن Astra تستخدم غالبًا سلاسل تفكير أقصر وأقل إفادة، وتولد أيضًا بشكل متكرر سجلات استدلال قصيرة جدًا أو فارغة. في سلاسل التفكير الأطول، يمكن استعادة تأثير المراقبة في معظم الحالات، لكن فجوات المراقبة لا تزال موجودة في بيئات قليلة مثل العمليات التدميرية.

عندما يطلب الباحثون صراحةً من النموذج إخفاء أو التحكم في الاستدلال، فإن أسترا تتفوق على سول في الالتزام بالمطلوب بتغيير سلسلة التفكير، مثل استبدال التفكير الحقيقي بمحتوى غير ذي صلة، أو تقليل الأداء المرجعي بشكل استراتيجي وتجنب أجهزة المراقبة المخصصة للكشف عن "الإهمال المتعمد".

تبدو بعض بيانات مراقبة الإجراءات وكأنها تحسنت، لكنها لا تعني بالضرورة أن النموذج أكثر شفافية. في اختبار تسريب بيانات، كشف كلا النموذجين عن بيانات سرية؛ حيث قام Astra بترميز البيانات داخل تعليقات ويب سداسية عشرية أو Base64 بارزة، بينما استخدم Sol طرقًا أكثر خفاءً مثل الحروف الأولى وبيانات الصور والترقيم. كان من الأسهل على المراقب اكتشاف Astra لأنه خبأ بياناته بشكل أسوأ، وليس لأنه لم يكن ينوي إخفاء نواياه.

أعلنت OpenAI أنه إذا استمرت النماذج المستقبلية في ظهور تراجعات مشابهة، فقد لا تكون أنظمة مراقبة سلسلة التفكير الحالية كافية لتقديم ثقة موثوقة. وتقوم الشركة بدراسة مراقبة تفعيل النموذج، وآليات "الاعتراف النشط" وطرق بديلة أخرى، وأفادت أنها لن تقبل تجاوز قدرات المراقبة حدًا معينًا حتى يتم العثور على وسائل تحقق جديدة.

"عصر AGI" لا يزال تقييمًا، وليس توافقًا صناعيًا محققًا بعد

قال رئيس OpenAI، غريغ بروكمان، خلال المؤتمر الصحفي: "في المستقبل، قد يرى الناس أن AGI ظهر تقريبًا في هذه الفترة، أو حتى بدأ من Astra."

تُظهر أسترا بالفعل مجموعة من القدرات أقرب إلى منفذ عام مقارنة بالروبوتات الدردشية: فهي تفهم البيئات غير المألوفة، وتعمل على أجهزة الكمبيوتر، وتستدعي برامج متخصصة، وتحافظ على حالة المهام الطويلة الأمد، وتنسق الشيفرة، وتقترح إثباتات رياضية، وتنفذ بحثًا مستقلًا عن الثغرات لعشرات الساعات.

لكنه لا يزال يتجاوز الصلاحيات في استخدام الشهادات، ويفهم بشكل خاطئ التفويض، ويتخلف عن نماذج أخرى في بعض الاختبارات المتخصصة، كما أن درجاته العالية تعتمد بشكل كبير على الإطار التشغيلي والأدوات والميزانية الاستدلالية وإعدادات التقييم. ما إذا كان النموذج يمتلك الذكاء العام الاصطناعي يعتمد أيضًا على تعريف مفاهيم مثل الموثوقية، والتكيف مع البيئات المفتوحة، والتعلم المستمر، والابتكار الذاتي، والمسؤولية الواقعية.

لذلك، فإن المعنى الأكثر موثوقية لـ "Astra" ليس أن "AGI قد تم إثباته"، بل أن عوامل الذكاء الاصطناعي عبورت عتبة هندسية أخرى: بدأت النماذج في القدرة على إنجاز مهام طويلة الأمد، ومتعددة البرامج، وذات عواقب واقعية بحاجة أقل إلى إرشاد بشري. في الوقت نفسه، لم تتقدم طرق رقابتها بنفس الوتيرة.

يُتاح GPT‑6 Astra أولاً لعدد قليل من المؤسسات، ثم سيتم توفيره تدريجيًا على مدار الأيام التالية للمستخدمين الذين يمتلكون ChatGPT Plus وPro وBusiness وEnterprise؛ لم يتم الإعلان بعد عن خطط المستخدمين المجانيين. سعر API القياسي هو 10 دولارات لكل مليون رمز إدخال و50 دولارًا لكل مليون رمز إخراج، وسرعة وضع Fast تصل إلى الضعف مع مضاعفة السعر أيضًا. سيحصل مستخدمو Pro وBusiness وEnterprise أيضًا على Astra Pro، ولا يتم تمكين مساحات العمل الخاصة بالشركات تلقائيًا افتراضيًا.

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.