درجة GPT-6 Astra شبه المثالية في ARC-AGI-3 تثير جدلاً حول الذكاء العام الاصطناعي

iconMetaEra
مشاركة
AI summary iconملخص
حقق GPT-6 Astra درجة شبه مثالية في ARC-AGI-3، باستخدام نموذج عالم رمزي لحل الألغاز المعقدة بشكل أفضل من البشر في 96٪ من المهام. تكلفت الاختبارات 18,000 دولار، وقال الناقدون إنه اعتمد على أدوات خارجية بدلاً من ذكاء اصطناعي عام حقيقي. وسط تزايد الاهتمام بالأصول المعرضة للمخاطر، فإن أداء النموذج يثير أسئلة حول التقدم الحقيقي في الذكاء الاصطناعي مقابل الحوسبة عالية التكلفة. وتشهد وكالات CFT بالفعل كيف يمكن أن تؤثر التطورات في الذكاء الاصطناعي على الإطارات التنظيمية.
أثار أداء GPT-6 Astra في اختبار ARC-AGI-3، حيث حقق نتيجة تقترب من 100٪، اهتمامًا كبيرًا. يقوم هذا النموذج بإنشاء "نماذج عالم رمزي" فعّالة، حيث يُجرّد العالم الحقيقي إلى رموز منطقية ورموز سببية، ويُنشئ تلقائيًا نظامًا جبريًا رمزيًا DSL لتسجيل قواعد البيئة في ألعاب رسومية غير مألوفة، ثم يبني "رملية افتراضية" لمحاكاة الاستنتاجات قبل اتخاذ الإجراءات. ومع ذلك، فإن الدرجات العالية تأتي وراءها تكلفة حوسبة باهظة تبلغ 360 دولارًا لكل سؤال، و18,000 دولار للامتحان بأكمله. وأشار رئيس مؤسسة ARC Prize، غريغ كامرادت، إلى أن هذه الدرجات العالية تعتمد على إطار عمل خارجي يُدعى Harness، ولا تمثل اختراقًا حقيقيًا في الذكاء العام الاصطناعي، بل تُثبت فقط أن الذكاء الاصطناعي يصبح أكثر ذكاءً.

كاتب المقال، المصدر: LeFeng.com

اختراق اختبار ذكاء الذكاء الاصطناعي! هل نموذج عالم الرموز لـ GPT-6 Astra هو اختراق أم تزييف بالمال؟

كل سؤال يحرق 360 دولارًا، هل حقق GPT-6 المرور عبر AGI؟

تم الكشف أخيرًا عن أقوى نموذج من OpenAI، GPT-6 Astra، الذي حقق اختراقات مذهلة في تشغيل الحواسيب والبحث العلمي والدفاع الأمني. وأكثر النتائج إثارة للجدل بين الجمهور هي أداؤه القريب من 100% في اختبار ARC-AGI-3.

اختراق اختبار ذكاء الذكاء الاصطناعي! هل نموذج عالم الرموز لـ GPT-6 Astra هو اختراق أم تزييف بالمال؟

ما هو ARC-AGI-3؟ إنه اختبار التقييم المعترف به عالميًا في مجال التكنولوجيا لقياس "ذكاء" الذكاء الاصطناعي، ويمكنك تصوره كامتحان القبول لنادي مينسا للذكاء الاصطناعي.

يحتوي هذا الاختبار على مسائل أنماط رسومية متغيرة باستمرار، ولا يمكن حلها بالتدريب المسبق؛ يجب على الذكاء الاصطناعي أن يستكشف البيئة ويستنتج الأهداف مثل الإنسان، ويستند إلى ردود أفعاله الفورية وقدراته الاستدلالية لاكتشاف الأنماط. هذا النوع من التقييمات أكثر تطورًا في مختلف التقييمات، وهو أكثر قدرة على اختبار ما إذا كان الذكاء الاصطناعي مجرد أداة أم ذكاء حقيقي.

لكن GPT-6 Astra تجاوز هذا الاختبار تمامًا، علماً أن النموذج السابق GPT-5.6 Sol حصل على درجة 38.3%، وهو تقدم هائل حقًا. هذه الذكاء يفوق حتى البشر، حيث كان أكثر كفاءة من البشر في 96% من المستويات، وكان متوسط عدد الخطوات التي قام بها أقل من البشر بنسبة 51.7%.

إذا كان لدى ذكاء اصطناعي قدرة حقيقية على إنشاء قواعد منطقية وحل المشكلات في بيئة تمامًا غير مألوفة، يمكننا التخيل أن المستقبل قد يرى أنه يتخذ قرارات صحيحة في ظروف قيادة ذاتية غير معروفة، أو أنه يُستنتج بنية جزيئية لدواء فعال بسرعة عند ظهور فيروس جديد وغير معروف.

للاستكشاف لماذا يكون GPT-6 Astra ذكيًا جدًا، أعاد فريق ARC Prize الرسمي مراجعة سجلاته الخلفية، ووجد أنه أثناء اللعب، يُنشئ نموذجًا رمزيًا فعالًا للعالم.

اختراق اختبار ذكاء الذكاء الاصطناعي! هل نموذج عالم الرموز لـ GPT-6 Astra هو اختراق أم تزييف بالمال؟

نموذج عالم الرموز هو تطوير متقدم لنموذج "العالم". عندما يتنبأ نموذج العالم بالمستقبل باستخدام صور، كما يفعل الفنان؛ فإن نموذج عالم الرموز الفوري يشبه أكثر الرياضي، الذي يجرّد العالم الحقيقي إلى رموز منطقية ورموز سببية.

يُعتبر هذا التقنية مسارًا لا مفر منه لتطور الذكاء الاصطناعي نحو الاستدلال المتقدم.

What is the Symbol World Model?

في الماضي، كان أحد الأسباب الرئيسية لعدم حصول النماذج الكبيرة على درجات عالية في اختبارات سلسلة ARC-AGI هو اعتيادها على "التجربة والخطأ العشوائية". كانت الذكاء الاصطناعي تقطع شاشة اللعبة إلى كتل بكسل، وتضغط عشوائيًا أولاً، وإذا لم تكن صحيحة، تغير الاتجاه، وتعتمد على الحظ لإكمال اللعبة.

في هذا النمط، حتى مع وجود بعض الت突破ات في النقاط، فإن الذكاء الاصطناعي لا يفهم أو يتقن قواعد اللعبة حقًا.

يتمكن نموذج عالم الرموز من السيطرة على كل شيء لأنه يفهم تمامًا القوانين الفيزيائية والعلاقات السببية للبيئة المحيطة، ثم يتخذ قراراته من خلال حسابات دقيقة.

في الاختبارات العملية، عندما يدخل GPT-6 Astra لعبة رسومية مجهولة، فإنه يبدأ في تدوين ملاحظات واسعة باستخدام DSL مبتكر، وهو نظام رموز جبرية خاص، لتسجيل البيئة الملاحظة. على سبيل المثال، فإنه يسجل بدقة القواعد الضمنية المحتملة للعبة، وسلسلة من الأوامر التي سيتم تنفيذها، بل وحتى يرسم مسارات حركة كل بكسل بدقة على نظام إحداثيات.

يؤدي هذا الأسلوب في تسجيل الجبر إلى حالة عالم واحدة وحيدة ومحددة، مقارنةً بالغموض الناتج عن التفاعل بلغة طبيعية في النماذج السابقة، مما سيحقق قفزة هائلة في الدقة.

ثم سيكتب في ذهنه منطقًا لبرنامج Python: "إذا ضغطت على A، فسيتم تحويل الشكل 90 درجة إلى اليسار".

ثم تقوم ببناء "صندوق رملي افتراضي" في عقلها، وتحاكي الخطة التالية في ذهنها. وبعد التأكد من إغلاق المنطق بدقة وبدون أخطاء، فقط حينها تضغط على الخطوة الأولى في اللعبة الواقعية. هذا هو السبب في أن كفاءة عملياتها أعلى بكثير من كفاءة البشر.

لاختبار حدود قدرات GPT-6 Astra، أدخلت منصة الاختبار الحمراء PRO‑LONG النظام داخل بيئة رملية للرمز، وسمحت للذكاء الاصطناعي بكتابة وتشغيل رموز مخصصة بشكل مستقل.

نتيجةً لذلك، بدأ GPT-6 Astra في "تخصيص" أدوات لكل لعبة. على سبيل المثال، في لعبة متاهة معقدة بها حراس يدورون، كتب GPT-6 Astra نظام ملاحة بنفسه، ثم أضاف قواعد قتال، وحاكى مسارات دوران الحراس، وأخيرًا استخدم سلسلة الأدوات التي أنشأها للتنبؤ بالنتائج والتحقق منها بدقة.

في السنوات الأولى، كانت هذه القدرة على استنتاج الرموز وبناء الأدوات الذاتية تعتمد بالكامل على إطار عمل خارجي يُسمى Harness. كان يساعد النموذج على تحويل الصور، وتسجيل الحالة، والتحقق من النتائج، لكنه كان يعاني من عيوب واضحة: نقل البيانات بين النموذج والإضافات الخارجية يسبب تأخيرًا عاليًا؛ قدرات الهندسة الخاصة بالإضافات الخارجية كانت منفصلة تمامًا عن تدريب أوزان النموذج الكبير؛ وبسبب الاعتماد الكبير على بيئة الحوسبة السحابية والنصوص الخارجية، كان من الصعب جدًا نشر هذه القدرات المتقدمة على الأجهزة الطرفية أو الحوسبة الحدية.

بينما تقوم GPT-6 Astra الآن بدمج قدرات كبيرة تابعة لـ Harness داخل أوزان النموذج نفسها. ولم يتمكن العالم البارز جاري ماركوس، الذي يُشجع دائمًا نماذج العالم الرمزي، من إبداء إعجابه الكبير بـ GPT-6 Astra كنصر كبير على هذا المسار.

في السنتين الأخيرتين، ظهرت كم هائل من النتائج الأساسية في هذا المجال من قبل الأوساط الأكاديمية والصناعية، من هارفارد وMIT إلى Google DeepMind، حيث يُجري الجميع رهانهم على "نماذج العالم الرمزي". قبل تقاطعات لا حصر لها على طريق الذكاء العام الاصطناعي، يتشكل إجماع تقني أساسي في الصناعة.

بدرجة كهذه، هل AGI مضمونة؟

المُعد يُطفئ الحماس بنفسه

من المثير للاهتمام أنه أثناء احتفال الجميع بهذا التصنيف، قام غريغ كامراد، رئيس مؤسسة ARC Prize، بخفض التوقعات شخصيًا عندما تم تداول عبارة غريغ بروكمان، الرئيس التنفيذي لـ OpenAI: "AGI قد حان".

هو الشخص المحوري بين مصممي الأسئلة، وهو الأكثر كفاءة في تحديد كيفية تصميم المعيار وكيفية تفسير الدرجات. من منظور التقييم، يرى أن الدرجات حقيقية، لكنها لا تزال تبعد عن الذكاء العام الاصطناعي مسافة شاسعة.

حتى الآن، شهد عددًا كبيرًا من الفرق تحقق أكثر من 90% على ARC-AGI-3 باستخدام Agent Harness، مثل PRO-LONG الذي يمتلك ذاكرة خارقة، وTycho المتخصص في الاستدلال العميق، وPrime Agent الذي يستطيع تطوير بيئة البرمجة الخاصة به.

جميع المنتجات التي تحصل على درجات عالية لديها وصفة تقنية مشتركة، وهي تضم خمسة أجزاء رئيسية: ذاكرة غير مفقودة، تحليل برمجي، اختبار فرضيات صريحة، حالة دائمة، وحسابات داخلية منخفضة التكلفة.

يتحمل الذاكرة بدون فقدان المسؤولية عن التذكر، وتحليل البرمجة المسؤولية عن المنطق، واختبار الفرضيات الصريحة المسؤولية عن الاستنتاج، والحالة الدائمة المسؤولية عن سياق التفاعلات المتعددة، والحسابات الداخلية منخفضة التكلفة المسؤولية عن قوة الحوسبة الداخلية الرخيصة، مما يسمح للذكاء الاصطناعي بتجربة أخطاء جنونية في بيئة افتراضية قبل إخراج الإجابة الصحيحة. معًا، تشكل هذه العناصر هيكلًا لا يُقهر يعوّض عن نقاط ضعف النموذج نفسه.

يقترب GPT-6 Astra من تحقيق نسبة 100% باستخدام نفس مجموعة الهارنيس الفاخرة، حيث يستفيد من "قاعدة مُكيّفة للموردين" مصممة خصيصًا، وتستخدم المحادثات المستمرة وضغط السياق لدعم سلسلة المنطق الخاصة به؛ وكل مرة يكمل فيها جولة لعبة، يستهلك 360 دولارًا من قوة الحوسبة المكلفة. إذا تم إكمال الاختبار بالكامل، فستصل فاتورة قوة الحوسبة الإجمالية إلى مبلغ مذهل قدره 18,000 دولار أمريكي (ما يعادل حوالي 135,000 يوان صيني)!

قد يحتاج الإنسان إلى بضع دقائق فقط لحل لغز بصري، وبحساب استهلاك الطاقة البشري البالغ 20 واطًا، تبلغ تكلفة الكهرباء أقل من نصف سنت؛ حتى مع إضافة التعويض الفعلي عن الأجر بالساعة للمشاركين، تبلغ التكلفة حوالي 12.78 دولارًا لكل جولة، بينما يستهلك الذكاء الاصطناعي 360 دولارًا. هل يمكن حقًا أن تصبح هذه النتائج التي تم تحقيقها بفضل "القدرة المالية" متاحة للعامة كشكل من أشكال الذكاء العام الاصطناعي؟

بالطبع، بدأ GPT-6 Astra في تضمين قدرات Harness تدريجيًا، وإذا استمر التطور، فستصبح القدرة الحسابية الكامنة داخل النموذج أكثر قوة بكثير. ومع ذلك، نظرًا لأن عملية الاستدلال بدأت تصبح غير شفافة، لا يعرف المطورون ما إذا كان الذكاء الاصطناعي فهم حقًا، أم أنه وجد طرقًا أكثر كفاءة للغش.

العودة إلى السؤال أعلاه، هل GPT-6 Astra يُعتبر AGI أم لا؟

في نهاية مقاله المطول، قدم غريغ كامرادت ردًا فلسفيًا على هذا السؤال: لماذا يُعتبر البشر "ذكاءً عامًا"؟ لأن البشر قادرون على التكيف مع أي عالم مجهول، حتى لو تم إلقاء طفل من العصور القديمة في العصر الحديث، فسيتمكن من تعلم ركوب المترو واستخدام الهاتف المحمول. هذا النوع من الذكاء استمر لألف عام ودفع تقدم التكنولوجيا باستمرار. لكن الاختبارات التي تطلبها صناعة التكنولوجيا اليوم ليست سوى امتحان "مطابقة الصور" مُصمم خصيصًا للذكاء الاصطناعي.

هذا فقط يثبت أن الذكاء الاصطناعي يصبح أكثر ذكاءً، لكنه ليس دليلاً على قدوم AGI.

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.