تُصبح توليد الإجابات قدرة أساسية للذكاء الاصطناعي، بينما يكون استنتاج العالم الحقيقي هو المهمة الأصعب في المرحلة القادمة.
القرارات الحقيقية ليست سؤالاً وجواباً ثابتاً. إنها تحدث في عالم متغير باستمرار، حيث تتصرف كيانات متعددة في وقت واحد، وتنقصه المعلومات، ويعجّ بالشكوك.
على سبيل المثال، إذا أطلق نموذج مفتوح المصدر جديد فجأة خفض التكاليف، هل ستتبع شركات النماذج الرائدة بخفض الأسعار؟ وكيف سيعيد مزودو السحابة والمطورون وشركات التطبيقات ترتيب مواقفهم؟ في مثل هذه القرارات، يغير إجراء طرف واحد الشروط التي تواجهها الأطراف الأخرى في الخطوة التالية، وستستمر ردود الأفعال الجديدة في إعادة تشكيل الوضع. إنه مثل لعبة شطرنج حيث يضع جميع اللاعبين قطعهم في نفس الوقت، وكل قطعة تُوضع تغير لعبتها بالكامل.
في هذا السياق، بعد إطلاق نظام Decitron (يُعرف اختصارًا باسم "القرار") من Zhongke Wenge، وصفته العديد من وسائل الإعلام التكنولوجية الرائدة بأنه "أول نموذج قرار عام عالميًا". لا يشير هذا الوصف إلى ظهور تقنية واحدة مثل نموذج العالم أو الوكلاء المتعددين أو حل الألعاب لأول مرة، بل يؤكد على أن Decitron هو أول نظام يوحد هذه القدرات ضمن إطار قرار موحد موجه نحو العالم المفتوح، مُشكّلًا حلقة مغلقة كاملة تشمل النمذجة المستمرة، والمحاكاة، والحل، والضبط.
ما يُقصد بـ"عامة" هو محاولة تحويل مشكلات اتخاذ القرار المعقدة من مجالات مختلفة إلى هيكل مشترك — حالة العالم، الكيانات المشاركة، فضاء الإجراءات، العلاقات المقيدة، التفاعل متعدد المراحل، والنتائج غير المؤكدة، مع الاستمرار في الاستدلال والحل ضمن نفس الإطار.

عنوان تقرير التقنية: https://chinaxiv.org/abs/202608.00064
في 3 أغسطس، تم إصدار التقرير التقني الكامل لـ Decitron، حيث كشف لأول مرة عن ثلاث مساهمات تقنية رئيسية:
أولاً، اقتراح نموذج عالم صريح يُسمى MetaWorld، والذي يُنظّم المعلومات متعددة المصادر إلى حالة عالم مُهيكلة ودائمة وقابلة للحساب، مع نمذجة سببية لها؛ ثانياً، استخدام التمثيل الرسمي State–Action–Outcome (SAO) لتحويل القرارات المعقدة إلى أشكال حسابية واستدلالية؛ ثالثاً، بناء هندسة استدلال هجينة تدمج المحاكاة متعددة الوكلاء والاستدلال اللعب والتحسين الرسمي تُسمى AutoABM، والتي تحلّ مشكلات قرارات معقدة مثل تحقيق التوازن اللعب وتخطيط الاستراتيجيات ورضا القيود باستخدام نظام استدلال قرارات متعدد الوكلاء. معاً، تشكل هذه العناصر الثلاثة الأساس التقني للآلة القرار، بهدف تحويل التقييمات اللحظية للأنظمة الذكية إلى عملية حسابية واستدلالية مستمرة تتحديث مع تغير العالم.
ما هي البنية المطلوبة لمشاركة الذكاء الاصطناعي في اتخاذ قرارات حقيقية؟
حاليًا، ظهرت بالفعل القدرات الأساسية التي تحتاجها الذكاء الاصطناعي حول "محاكاة اتخاذ القرار" (مثل نماذج العالم، والوكالات المتعددة، والاستدلال اللعب، والتنبؤ الاحتمالي). التحدي الحقيقي يكمن في: عندما ينتقل الذكاء الاصطناعي من المهام المغلقة إلى العالم الحقيقي المفتوح، يجب أن تعمل هذه القدرات معًا بشكل متناسق حول حالة عالم واحدة مستمرة التحديث، ولا يمكن أن تقدم تحليلات منفصلة وغير مرتبطة في مطالبة واحدة فقط.
أولاً، ننظر إلى النموذج العالمي. عند ذكر "World Model"، يفكر الناس بسهولة في نماذج العالم المادي التي تركز على البيئات البصرية والمكانية والفيزيائية أو الروبوتية مثل Sora وWorld Labs وV-JEPA. أما MetaWorld الذي طرحته Decision Machine، فتركز على سيناريوهات قرار أكثر تعقيداً: الاقتصاد، والسياسات، والمنافسة الشركاتية، والجغرافيا السياسية، وغيرها من الأنظمة المفتوحة، حيث تشمل نمذجة النظام كيانات ومتغيرات وعلاقات وقيود أكثر تعقيداً.
يمكن اعتبار MetaWorld تمديدًا للنماذج العالمية إلى الأنظمة الاجتماعية، ويتطلب معالجة ثلاثة أنواع من المشكلات الصعبة: اختلاف القواعد، والانعكاسية (التفاعل الثنائي والتأثيرات الدائرية بين الأسباب والنتائج)، وعدم اليقين الذي لا يمكن القضاء عليه تمامًا. وهذا يطرح مشكلة مباشرة: إذا حدث انحراف في تقييم العالم الحالي، هل سيتبع ذلك انحراف في الاستنتاجات اللاحقة؟
بمجرد دخول النظام الاجتماعي، لا يكفي فقط الحفاظ على حالة البيئة، بل يجب على الذكاء الاصطناعي أيضًا تقييم كيفية تصرف المشاركين الآخرين. لقد أظهر فريق CICERO من Meta وفريق جامعة بكين وغيرها مشروع Richelieu قدرة عدة وكلاء على التفاعل والمنافسة ضمن معلومات محدودة؛ أما بالنسبة للقرارات الحقيقية في عالم مفتوح، فبعد محاكاة إجراءات جميع الأطراف، يجب الاستمرار في تقييم ما إذا كانت الاستراتيجيات قابلة للتطبيق، وأين قد تقع المفاوضات من حيث التوازنات المحتملة، وإمكانية وشروط حدوث سيناريوهات مستقبلية مختلفة.
إن معنى آلة اتخاذ القرار يكمن في هذا: فإن بنية الاستدلال الهجينة AutoABM توحد فهم اللغة الدلالي للنماذج الكبيرة، والتمثيل المهيكل SAO، ونمذجة ومحاكاة الوكلاء المتعددين، والاستدلال والتحسين الاستراتيجي على سلسلة تنفيذ واحدة، مما يربط بين الخطوات الأربع: "فهم العالم — محاكاة الاستدلال — إيجاد القرار — تقييم المستقبل".
من الواقع إلى المستقبل، كيف تُنجز آلة القرار تحليلًا معقدًا؟
يتكون آلة اتخاذ القرار من ستة مستويات: المدخلات والمهام، البيانات والمعرفة، النمذجة والصياغة، المحاكاة والاستدلال، التنبؤ والضبط، والتقارير والتفسير، مما يشكل رابطًا كاملًا من المعلومات الواقعية إلى مخرجات اتخاذ القرار.

بعد ذلك، نأخذ مثالًا: "كيف يمكن أن تتطور صراع تجاري معقد خلال النصف العام المقبل؟" لنشاهد كيف تبني آلة القرار الحالة الحالية للعالم من المعلومات الواقعية، وتحاكي إجراءات الأطراف المختلفة، وتُجري محاكاة للمسارات المختلفة التي قد تظهر في المستقبل، وما هي الشروط التي ستؤدي إلى هذه المسارات.
الخطوة الأولى: لا تُسرع في توقع المستقبل، بل ابدأ أولاً بفهم "ما الذي يحدث الآن" وما هي الحقائق التي تستحق الثقة.
المعلومات من العالم الحقيقي متشابكة، وقد تكون مكررة أو متعارضة، أو قديمة. تقوم آلة اتخاذ القرار أولاً بتحويل سؤال المستخدم إلى مهمة منظمة، تحدد بوضوح ما يجب الإجابة عنه، والجهات المعنية، ومدة المراقبة، والقيود المفروضة. في هذا المثال، سيحدد النظام أولاً الأطراف الرئيسية المشاركة في النزاع، ونطاق الوقت، ونقاط الخلاف الحالية، ثم يُرتب الشروط التي قد تؤثر على تطور الوضع، مثل التعريفات الجمركية، وسلاسل التوريد، وسياسات الصناعة، وسلوك الشركات، وبعد ذلك يجمع المعلومات من مصادر مختلفة مثل التقارير الإخبارية، ووسائل التواصل الاجتماعي، والتقارير البحثية، حول هذه العناصر.

الشكل 2: مخطط عملية معالجة البيانات
يتم أولاً معالجة المعلومات المجمعة من خلال إزالة التكرارات، والتجميع، واستخراج الأحداث، ثم تنظيمها في خط زمني للأحداث ومجموعة من وحدات الأدلة الأدق. بعد ذلك، يقيم النظام جودة كل دليل باستخدام درجة جودة الدليل (EQS)، مع تقييم مدى ارتباطها بالسؤال الحالي، ومصداقية المصدر، وحداثة وشمولية المحتوى، واتساق المعلومات بين مصادر مختلفة. كما يُقرر النظام مسار كل دليل بناءً على مستوى ثقته، حيث تنتقل الأدلة ذات الثقة العالية مباشرة إلى المراحل التالية من الاستنتاج.
إذا كانت الأدلة الحالية غير كافية أو出现了 تناقضات بين مصادر مختلفة، يستمر النظام في تنفيذ الاستدلال والاسترجاع المتناوب القائم على ReAct، ويعمل على تعديل البحث التالي بناءً على المعلومات المفقودة الحالية، ويُكمل خط الزمن الحالي بالمعلومات الجديدة التي تم العثور عليها.

الشكل 3: استخدام آلية الاستدلال والاسترجاع المتناوبة القائمة على ReAct
الخطوة الثانية، تحويل الحقائق المُصفاة إلى "حالة عالمية" مُحدَّثة باستمرار. تخبرك الحقائق النظام بما حدث، ثم يجب التقييم التالي: ما هي الحالة التي يُوجد عليها العالم الآن بعد تجميع هذه التغييرات معًا؟
تستخدم آلة اتخاذ القرار التمثيل State–Action–Outcome (SAO) لصياغة هذه العملية، حيث يصف State الحالة الحالية للعالم، ويسجل Action الإجراءات التي اتخذها كل عامل في هذه الحالة، ويسجل Outcome النتائج الناتجة عن هذه الإجراءات مثل العوائد والخسائر والتكاليف والمخاطر. يجدر بالذكر أن State يميز بين الحالة الكلية والحالة المفصلة القابلة للقياس. في هذه الحالة، يمكن أن تكون تصاعد التوترات حالة كلية، بينما يمكن أن تدخل مستويات التعريفات، وأسعار السلع، ودرجة تأثير سلسلة التوريد على الحالة المفصلة.
بالإضافة إلى ذلك، يأخذ النظام في الاعتبار الصدمات الخارجية بشكل منفصل، مثل التغييرات المفاجئة في السياسات أو التغيرات البيئية أو الأحداث الأخرى التي لا يتحكم فيها العامل. بعد حدوث إجراء وحدث خارجي، يتم تحديث حالة العالم. ثم تصبح الحالة المحدثة نقطة انطلاق للإجراء التالي. وهكذا دواليك، مما يشكل مسارًا متصلًا من SAO.

الشكل 4: عملية تشغيل SAO
المسؤول عن صيانة هذه الحالات فعليًا هو MetaWorld، والذي يُنتج هيكلًا قابلًا للحساب والتحديث لحالة العالم. ويمكن تقسيم الحالة إلى ثلاثة مستويات: طبقة البيئة (Environment Layer) التي تسجل البيئة العامة المشتركة بين جميع المشاركين، مثل مرحلة الموقف وأسعار الموارد؛ طبقة مقاييس الوكلاء (Agent Metrics Layer) التي تسجل موارد وكل قدرات وتقدم أهداف كل وكيل؛ وطبقة مصفوفة العلاقات (Relationship Matrix Layer) التي تسجل التغيرات في العلاقات بين الوكلاء المختلفين.
تستخدم MetaWorld أيضًا رسمًا بيانيًا موجهًا لا دوريًا سببيًا (Causal DAG) لتحديد كيفية تغير الحالة: التأثيرات المحتملة بين المتغيرات يتم تنظيمها في رسم بياني سببي أثناء مرحلة النمذجة. خلال عملية الاستدلال، تقوم النظام بتحديث حالة العقد ووزن الحواف السببية، لكنها لا تُعيد إنشاء رسم بياني سببي جديد في كل دورة.
هذا مهم جدًا للتنبؤات على المدى الطويل. أثرت التغييرات السابقة في التعريفات على الأسعار، وغيّرت الأسعار من اختيارات الشركات واستجابات الأطراف الأخرى، ويجب الحفاظ على هذه التغييرات لمواصلة الحسابات المستقبلية. تتحمل MetaWorld مسؤولية هذا "دفتر الحسابات العالمي" الذي يتم تحديثه باستمرار.
الخطوة الثالثة، مع وجود حالة العالم، تبدأ الوكلاء المختلفة في العمل. عادةً ما تتطلب نماذج مبنية على الوكلاء (ABM) التقليدية من الخبراء تعريف المشاركين وقواعد السلوك والمتغيرات البيئية وآليات التفاعل مسبقًا. إذا غيّرت السؤال، فسيتعين عليك إعادة نمذجة العديد من العناصر. يقدم مُتخذ القرار AutoABM لأتمتة هذه الخطوة: فبمجرد تلقي سؤال بلغة طبيعية، يجمع النظام الأدلة الخارجية لاستخلاص المشاركين والأهداف والقيود ومساحة الإجراءات والمتغيرات البيئية والعلاقات السببية، ثم يبني بعدها بيئة محاكاة متعددة الوكلاء بناءً على ذلك.
قد تشمل صراعات التجارة عدة وكلاء مختلفين مثل الحكومات والشركات ومنظمات الصناعة والمستهلكين، وكل طرف له أهدافه وموارده وتفضيلاته للمخاطر وخطوط حمراء لا يمكنه تجاوزها. هذه الوكلاء لا يمتلكون منظورًا إلهيًا، بل يتصرفون بناءً على المعلومات الجزئية التي يمتلكونها.
في كل دورة عمل، يقوم العامل أولاً باسترجاع التفاعلات السابقة والمسارات التاريخية، ثم يقيم الفرص والمخاطر والقيود في الوضع الحالي، ويُولّد عدة استراتيجيات بديلة ويختار واحدة منها. ولا تقتصر كل دورة على دفع اتجاه واحد فقط؛ بل يُطور النظام عدة حالات عالمية مختلفة في وقت واحد، تشمل مسارات توازن نسبيًا، واتجاهات تطور أكثر تفاؤلًا أو تشاؤمًا، بالإضافة إلى فروع ذات تأثير عالٍ ولكن احتمال حدوثها منخفض، والتي إذا حدثت ستغير الوضع بشكل واضح. ثم يتم تصفية وتحقق هذه المسارات، وتحديث حالة العالم، والانتقال إلى الدورة التالية. مع استمرار الأطراف في اتخاذ إجراءات، تفقد بعض المسارات شروط صحتها، بينما تصبح مسارات أخرى أكثر احتمالاً.

الشكل 5: نماذج سلوك العامل
بالإضافة إلى المحاكاة متعددة الوكلاء، تتطلب القرارات المعقدة "حاكماً رياضياً". يمكن للوكلاء المتعددين استكشاف العديد من المسارات المستقبلية التي تبدو معقولة، لكن التفكير في شيء لا يعني القدرة على تنفيذه؛ فاتخاذ القرار الحقيقي يخضع لقيود صارمة مثل الميزانية والموارد والوقت والحدود السياسية والعلاقات المتوازنة بين الأطراف المختلفة.
تم توصيل آلة اتخاذ القرار بقدرة حل رسمية تشمل خمس فئات من المشكلات: الألعاب الكلاسيكية، تخصيص الموارد والتحسين، تخطيط المسارات والجدولة، الاستدلال الاحتمالي تحت ظروف عدم اليقين، ورضا القيود. على سبيل المثال، يمكن إدخال هذه الطبقة الحسابية لتحديد كيفية توزيع الموارد عند وجود ميزانية محدودة، أو ما هي التوازنات الممكنة في الألعاب متعددة الأطراف، أو ما إذا كانت استراتيجية ما تتجاوز الحدود المحددة مسبقًا. وفيما يتعلق بمسائل الألعاب، يحتوي النظام على 9 أنواع من الألعاب الذرية الكلاسيكية المضمنة، مثل معضلة السجين، لعبة الصيد بالغزلان، لعبة الجبان، والألعاب صفرية المجموع، والتي تغطي 144 توبولوجيا من ألعاب روبنسون-غوفورث 2×2 لتحديد وحل هياكل الألعاب المختلفة.
يتمثل التركيز في هذه الطبقة في إعادة استراتيجيات المرشحات التي تولدها الوكلاء المتعددة إلى إطار حسابي للألعاب والقيود والتحسين، مما يحول "المنطقية دلالياً" إلى "قابلة للتحقق شكلياً".
على معيار TMGBench لاختبار قدرات الألعاب متعددة الوكلاء، بلغت دقة توازن القرار 99.4٪، ودقة التعرف على التوبولوجيا 100٪، ومتوسط وقت الحل 0.8 ثانية، ودرجة القابلية للتفسير 4.3/5.0.

الجدول 2: خمسة أنواع رئيسية من مشاكل الحل
التفريق بين محاكاة الوكلاء المتعددين وحلها التصوري واضح:前者负责展开可能的路径;后者负责检查这些路径在约束和博弈结构下是否成立。
في المرحلة الأخيرة من التحليل، لا يزال هناك سؤال أساسي متبقى: ما احتمال حدوث كل مسار مستقبلي تم عرضه سابقًا؟ ولذلك، قام الجهاز القرار بتعيين عملية التنبؤ والضبط.
بناءً على المسارات المرشحة المُستخلصة سابقًا، تُعالج هذه الطبقة عدم اليقين فيها: يُدمج النظام نتائج الاستدلال النموذجي مع إشارات المعايرة الخارجية لتعيين احتمالات مختلفة للنتائج، ثم يُعاير هذه الاحتمالات باستخدام معلومات الأسواق التنبؤية وأداء التنبؤات التاريخية وقواعد تقييم الاحتمالات. لا يُقدّم آلة القرار مجرد سلسلة من وصفات "ما قد يحدث"، بل تُرفق كل مسار بحكم احتمالي مرتبط به، ويتم تحديثها باستمرار مع ظهور أدلة جديدة ونتائج استدلالية.
يمكننا تصورها كـ "خريطة مستقبلية" ديناميكية تتغير باستمرار: استمرار تصاعد التوترات التجارية، أو تخفيف مؤقت من الطرفين، أو ظهور متغيرات طارئة جديدة، يمكن أن تصبح جميعها فروعًا مختلفة. يقيّم النظام احتمالية حدوث كل مسار، وما هي التغييرات التي قد تجعل مسارًا معينًا أكثر احتمالًا.

الشكل 6: وحدة تنبؤ الاحتمالات
هكذا، ربطت آلة اتخاذ القرار سلسلة كاملة من محاكاة القرار.
Verification experiment: Is this decision framework effective?
استخدم التقرير عدة مجموعات من التجارب لاختبار نظام الاستنتاج للآلة القرار، وأكثر النتائج جدارة بالملاحظة هي نتائج "الاستنتاج الحدثي والتنبؤ الاحتمالي".
أولاً، دعونا ننظر إلى مجموعة تنبؤ الأحداث التي أنشأها الفريق، ونلاحظ ما إذا كان الاستدلال المُهيكل يمكنه تحسين تنبؤ الأحداث. أنشأ الفريق مجموعة بيانات تحتوي على 74 حدثًا و370 سؤالًا ثنائيًا، وتغطي فئات متعددة من الأحداث عالية عدم الاستقرار، مع تضمين فترات تنبؤ مختلفة في التقييم. في إعداد التقييم الخاص بالفريق، كانت النتيجة الإجمالية للآلة القرار 78.41%.
بالإضافة إلى ذلك، في إعدادات LLM-NEWS، كانت نتيجة آلة القرار للمجموعة قصيرة الأجل (3-30 يومًا) 72.80٪، بينما كانت نتائج GPT-5.5 وClaude-4.7 على التوالي 35.43٪ و44.62٪؛ وبعد الدخول في الفترات المتوسطة والطويلة الأجل، تقلص الفرق تدريجيًا. أي أن الاستدلال المهيكل يظهر ميزة نسبية أكبر في السيناريوهات قصيرة الأجل التي تتغير بسرعة ويعسر فيها الاعتماد على الأنماط التاريخية.

ثم التجارب الإضافية على معيار سوق التنبؤ العام PolyBench.
إن دقة التنبؤ النهائية (FFA) لآلة اتخاذ القرار هي 81.20%، ودقة التنبؤ بالتبديل المتوقع (EVPA) هي 73.40%، وخطأ متوسط التربيع (MSE) هو 0.822، وكل هذه المؤشرات أفضل من Gemini-3-Flash وMiMo-V2-Flash وGrok-4.1-Fast. وهذا يشير إلى أن آلة اتخاذ القرار تحقق أداءً أفضل في التقاط اتجاهات تغيير احتمالات السوق والتحكم في أخطاء الاحتمالات.

الذكاء الاصطناعي للقرارات، يغير وحدة المنافسة في النماذج الكبيرة
يستخدم الذكاء الاصطناعي التوليدي الوحدات الرمزية كوحدة حساب أساسية لحل سؤال "كيفية توليد الجزء التالي من المحتوى"، بينما يتعامل الذكاء الاصطناعي القرار مع تغييرات حالة العالم كموضوع حساب أساسي لحل سؤال "كيف سيغير إجراء واحد حالة العالم التالية". يهتم الأول بما إذا كانت الإجابة منطقية، بينما يجب على الثاني أيضًا التعامل مع العلاقات السببية، والقيود الواقعية، وردود أفعال الخصوم، وتغيرات الاحتمالات. بينهما لا يوجد ببساطة تراكم للقدرات، بل تغيير في نموذج الحساب.
من الصعب أن تنشأ قدرات الذكاء الاصطناعي في اتخاذ القرار بشكل طبيعي فقط من خلال زيادة حجم المعلمات وتعزيز القدرة اللغوية. بعد الدخول إلى العالم المفتوح، لا تزال النماذج الأساسية مهمة، لكنها تبدأ بالتحول من كونها نظامًا كليًا إلى عنصر مكون في نظام اتخاذ القرار. وحدة المنافسة في الذكاء الاصطناعي أيضًا تنتقل من النموذج الفردي إلى النظام الكامل.
المعنى التقني لآلة اتخاذ القرار يكمن في أنها تُنظّم القدرات المتناثرة سابقًا ضمن هيكل قرار مشترك. ما يُسمى بـ"العمومية" لا يعني التنبؤ بمستقبل جميع المجالات، بل يعني أن مشكلات المجالات المختلفة يمكن ترجمتها جميعًا إلى حالات، وأفعال، ونتائج، وقيود، وعدم يقين، ثم إدخالها في إطار واحد للتحليل والحل.
من هذا المنظور، فإن القيمة الحقيقية لـ "أول نموذج قرار عالمي عام" لا تكمن فقط في التنافس على لقب "الأول"، بل في وضع إطار تقني كامل نسبيًا لـ "نموذج القرار العام": باستخدام وصف صريح للحالة لتمثيل العالم، وتطبيق وكالات متعددة لتنفيذ الإجراءات، واختبار الاستراتيجيات من خلال النظريات والتحسين، ثم استخدام التصحيح الاحتمالي لمسارات المستقبل المختلفة. ونتيجة لذلك، بدأت معايير تقييم الذكاء الاصطناعي也在 التغير — لا يكفي فقط تقييم دقة الإجابات، بل يجب أيضًا تقييم ما إذا كانت الحالة متسقة، وهل يمكن التحقق من الاستدلالات، وهل الاحتمالات موثوقة، وهل يمكن التحديث الفوري عند ظهور معلومات جديدة.
بعد كل شيء، الإجابة التي تبدو صحيحة لا تعني قرارًا يصمد أمام التغيرات الواقعية.
هذا المقال من حساب WeChat "Machine Heart" (ID: almosthuman2014)، المؤلف: مهتم بـ AI في اتخاذ القرار
