أصبحت مفرطة.
لم يمر سوى ثلاثة أيام من سبتمبر، وتم إطلاق خمسة نماذج رائدة بالفعل!
Fable 5.1 وMythos 5.1 من Anthropic، وGemini 3.8 Flash وCyber من Google، وMuse Spark1.3 من Meta... RSI، لقد حان بالتأكيد.
في الليلة الماضية،刚刚成为轻量级霸主的谷歌Gemini 3.8 Flash,就迎来了Meta的挑战。
زوكربيرغ يُعلن بثقة على X: تم إطلاق Muse Spark 1.3 رسميًا اليوم، حيث تقدم أداءً متقدمًا وتجربة شبه مجانية تمامًا. هذه أكبر قفزة حققناها حتى الآن في البرمجة وعملية الوكلاء!

ألكسندر وانغ، رئيس مختبر الذكاء الاصطناعي الفائق التابع لـ Meta، نشر ثلاث منشورات على X كاشفًا عن السلاح السري الأساسي لهذا "الضربة القاضية".
أشار إلى أن Muse Spark 1.3 قلّص الدورات غير الفعّالة مقارنةً بـ Muse Spark 1.2، وخفض عدد مرات استدعاء الأدوات بنسبة ~20%، وقلّص استهلاك tokens بنسبة ~25%، كما حافظت بشكل أفضل على المتطلبات في المهام الطويلة الأمد، "سيشعر المستخدمون بوضوح بهذه القفزة".

بعد إصدار Muse Spark 1.3، أصبح Gemini 3.8 Flash الذي تم إصداره الليلة الماضية يبدو محرجًا قليلاً.
يُظهر العرض أن تحسين Muse Spark 1.3 أكبر هذه المرة.
ليس فقط أنّه تجاوز GPT-5.6 Sol و Fable 5 في الأداء، بل إن مؤشر الذكاء Artificial Analysis تحت قوة الاستدلال Max قد وصل إلى 62 نقطة، مما يضعه بثقة في الطليعة الحالية.

في خمسة أشهر، طورت ميتا دون أن تلاحظ أربعة إصدارات من Muse Spark.
ألكسندر الملك يسخر من جوجل: "يتنفس دخان نماذج الآخرين"
في الآونة الأخيرة، كان الصف الأول للذكاء الاصطناعي مزدحمًا جدًا. GPT-5.6 يحتفظ بالعرش، بينما تقدم Fable 5.1 بقوة، وGemini 3.8 Flash يتجاوزهم في المنعطف.
ظهور Muse Spark 1.3 أربك جميع الأشخاص مباشرة.
في اختبار DeepSWE v1.1 الذي يعكس أفضل قدرات النموذج الحقيقية في البرمجة الطويلة المدى، تجاوز Muse Spark 1.3 مباشرةً Opus 5 وGPT-5.6 Sol، وأبعد أيضًا Gemini 3.8 Flash الذي تم إصداره حديثًا، وحقق أعلى درجة حالية.
Muse Spark 1.3: 75.4 درجة
Claude Opus 5: 74.0 درجة
GPT-5.6 Sol: 73.0 درجة

不仅如此,在其他几项关键的开发者指标中,Muse Spark 1.3 也展现出了不容小觑的性能。
في SWEAtlas CodeBase QnA، حصل على درجة 59.4، متفوقًا على GPT-5.6 Sol و Opus 5.
في Terminal-Bench 2.1، حصل على درجة 88.8.
على MRCR 512K-1M، حصل على درجة مذهلة قدرها 98.1! (كمقارنة، حصل GPT-5.6 Sol على 73.8 فقط، وهو فرق هائل).

في قدرات Agent، فقد تقارب بشكل أساسي أعلى المستويات المتقدمة، مع فرق ضئيل ببضعة نقاط مئوية فقط مقابل Opus 5 في اختبارات JobBench و OSWorld.

على Artificial Analysis، تفوق Muse Spark 1.3 على Gemini 3.8 Flash بوضوح.
على المؤشر الذكي، حصل على درجة 62، متساويًا مع Claude Fable 5، ودخل فئة القمة.

وفيما يتعلق بأعلى التكاليف التي يهتم بها المطورون، فإن تكلفة إدخال Muse أقل بـ 8 مرات من تكلفة Fable 5، وتكلفة الإخراج أقل بنحو 12 مرة، مما يوفر أفضل قيمة مقابل المال.
بمواجهة هذا الأداء المذهل، قال ألكسندر وانغ، الرئيس التنفيذي للذكاء الاصطناعي في ميتا، بشكل ساخر: "في مؤشر Artifical Analysis الذكي، لا يمثل Gemini شيئًا، بل يقتصر على استنشاق عادم نماذج الآخرين."
Google حقًا وقع في مصيدة.

يُقال ساخرًا: "قضت جوجل أربعة أشهر شاقة في إطلاق أربعة إصدارات من Gemini Flash، بينما أجرت ميتا أربع ترقيات متتالية لـ Muse Spark⁺ خلال خمسة أشهر. لكن جوجل لم تُبقِ على صدارتها سوى بضع ساعات، حتى تجاوزتها ميتا—هذا السيناريو مثير جدًا."

الأقل هو الأكثر: وحدة أداء بسعر دولار واحد تدوم ساعتين
إن ارتفاع الأداء مهم بالتأكيد، لكن في دائرة الذكاء الاصطناعي اليوم، ما يثير المطورين حقًا هو دائمًا الأداة السهلة الاستخدام والرخيصة.
يُطلق على Muse Spark 1.3 لقب ملك القيمة مقابل السعر لأنه ليس فقط سريعًا، بل أيضًا يوفر المال بشكل استثنائي.
كما قال ألكسندر وانغ، فإن Muse Spark 1.3 "رخيصة لدرجة لا تُذكر" و"أداء متقدم، والتكلفة مجرد جزء ضئيل".


لقد سلكت طريقًا مختلفًا تمامًا عن النماذج الكبيرة السابقة التي تعتمد على "القوة الغاشمة وإضافة المعلمات بجنون" — إنها تُقلل.
تم تدريب Muse Spark 1.3 خصيصًا لتحسين البرمجة على المدى الطويل وقدرة أفضل على اتباع التعليمات، مما يقلل من جولات التفاعل غير الضرورية ويجعل المخرجات أكثر إيجازًا.

أصبح أكثر ذكاءً وانسيابية، وأسلوب الكود أنظف، وأقل تكرارًا.
والنتيجة المباشرة لهذا الطرح هي الانخفاض الحاد في التكلفة.
إليك حالة اختبار حقيقية مذهلة جدًا.
المطور @SPAC89 قام بمقارنة Muse Spark 1.3 Ultra Contributor Mode مع Fable 5.1 xHigh.

يحتوي الـ Prompt الذي قدمه على قاعدة صارمة "لتحسين الذات": إذا كان تقييم القاضي المستقل أقل من 9.5/10، يجب على الوكيل تحسين الكود وإعادة المحاولة.
عمل كلا النموذجين لمدة ساعتين تقريبًا، وكانت النتائج مذهلة.
يبدو Muse Spark 1.3 وكأنه عامل فائق الكفاءة لا يعرف التعب، فهو لم يتوقف أبدًا، واجتاز 20 دورة تحسين ذاتي، حيث يُطلق كل مرة 3 وكلاء — ما يعادل أكثر من 60 تشغيلًا للوكلاء خلال ساعتين.
لكن تكلفة إكمال هذه المهمة الطويلة والمعقدة للغاية كانت أقل من دولار واحد!

أعرب المطور عن دهشته: "هذا تجاوز تمامًا توقعاتي، إنه حقًا عمل فني!"
في التسعير الكلي، أظهرت ميتا نية صادقة للغاية. فقد حافظ النموذج الجديد على التسعير عند 1.25 دولار لكل مليون رمز إدخال و4.25 دولار لكل مليون رمز إخراج، مع زيادة الكمية دون رفع السعر.

في التسعير، تُعد نسخة المساهمين من Muse Spark 1.3 "muse-spark-1.3-contributor" أدنى سعر ممكن للنماذج الأجنبية. (الثمن هو استخدام البيانات لتحسين منتجات Meta.)

المؤسس والمطور ميهول مohan من Codedamn يقول مباشرة:
أسعار طبقة المساهمين في Muse Spark 1.3 غير واقعية بشكل مفرط، هذا هو ما تفعله مختبرات الذكاء الاصطناعي الأمريكية « ديب سيك لحظة التسعير.

وفقًا لإحصائيات Artificial Analysis، فإن تكلفة المهمة الواحدة لموديل Muse Spark 1.3 تبلغ فقط 0.55 دولارًا بين النماذج ذات المستوى المعرفي المتساوي (درجة 59 فما فوق)، مما يجعله الحل الأمثل المطلق.
مقارنةً بذلك، تكلفة Grok 4.6 بنفس الذكاء (61 درجة) هي 0.94 دولار، بينما تتطلب GPT-5.6 Sol 0.95 دولار، وClaude Opus 5 تصل إلى 1.23 دولار.
حتى أن المطور كارتيك أشار إلى أن Muse Spark 1.3 تبدو مزودة بقدرة استدلالية "دورية عميقة" مشابهة لـ Sol وFable.
إنه لا يولد الإجابة فورًا، بل يفهم إجراء الاستدلال المنطقي داخليًا، مما يجعل كفاءة الرموز الخاصة به مذهلة.

انطلاق ألكسندر وانغ، الطموح النهائي لزوكربيرغ
ظهور Muse Spark 1.3 لا يمكن أن يحدث دون المُتداولين وراءه.
في يوليو من هذا العام، أطلقت Meta Muse Spark 1.1، والتي تتميز بسياق طويل يصل إلى 1M وعمليات الحاسوب.
في أقل من شهرين، رفعت النسخة 1.3 قدرة الترميز الطويلة إلى مستوى GPT-5.6.
هذا التكرار السريع هو بالضبط النتيجة التي أتى بها ألكسندر وانغ بعد توليه مختبر الذكاء الفائق التابع لـ Meta.
ما هدفهم النهائي؟ كما أكد زوكربيرغ وألكسندر وانغ مرارًا وتكرارًا على كلمتين: "الوكيل" و"رخيص لدرجة لا تُذكر".
بمعنى آخر، تنظر ميتا إلى الفرصة التالية في ASI — "هندسة الوكلاء".
أكد ألكسندر وانغ، مدير Meta AI، في مقابلة مع Axios أن جميع تحسينات التوفر تهدف إلى خدمة الرؤية الطموحة التي أشار إليها زوكربيرغ مرارًا وتكرارًا — إنشاء وكيل شخصي متاح على مدار الساعة طوال أيام الأسبوع.

لجعل وكيل يعالج البريد الإلكتروني، ويكتب الكود، وينحل البيانات على مدار 24 ساعة، يجب أن يتوفر لديه شرطان.
1. ذكي جدًا ومستقر: يحتاج إلى دعم سلاسل محادثات طويلة جدًا (سلاسل طويلة)، ويمكنه معالجة تدفقات عمل متعددة بالتوازي.
عندما يكون الأمر غامضًا، يجب أن يطرح أسئلة استباقية؛ عندما يواجه عقبات، يجب أن يطلب مساعدة البشر؛ قبل تنفيذ العمليات الحاسمة، يجب أن يؤكد. والأهم من ذلك، ألا يخلق وهومًا.
2. رخيص جدًا: إذا كان تكلفة تشغيل العامل الذكي الشخصي يوميًا تصل إلى عشرات الدولارات، فسيظل دائمًا لعبة لقلة فقط.
ظهور Muse Spark 1.3 يُمهد بشكل أساسي الطريق للوكلاء الشخصيين على مدار 7×24 ساعة.
إنه مثل مهندس خبير ناضج، عندما تمنحه هدفًا، يستطيع التخطيط لنفسه، وتصحيح أخطائه، وتسليم النتيجة.
لذلك، كشف سون زهيتشينغ، خريج جامعة بكين وباحث في ميتا، أن فريق ميتا أعاد تدريب نموذج الأفوكادو السابق، مما حقق تحسينًا أفضل في التوسع في الاختبارات.

ما وراء الاحتفال: هل تم خداعنا عبر "التزوير في الترتيبات"?
However, Muse Spark 1.3 has also been questioned.
أصدرت مؤسسة الذكاء الاصطناعي المعروفة BridgeMind رسالة مُلهمة:
تم إصدار Gemini 3.8 Flash وMuse Spark 1.3 اليوم معًا. يبدو كلاهما ممتازًا في الاختبارات القياسية.
Muse Spark 1.3 حاليًا متزامن مع Fable 5 على المؤشر الذكي... أريد أن أشعر بالإثارة. لكنني لا أشعر بها.
لأن إصدارات الذكاء الاصطناعي لهذا الشهر متشابهة تمامًا، حيث ارتفعت النقاط، لكن تجربة العالم الحقيقي لم تتحسن إطلاقًا.
هذا مُحبِط. ثقتي في المعايير تتناقص أسبوعًا بعد أسبوع، وثقتي في المختبرات التي تُلاعب المعايير تكاد تنعدم.

هذه الجملة تُصيب بدقة نقاط الألم الحالية في صناعة النماذج الكبيرة.
أجرى مستخدمون على الإنترنت اختبارات ضغط على Muse Spark 1.3 وGemini Flash 3.8z تحت قيود ثلاثية الأبعاد على مستوى الخادم، وكُشفت نقاط الضعف في كلا النموذجين:
Muse Spark 1.4 ليست جيدة كما يُزعم، بينما Gemini Flash 3.5 تُزيف الترتيبات بشكل صارخ.

الآن، وقعت المختبرات الكبرى في دوامة "التدريب من أجل تحسين التقييمات". عند إصدار نموذج، يصاحبها بالضرورة بعض رسومات الرادار ومقتطفات لقوائم الترتيب التي تُظهر تفوقها على المنافسين.
DeepSWE و Tau3-Bench و GPQA أصبحت أهدافًا مجنونة للجميع للتدريب المكثف.
While Muse Spark 1.3 has also revealed its true nature.
في التقرير العميق لـ Artificial Analysis، يمكننا أيضًا ملاحظة تراجع طفيف فيه.
على سبيل المثال، في اختبار AA-Omniscience، انخفضت إصدارات xhigh و max. السبب هو ارتفاع "معدل الامتناع" — فعندما لا تكون متأكدة، فإنها تفضل عدم الإجابة بدلاً من اختراع إجابات.
هذا يقلل من معدل الوهم، لكنه يشير أيضًا إلى أن مخزون معرفته المطلق لم يتحسن بنفس القدر المبالغ فيه الذي تحسّن به الأداء.

في النصف الثاني للنماذج الكبيرة، ما الذي نقارن به؟
اليوم، مع إصدار Muse Spark 1.3 وGemini 3.8 Flash، يمكننا استخلاص عدة استنتاجات.
أولاً، تُحقق "مكاسب المعلمات" للنموذج الأساسي ذروتها.
المسار القائم فقط على زيادة حجم المعلمات لتعزيز الذكاء يصبح تدريجيًا أقل فعالية.
في المستقبل، من يستطيع أن يُدخل آلية استدلال مشابهة لـ"العمق الدائري" في البنية النظامية، كما فعل Muse Spark 1.3، ويُجري تبسيطًا قصوى في استدعاء الأدوات، سيحقق قفزة حقيقية في التجربة.
إضافةً إلى ذلك، فإن "هندسة الوكلاء" هي المفتاح الحاسم.
المنافسة بين النماذج الكبيرة انتقلت من "من يتحدث أفضل" إلى "من يعمل أفضل".
الحاجز الأساسي المستقبلي ليس الأداء الفردي، بل القدرة على تنفيذ المهام الطويلة الأمد بتكاليف منخفضة جدًا.
ستُعيد نماذج مثل Muse Spark 1.3، التي يمكنها إكمال 60 دورة تجريبية بتكلفة أقل من دولار واحد، تشكيل نماذج الأعمال بالكامل.
المراجع:
https://x.com/SPAC89/status/2095284969614475744
https://research.meta.ai/blog/introducing-muse-spark-1-3
https://x.com/AIatMeta/status/2095234385129963666?s=20
https://artificialanalysis.ai/zh/models/muse-spark-1-3
https://x.com/EdwardSun0909/status/2095236891574780275?s=20
هذا المقال من حساب WeChat "New Intelligence Yuan"، الكاتب: Apocalypses of ASI
