في دائرة النماذج الكبيرة، يُستخدم اختبار "الارتداء لملابس مزيفة" بشكل شائع.
في الآونة الأخيرة، ظهر نموذج مجهول يُدعى Ox Alpha فجأة على OpenRouter. Ox تعني ببساطة "ثور"، وسرعان ما أطلق عليه المتابعون في الصين اسمًا أكثر واقعية:
نموذج "الثور قادم".
وفقًا للإفصاحات المقدمة من OpenRouter، يمتلك Ox Alpha سياقًا بـ 1 مليون رمز، ويدعم مدخلات النص والصور والفيديو، ويمكنه استدعاء الأدوات، وهو مجاني تمامًا حاليًا.

بعد الإطلاق بوقت قصير، قام المطورون بربطه بعامل الترميز ووضعه في مستودعات كود حقيقية للاختبار.
أظهرت نتائج الاختبار الأولية أن نموذج "نيولاي" غير المعروف المصدر قد اقترب من قدرات نماذج البرمجة الرائدة الحالية.
في الوقت نفسه، أفاد مستخدمون على الإنترنت أن نموذجًا مجهولًا يُدعى korrine قيد الاختبار على Code Arena. يعتقد البعض أنه كيمي K3.1، ويُشار إليه أيضًا من قبل البعض إلى Qwen و MiMo، وتُقال أشياء مختلفة.
في أغسطس، تحول عالم النماذج الكبيرة فجأة إلى لعبة غموض كبيرة.
أداء النموذج الكبير "نيو لاي" مميز
ما جذب الانتباه حقًا إلى Ox Alpha هو قدرته على البرمجة.
قام المطور بن ديفيس باستخراج 10 مهام من DeepSWE للاختبار، وأنجز Ox Alpha 8 منها، ب率达到 نجاح 80%. وفي النتائج المنشورة، كانت Fable 5 Max عند 65%، وGLM-5.3 Max وGrok 4.6 xhigh كلاهما عند 62%، وGPT-5.6 Sol Max عند 52%.

DeepSWE يقيّم القدرات الحقيقية في هندسة البرمجيات. يجب على النموذج قراءة مستودع الكود، وتحديد المشكلات، وتعديل الكود، وتشغيل الاختبارات، ثم تصحيح الأخطاء بناءً على الأخطاء المُبلغ عنها. مقارنةً بأسئلة البرمجة أحادية الدورة، فهو أقرب إلى العمل الفعلي لوكيل البرمجة.
ومع ذلك، فإن عينة المهام العشرة صغيرة. بعد ذلك، اختبر مطورون آخرون مجموعة فرعية أخرى من DeepSWE، وحصلوا على نتيجة تبلغ حوالي 63%. نطاق المهام وتكوين التشغيل في كلا الاختبارين ليسا متطابقين تمامًا، لذا لا يمكن حاليًا تحديد الترتيب الدقيق لـ Ox Alpha بناءً على ذلك.

لكن هذه النتائج الأولية تُظهر أن هذا النموذج المجهول قد أظهر إمكانات قوية في الترميز الطويل المدى، مع قدرات تقترب من النماذج الرائدة الحالية.
من هو مالك النموذج الكبير "نيو لاي"؟
يُعتقد على نطاق واسع أن هوية النموذج الكبير "نيو لاي" هو GLM-5.3 Flash الذي لم يُصدر بعد من Zhipu، أو الإصدار متعدد الوسائط من GLM-5.3.
كتب شخص ما مدونة مخصصة للتحليل:
1. أقوى دليل يأتي من مشفر الفيديو. في أربع مقاطع فيديو بسرعات إطارات وأطوال ودقة مختلفة، استهلك Ox Alpha نفس عدد رموز البصرية تمامًا مثل GLM-5V-Turbo. بينما أظهرت MiMo وQwen وGLM-4.6V نتائج مختلفة بشكل واضح.
2. كما أن مُميّز النصوص متوافق تمامًا. قام الباحثون باختبار 25 مجموعة من المُحفزات، وظلت فجوة عدد التوكنات بين Ox Alpha و GLM-5.3 ثابتة عند 75 توكن.
3. تشير ميزات أخرى أيضًا إلى Zhipu. يرفض Ox Alpha معالجة الصوت، بنفس طريقة توجيه GLM-5V؛ كما أن أسلوب الإجابة وعدد خطوات تنفيذ العميل وواجهة الاستدلال قريبة جدًا من GLM. كما استخدمت Zhipu سابقًا Pony Alpha لاختبار GLM-5 بشكل مجهول، مما يوفر سابقة تشغيل مماثلة.

https://ox-alpha-evidence-production.up.railway.app/
كما وجد مستخدمون آخرون أدلة من المحادثة.

يعتقد بن ديفيس أن هناك 99% احتمالًا أن هذا هو GLM-5.x.

هذه الأدلة تزيد من مصداقية ما قاله GLM، لكنها غير كافية لإتمام تأكيد الهوية.
حتى الآن، لم تُصدر OpenRouter أو ZhiPu أي رد علني.
هوية كورين أكثر غموضًا
هوية النموذج الكبير "نيو لاي" لا تزال غامضة، وظهر نموذج مجهول آخر يُدعى korrine في Code Arena.
في البداية، تكهّن كثيرون أنه كيمي K3.1، السبب هو كيمي قبل إصدار K3، كان يُفترض أنه تم اختباره تحت اسم رمزية kivine. وبما أن kivine تشبه هيكليًا korrine، فقد أثار ذلك ارتباطات.

ومع ذلك، أضاف المصدر الذي نشر الخبر لأول مرة لاحقًا أن النموذج الجديد Moonshot الذي تم التعرف عليه سابقًا قد يتوافق مع كود آخر هو adamant-ananke. وقد يأتي korrine أيضًا من فرق صينية أخرى مثل Qwen.

في قسم التعليقات، لا يزال البعض يشير إليه إلى MiMo V3.

لماذا تُفضل شركات النماذج الكبيرة "ارتداء أقنعة"؟
الاختبارات المجهولة تصبح جزءًا مهمًا قبل الإصدار الرسمي للنماذج الكبيرة.
إخفاء المُصنّع والنماذج في Arena يمكنه تقليل التحيز الناتج عن العلامة التجارية قدر الإمكان. حيث لا يرى المستخدمون هوية النموذج، بل يختارون بناءً على الإخراج الفعلي، مما يجعل نتائج المواجهات المتراكمة أكثر قربًا من تجربة المستخدم الحقيقية.
يوفر OpenRouter بيئة اختبار من نوع آخر.
سيقوم المطورون بتوصيل النموذج بأنواع مختلفة من وكلاء الترميز، ليُدخله مستودعات حقيقية، ويدعو الأدوات بشكل متواصل، ويعالج مهام هندسة البرمجيات التي تستمر لساعات عديدة. يمكن الكشف بسرعة عن استقرار السياق، وموثوقية استدعاء الأدوات، وما إذا كان النموذج سيُدخل في دوائر أو ينحرف أثناء المهام الطويلة، من خلال الاستخدام المكثف.
للمصنّعين النماذج، هذا يعادل اختبار ضغط عام. يمكن للفريق مراقبة حالات الفشل مسبقًا، وتأكيد قدرة خدمة الاستدلال، وجمع سمعة حقيقية قبل الإطلاق الرسمي.
بالإضافة إلى ذلك، أصبح "تخمين النموذج" أيضًا وسيلة تسويقية متزايدة الأهمية، حيث يمكن للغموض حول الهوية أن يطيل دورة النقاش.
أخيرًا، لنعد إلى النموذج نفسه. إذا كان Ox Alpha حقًا نموذجًا مُسرّعًا، وقد وصلت قدراته البرمجية إلى مستوى الرأس، فما المدى الذي سيصل إليه الإصدار الكامل، الأعلى تمويلًا والأكثر اكتمالاً؟
رابط المرجع:
https://x.com/Adidotdev/status/2090833298713096241
https://x.com/davis7/status/2090669483740279155?s=20
https://x.com/davis7/status/2090655207831298095?s=20
https://x.com/MaxForAI/status/2090783750217162788
هذا المقال من حساب ويشات الرسمي "ماشين سينس" (ID: almosthuman2014)، المؤلف: مهتم بالذكاء الاصطناعي
