في الأسبوع الماضي، ظهر Qwen3.8-Max-Preview وKimi K3 متتاليين، مما دفع حجم معلمات النماذج الكبيرة المحلية إلى أكثر من تريليونين.
لكن منافسة النماذج الكبيرة تجاوزت منذ زمن النسخة التي تركز فقط على المعايير وعدد المعلمات. القدرة على التدخل الفعلي في سير العمل اليومي هي أفضل معيار لقياس قدرة النموذج الأساسي.
لهذا السبب، قررت Biteye اليوم أن تعرف إذا كان الحمار أو الحصان، فجربها.
بنفس مطالبة "اجعل لعبة صغيرة على الويب بأسلوب Biteye بجملة واحدة"، قدمت نماذج Qwen3.8 وKimi K3 وgpt5.6 sol إجابات مختلفة تمامًا:
- Qwen3.8: قادر على الحركة، وفقط قادر على الحركة
- GPT-5.6 Sol: المظهر البصري جميل، مثل موقع العلامة التجارية الرسمي
- Kimi K3: الأكثر تنوعًا في الميزات، وأقوى إحساس باللعبة
⚠️ ملاحظة توضيحية: نظرًا لقيود الحوسبة على Kimi K3، لم يعد الاشتراك مفتوحًا، وقد تم استدعاء هذا الاختبار من قبل WorkBuddy.
Qwen3.8: إقلاع الطائرة المقاتلة، ثم لم يحدث شيء | التقييم: نجمة واحدة ⭐
https://x.com/i/status/2079865420576927996
فتح إصدار Qwen3.8، أول انطباع هو: هل تضحك علي؟
خلفية زرقاء داكنة، وشعار في المنتصف ليس شعارًا أصليًا لـ Biteye، وزر "بدء اللعبة". النص الأسود في العنوان يندمج مع الخلفية الداكنة، كأنه فعّل وضع التخفي مسبقًا.
بعد الدخول إلى اللعبة، الوظائف الأساسية تكون مقبولة إلى حد ما:
- Drag the fighter jet with your mouse
- الإطلاق التلقائي للرصاص
- طائرة معادية على شكل مثلث أحمر
- Score statistics
- الاصطدام وآلية الإنهاء
في الاختبار العملي، يمكن للطائرة المقاتلة أن تطلق النار بشكل مستمر، وارتفع النقاط إلى 858، ونجح Qwen3.8 على الأقل.
لكن المشكلة أن اللعبة بأكملها تشبه مثال Canvas مُنشأ حديثًا: الطائرات المعادية مثل المثلثات، والطلقات مثل النقاط الضوئية، ولا توجد تغييرات كبيرة في اللعب. لا توجد أي تطورات في الأسلحة، ولا نظام للمعدات، ولا إيقاع واضح للمراحل.
كما أعلنت فرقة Qwen نفسها، لم تكتمل التدريبات اللاحقة لـ Qwen3.8، وهي قيد "التحسين اليومي".
من الواضح أن فريق الفن والتخطيط لم ينضما بعد إلى المجموعة.
GPT-5.6 Sol: التصميم الجيد، لكن اللعب يحتاج إلى تحسين | التقييم: 3.5 ⭐
https://x.com/i/status/2079865420576927996
افتح إصدار GPT-5.6 Sol، وفجأة يرتفع الزخم.
الجانب الأيسر يحتوي على المهام البارزة، والجانب الأوسط هو منطقة القتال، والجانب الأيمن هو رادار مرئي ووحدة قياس عن بعد. الخلفية الداكنة مع لون سماوي فلوري، بالإضافة إلى المزج بين الصينية والإنجليزية وعناصر علامة Biteye، تخلق إحساسًا بصريًا قويًا يشبه لوحة قيادة عميل سري 007.
نظامه أيضًا أغنى بكثير من Qwen، على سبيل المثال:
- Wave波次
- Armor装甲
- حالة Overdrive
- Combo連擊
- أعلى سجل
- إيقاف الوظيفة
- عمل الماوس واللوحة المفاتيح معًا
في الاختبار العملي، نجح اللعبة في التشغيل وحصلت على 922 نقطة. بعد الفشل، لا يتم عرض "Game Over" بشكل بسيط، بل يظهر "الطائرة المقاتلة غير متصلة"، وعند إعادة البدء، يُطلق عليه "إعادة الاتصال". من البداية حتى التقييم، تحتفظ النصوص والتصميم بعالم بصري متسق، وهو أمر مميز جدًا.
لكن مشكلة GPT-5.6 Sol هي أنها تُقدّم التغليف بشكل مفرط. تشغل لوحات المعلومات على الجانبين مساحة كبيرة، بينما يتم دفع منطقة اللعبة الحقيقية إلى الوسط. إنها أكثر شبهاً بصفحة حملة ترويجية مكتملة جيداً، تم إدراج لعبة صغيرة فيها بالصدفة.
بالمقارنة مع Qwen3.8، تم تعيين فريق الفنون والعلامة التجارية والتشغيل الخاص بـ gpt-5.6 sol، لكن مصممي الألعاب يبدو أنهم أخذوا قيلولة.
Kimi K3: بينما يُجري الآخرون نموذجًا تجريبيًا، تبدأ في إضافة نقاط الدفع المدفوعة | التقييم: 4 نجوم ⭐
https://x.com/i/status/2079865420576927996
رغم أن الشاشة الأولى لـ Kimi K3 ليست مذهلة مثل GPT-5.6 Sol، إلا أن طريقة اللعبة تغير الأمور:
- W: ترقية القوة النارية
- S: StarShield
- B: قنبلة
- H: إصلاح
- Space: Deploy the bomb
- P: مُعلَّق
- M: إيقاف الصوت
بعد الدخول إلى اللعبة، هناك ثلاث حياة، ومستوى القوة، وعدد القنابل، وزر الإيقاف المؤقت، ومفتاح الصوت.
النسختان الأخريان لا تزالان تتعثّران في حلّ "كيفية تحريك الطائرة"، بينما بدأ Kimi K3 في التفكير في كيفية لعب اللعبة بعد أن يلتقط اللاعب الأدوات.
هذا هو الفرق الأكثر وضوحًا بين الإصدارات الثلاثة: قام Qwen بإضافة وظيفة التصويب، وقام Sol بتغليف بصري، بينما أضاف Kimi بشكل نشط الأدوات والموارد والنمو والمهارات النشطة.
Of course, its visuals are still not detailed. Enemy aircraft and effects are mostly simple geometric shapes, and some logo assets are applied quite directly. But as a small game, it knows best how to constantly give players new things.
ثلاثة نماذج، إلى أي قسم يُستقطب كل منها؟
إذا اعتُبرت النماذج الثلاثة موظفين جدد، فسيكون هذا الاختبار تقريبًا كالتالي:
لعبة توليد جملة واحدة، لم يعد التنافس يعتمد فقط على الكود
على سبيل المثال، مع اختبار طائرة Biteye الرعدية، الآن من السهل جدًا جعل النموذج الكبير يكتب كودًا لإنشاء صفحة ويب "تتحرك الطائرة وتطلق الرصاص".
لكن ما يُحدث الفرق الحقيقي هو ما إذا كان النموذج، بعد تدريبه على المنطق المسبق، سيصمم بنشاط ملاحظات، ومستويات، وأدوات، ونمو، ومواضيع بصرية. لا يكفي أن يفهم النموذج الكبير الشيفرة، بل يجب أن يفهم حقًا لماذا يرغب اللاعبون في لعب جولة أخرى.
