Qwen3.8, Kimi K3 et GPT-5.6 testés dans la génération de jeux « Thunder Jet »

iconMetaEra
Partager
AI summary iconRésumé
Un récent test sur chaîne dans MetaEra a évalué Qwen3.8, Kimi K3 et GPT-5.6 Sol pour la création d’un jeu web « Thunder Jet ». Qwen3.8 a produit un jeu de base, GPT-5.6 Sol s’est concentré sur les visuels, et Kimi K3 a ajouté des armes et des améliorations. Les résultats montrent comment les actualités crypto et les LLM sont testés pour la logique de conception de jeux au-delà de la génération de code.

Au cours de la semaine écoulée, Qwen3.8-Max-Preview et Kimi K3 ont été dévoilés successivement, portant la taille des paramètres des grands modèles nationaux à plus de 2 billions.

Cependant, la bataille des grands modèles a depuis longtemps dépassé la phase où l'on se contentait de regarder les benchmarks et les paramètres. La capacité à s'intégrer concrètement dans les flux de travail quotidiens est le meilleur critère pour évaluer les performances des modèles de base.

À ce sujet, Biteye décide aujourd'hui de mettre les choses au clair.

Avec le même prompt « Créez un petit jeu web de type Thunder Fighter au style Biteye en une phrase », les trois modèles Qwen3.8, Kimi K3 et gpt5.6 sol ont produit des réponses complètement différentes :

  • Qwen3.8 : capable de bouger, et uniquement capable de bouger
  • GPT-5.6 Sol : L'interface est visuellement attrayante, comme un site web officiel de marque.
  • Kimi K3 : le plus de fonctionnalités, le plus fort sentiment de jeu

⚠️ Avertissement : en raison de limitations de puissance de calcul, Kimi K3 n'est plus disponible pour abonnement ; ce test a été effectué par WorkBuddy.

Qwen3.8 : L'avion de combat a décollé, mais il n'y a eu rien d'autre | Évaluation : 1 étoile

https://x.com/i/status/2079865420576927996

🔗 : Essayez la version Qwen3.8

Ouvrir la version Qwen3.8, premier sentiment : tu te moques de moi ?

Fond bleu foncé, un logo non natif de Biteye au centre, un bouton « Commencer le jeu ». Le texte noir dans le titre se fond dans le fond sombre, comme s'il avait activé le mode invisibilité à l'avance.

Après avoir entré le jeu, les fonctionnalités de base sont tout juste acceptables :

  • Drag the fighter jet with your mouse
  • Tir automatique
  • Avion ennemi en triangle rouge
  • Score counting
  • Collision et mécanisme de clôture

Lors des tests pratiques, l'avion de chasse a pu tirer en continu, et le score a atteint 858 ; Qwen3.8 fonctionne au moins correctement.

Le problème, c’est que le jeu ressemble à un simple démonstrateur Canvas : les avions ennemis sont des triangles, les balles sont des points lumineux, et le gameplay ne change pratiquement pas. Il n’y a aucune progression d’armes, aucun système d’objets, et aucun rythme de niveau évident.

Comme l'a annoncé l'équipe Qwen elle-même, le fine-tuning de Qwen3.8 n'est pas encore terminé et est en cours d'itération quotidienne.

Apparemment, les artistes et les concepteurs n'ont pas encore rejoint le groupe.

GPT-5.6 Sol : L'aspect visuel est bien, mais le gameplay nécessite des améliorations | Évaluation : 3,5 ⭐

https://x.com/i/status/2079865420576927996

🔗 : Essayez la version GPT-5.6 Sol

Ouvrez la version GPT-5.6 Sol, et l'ambiance monte immédiatement.

À gauche se trouvent les tâches marquantes, au centre la zone de combat, et à droite le radar visualisé et les modules de télémétrie. Un fond sombre combiné à un cyan fluorescent, ainsi qu’un mélange de chinois et d’anglais et des éléments de la marque Biteye, créent une esthétique très similaire à un tableau de bord d’agent 007.

Son système est également bien plus riche que celui de Qwen, par exemple :

  • Wave
  • Armor装甲
  • État Overdrive
  • Combo连击
  • Record maximal
  • Fonction de pause
  • Commande simultanée par souris et clavier

Lors des tests réels, le jeu a fonctionné correctement et a obtenu un score de 922. En cas d'échec, il n'affiche pas simplement « Game Over », mais « Avion hors ligne » ; pour recommencer, il faut cliquer sur « Reconnecter ». Du début à la fin, le texte et le visuel maintiennent une cohérence narrative, ce qui est assez stylé.

Cependant, le problème avec GPT-5.6 Sol, c’est qu’il est trop bon pour le conditionnement. Les panneaux d’information des deux côtés occupent un espace considérable, tandis que la zone de jeu réelle est comprimée au centre. Cela ressemble davantage à une page d’action de marque très aboutie, dans laquelle un petit jeu a été intégré en passant.

Par rapport à Qwen3.8, l'équipe artistique, la marque et les opérations de gpt-5.6 sol sont toutes en place, mais le concepteur de jeu semble avoir fait la sieste.

Kimi K3 : Pendant que les autres font des démos, il commence à intégrer des points d'achat premium | Évaluation : 4 étoiles ⭐

https://x.com/i/status/2079865420576927996

🔗:Essayez la version Kimi K3

La page d'accueil de Kimi K3 n'est pas aussi impressionnante que celle de GPT-5.6 Sol, mais dès que les instructions du jeu apparaissent, l'ambiance change :

  • W : Puissance renforcée
  • S: StarShield
  • B : Bombe
  • H : Correction
  • Space: Drop the bomb
  • P : Pause
  • M : Muet

Après avoir commencé le jeu, vous disposez de trois vies, d'un niveau de puissance de feu, d'un nombre de bombes, d'un bouton de pause et d'un interrupteur sonore.

Les deux autres versions peinent encore à résoudre « comment déplacer l'avion », tandis que Kimi K3 commence déjà à envisager comment les joueurs interagiront avec les objets ramassés.

C'est aussi la différence la plus évidente entre les trois versions : Qwen a implémenté la fonction de tir, Sol a apporté le packaging visuel, et Kimi a activement ajouté les objets, les ressources, la progression et les compétences actives.

Of course, its visuals are still not detailed. Enemy aircraft and effects are mostly simple geometric shapes, and some logo assets are applied quite directly. But as a small game, it knows best how to constantly give players new things.

Trois modèles, à quel département les recruter ?

Si l'on considère les trois modèles comme de nouveaux employés, ce test ressemblerait à peu près à cela :

Image

Un jeu généré en une phrase, où la rapidité ne se mesure plus seulement au code.

Avec l'exemple du test de l'avion foudroyant de Biteye, il n'est plus difficile aujourd'hui de faire écrire à un grand modèle du code pour créer une page web où « l'avion se déplace et les balles sont tirées ».

Mais ce qui fait vraiment la différence, c’est que, après une formation sur la logique préalable, le modèle concevra-t-il activement des mécanismes de retour, des niveaux, des objets, une progression et un thème visuel ? Le grand modèle doit non seulement comprendre le code, mais aussi véritablement comprendre pourquoi les joueurs veulent rejouer.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.