Qwen3.8, Kimi K3 y GPT-5.6 se probaron en la generación de juegos 'Thunder Jet'

iconMetaEra
Compartir
AI summary iconResumen
Una reciente prueba de noticias on-chain en MetaEra evaluó a Qwen3.8, Kimi K3 y GPT-5.6 Sol en la generación de un juego web llamado 'Thunder Jet'. Qwen3.8 produjo un juego básico, GPT-5.6 Sol se enfocó en los visuales, y Kimi K3 añadió armas y mejoras. Los resultados muestran cómo las noticias de cripto y los LLMs se están probando para diseñar lógica de juegos más allá de la generación de código.

La semana pasada, Qwen3.8-Max-Preview y Kimi K3 se presentaron sucesivamente, llevando el tamaño de parámetros de los modelos grandes nacionales a más de 2 billones.

Sin embargo, la competencia entre grandes modelos ya superó la etapa en la que solo se evaluaban los benchmarks y los parámetros. La capacidad de integrarse realmente en los flujos de trabajo diarios es el mejor estándar para medir la habilidad de los modelos base.

Para esto, Biteye decidió hoy poner a prueba si es un burro o un caballo, sacándolo a pasear.

Mismo prompt: “Haz un pequeño juego web de Thunder Fighter con un estilo Biteye en una sola oración”, tres modelos — Qwen3.8, Kimi K3 y gpt5.6 sol — entregaron respuestas completamente diferentes:

  • Qwen3.8: Puede moverse, y solo puede moverse
  • GPT-5.6 Sol: La visualización es atractiva, como la página web de una marca
  • Kimi K3: el que tiene más funciones y mayor sentido de juego

⚠️ Nota informativa: Debido a que Kimi K3 ya no está disponible para suscripción por limitaciones de potencia de cálculo, esta prueba fue realizada mediante WorkBuddy.

Qwen3.8: El avión de combate despegó, pero no pasó nada más | Calificación: 1 estrella ⭐

https://x.com/i/status/2079865420576927996

🔗:Prueba la versión Qwen3.8

Abrir la versión Qwen3.8, la primera impresión es: ¿me estás tomando el pelo?

Fondo azul oscuro, un logotipo que no es nativo de Biteye en el centro, y un botón "Comenzar juego". El texto negro en el título se funde con el fondo oscuro, como si hubiera activado previamente el modo invisibilidad.

Al entrar al juego, las funciones básicas son más o menos funcionales:

  • Arrastre el avión de combate con el mouse
  • Disparo automático
  • Avión enemigo con triángulo rojo
  • Puntuación
  • Colisión y mecanismo de finalización

En la prueba práctica, el avión de combate puede disparar continuamente, y la puntuación aumentó hasta 858; Qwen3.8 al menos funcionó.

El problema es que todo el juego parece un demo de Canvas recién montado: los aviones enemigos son triángulos, las balas son puntos de luz, y la jugabilidad no ha cambiado en absoluto. No hay ningún sistema de crecimiento de armas, ningún sistema de ítems, ni ritmo de niveles evidente.

Como lo anunció el propio equipo de Qwen, el entrenamiento posterior de Qwen3.8 aún no está listo y se encuentra en "iteración diaria".

Claramente, el arte y la planificación aún no han entrado al grupo.

GPT-5.6 Sol: El diseño gráfico es bueno, pero la jugabilidad necesita mejora | Calificación: 3.5 ⭐

https://x.com/i/status/2079865420576927996

🔗:Prueba la versión GPT-5.6 Sol

Abrir la versión GPT-5.6 Sol, y de inmediato se eleva el ánimo.

A la izquierda se encuentran las tareas destacadas, en el centro está la zona de combate, y a la derecha, el radar visualizado y los módulos de telemetría. El fondo oscuro combinado con cian fluorescente, junto con el texto en chino e inglés y los elementos de la marca Biteye, crea una sensación visual muy similar al panel de instrumentos de un agente 007.

Su sistema también es mucho más rico que el de Qwen, por ejemplo:

  • Wave波次
  • Armor装甲
  • Estado Overdrive
  • Combo de golpes
  • Récord más alto
  • Función de pausa
  • Operación dual con ratón y teclado

En la prueba práctica, el juego se ejecutó correctamente y obtuvo una puntuación de 922. Tras fallar, no aparece simplemente "Game Over", sino "Avión fuera de línea"; para reiniciar, se muestra "Reconectar". Desde el inicio hasta el resultado final, el texto y el diseño mantienen un mismo universo narrativo, lo cual es bastante elegante.

Sin embargo, el problema con GPT-5.6 Sol es que es demasiado bueno en el empaquetado. Los paneles de información a ambos lados ocupan un espacio considerable, mientras que la zona real del juego queda comprimida en el centro. Es más como una página de campaña de marca muy pulida, con un pequeño juego incrustado de paso.

En comparación con Qwen3.8, el arte, la marca y las operaciones de gpt-5.6 sol ya están completos, pero el diseño del juego claramente ha relajado un poco.

Kimi K3: Mientras otros hacen demos, ella comienza a añadir puntos de pago | Calificación: 4 ⭐

https://x.com/i/status/2079865420576927996

🔗:Prueba la versión Kimi K3

Aunque la pantalla inicial de Kimi K3 no es tan impresionante como la de GPT-5.6 Sol, cuando aparece la descripción del juego, el sabor es diferente:

  • W: Potencia aumentada
  • S: StarShield
  • B: Bomba
  • H: Arreglado
  • Space: Deploy the bomb
  • P: Pausa
  • M: Silenciar

Al entrar al juego, aún tienes tres vidas, nivel de火力, cantidad de bombas, botón de pausa y interruptor de sonido.

Los otros dos versiones aún están lenta mente resolviendo "cómo se mueve el avión", mientras que Kimi K3 ya está considerando cómo jugar después de que el jugador recoja un objeto.

Esta es también la diferencia más notable entre las tres versiones: Qwen implementó la función de disparo, Sol realizó el empaquetado visual, y Kimi completó activamente los objetos, recursos, crecimiento y habilidades activas.

Of course, its visuals are still not detailed. Enemy aircraft and effects are mostly simple geometric shapes, and some logo assets are applied quite directly. But as a small game, it knows best how to constantly give players new things.

¿A qué departamento se contratan los tres modelos?

Si se consideran los tres modelos como nuevos empleados, esta prueba sería aproximadamente así:

Imagen

Un juego generado en una sola frase, donde ya no solo se compite con el código.

Con el ejemplo de la prueba de Thunder Fighter de Biteye, ahora no es difícil hacer que un modelo grande escriba código para crear una página web donde "el avión se mueva y se disparen balas".

Pero lo que realmente marca la diferencia es si, después del entrenamiento en lógica previa, el modelo diseñará activamente retroalimentación, niveles, objetos, progreso y temas visuales. Los modelos grandes no solo deben comprender el código, sino también comprender realmente por qué los jugadores quieren jugar una ronda más.

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.