La semana pasada, Qwen3.8-Max-Preview y Kimi K3 se presentaron sucesivamente, llevando el tamaño de parámetros de los modelos grandes nacionales a más de 2 billones.
Sin embargo, la competencia entre grandes modelos ya superó la etapa en la que solo se evaluaban los benchmarks y los parámetros. La capacidad de integrarse realmente en los flujos de trabajo diarios es el mejor estándar para medir la habilidad de los modelos base.
Para esto, Biteye decidió hoy poner a prueba si es un burro o un caballo, sacándolo a pasear.
Mismo prompt: “Haz un pequeño juego web de Thunder Fighter con un estilo Biteye en una sola oración”, tres modelos — Qwen3.8, Kimi K3 y gpt5.6 sol — entregaron respuestas completamente diferentes:
- Qwen3.8: Puede moverse, y solo puede moverse
- GPT-5.6 Sol: La visualización es atractiva, como la página web de una marca
- Kimi K3: el que tiene más funciones y mayor sentido de juego
⚠️ Nota informativa: Debido a que Kimi K3 ya no está disponible para suscripción por limitaciones de potencia de cálculo, esta prueba fue realizada mediante WorkBuddy.
Qwen3.8: El avión de combate despegó, pero no pasó nada más | Calificación: 1 estrella ⭐
https://x.com/i/status/2079865420576927996
Abrir la versión Qwen3.8, la primera impresión es: ¿me estás tomando el pelo?
Fondo azul oscuro, un logotipo que no es nativo de Biteye en el centro, y un botón "Comenzar juego". El texto negro en el título se funde con el fondo oscuro, como si hubiera activado previamente el modo invisibilidad.
Al entrar al juego, las funciones básicas son más o menos funcionales:
- Arrastre el avión de combate con el mouse
- Disparo automático
- Avión enemigo con triángulo rojo
- Puntuación
- Colisión y mecanismo de finalización
En la prueba práctica, el avión de combate puede disparar continuamente, y la puntuación aumentó hasta 858; Qwen3.8 al menos funcionó.
El problema es que todo el juego parece un demo de Canvas recién montado: los aviones enemigos son triángulos, las balas son puntos de luz, y la jugabilidad no ha cambiado en absoluto. No hay ningún sistema de crecimiento de armas, ningún sistema de ítems, ni ritmo de niveles evidente.
Como lo anunció el propio equipo de Qwen, el entrenamiento posterior de Qwen3.8 aún no está listo y se encuentra en "iteración diaria".
Claramente, el arte y la planificación aún no han entrado al grupo.
GPT-5.6 Sol: El diseño gráfico es bueno, pero la jugabilidad necesita mejora | Calificación: 3.5 ⭐
https://x.com/i/status/2079865420576927996
🔗:Prueba la versión GPT-5.6 Sol
Abrir la versión GPT-5.6 Sol, y de inmediato se eleva el ánimo.
A la izquierda se encuentran las tareas destacadas, en el centro está la zona de combate, y a la derecha, el radar visualizado y los módulos de telemetría. El fondo oscuro combinado con cian fluorescente, junto con el texto en chino e inglés y los elementos de la marca Biteye, crea una sensación visual muy similar al panel de instrumentos de un agente 007.
Su sistema también es mucho más rico que el de Qwen, por ejemplo:
- Wave波次
- Armor装甲
- Estado Overdrive
- Combo de golpes
- Récord más alto
- Función de pausa
- Operación dual con ratón y teclado
En la prueba práctica, el juego se ejecutó correctamente y obtuvo una puntuación de 922. Tras fallar, no aparece simplemente "Game Over", sino "Avión fuera de línea"; para reiniciar, se muestra "Reconectar". Desde el inicio hasta el resultado final, el texto y el diseño mantienen un mismo universo narrativo, lo cual es bastante elegante.
Sin embargo, el problema con GPT-5.6 Sol es que es demasiado bueno en el empaquetado. Los paneles de información a ambos lados ocupan un espacio considerable, mientras que la zona real del juego queda comprimida en el centro. Es más como una página de campaña de marca muy pulida, con un pequeño juego incrustado de paso.
En comparación con Qwen3.8, el arte, la marca y las operaciones de gpt-5.6 sol ya están completos, pero el diseño del juego claramente ha relajado un poco.
Kimi K3: Mientras otros hacen demos, ella comienza a añadir puntos de pago | Calificación: 4 ⭐
https://x.com/i/status/2079865420576927996
Aunque la pantalla inicial de Kimi K3 no es tan impresionante como la de GPT-5.6 Sol, cuando aparece la descripción del juego, el sabor es diferente:
- W: Potencia aumentada
- S: StarShield
- B: Bomba
- H: Arreglado
- Space: Deploy the bomb
- P: Pausa
- M: Silenciar
Al entrar al juego, aún tienes tres vidas, nivel de火力, cantidad de bombas, botón de pausa y interruptor de sonido.
Los otros dos versiones aún están lenta mente resolviendo "cómo se mueve el avión", mientras que Kimi K3 ya está considerando cómo jugar después de que el jugador recoja un objeto.
Esta es también la diferencia más notable entre las tres versiones: Qwen implementó la función de disparo, Sol realizó el empaquetado visual, y Kimi completó activamente los objetos, recursos, crecimiento y habilidades activas.
Of course, its visuals are still not detailed. Enemy aircraft and effects are mostly simple geometric shapes, and some logo assets are applied quite directly. But as a small game, it knows best how to constantly give players new things.
¿A qué departamento se contratan los tres modelos?
Si se consideran los tres modelos como nuevos empleados, esta prueba sería aproximadamente así:
Un juego generado en una sola frase, donde ya no solo se compite con el código.
Con el ejemplo de la prueba de Thunder Fighter de Biteye, ahora no es difícil hacer que un modelo grande escriba código para crear una página web donde "el avión se mueva y se disparen balas".
Pero lo que realmente marca la diferencia es si, después del entrenamiento en lógica previa, el modelo diseñará activamente retroalimentación, niveles, objetos, progreso y temas visuales. Los modelos grandes no solo deben comprender el código, sino también comprender realmente por qué los jugadores quieren jugar una ronda más.
