Na última semana, o Qwen3.8-Max-Preview e o Kimi K3 foram lançados sucessivamente, levando o tamanho dos parâmetros dos grandes modelos nacionais para mais de 2 trilhões.
No entanto, a disputa entre grandes modelos já ultrapassou a versão que avaliava apenas benchmarks e parâmetros. A capacidade de integrar-se efetivamente aos fluxos de trabalho diários é o melhor critério para medir a competência dos modelos base.
Para isso, o Biteye decidiu hoje colocar o burro para correr e ver se é burro ou cavalo.
Mesmo com o mesmo prompt de “faça um pequeno jogo web no estilo Biteye de Thunder Fighter em uma única frase”, os modelos Qwen3.8, Kimi K3 e gpt5.6 sol entregaram respostas completamente diferentes:
- Qwen3.8: Pode se mover, e apenas pode se mover
- GPT-5.6 Sol: Visualmente atraente, como um site oficial da marca
- Kimi K3: o que tem mais recursos e o maior senso de jogo
⚠️ Aviso: Como o Kimi K3 não está mais disponível para assinatura devido a limitações de poder de processamento, este teste foi finalmente realizado pelo WorkBuddy.
Qwen3.8: O avião de combate decolou, mas não houve mais nada | Avaliação: 1 estrela ⭐
https://x.com/i/status/2079865420576927996
🔗:Experimente a versão Qwen3.8
Abrir a versão Qwen3.8, a primeira impressão é: você está me enganando?
Fundo azul escuro, um logotipo que não é nativo do Biteye no centro, um botão "Iniciar Jogo". O texto preto no título se funde ao fundo escuro, como se tivesse ativado o modo invisível antecipadamente.
Ao entrar no jogo, as funções básicas são apenas suficientes:
- Arraste o avião com o mouse
- Disparo automático
- Inimigo triangular vermelho
- Score statistics
- Colisão e mecanismo de encerramento
Em testes práticos, o caça pode disparar continuamente, e a pontuação subiu até 858; o Qwen3.8 pelo menos funcionou.
Mas o problema é que todo o jogo parece um demo de Canvas recém-construído: os aviões inimigos são triângulos, as balas são pontos de luz, e a jogabilidade não mudou praticamente nada. Não há nenhum sistema de crescimento de armas, nenhum sistema de itens e nenhum ritmo de nível evidente.
Como a própria equipe Qwen anunciou, o pós-treinamento do Qwen3.8 ainda não está pronto e está sendo "iterado diariamente".
Claramente, a arte e o planejamento ainda não entraram no grupo.
GPT-5.6 Sol: A arte está boa, mas a jogabilidade precisa ser aprimorada | Avaliação: 3,5 ⭐
https://x.com/i/status/2079865420576927996
🔗:Experimente a versão GPT-5.6 Sol
Abrir a versão GPT-5.6 Sol, a energia imediatamente aumenta.
À esquerda está a tarefa clara, no centro está a área de combate, à direita estão o radar visualizado e os módulos de telemetria. O fundo escuro combinado com ciano fluorescente, além da mistura de chinês e inglês e elementos da marca Biteye, cria uma sensação visual muito parecida com o painel de um agente 007.
Seu sistema também é muito mais rico que o Qwen, por exemplo:
- Wave波次
- Armor装甲
- Estado Overdrive
- Combo de acertos consecutivos
- Recorde mais alto
- Função de pausa
- Operação dupla com mouse e teclado
Em testes reais, o jogo foi executado com sucesso e obteve 922 pontos. Após falhar, não aparece simplesmente "Game Over", mas sim "Aeronave offline"; para reiniciar, aparece "Reconectar". Desde o início até o resultado final, o texto e os elementos visuais mantêm um universo coerente — algo bem sofisticado.
No entanto, o problema com o GPT-5.6 Sol é que ele é muito bom em embalar. Os painéis de informações nas laterais ocupam grande espaço, enquanto a área real do jogo é comprimida no centro. Ele parece mais uma página de campanha de marca bem desenvolvida, com um pequeno jogo embutido por acaso.
Em comparação com o Qwen3.8, a arte, a marca e as operações do GPT-5.6 SOL estão todas em posição, mas o planejamento do jogo claramente pegou um pouco de folga.
Kimi K3: Enquanto outros fazem demonstrações, ele começa a adicionar pontos de pagamento | Avaliação: 4 ⭐
https://x.com/i/status/2079865420576927996
🔗:Experimente a versão Kimi K3
A tela inicial do Kimi K3 não é tão impressionante quanto a do GPT-5.6 Sol, mas assim que as instruções do jogo aparecem, o sabor muda:
- W: Potência aumentada
- S: StarShield
- B: Bomba
- H:Correção
- Space: Deploy the bomb
- P: Pausar
- M: Silenciar
Após entrar no jogo, há três vidas, nível de fogo, número de bombas, botão de pausa e interruptor de som.
Os outros dois ainda estão lentamente resolvendo "como mover o avião", enquanto o Kimi K3 já está considerando como os jogadores jogam após pegarem itens.
Essa é também a diferença mais óbvia entre os três modelos: o Qwen implementou a função de disparo, o Sol realizou o pacote visual, e o Kimi complementou ativamente os itens, recursos, crescimento e habilidades ativas.
Of course, its visuals are still not detailed. Enemy aircraft and effects are mostly simple geometric shapes, and some logo assets are applied quite directly. But as a small game, it knows best how to constantly give players something new.
Três modelos, em qual departamento cada um deve ser contratado?
Se os três modelos fossem novos funcionários, este teste seria mais ou menos assim:
Jogos gerados em uma frase, a corrida já não é mais apenas sobre código
Com o exemplo do teste do Thunder Fighter da Biteye, agora não é difícil fazer um grande modelo escrever código para criar uma página web onde "o avião se move e as balas são disparadas".
Mas o que realmente faz a diferença é se, após o treinamento lógico prévio, o modelo projetará ativamente feedback, níveis, itens, progressão e temas visuais. Os grandes modelos não apenas precisam entender o código, mas também compreender verdadeiramente por que os jogadores querem jogar mais uma rodada.
