A Alibaba lançou e abriu o código do modelo Qwen 3.8 Flash, que utiliza a arquitetura MoE de 125B, ativando apenas cerca de 6B de parâmetros por token, com suporte nativo a 262144 tokens de contexto e expansível até 1M tokens via YaRN. A inovação deste modelo reside na sua capacidade de operar em placas gráficas de consumo 4090, permitindo a migração de modelos de texto longo de nível de data center para hardware de consumo. Além disso, seu preço é mais competitivo: 0,8 yuan por milhão de tokens de entrada e 2,7 yuan por milhão de tokens de saída, apenas um terço do preço do DeepSeek-V4-Flash. Testes práticos demonstram que o modelo pode concluir a redação de textos para quatro plataformas em 2 minutos e extrair atas de reuniões, organizar tabelas e gerar e-mails em 4 minutos. O Qwen 3.8 Flash já está disponível na plataforma Qwen Office, com a API simultaneamente aberta. No mesmo dia, o Zhipu também abriu o código do GLM-5.3-Flash, cujo desempenho é comparável ao Claude Opus 4.8, mas com preço um quarenta avos dele.Autor do artigo, fonte: Quantum Bit
Novo modelo da Alibaba Qwen eleva os padrões novamente.
Eles lançaram e tornaram open-source o Qwen 3.8 Flash-Next, que não apenas superou imediatamente o DeepSeek-V4-Flash em preço, mas também conquistou o topo do Huggingface logo após o lançamento!

Os usuários do Twitter também ficaram eufóricos, e até engenheiros compartilharam vídeos de teste reais exclamando: incrível:
Qwen 3.8 Flash derrubou a barreira da VRAM,um modelo de linguagem de longo texto de nível de data center, agora rodando em uma placa de vídeo 4090 de consumo!
Alguém já o está usando entusiasmado no trabalho.
Em menos de 8 minutos, ele completou todo o fluxo de trabalho que abrange programação em Python, análise de múltiplas tabelas e geração de relatórios:

Também não há problema com efeitos de torre:

Uau, é realmente tão legal assim? Claro que também vamos tentar.

Apenas 0,8 yuan por milhão de tokens de entrada
O Qwen3.8-Flash utiliza a arquitetura MoE de 125B, ativando apenas cerca de 6B de parâmetros por token, suportando nativamente até 262144 tokens de contexto e podendo ser expandido para 1M tokens através do YaRN.
Ao mesmo tempo, é também uma prévia da nova arquitetura do Qwen4.
Em comparação com o Qwen 3.7 Plus, o Qwen 3.8 Flash não apenas reduziu os parâmetros ativados para um terço, mas também reduziu o custo de treinamento para apenas um nono, além de apresentar capacidades mais robustas em geral, raciocínio matemático e programação.
Mais impressionante ainda é o preço: apenas 0,8 yuan por milhão de tokens de entrada no Qwen 3.8 Flash, 2,7 yuan para saída, e 0,1 yuan para acerto de cache, com preço mínimo de 1/3 do DeepSeek-V4-Flash.
É muito mais forte do que o corte de um em拼多多 (não é sério)

Tudo bem, tudo bem, já que o preço chegou a esse ponto, vamos direto ao ponto e testar a capacidade real do Qwen 3.8 Flash em cenários de trabalho com dois testes práticos.
Teste prático 1: Criar quatro versões de copy para produtos de câmera, adaptadas a diferentes plataformas.
Criamos um "Desafio de Redação de Marketing" em que o Qwen 3.8 Flash reescreveu um material de produto de câmera de quase dez mil palavras em textos para Xiaohongshu, Weibo, Douyin e Moments, com um orçamento de apenas 1 yuan, para ver quantas tarefas ele conseguiria completar.
As instruções são as seguintes:

Após enviar o prompt, fui até a cozinha da empresa pegar um copo d'água, tudo em menos de dois minutos.
Ao voltar, vi que os textos para as quatro plataformas já estavam todos prontos, e @marcaram corretamente a marca, o estilo e as hashtags (exceto que eu não publicaria algo tão longo no meu feed haha):




Em menos de dois minutos, finalizei quatro textos — a velocidade do “trabalhador cibernético” está aprovada.
Mas no ambiente profissional, o que realmente causa dor de cabeça muitas vezes não é escrever textos, e sim quem vai organizar a bagunça depois da reunião.
Então, demos a ele um segundo trabalho para testar sua capacidade prática no ambiente de trabalho.
Teste prático 2: Transformar uma reunião semanal de produto em um plano executável
Com o tema “Reunião de Avaliação de Requisitos e Tecnologia do Agente de Atendimento Inteligente V2.0”, reproduzimos fielmente um material original de transcrição da reunião, com mais de dez mil palavras, cheio de erros de digitação homófonos e conversas triviais, como aquele que as pessoas recebem logo após uma reunião semanal. E o Qwen3.8-Flash realizou em uma única tentativa as três tarefas: extrair resumos, organizar tabelas e redigir o e-mail de notificação pós-reunião.
△ A imagem foi gerada por IA, ouvir “token” como “偷啃” é realmente muito cotidiano
As instruções são as seguintes:

No modo padrão, em menos de 4 minutos, o Qwen3.8-Flash concluiu todas as tarefas com sucesso, com resumos precisos das cinco conclusões principais, conteúdo de atribuição de tarefas na tabela, formato de e-mail adequado e destinatários correspondentes exatamente ao conteúdo da reunião.



△ Imagens de resultados parciais do teste
Mesmo sem ser solicitado, ele automaticamente nos organizou os itens ainda não resolvidos na reunião, facilitando nossa próxima discussão, be like:

E até este ponto, ainda não esgotei meu limite!
Ahahaha, essa sensação de liberdade é incrível.
Agora, o Qwen 3.8 Flash já foi lançado no plataforma "Qianwen Office", e as APIs também estão disponíveis同步. Vamos tentar!

Mais uma coisa
A guerra de preços dos grandes modelos nacionais está ficando mais intensa.
Quase ao mesmo tempo em que o Qwen 3.8 Flash foi lançado como código aberto, Zhipu também liberou como código aberto o primeiro modelo multimodal nativo da série GLM-5, o GLM-5.3-Flash, também conhecido anteriormente como o grande modelo "Niu Lai" Ox Alpha.
Na avaliação, o desempenho desse modelo é comparável ao Claude Opus 4.8, mas o preço foi reduzido para 1/10 do GLM-5.3.

Além disso, o GLM-5.3-Flash também oferece generosamente uma promoção de meio preço por duas semanas, o que significa que, durante o período da promoção, o preço do GLM-5.3-Flash é apenas 1/20 do preço do GLM-5.3 e 1/40 do preço do Opus4.8.

Além disso, o Qwen 3.8 Flash e o GLM-5.3-Flash também têm em comum o fato de que, desta vez, ambos surpreenderam o DeepSeek-V4-Flash com preços extremamente baixos (o DeepSeek se afastou murmurando):
△ Gráfico de comparação de preços para DeepSeek-V4-Flash, Qwen 3.8 Flash, GLM-5.3-Flash
Sem dúvida, está muito competitivo.
