Qwen 3.8 Flash reduz custos para um terço do DeepSeek-V4-Flash

iconMetaEra
Compartilhar
AI summary iconResumo
O Qwen 3.8 Flash da Alibaba, agora disponível na plataforma Qwen Office, oferece 125B MoE com 6B parâmetros ativos por token. Ele suporta nativamente 262.144 tokens e opera em GPUs 4090. Com preço de 0,8 RMB por milhão de tokens de entrada, custa um terço do DeepSeek-V4-Flash. Traders que acompanham altcoins para observar podem considerar esse um desenvolvimento chave. O modelo realiza tarefas complexas em menos de quatro minutos e está pronto para API. No mesmo dia, a Zhipu lançou o GLM-5.3-Flash como código aberto, com preço correspondente a um quadragésimo do Claude Opus 4.8. O sentimento do mercado, incluindo o índice de medo e ganância, pode mudar com a entrada de modelos tão eficientes em custo.
A Alibaba lançou e abriu o código do modelo Qwen 3.8 Flash, que utiliza a arquitetura MoE de 125B, ativando apenas cerca de 6B de parâmetros por token, com suporte nativo a 262144 tokens de contexto e expansível até 1M tokens via YaRN. A inovação deste modelo reside na sua capacidade de operar em placas gráficas de consumo 4090, permitindo a migração de modelos de texto longo de nível de data center para hardware de consumo. Além disso, seu preço é mais competitivo: 0,8 yuan por milhão de tokens de entrada e 2,7 yuan por milhão de tokens de saída, apenas um terço do preço do DeepSeek-V4-Flash. Testes práticos demonstram que o modelo pode concluir a redação de textos para quatro plataformas em 2 minutos e extrair atas de reuniões, organizar tabelas e gerar e-mails em 4 minutos. O Qwen 3.8 Flash já está disponível na plataforma Qwen Office, com a API simultaneamente aberta. No mesmo dia, o Zhipu também abriu o código do GLM-5.3-Flash, cujo desempenho é comparável ao Claude Opus 4.8, mas com preço um quarenta avos dele.

Autor do artigo, fonte: Quantum Bit

Novo modelo da Alibaba Qwen eleva os padrões novamente.

Eles lançaram e tornaram open-source o Qwen 3.8 Flash-Next, que não apenas superou imediatamente o DeepSeek-V4-Flash em preço, mas também conquistou o topo do Huggingface logo após o lançamento!

Imagem

Os usuários do Twitter também ficaram eufóricos, e até engenheiros compartilharam vídeos de teste reais exclamando: incrível:

Qwen 3.8 Flash derrubou a barreira da VRAM,um modelo de linguagem de longo texto de nível de data center, agora rodando em uma placa de vídeo 4090 de consumo!

Imagem

Alguém já o está usando entusiasmado no trabalho.

Em menos de 8 minutos, ele completou todo o fluxo de trabalho que abrange programação em Python, análise de múltiplas tabelas e geração de relatórios:

Imagem

Também não há problema com efeitos de torre:

Imagem

Uau, é realmente tão legal assim? Claro que também vamos tentar.

Imagem

Apenas 0,8 yuan por milhão de tokens de entrada

O Qwen3.8-Flash utiliza a arquitetura MoE de 125B, ativando apenas cerca de 6B de parâmetros por token, suportando nativamente até 262144 tokens de contexto e podendo ser expandido para 1M tokens através do YaRN.

Ao mesmo tempo, é também uma prévia da nova arquitetura do Qwen4.

Em comparação com o Qwen 3.7 Plus, o Qwen 3.8 Flash não apenas reduziu os parâmetros ativados para um terço, mas também reduziu o custo de treinamento para apenas um nono, além de apresentar capacidades mais robustas em geral, raciocínio matemático e programação.

Mais impressionante ainda é o preço: apenas 0,8 yuan por milhão de tokens de entrada no Qwen 3.8 Flash, 2,7 yuan para saída, e 0,1 yuan para acerto de cache, com preço mínimo de 1/3 do DeepSeek-V4-Flash.

É muito mais forte do que o corte de um em拼多多 (não é sério)

Imagem

Tudo bem, tudo bem, já que o preço chegou a esse ponto, vamos direto ao ponto e testar a capacidade real do Qwen 3.8 Flash em cenários de trabalho com dois testes práticos.

Teste prático 1: Criar quatro versões de copy para produtos de câmera, adaptadas a diferentes plataformas.

Criamos um "Desafio de Redação de Marketing" em que o Qwen 3.8 Flash reescreveu um material de produto de câmera de quase dez mil palavras em textos para Xiaohongshu, Weibo, Douyin e Moments, com um orçamento de apenas 1 yuan, para ver quantas tarefas ele conseguiria completar.

As instruções são as seguintes:

Imagem

Após enviar o prompt, fui até a cozinha da empresa pegar um copo d'água, tudo em menos de dois minutos.

Ao voltar, vi que os textos para as quatro plataformas já estavam todos prontos, e @marcaram corretamente a marca, o estilo e as hashtags (exceto que eu não publicaria algo tão longo no meu feed haha):

Imagem

Imagem

Imagem

Imagem

Em menos de dois minutos, finalizei quatro textos — a velocidade do “trabalhador cibernético” está aprovada.

Mas no ambiente profissional, o que realmente causa dor de cabeça muitas vezes não é escrever textos, e sim quem vai organizar a bagunça depois da reunião.

Então, demos a ele um segundo trabalho para testar sua capacidade prática no ambiente de trabalho.

Teste prático 2: Transformar uma reunião semanal de produto em um plano executável

Com o tema “Reunião de Avaliação de Requisitos e Tecnologia do Agente de Atendimento Inteligente V2.0”, reproduzimos fielmente um material original de transcrição da reunião, com mais de dez mil palavras, cheio de erros de digitação homófonos e conversas triviais, como aquele que as pessoas recebem logo após uma reunião semanal. E o Qwen3.8-Flash realizou em uma única tentativa as três tarefas: extrair resumos, organizar tabelas e redigir o e-mail de notificação pós-reunião.

Imagem△ A imagem foi gerada por IA, ouvir “token” como “偷啃” é realmente muito cotidiano

As instruções são as seguintes:

Imagem

No modo padrão, em menos de 4 minutos, o Qwen3.8-Flash concluiu todas as tarefas com sucesso, com resumos precisos das cinco conclusões principais, conteúdo de atribuição de tarefas na tabela, formato de e-mail adequado e destinatários correspondentes exatamente ao conteúdo da reunião.

Imagem

Imagem

Imagem

Imagem△ Imagens de resultados parciais do teste

Mesmo sem ser solicitado, ele automaticamente nos organizou os itens ainda não resolvidos na reunião, facilitando nossa próxima discussão, be like:

Imagem

E até este ponto, ainda não esgotei meu limite!

Ahahaha, essa sensação de liberdade é incrível.

Agora, o Qwen 3.8 Flash já foi lançado no plataforma "Qianwen Office", e as APIs também estão disponíveis同步. Vamos tentar!

Imagem

Mais uma coisa

A guerra de preços dos grandes modelos nacionais está ficando mais intensa.

Quase ao mesmo tempo em que o Qwen 3.8 Flash foi lançado como código aberto, Zhipu também liberou como código aberto o primeiro modelo multimodal nativo da série GLM-5, o GLM-5.3-Flash, também conhecido anteriormente como o grande modelo "Niu Lai" Ox Alpha.

Na avaliação, o desempenho desse modelo é comparável ao Claude Opus 4.8, mas o preço foi reduzido para 1/10 do GLM-5.3.

Imagem

Além disso, o GLM-5.3-Flash também oferece generosamente uma promoção de meio preço por duas semanas, o que significa que, durante o período da promoção, o preço do GLM-5.3-Flash é apenas 1/20 do preço do GLM-5.3 e 1/40 do preço do Opus4.8.

Imagem

Além disso, o Qwen 3.8 Flash e o GLM-5.3-Flash também têm em comum o fato de que, desta vez, ambos surpreenderam o DeepSeek-V4-Flash com preços extremamente baixos (o DeepSeek se afastou murmurando):

Imagem△ Gráfico de comparação de preços para DeepSeek-V4-Flash, Qwen 3.8 Flash, GLM-5.3-Flash

Sem dúvida, está muito competitivo.

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.