Zhipu lança o novo modelo GLM-5.3-Flash, que anteriormente foi disponibilizado gratuitamente na plataforma de teste sob o nome anônimo Ox Alpha, alcançando mais de 50 trilhões de tokens em tráfego em cinco dias. O modelo utiliza mais de 100.000 chips nacionais em cluster para serviços de inferência, com eficiência de hardware e custo por token já comparáveis aos GPUs da NVIDIA. Em desempenho, o modelo obteve 57 pontos no índice de inteligência geral AA, empatando com o Claude Opus 4.8. Em termos de precificação, a entrada custa 0,8 yuan por milhão de tokens e a saída, 2,8 yuan por milhão de tokens, significativamente abaixo dos concorrentes. A arquitetura emprega um design híbrido de atenção esparsa e linear, sendo o primeiro modelo nativamente multimodal da série GLM-5. Diante do aumento coletivo nos preços dos modelos de IA na China, a Zhipu adota uma estratégia de preços baixos para conquistar o mercado.Autor e fonte do artigo: LatePost
Em 26 de agosto, Zhipu confirmou oficialmente: o modelo anônimo Ox Alpha, que gerou grande discussão na comunidade de desenvolvedores (conhecido na comunidade chinesa como "Niu Lai"), é, na verdade, o recém-lançado GLM-5.3-Flash. O código do modelo foi inspirado no filme recentemente em cartaz na China, "Niu Lai".
Antes de seu lançamento oficial, o modelo foi disponibilizado gratuitamente para teste anônimo no OpenRouter e OpenCode, acumulando mais de 50 trilhões de tokens em tráfego em cinco dias, batendo os recordes de crescimento de tráfego das duas plataformas, com o uso atual já superando mais de duas vezes o do DeepSeek. Mas o verdadeiro motivo que chamou a atenção do mercado foi um detalhe divulgado posteriormente pela Zhipu: todo esse tráfego foi suportado exclusivamente por chips nacionais.
A Zhipu afirmou em sua documentação técnica oficial que mais de 100.000 chips nacionais foram utilizados em cluster para o serviço de inferência desse modelo, "atingindo níveis de eficiência de hardware e custo por token comparáveis aos das principais GPUs da NVIDIA".
A instituição de pesquisa semicondutora SemiAnalysis publicou imediatamente um comentário na plataforma X: “Todo o tráfego é suportado por chips nacionais, com eficiência de hardware e custo por token já comparáveis às GPUs da NVIDIA. Após o anúncio de ontem do Jalapeño (chip de inferência desenvolvido pela OpenAI), a vantagem da CUDA é novamente desafiada.”

100 mil unidades de cartões nacionais: da fase de teste à produção, Zhipu descreveu os detalhes de implantação deste cluster de chips nacionais na documentação técnica.
O principal gargalo de um único chip reside na capacidade e largura de banda da memória, tornando especialmente difícil suportar comprimentos de contexto de até 1 milhão de tokens. Para isso, Zhipu construiu um motor de inferência dedicado baseado no SGLang, utilizando técnicas como quantização W8A8, quantização de cache híbrida INT8/FP8/BF16 e paralelismo de tensor dentro do nó, além de introduzir uma arquitetura separada de produção Encode–Prefill–Decode (EPD), dividindo a codificação multimodal, o pré-preenchimento do prompt e a decodificação token a token em pools de trabalho independentemente agendáveis.
Zhipu afirma que o desempenho do serviço end-to-end aumentou três vezes em comparação com a linha de base inicial no mesmo hardware.
De acordo com o LatePost, os fornecedores desses chips podem ser Huawei, Moore Threads e Hygon. A Zhipu não comentou oficialmente sobre o assunto, e os documentos técnicos não especificam os modelos exatos dos chips.
A SemiAnalysis destacou especialmente em seu comentário que, anteriormente, havia a opinião de que apenas os principais laboratórios de ponta possuíam a capacidade de processamento de 100 trilhões de tokens por dia, “e aqui, 100 trilhões de tokens de tráfego gratuito por dia estão sendo executados inteiramente em chips nacionais.”

Modelo em si: Comparado ao DeepSeek, o preço é 1/40 do Claude Opus 4.8. O GLM-5.3-Flash possui 320B de parâmetros totais e 18B de parâmetros ativados, com um volume de parâmetros aproximadamente 40% do do seu antecessor de topo, o GLM-5.3, quase equivalente ao DeepSeek V4 Flash.
Em termos de desempenho, os testes oficiais da Zhipu mostram que o GLM-5.3-Flash obteve 57 pontos no Artificial Analysis Intelligence Index (índice AA de inteligência), superando a geração anterior, o GLM-5.2, empatando com o Claude Opus 4.8 da Anthropic e superando a versão oficial do modelo旗舰 da DeepSeek, o V4 Pro, que tem 53 pontos.

Em termos de precificação, o GLM-5.3-Flash cobra 0,8 yuan por milhão de tokens de entrada e 2,8 yuan por milhão de tokens de saída, com preço de acerto de cache de 0,23 yuan, que é um décimo do GLM-5.3. Durante as duas semanas anteriores ao lançamento, haverá desconto de 50%.
Zhipu afirmou que o GLM-5.3-Flash é precificado a 1/10 do preço do GLM-5.3, e durante a promoção limitada, a 1/20 do preço do GLM-5.3, ou seja, 1/40 do preço do Claude Opus 4.8.
Em comparação com o DeepSeek V4 Flash após a revisão de preços (entrada a 1,5 yuan, saída a 4,5 yuan durante horário de baixa demanda), o GLM-5.3-Flash é mais barato na maioria dos cenários de chamada comuns.

Inovação de arquitetura: parâmetros e camadas reduzidos quase pela metade. O GLM-5.3-Flash adota um design de arquitetura totalmente diferente do GLM-5.3, o que é a razão fundamental para sua capacidade de alcançar desempenho superior com custo reduzido.
Em comparação com o GLM-4.5, o GLM-5.3-Flash possui quantidade total de parâmetros semelhante (355B vs. 320B), mas o número de parâmetros ativados caiu de 32B para 18B, e o número de camadas reduziu de 92 para 45, quase pela metade.
Zhipu afirma que o GLM-5.3-Flash é o primeiro modelo de ponta de código aberto a adotar uma arquitetura híbrida de atenção esparsa e atenção linear. Em comparação com o GLM-5.3, sua quantidade de cálculo de atenção e o tamanho do cache KV foram reduzidos em 3,01 vezes e 4,44 vezes, respectivamente.
Além disso, este modelo é o primeiro modelo multimodal nativo da série GLM-5, suportando entrada de imagens e vídeos, e também é o primeiro novo modelo lançado pela Zhipu com capacidade multimodal desde que a empresa se concentrou estrategicamente em coding.

O lançamento do GLM-5.3-Flash ocorreu após uma onda coletiva de aumentos de preços no mercado chinês de modelos de IA.
O preço de saída do Kimi K3 atinge até 100 yuan por milhão de tokens, mais de três vezes o valor da geração anterior K2.6; após o aumento de preços no primeiro semestre, o preço de saída da ZhiPu também chegou a 28 yuan; o DeepSeek V4 Pro subiu de 6 yuan para 13,5 yuan, com pico de 27 yuan; o preço de saída do DeepSeek V4 Flash aumentou de 2 yuan para 4,5 yuan, com pico de 9 yuan.
A consequência direta do aumento de preço é a vazão da demanda. O LatePost apontou que, após o aumento de preço do DeepSeek V4 Flash, o volume de chamadas na plataforma OpenCode caiu pela metade, e essa demanda se tornou um novo espaço de crescimento para as empresas fabricantes de modelos nacionais.
A estratégia de precificação do GLM-5.3-Flash visa exatamente essa lacuna.
