A Z.ai da China, anteriormente conhecida como Zhipu AI, lançou o GLM-5.3-Flash em 26 de agosto, tornando-o o primeiro modelo nativamente multimodal da série GLM-5. O lançamento é notável por razões além do próprio modelo: ele opera inteiramente em aceleradores de IA produzidos domesticamente, uma demonstração clara de que o hardware chinês pode lidar com cargas de trabalho em grande escala.
O timing importa. Controles de exportação dos EUA restringiram o acesso aos chips mais avançados da NVIDIA para compradores chineses, forçando empresas como a Z.ai a construir em torno do que têm.
O que o modelo realmente faz
O GLM-5.3-Flash utiliza uma arquitetura híbrida que combina atenção esparsa e linear, uma escolha de design que reduz significativamente os requisitos de computação. O modelo possui 320 bilhões de parâmetros no total, mas ativa apenas 18 bilhões por token, o que significa que acessa uma base de conhecimento massiva sem incorrer no custo computacional completo em cada inferência.
A janela de contexto está em 1 milhão de tokens, posicionando-a entre as mais longas disponíveis em qualquer modelo aberto. O suporte nativo para entradas de imagem e vídeo torna-o verdadeiramente multimodal desde o nível da arquitetura, e não como uma funcionalidade adicionada posteriormente.
No benchmark de codificação DeepSWE v1.1, o GLM-5.3-Flash obteve 63,4, em comparação com 46,2 do seu antecessor, GLM-5.2. O modelo também obteve 57 no Índice de Inteligência de Análise Artificial.
Os preços são agressivos. O acesso à API custa US$ 0,15 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída, com entradas em cache disponíveis por US$ 0,03. A Z.ai descreve o custo como aproximadamente um décimo de algumas opções concorrentes.
Chips chineses realizando trabalho real
A Z.ai implantou o GLM-5.3-Flash em clusters de aceleradores de IA fabricados nacionalmente, depois desenvolveu pilhas de serviço personalizadas e aplicou técnicas de quantização adaptadas a esse hardware. O resultado foi uma melhoria de três vezes no desempenho de ponta a ponta em comparação com uma abordagem de implantação mais genérica.
O modelo é fornecido com pesos abertos sob a licença MIT, disponíveis nos formatos FP8 e BF16 no Hugging Face e no ModelScope. A MIT é uma das licenças mais permissivas: desenvolvedores e empresas podem usar, modificar e distribuir os pesos comercialmente sem restrições.
