Zhipu lança o GLM-5.3-Flash, primeiro modelo nativamente multimodal em chips chineses

iconCryptoBriefing
Compartilhar
AI summary iconResumo
A Zhipu AI lançou o GLM-5.3-Flash em 26 de agosto, o primeiro modelo nativamente multimodal da série GLM-5. Esta notícia de IA + cripto marca um marco, pois o modelo opera inteiramente em aceleradores de IA fabricados na China, com 320 bilhões de parâmetros. Ele suporta 1 milhão de tokens e entradas nativas de imagem/vídeo. O modelo obteve 63.4 no benchmark de codificação DeepSWE v1.1 e está disponível sob a licença MIT no Hugging Face e no ModelScope. Esta notícia on-chain destaca a crescente integração das tecnologias de IA e blockchain.

A Z.ai da China, anteriormente conhecida como Zhipu AI, lançou o GLM-5.3-Flash em 26 de agosto, tornando-o o primeiro modelo nativamente multimodal da série GLM-5. O lançamento é notável por razões além do próprio modelo: ele opera inteiramente em aceleradores de IA produzidos domesticamente, uma demonstração clara de que o hardware chinês pode lidar com cargas de trabalho em grande escala.

O timing importa. Controles de exportação dos EUA restringiram o acesso aos chips mais avançados da NVIDIA para compradores chineses, forçando empresas como a Z.ai a construir em torno do que têm.

O que o modelo realmente faz

O GLM-5.3-Flash utiliza uma arquitetura híbrida que combina atenção esparsa e linear, uma escolha de design que reduz significativamente os requisitos de computação. O modelo possui 320 bilhões de parâmetros no total, mas ativa apenas 18 bilhões por token, o que significa que acessa uma base de conhecimento massiva sem incorrer no custo computacional completo em cada inferência.

Anúncio

A janela de contexto está em 1 milhão de tokens, posicionando-a entre as mais longas disponíveis em qualquer modelo aberto. O suporte nativo para entradas de imagem e vídeo torna-o verdadeiramente multimodal desde o nível da arquitetura, e não como uma funcionalidade adicionada posteriormente.

No benchmark de codificação DeepSWE v1.1, o GLM-5.3-Flash obteve 63,4, em comparação com 46,2 do seu antecessor, GLM-5.2. O modelo também obteve 57 no Índice de Inteligência de Análise Artificial.

Os preços são agressivos. O acesso à API custa US$ 0,15 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída, com entradas em cache disponíveis por US$ 0,03. A Z.ai descreve o custo como aproximadamente um décimo de algumas opções concorrentes.

Chips chineses realizando trabalho real

A Z.ai implantou o GLM-5.3-Flash em clusters de aceleradores de IA fabricados nacionalmente, depois desenvolveu pilhas de serviço personalizadas e aplicou técnicas de quantização adaptadas a esse hardware. O resultado foi uma melhoria de três vezes no desempenho de ponta a ponta em comparação com uma abordagem de implantação mais genérica.

O modelo é fornecido com pesos abertos sob a licença MIT, disponíveis nos formatos FP8 e BF16 no Hugging Face e no ModelScope. A MIT é uma das licenças mais permissivas: desenvolvedores e empresas podem usar, modificar e distribuir os pesos comercialmente sem restrições.

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.