Odaily Planet Daily News: Zhipu anunciou oficialmente o lançamento e a abertura do código do GLM-5.3-Flash, o primeiro modelo multmodal nativo da série GLM-5.
Segundo informações, o desempenho geral do GLM-5.3-Flash supera o GLM-5.2, com avaliações de programação e Agent já próximas ao Claude Opus 4.8, mas com preço equivalente a apenas um décimo do GLM-5.2. Ele também introduziu um novo modelo base, pela primeira vez incorporando na série principal GLM uma arquitetura híbrida de atenção esparsa e atenção linear, pré-treinada com 30T tokens de dados multimodais.
Zhipu afirmou que, para coletar feedback amplo e profissional de usuários, realizou um grande teste pré-lançamento do modelo anônimo Ox-Alpha (conhecido na comunidade chinesa como Niu Lai) nas plataformas OpenCode e OpenRouter. O Ox-Alpha tornou-se rapidamente o modelo mais popular da semana, estabelecendo novos recordes de volume de chamadas em ambas as plataformas. Todo esse tráfego de requisições foi suportado por capacidade de processamento fornecida por chips nacionais.
Anteriormente, a comunidade relatou que o DeepSWE do Ox Alpha alcançou 80% em um teste de poucas amostras, mas esse teste continha apenas 10 perguntas. Após ampliar a amostra, o desempenho caiu para cerca de 63%, e os testadores corrigiram voluntariamente a afirmação inicial. Esse resultado ainda se enquadra no primeiro escalão, mas não é tão impressionante quanto os 80% iniciais. Com o peso aberto ao público, os desenvolvedores podem implantar diretamente usando frameworks como vLLM, SGLang e KTransformers, sem mais precisar recorrer à API de modelos anônimos.
