Z.ai de China, la empresa anteriormente conocida como Zhipu AI, lanzó GLM-5.3-Flash el 26 de agosto, convirtiéndolo en el primer modelo nativamente multimodal de la serie GLM-5. El lanzamiento es notable por razones más allá del modelo en sí: funciona completamente con aceleradores de IA producidos localmente, una demostración clara de que el hardware chino puede manejar cargas de trabajo a gran escala.
El momento es importante. Los controles de exportación de EE. UU. han restringido el acceso a los chips más avanzados de NVIDIA para compradores chinos, obligando a empresas como Z.ai a desarrollar soluciones con lo que tienen disponible.
Lo que realmente hace el modelo
GLM-5.3-Flash utiliza una arquitectura híbrida que combina atención dispersa y lineal, una elección de diseño que reduce significativamente los requisitos de cómputo. El modelo tiene un total de 320 mil millones de parámetros, pero activa solo 18 mil millones por token, lo que significa que accede a una base de conocimiento masiva sin incurrir en el costo computacional completo en cada inferencia.
La ventana de contexto se sitúa en 1 millón de tokens, ubicándola entre las más largas disponibles en cualquier modelo abierto. El soporte nativo para entradas de imagen y video la hace verdaderamente multimodal desde el nivel de arquitectura, y no como una funcionalidad añadida.
En el benchmark de codificación DeepSWE v1.1, GLM-5.3-Flash obtuvo 63.4, en comparación con 46.2 de su predecesor GLM-5.2. El modelo también obtuvo 57 en el Índice de Inteligencia de Análisis Artificial.
Los precios son agresivos. El acceso a la API cuesta $0.15 por millón de tokens de entrada y $0.50 por millón de tokens de salida, con entradas en caché disponibles a $0.03. Z.ai describe este costo como aproximadamente una décima parte de algunas opciones competidoras.
Los chips chinos realizando trabajo real
Z.ai implementó GLM-5.3-Flash en clústeres de aceleradores de IA fabricados localmente, luego desarrolló pilas de servicio personalizadas y aplicó técnicas de cuantización adaptadas a ese hardware. El resultado fue una mejora de tres veces en el rendimiento de extremo a extremo en comparación con un enfoque de implementación más genérico.
El modelo se entrega con pesos abiertos bajo la licencia MIT, disponibles en formatos FP8 y BF16 en Hugging Face y ModelScope. La licencia MIT es una de las más permisivas: los desarrolladores y empresas pueden usar, modificar y distribuir los pesos con fines comerciales sin restricciones.
