Zhipu lanza el modelo GLM-5.3-Flash en 100.000 chips nacionales, compitiendo con NVIDIA

iconMetaEra
Compartir
AI summary iconResumen
Zhipu AI ha lanzado el modelo GLM-5.3-Flash, ahora desplegado en un clúster de más de 100.000 chips nacionales. El modelo, anteriormente conocido como Ox Alpha, iguala la eficiencia y el costo por token de las GPU de NVIDIA, obteniendo una puntuación de 57 en el Índice de Inteligencia AA. Ofrece precios más bajos que los principales competidores y es el primer modelo multimodal nativo de la serie GLM-5. Los datos en cadena muestran un creciente interés en la infraestructura de IA, con análisis en cadena que destacan el cambio hacia soluciones nacionales rentables.
Zhipu lanza el nuevo modelo GLM-5.3-Flash, que previamente se ofreció gratuitamente en una plataforma de prueba bajo el nombre anónimo Ox Alpha, alcanzando más de 50 billones de tokens en tráfico en cinco días. El modelo se ejecuta en más de 100.000 chips nacionales para servicios de inferencia, logrando una eficiencia de hardware y un costo por token comparable al de las GPU de NVIDIA. En rendimiento, el modelo obtiene una puntuación de 57 en el índice integral de inteligencia AA, empatando con Claude Opus 4.8. En cuanto a precios, la entrada cuesta 0,8 yuanes por millón de tokens y la salida 2,8 yuanes por millón de tokens, mucho menos que los competidores. La arquitectura utiliza un diseño híbrido de atención dispersa y lineal, siendo el primer modelo nativamente multimodal de la serie GLM-5. En un contexto en el que los modelos de IA en China están aumentando sus precios, Zhipu está adoptando una estrategia de precios bajos para captar mercado.

Autor y fuente del artículo: LatePost

El 26 de agosto, Zhipu confirmó oficialmente: el modelo anónimo Ox Alpha, que generó gran discusión en la comunidad de desarrolladores (conocido en la comunidad china como "Niu Lai"), es precisamente su recién lanzado GLM-5.3-Flash. El código del modelo se inspira en la reciente película popular en China, "Niu Lai".

Antes de su lanzamiento oficial, el modelo se puso a prueba gratuitamente de forma anónima en OpenRouter y OpenCode, acumulando más de 50 billones de tokens en tráfico en cinco días, rompiendo los récords de crecimiento de tráfico en ambas plataformas, con un uso actual que ya supera en más del doble el de DeepSeek. Pero lo que realmente llamó la atención del mercado fue un detalle revelado posteriormente por Zhipu: todo este tráfico fue soportado exclusivamente por chips nacionales.

ZhiPu indica en su documentación técnica oficial que se utilizan más de 100,000 chips nacionales en clúster para el servicio de inferencia de este modelo, "la eficiencia del hardware y el costo por token ya han alcanzado niveles comparables a los de las GPU NVIDIA líderes".

La institución de investigación semiconductora SemiAnalysis publicó inmediatamente un comentario en la plataforma X: "Todo el tráfico es soportado por chips nacionales; la eficiencia del hardware y el costo por token ya son comparables con las GPU de NVIDIA. Tras el anuncio de ayer de Jalapeño (el chip de inferencia desarrollado por OpenAI), el foso de CUDA vuelve a ser puesto a prueba."

100,000 tarjetas nacionales: Desde la prueba hasta la producción, Zhipu describe en su documentación técnica los detalles de la implementación de este clúster de chips nacionales.

El cuello de botella principal en un solo chip radica en la capacidad y el ancho de banda de la memoria, lo que hace especialmente difícil soportar longitudes de contexto de hasta 1 millón de tokens. Para abordar esto, Zhipu construyó un motor de inferencia dedicado sobre SGLang, empleando técnicas como cuantización W8A8, cuantización mixta de caché INT8/FP8/BF16 y paralelismo de tensores dentro del nodo, e introdujo una arquitectura separada de producción Encode–Prefill–Decode (EPD), dividiendo la codificación multimodal, el prefills de prompt y la decodificación por token en piscinas de trabajo independientemente programables.

Zhipu afirma que el rendimiento del servicio end-to-end se triplicó en comparación con la línea de base inicial en el mismo hardware.

Según información de LatePost, los proveedores de estos chips podrían ser Huawei, Moore Threads y Hygon. Zhipu no ha hecho comentarios al respecto, y los documentos técnicos no especifican los modelos exactos de los chips.

SemiAnalysis destacó en su comentario que anteriormente se creía que solo los laboratorios líderes en vanguardia tenían la capacidad de procesamiento de 100 billones de tokens diarios, "y aquí, 100 billones de tokens diarios de tráfico gratuito funcionan completamente sobre chips nacionales."

Modelo en sí: Comparado con DeepSeek, el precio es 1/40 del de Claude Opus 4.8. GLM-5.3-Flash tiene un tamaño total de 320B parámetros y 18B parámetros activos, aproximadamente el 40% de la versión anterior de GLM-5.3, casi equivalente a DeepSeek V4 Flash.

En términos de rendimiento, las evaluaciones oficiales de Zhipu muestran que GLM-5.3-Flash obtuvo una puntuación de 57 en el Artificial Analysis Intelligence Index (índice AA de inteligencia integral), superando al modelo anterior de gama alta, GLM-5.2, empatando con el Claude Opus 4.8 de Anthropic y superando la versión oficial del modelo insignia de DeepSeek, V4 Pro, que obtuvo 53 puntos.

En términos de precios, GLM-5.3-Flash cobra 0.8 yuanes por millón de tokens de entrada y 2.8 yuanes por millón de tokens de salida, con un precio de acierto en caché de 0.23 yuanes, que es la décima parte del precio de GLM-5.3. Durante las dos primeras semanas de lanzamiento, se aplicará un 50 % de descuento.

Zhipu indica que el precio de GLM-5.3-Flash es la décima parte del de GLM-5.3, y durante la oferta limitada, es la vigésima parte del de GLM-5.3, y la cuadragésima parte del de Claude Opus 4.8.

En comparación con DeepSeek V4 Flash tras la ajuste de precios (entrada de 1.5 yuanes y salida de 4.5 yuanes durante horas valle), GLM-5.3-Flash es más económico en la mayoría de los escenarios de llamada comunes.

Innovación arquitectónica: los parámetros y capas activos se reducen casi a la mitad. GLM-5.3-Flash adopta un diseño arquitectónico completamente diferente al de GLM-5.3, lo que constituye la razón fundamental para lograr un rendimiento superior con costos más bajos.

En comparación con GLM-4.5, GLM-5.3-Flash tiene una cantidad total de parámetros similar (355B frente a 320B), pero la cantidad de parámetros activados disminuyó de 32B a 18B, y el número de capas se redujo de 92 a 45, casi a la mitad.

Zhipu afirma que GLM-5.3-Flash es el primer modelo de vanguardia de código abierto que utiliza una arquitectura híbrida de atención dispersa y atención lineal. En comparación con GLM-5.3, su cálculo de atención y el tamaño del caché KV se redujeron en 3.01 y 4.44 veces, respectivamente.

Además, este modelo es el primero nativamente multimodal de la serie GLM-5, compatible con entradas de imágenes y videos, y también es el primer nuevo modelo lanzado por Zhipu con capacidades multimodales desde que se enfocó estratégicamente en coding.

El lanzamiento de GLM-5.3-Flash ocurre tras una ola de aumentos de precios en el mercado chino de modelos de IA.

El precio de salida de Kimi K3 alcanza hasta 100 yuanes por millón de tokens, más de tres veces el de su predecesor K2.6; tras el aumento de precios en el primer semestre, el precio de salida de ZhiPu también llegó a 28 yuanes; DeepSeek V4 Pro aumentó de 6 yuanes a 13.5 yuanes, y hasta 27 yuanes en horas pico; el precio de salida de DeepSeek V4 Flash subió de 2 yuanes a 4.5 yuanes, y alcanza 9 yuanes en horas pico.

El efecto directo del aumento de precios es la溢出 de la demanda. Según LatePost, tras el aumento de precios de DeepSeek V4 Flash, la cantidad de llamadas en la plataforma OpenCode se redujo a la mitad, y esta demanda se convirtió en un nuevo espacio de crecimiento para los fabricantes de modelos nacionales.

La estrategia de precios de GLM-5.3-Flash está precisamente orientada a cubrir esta brecha.

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.