En dos semanas, 100.000 aceleradores AI nacionales, un comienzo para optimizar tu propio modelo.Autor del artículo: APPSO
Fuente: Wall Street Journal
Just now, Tang Jie, Chief Scientist of Zhipu GLM, shared a study on the optimization of the GLM-5.3-Flash inference system on the X platform.
Reveló que, desde la primera ejecución de GLM-5.3-Flash en un acelerador de IA nacional hasta completar la carga de todo el tráfico de producción, solo se necesitaron dos semanas. Durante este proceso, la capacidad de rendimiento extremo a extremo del sistema aumentó 3.2 veces.

Lo que más impresionó a Tang Jie fue que no solo los ingenieros de infraestructura realizaron una gran cantidad de optimizaciones, sino también un Infra Agent impulsado por GLM-5.3.
«Un modelo que ayuda a optimizar el servicio mismo.» Así describió唐杰 este cambio.
En su opinión, esto significa que la IA comienza a participar en la optimización de los sistemas que alojan su propio funcionamiento. Aunque aún está muy lejos de una verdadera auto-mejora recursiva (Recursive Self-Improvement, RSI), ya ha surgido una forma temprana.

El equipo de Zhipu también mencionó que, durante el último año, observaron que el papel de GLM está cambiando.
Inicialmente, el equipo exploró la capacidad de GLM en la comprensión de código y la ciberseguridad, con la esperanza de que el modelo ayudara a analizar vulnerabilidades en código complejo. Pero a medida que las capacidades del modelo mejoraron, GLM comenzó a participar en la construcción de sistemas de IA mismos.
El equipo indicó que han observado cómo el modelo completa tareas que anteriormente requerían que equipos de ingenieros de infraestructura experimentados dedicaran varias semanas, y que estas tareas afectan directamente la forma en que se entrenarán y desplegarán los próximos modelos.
Despliegue del clúster de capacidad de cómputo nacional en dos semanas
Llevar un modelo grande desde su primera ejecución en nuevo hardware hasta un servicio de inferencia capaz de soportar solicitudes de producción de forma estable requiere una gran cantidad de trabajo de ingeniería de sistemas.
GLM-5.3-Flash se implementó en un clúster compuesto por más de 100,000 aceleradores de IA nacionales. El equipo de Zhipu indicó que esta fue una implementación a gran escala sin referencias previas de experiencia madura.
El equipo necesita resolver múltiples problemas, incluyendo limitaciones de capacidad de memoria de los chips nacionales y ancho de banda de interconexión, adaptación a nuevas arquitecturas de modelos, soporte para contextos largos de 1 millón de tokens y procesamiento de solicitudes multimodales. Al mismo tiempo, el ecosistema de software de los aceleradores de IA nacionales aún se encuentra en desarrollo, con soporte insuficiente para algunos kernels y muchos recursos que el equipo de ingeniería debe explorar por su cuenta.
Tang Jie indicó que, bajo estas limitaciones, el Infra Agent impulsado por GLM-5.3 participó en el proceso de optimización del sistema de inferencia, ayudando a analizar cuellos de botella de rendimiento, proponer soluciones de optimización y realizar modificaciones parciales en el código.
El proceso de optimización no consiste simplemente en aumentar los recursos de cómputo, sino en encontrar un nuevo equilibrio entre potencia de cómputo, memoria, comunicación y programación.
El equipo de Zhipu implementó una serie de soluciones de optimización. Por ejemplo, utiliza ReplaySSM para intercambiar cálculo por espacio de memoria, reduce la presión de memoria GPU mediante paralelismo de tensores dentro de los nodos, mejora la utilización de la capacidad mediante caché de precisión mixta INT8, FP8 y BF16, e introduce simultáneamente la arquitectura separada Encode-Prefill-Decode (EPD) para permitir una programación más flexible de las distintas etapas de inferencia.
Finalmente, el rendimiento del servicio end-to-end de GLM-5.3-Flash mejoró aproximadamente 3 veces en comparación con la versión inicial, alcanzando niveles de utilización de hardware y costo por token cercanos a los de las plataformas principales de GPU NVIDIA.

Después del despliegue, GLM-5.3-Flash también entró en pruebas en entornos de uso real. El equipo de Zhipu indicó que este modelo funcionó anteriormente bajo el nombre anónimo Ox-Alpha en las plataformas OpenCode y OpenRouter, convirtiéndose en una de los modelos con mayor uso en ambas plataformas en una semana, procesando más de 62 billones de tokens en seis días.
Sin embargo, el verdadero cambio en este experimento no es solo que la IA escriba código, sino que pueda comprender por qué los sistemas complejos experimentan cambios de rendimiento.
Por ejemplo, cuando el sistema informa una "disminución del 20% en el rendimiento", solo indica que hay una anomalía en algún lugar, pero no puede decir directamente al agente en qué capa se produjo el problema, si la suposición actual es errónea, ni qué se debe verificar a continuación.
Para ingenieros experimentados, este tipo de juicio se basa en experiencia a largo plazo. Los ingenieros saben cuándo revisar la línea de tiempo de ejecución, cuándo ejecutar pruebas microbenchmark y qué módulos comparar.
El equipo de Zhipu espera convertir esta experiencia de ingeniería en un mecanismo de retroalimentación que pueda ser llamado por IA, y lo denomina «dense feedback».

El núcleo de este mecanismo es permitir que el agente obtenga información más cercana al proceso de juicio técnico.
Cuando el modelo necesita confirmar si el cálculo es correcto, puede obtener retroalimentación sobre la precisión correspondiente; cuando necesita analizar la causa de la disminución del rendimiento, puede revisar el consumo de tiempo durante el funcionamiento del sistema; cuando intenta nuevas soluciones de optimización, puede evaluar mediante experimentos si dicha solución es aplicable al escenario actual.
El equipo de Zhipu considera que un feedback verdaderamente efectivo debe cumplir varias condiciones: debe estar lo suficientemente cerca del problema específico, poder obtenerse rápidamente y poder verificarse mediante experimentos objetivos. De lo contrario, grandes volúmenes de registros y métricas podrían dificultar que el agente determine la dirección de su próxima acción.
Sistema de optimización de modelos, servicio del sistema de modelos
Con la ayuda de dense feedback, Infra Agent comenzó a participar en la identificación de problemas ocultos en el sistema de razonamiento.
En el contexto de KDA, el agente descubrió un problema que afecta la precisión del cálculo de contextos largos.
Debido a que es necesario fusionar constantemente las matrices de estado entre diferentes fragmentos de contexto, los errores de redondeo generados por el cálculo TF32 se acumulan a medida que aumenta la longitud de la secuencia, lo que finalmente provoca desviaciones en los resultados del cálculo.
El agente localiza el problema en el manejo de precisión durante el proceso de propagación y fusión de estados, comparando los resultados de diferentes rutas de ejecución. La corrección relacionada ya se ha integrado en el PR #1180 del proyecto Flash Linear Attention.
Otro problema surge entre la transferencia KV y el programador DeepEP.
Durante la prueba, el agente descubrió que KV Transfer no tiene una superposición efectiva con DeepEP Dispatch, lo que provoca que en algunos escenarios el costo de transmisión supere el 30%.
Luego, el agente continuó analizando la cadena de llamadas entre Python y C++, y descubrió que la ruta dentro del nodo no liberaba oportunamente el GIL de Python, lo que impidió que la tarea de transmisión avanzara a tiempo.
Después de la modificación, el sobrecosto adicional de KV Transfer se redujo de más del 30% a menos del 1%.

Además, el agente optimizó un kernel de decodificación.
Descubrió que, debido a un problema en la forma de dividir el Kernel, el mismo cálculo de normalización se ejecutó cuatro veces. Al reorganizar la estructura de cálculo y reducir los cálculos duplicados, el Kernel logró finalmente una mejora de rendimiento de 1.71 veces.
Esta idea de optimización proviene del aprendizaje del Agente sobre los kernels existentes de proyectos como SGLang, Flash Linear Attention y DeepGEMM. Extrae la experiencia de optimización de estos códigos para formar un «esqueleto de optimización», y luego evalúa su aplicabilidad según las retroalimentaciones del sistema actual.

Anteriormente, este tipo de experiencia de optimización dependía principalmente del conocimiento acumulado por los ingenieros.
Durante este proceso, el agente comienza a aprender métodos de optimización a partir del código existente y luego los verifica mediante experimentos para determinar si son adecuados para nuevos entornos de hardware y modelos.
Tang Jie indicó que los ingenieros humanos siguen siendo responsables de establecer objetivos, crear entornos de retroalimentación y revisar modificaciones de alto riesgo.
Pero el rol del ingeniero está cambiando, de ser quien resuelve directamente cada problema, a ser quien diseña sistemas de retroalimentación.
El equipo de ZhiPu cree que un entorno de retroalimentación verificable basado en tareas de infraestructura real también podría ser una base importante para entrenar el próximo modelo. Cada vez que un agente completa una tarea de ingeniería, podría convertirse en datos para el aprendizaje del próximo modelo.
Actualmente, los casos de GLM-5.3-Flash aún distan de una auto-mejora recursiva en el sentido verdadero. Sin embargo, Tang Jie cree que ya ha surgido un ciclo de tamaño mínimo.
El sistema optimiza el modelo, y el servicio del sistema respalda al modelo.
