Em duas semanas, 100 mil aceleradores de IA nacionais, um começo para otimizar seu próprio modelo.Autor do artigo: APPSO
Fonte: Wall Street Journal
Just now, Tang Jie, Chief Scientist of Zhipu GLM, shared a study on the optimization of the GLM-5.3-Flash inference system on the X platform.
Ele revelou que, desde a primeira execução do GLM-5.3-Flash em um acelerador de IA nacional até a conclusão do carregamento de todo o tráfego de produção, foram necessárias apenas duas semanas. Durante esse processo, a capacidade de throughput extremo a extremo do sistema aumentou 3,2 vezes.

O que mais impressionou Tang Jie foi que não foram apenas os engenheiros de infraestrutura que realizaram grande parte das otimizações, mas também um Infra Agent impulsionado pelo GLM-5.3.
“Um modelo que ajuda a otimizar o próprio serviço.”唐杰 assim descreveu essa mudança.
Na sua visão, isso significa que a IA começou a participar da otimização dos sistemas que suportam sua própria operação. Embora ainda esteja muito distante de uma verdadeira autoaprimoramento recursivo (Recursive Self-Improvement, RSI), uma forma inicial já surgiu.

A equipe do Zhipu também mencionou que, no último ano, observaram uma mudança no papel do GLM.
Inicialmente, a equipe explorou a capacidade do GLM em compreensão de código e segurança cibernética, esperando que o modelo ajudasse a analisar vulnerabilidades em códigos complexos. Mas à medida que as capacidades do modelo aumentaram, o GLM passou a participar na construção de próprios sistemas de IA.
A equipe afirmou que observou o modelo concluindo tarefas que anteriormente exigiam equipes de engenheiros de infraestrutura sênior semanas para serem realizadas, e essas tarefas afetam diretamente a forma como os próximos modelos serão treinados e implantados.
Conclusão da implantação do cluster de poder de computação nacional em duas semanas
Levar um grande modelo da primeira execução em novo hardware até um serviço de inferência capaz de suportar solicitações de produção de forma estável exige um grande esforço de engenharia de sistemas.
A implantação do GLM-5.3-Flash foi executada em um cluster composto por mais de 100 mil aceleradores de IA nacionais. A equipe de Zhipu afirmou que esta foi uma implantação em larga escala sem referências anteriores de experiência madura.
A equipe precisa resolver vários problemas, incluindo limitações de capacidade de memória de vídeo e largura de banda de interconexão de chips nacionais, adaptação de novas arquiteturas de modelos, suporte a contextos longos de 1 milhão de tokens e processamento de solicitações multimodais. Ao mesmo tempo, o ecossistema de software dos aceleradores de IA nacionais ainda está em desenvolvimento, com suporte insuficiente para alguns kernels e muitos recursos que precisam ser explorados pela equipe de engenharia.
Tang Jie afirmou que, sob essas restrições, o Infra Agent impulsionado pelo GLM-5.3 participou do processo de otimização do sistema de inferência, ajudando a analisar gargalos de desempenho, propor soluções de otimização e realizar algumas alterações no código.
O processo de otimização não consiste simplesmente em aumentar os recursos de computação, mas em encontrar um novo equilíbrio entre poder de processamento, memória, comunicação e agendamento.
A equipe do Zhipu implementou uma série de soluções de otimização. Por exemplo, utiliza o ReplaySSM para trocar cálculo por espaço de memória, reduz a pressão de memória de vídeo por meio de paralelismo de tensores dentro dos nós, aumenta a utilização da capacidade com cache de precisão mista INT8, FP8 e BF16, e introduz a arquitetura separada Encode-Prefill-Decode (EPD), permitindo um agendamento mais flexível para diferentes estágios de inferência.
Finalmente, o desempenho do serviço end-to-end do GLM-5.3-Flash aumentou aproximadamente 3 vezes em comparação com a versão inicial, alcançando níveis próximos aos da plataforma principal de GPU NVIDIA em termos de utilização de hardware e custo por token.

Após a implantação, o GLM-5.3-Flash foi submetido a testes em ambiente real de uso. A equipe de Zhipu informou que o modelo operou anteriormente sob o nome anônimo Ox-Alpha nas plataformas OpenCode e OpenRouter, tornando-se um dos modelos mais utilizados em ambas as plataformas em uma semana, processando mais de 62 trilhões de tokens em seis dias.
No entanto, a verdadeira mudança neste experimento não foi apenas permitir que a IA escrevesse código, mas sim fazer com que a IA pudesse entender por que sistemas complexos apresentam mudanças de desempenho.
Por exemplo, quando o sistema relata uma "redução de 20% no throughput", ele apenas indica que há uma anomalia em algum lugar, mas não consegue informar diretamente ao agente em qual camada ocorreu o problema, se a suposição atual está errada ou o que deve ser verificado em seguida.
Para engenheiros experientes, esse tipo de julgamento depende de experiência prolongada. Os engenheiros sabem quando verificar a linha do tempo de execução, quando executar microbenchmarks e quais módulos comparar.
A equipe do Zhipu deseja transformar essa experiência de engenharia em um mecanismo de feedback acessível pela IA, denominando-o de «dense feedback».

O núcleo desse mecanismo é permitir que o Agente obtenha informações mais próximas do processo de julgamento de engenharia.
Quando o modelo precisa confirmar se o cálculo está correto, ele pode obter feedback de correção correspondente; quando precisa analisar a causa da queda de desempenho, pode verificar o consumo de tempo durante a execução do sistema; quando tenta novas soluções de otimização, pode avaliar por meio de experimentos se a solução é adequada para o cenário atual.
A equipe do ZhiPu acredita que um feedback verdadeiramente eficaz precisa atender a alguns critérios: deve estar suficientemente próximo do problema específico, ser rapidamente acessível e poder ser verificado por meio de experimentos objetivos. Caso contrário, grandes volumes de logs e métricas podem dificultar ainda mais a capacidade do Agente de determinar o próximo passo.
Sistema de otimização de modelos, serviço do sistema de modelos
Com a ajuda do dense feedback, o Infra Agent começou a participar na identificação de problemas ocultos no sistema de raciocínio.
No contexto paralelo do KDA, o agente identificou um problema que afeta a precisão do cálculo de contextos longos.
Como é necessário mesclar continuamente matrizes de estado entre diferentes shards de contexto, os erros de arredondamento gerados pelo cálculo TF32 se acumulam à medida que o comprimento da sequência aumenta, resultando finalmente em desvios nos resultados do cálculo.
O agente localizou o problema no tratamento de precisão durante o processo de propagação e fusão de estados, comparando os resultados de diferentes caminhos de execução. A correção relacionada já foi integrada ao PR #1180 do projeto Flash Linear Attention.
Outro problema surgiu entre a transferência KV e o agendamento do DeepEP.
Durante o teste, o agente descobriu que o KV Transfer não formou sobreposição eficaz com o DeepEP Dispatch, resultando em sobrecarga de transmissão superior a 30% em alguns cenários.
Em seguida, o Agente continuou a análise ao longo da cadeia de chamadas Python e C++, descobrindo que o caminho dentro do nó não liberou o GIL do Python a tempo, impedindo que a tarefa de transmissão avançasse adequadamente.
Após a modificação, o custo adicional trazido pelo KV Transfer foi reduzido de mais de 30% para menos de 1%.

Além disso, o Agent também otimizou um Decode Kernel.
Ele descobriu que, devido ao problema na forma de divisão do Kernel, o mesmo cálculo de normalização foi executado quatro vezes repetidamente. Ao reorganizar a estrutura de cálculo e reduzir os cálculos duplicados, o Kernel obteve finalmente um aumento de desempenho de 1,71 vezes.
Essa abordagem de otimização deriva do aprendizado do Agente sobre os kernels existentes em projetos como SGLang, Flash Linear Attention e DeepGEMM. Ela extrai a experiência de otimização desses códigos como um “esqueleto de otimização” e, em seguida, avalia sua aplicabilidade com base no feedback do sistema atual.

No passado, experiências semelhantes de otimização dependiam principalmente da acumulação individual dos engenheiros.
Durante esse processo, o Agente começa a aprender métodos de otimização a partir do código existente e, em seguida, valida por meio de experimentos se esses métodos são adequados para novos ambientes de hardware e modelos.
Tang Jie afirmou que os engenheiros humanos ainda são responsáveis por definir metas, criar ambientes de feedback e revisar alterações de alto risco.
Mas o papel dos engenheiros está mudando, passando de quem resolve diretamente cada problema para quem projeta sistemas de feedback.
A equipe do ZhiPu acredita que um ambiente de feedback verificável baseado em tarefas de infraestrutura real também pode ser uma base importante para treinar o próximo modelo. Cada vez que um Agente conclui uma tarefa de engenharia, pode se tornar dados para o próximo modelo aprender.
Atualmente, os casos do GLM-5.3-Flash ainda estão distantes de uma autoaprimoração recursiva no sentido verdadeiro. Mas Tang Jie acredita que um ciclo mínimo já surgiu.
O sistema otimiza o modelo, e o serviço do sistema sustenta o modelo.
