За две недели — 100 000 отечественных AI-beschleuniger, начало оптимизации собственной модели.Автор статьи: APPSO
Источник: Wall Street Journal
Только что главный научный сотрудник Zhipu GLM Тан Цзе поделился исследованием по оптимизации системы вывода GLM-5.3-Flash на платформе X.
Он отметил, что от первого запуска GLM-5.3-Flash на отечественном AI-beschleuniger до полной нагрузки производственного трафика прошло всего две недели. В течение этого процесса системная сквозная пропускная способность увеличилась в 3,2 раза.

Самым впечатляющим для Тан Цзе было то, что над большим количеством оптимизаций работали не только инженеры инфраструктуры, но и Infra Agent, управляемый GLM-5.3.
«Модель, помогающая оптимизировать собственные услуги», — так Тан Цзе описал это изменение.
По его мнению, это означает, что ИИ начинает участвовать в оптимизации систем, на которых он сам функционирует. Хотя до настоящего рекурсивного самосовершенствования (Recursive Self-Improvement, RSI) еще далеко, уже появилась его ранняя форма.

Команда ZhiPu также отметила, что за последний год они наблюдали изменение роли GLM.
Изначально команда изучала возможности GLM в области понимания кода и кибербезопасности, надеясь, что модель поможет анализировать уязвимости в сложном коде. Однако по мере улучшения возможностей модели GLM начала участвовать в создании самих AI-систем.
Команда отметила, что они наблюдали, как модель выполняет задачи, которые ранее требовали от команды опытных инженеров по инфраструктуре нескольких недель работы, и эти задачи напрямую влияют на методы обучения и развертывания следующего поколения моделей.
Развертывание отечественного кластера вычислительных мощностей завершено за две недели
Перевод крупной модели с первого запуска на новом оборудовании до стабильного сервиса вывода, способного обрабатывать производственные запросы, требует значительных системных инженерных усилий.
GLM-5.3-Flash此次部署运行在由超过10万颗国产AI加速器组成的集群上。智谱团队表示,这是一次此前缺乏成熟经验参考的大规模部署。
Команде необходимо решить несколько задач, включая ограничения по объему памяти отечественных чипов и пропускной способности соединений, адаптацию новых архитектур моделей, поддержку длинного контекста в 1 млн токенов и обработку мультимодальных запросов. В то же время программная экосистема отечественных ускорителей ИИ все еще находится на стадии развития: часть Kernel-поддержки отсутствует, и многие аспекты требуют самостоятельного изучения инженерной командой.
Тан Цзе отметил, что при этих ограничениях Infra Agent, управляемый GLM-5.3, участвовал в процессе оптимизации системы вывода, помогая анализировать узкие места производительности, предлагать решения для оптимизации и вносить изменения в часть кода.
Весь процесс оптимизации заключается не в простом увеличении вычислительных ресурсов, а в поиске нового баланса между вычислительной мощностью, памятью, связью и планированием.
Команда ZhiPu применила ряд оптимизационных решений. Например, с помощью ReplaySSM обменивают вычислительные ресурсы на объем памяти, применяют тензорное параллелизм внутри узлов для снижения нагрузки на видеопамять, используют смешанную точность INT8, FP8 и BF16 для повышения эффективности использования емкости, а также внедряют разделенную архитектуру Encode-Prefill-Decode (EPD), позволяющую более гибко планировать различные этапы вывода.
В итоге производительность конечного сервиса GLM-5.3-Flash увеличилась примерно в 3 раза по сравнению с первоначальной версией, а использование аппаратных ресурсов и стоимость на один токен достигли уровня ведущих платформ NVIDIA GPU.

После развертывания GLM-5.3-Flash был протестирован в реальной среде использования. Команда Zhipu сообщила, что эта модель ранее работала на платформах OpenCode и OpenRouter под анонимным названием Ox-Alpha и за неделю стала одной из самых используемых моделей на обеих платформах, обработав более 62 триллионов токенов за шесть дней.
Однако настоящим изменением в этом эксперименте стало не просто написание кода ИИ, а способность ИИ понимать, почему возникают изменения производительности в сложных системах.
Например, когда система сообщает «снижение пропускной способности на 20%», она может указать только на наличие аномалии, но не может напрямую сообщить агенту, на каком уровне возникла проблема, является ли текущая гипотеза ошибочной и что следует проверить дальше.
Для опытных инженеров такие оценки основаны на длительном опыте. Инженеры знают, когда проверять временные линии выполнения, когда запускать микробенчмарки и какие модули сравнивать по выводу.
Команда ZhiPu стремится превратить этот инженерный опыт в механизм обратной связи, доступный для ИИ, и называет его «плотной обратной связью».

Суть этой системы заключается в том, чтобы предоставить агенту информацию, максимально приближенную к процессу инженерных расчетов.
Когда модели необходимо подтвердить правильность вычислений, она может получить соответствующую обратную связь о точности; когда модели необходимо проанализировать причины снижения производительности, она может просмотреть временные затраты в процессе работы системы; когда модель пробует новые методы оптимизации, она может оценить применимость этого метода к текущей ситуации с помощью экспериментов.
Команда ZhiPu считает, что действительно эффективный обратный связь должен удовлетворять нескольким условиям: он должен быть достаточно близок к конкретной проблеме, быстро доступен и поддаваться проверке с помощью объективных экспериментов. В противном случае большое количество логов и метрик может затруднить агенту определение направления следующих действий.
Система оптимизации моделей, сервисная модель системы
Благодаря плотной обратной связи Infra Agent начал участвовать в выявлении скрытых проблем в системе рассуждений.
В контексте параллельных путей KDA агент обнаружил проблему, влияющую на точность вычислений с длинным контекстом.
Поскольку между различными контекстными фрагментами необходимо постоянно объединять матрицы состояний, округлительные ошибки, возникающие при вычислениях TF32, накапливаются с увеличением длины последовательности, в конечном итоге приводя к отклонениям в результатах вычислений.
Агент выявил проблему в обработке точности на этапах распространения и объединения состояний, сравнив результаты различных путей выполнения. Соответствующие исправления уже включены в PR #1180 проекта Flash Linear Attention.
Еще одна проблема возникла между KV Transfer и расписанием DeepEP.
В процессе тестирования агент обнаружил, что KV Transfer не имеет эффективного перекрытия с DeepEP Dispatch, что приводит к увеличению затрат на передачу более чем на 30% в некоторых сценариях.
Затем агент продолжил анализ по цепочке вызовов Python и C++, обнаружив, что путь внутри узла не освобождал Python GIL вовремя, что препятствовало своевременному продвижению задачи передачи.
После внесения изменений дополнительные расходы, связанные с KV Transfer, снизились с более чем 30% до менее чем 1%.

Кроме того, Agent также оптимизировал Decode Kernel.
Он обнаружил, что из-за проблемы с методом разделения ядра одна и та же группа вычислений нормализации выполнялась четыре раза. За счет переорганизации структуры вычислений и снижения повторных вычислений производительность этого ядра в итоге повысилась в 1,71 раза.
Эта идея оптимизации основана на анализе агентом существующих ядер проектов SGLang, Flash Linear Attention и DeepGEMM. Она выделяет опыт оптимизации из этих кодов в виде «скелета оптимизации», а затем использует обратную связь от текущей системы для оценки применимости.

Раньше подобный опыт оптимизации в основном зависел от личного опыта инженеров.
В процессе этого агент начинает учиться оптимизировать методы на основе существующего кода, а затем проверять экспериментально, подходят ли эти методы для новых аппаратных средств и сред моделей.
Тан Цзе отметил, что человеческие инженеры по-прежнему отвечают за установку целей, создание среды обратной связи и проверку высокорисковых изменений.
Но роль инженеров меняется: от людей, которые напрямую решают каждую проблему, к тем, кто проектирует системы обратной связи.
Команда ZhiPu считает, что среда проверяемых обратных связей, основанная на реальных инфраструктурных задачах, может также стать важной основой для обучения следующего поколения моделей. Каждое выполнение инженерной задачи агентом может стать данными для обучения следующего поколения моделей.
На данный момент случаи с GLM-5.3-Flash все еще далеки от истинной рекурсивной самосовершенствующейся системы. Однако Тан Цзе считает, что уже появился минимальный цикл.
Модель оптимизирует систему, а система обслуживает модель.
