За дві тижні — 100 000 вітчизняних AI-акселераторів, початок оптимізації власної моделі.Автор статті: APPSO
Джерело: Wall Street Journal
Щойно професор Тан Цзе, головний науковець Zhipu GLM, поділився дослідженням щодо оптимізації інференсної системи GLM-5.3-Flash на платформі X.
Він зазначив, що від першого запуску GLM-5.3-Flash на вітчизняному AI-прискорювачі до повного завантаження всього виробничого трафіку минуло лише два тижні. У цьому процесі енд-ту-енд пропускна здатність системи зросла в 3,2 рази.

Найбільше вразило Тан Цзе те, що велику кількість оптимізацій виконала не лише команда інфраструктурних інженерів, а й Infra Agent, який працює на основі GLM-5.3.
«Модель, що допомагає оптимізувати власні послуги.» — так Тан Цзе описав цю зміну.
На його думку, це означає, що ШІ починає брати участь у оптимізації систем, які забезпечують його роботу. Хоча до справжньої рекурсивної самоудосконалення (Recursive Self-Improvement, RSI) ще дуже далеко, вже з’явилася початкова форма.

Команда Zhipu також зазначила, що за останній рік вони спостерігали, як роль GLM змінюється.
Спочатку команда досліджувала здатність GLM у розумінні коду та кібербезпеці, сподіваючись, що модель допоможе аналізувати вразливості у складному коді. Але зі зростанням здатностей моделі GLM почала брати участь у створенні самих AI-систем.
Команда зазначила, що спостерігала, як модель виконує завдання, які раніше вимагали кількох тижнів роботи досвідчених інженерів інфраструктури, і ці завдання безпосередньо впливають на спосіб навчання та розгортання наступних моделей.
Двотижневе розгортання китайського кластера обчислювальних потужностей
Щоб перейти від першого запуску великої моделі на новому обладнанні до стабільного інференс-сервісу, здатного обробляти виробничі запити, необхідно виконати великий обсяг системних інженерних робіт.
GLM-5.3-Flash цього разу розгорнуто на кластері з більше ніж 100 000 китайських AI-прискорювачів. Команда Zhipu зазначила, що це було масштабне розгортання без попереднього досвіду.
Команді потрібно вирішити кілька питань, зокрема обмеження об’єму пам’яті чіпів вітчизняного виробництва та пропускної здатності з’єднань, адаптація нової архітектури моделі, підтримка довгого контексту в 1 мільйон токенів та обробка мультимодальних запитів. Разом із тим, програмне забезпечення для вітчизняних прискорювачів ШІ все ще перебуває на етапі розвитку: деякі Kernel не підтримуються, багато інформації потрібно досліджувати самостійно інженерним командам.
Тан Цзе зазначив, що за цих обмежень Infra Agent, що працює на GLM-5.3, брав участь у процесі оптимізації системи висновків, допомагаючи аналізувати обмеження продуктивності, пропонувати рішення для оптимізації та виконувати частину змін у коді.
Процес оптимізації полягає не просто у збільшенні обчислювальних ресурсів, а у пошуку нової рівноваги між обчислювальною потужністю, пам’яттю, зв’язком і плануванням.
Команда ZhiPu застосувала серію оптимізацій. Наприклад, через ReplaySSM обмінюють обчислення на пам’ять, використовують тензорне паралелізування всередині вузла для зменшення навантаження на відеопам’ять, застосовують змішану точність INT8, FP8, BF16 для підвищення ефективності використання ємності, а також впроваджують розділену архітектуру Encode-Prefill-Decode (EPD), що дозволяє гнучкіше планувати різні етапи виведення.
На завершальному етапі продуктивність енд-ту-енд сервісу GLM-5.3-Flash зросла приблизно в 3 рази порівняно з початковою версією, а використання апаратних ресурсів і вартість на один токен досягли рівня основних платформ NVIDIA GPU.

Після завершення розгортання GLM-5.3-Flash був протестований у реальних умовах використання. Команда Zhipu повідомила, що ця модель раніше працювала на платформах OpenCode та OpenRouter під анонімною назвою Ox-Alpha і протягом тижня стала однією з найбільш використовуваних моделей на обох платформах, обробивши понад 62 трильйони токенів за шість днів.
Проте справжнім змінами цього експерименту було не просто те, що ШІ писав код, а те, що ШІ зміг зрозуміти, чому складні системи змінюють свою продуктивність.
Наприклад, коли система повідомляє про «зниження пропускної здатності на 20%», вона може лише вказувати на наявність аномалії, але не може безпосередньо повідомити агенту, який рівень вийшов з ладу, чи є поточна гіпотеза помилковою, і що слід перевірити на наступному етапі.
Для досвідчених інженерів такі висновки ґрунтуються на довголітньому досвіді. Інженери знають, коли перевіряти часову шкалу виконання, коли запускати мікробенчмарки та які модулі порівнювати.
Команда ZhiPu прагне перетворити цей інженерний досвід на механізм зворотного зв’язку, який може використовувати ШІ, і назвати його «густим зворотним зв’язком».

Суть цього механізму полягає в тому, щоб надати агенту інформацію, яка ближча до процесу інженерного аналізу.
Коли модель має підтвердити правильність обчислень, вона може отримати відповідний фідбек щодо точності; коли модель має проаналізувати причини зниження продуктивності, вона може переглянути час, витрачений на процеси системи; коли модель намагається нової оптимізаційної стратегії, вона може за допомогою експериментів визначити, чи підходить ця стратегія для поточної ситуації.
Команда ZhiPu вважає, що справді ефективний відгук повинен відповідати кільком умовам: він має бути достатньо близьким до конкретної проблеми, швидко отримуватися та піддаватися перевірці за допомогою об’єктивних експериментів. В іншому випадку велика кількість логів та показників може ускладнити агенту визначення напрямку наступних дій.
Система оптимізації моделей, сервісна модель системи
З допомогою щільного зворотного зв’язку Infra Agent почав брати участь у виявленні прихованих проблем у системі міркувань.
У контексті KDA паралельних шляхів агент виявив проблему, що впливає на точність обчислень довгих контекстів.
Оскільки між різними фрагментами контексту потрібно постійно об’єднувати матриці стану, округлення, що виникають при TF32-обчисленнях, накопичуються зі збільшенням довжини послідовності, що в кінцевому підсумку призводить до відхилень у результатах обчислень.
Агент визначив проблему в обробці точності під час поширення та об'єднання станів, порівнюючи результати різних шляхів виконання. Відповідні виправлення були об'єднані в PR #1180 проекту Flash Linear Attention.
Інша проблема виникає між KV Transfer і DeepEP розкладом.
Під час тестування агент виявив, що KV Transfer не має ефективного перекриття з DeepEP Dispatch, що призводить до збільшення витрат на передачу більше ніж на 30% у деяких сценаріях.
Після цього агент продовжив аналіз ланцюжка викликів Python та C++, виявивши, що шлях всередині вузла не звільняв Python GIL вчасно, що заважало своєчасному просуванню завдань передачі.
Після внесення змін додаткові витрати, пов’язані з KV Transfer, зменшилися з понад 30% до менше ніж 1%.

Крім того, Agent оптимізував Decode Kernel.
Виявлено, що через проблему зі способом розбиття Kernel одні й ті ж обчислення нормалізації виконувалися чотири рази. Шляхом переорганізації структури обчислень та зменшення повторних обчислень, цей Kernel отримав підвищення продуктивності на 1,71 рази.
Ця ідея оптимізації походить від агента, який вивчив існуючі ядра проектів SGLang, Flash Linear Attention та DeepGEMM. Вона витягує досвід оптимізації з цих кодів у вигляді «оптимізаційного скелету» і далі, з урахуванням зворотного зв’язку поточної системи, визначає, чи вона застосовна.

Раніше подібний досвід оптимізації залежав виключно від особистого досвіду інженерів.
У цьому процесі агент починає вчитися оптимізаційним методам з існуючого коду, а потім перевіряє експериментально, чи підходять ці методи для нових апаратних засобів та середовищ моделей.
Тан Цзе зазначив, що людські інженери все ще відповідають за встановлення цілей, створення середовища зворотного зв’язку та перевірку високоризикованих змін.
Але роль інженерів змінюється: вони все менше вирішують кожну проблему безпосередньо і все більше стають тими, хто проектує системи зворотного зв’язку.
Команда ZhiPu вважає, що перевіряєма середовище зворотного зв’язку, побудоване на реальних інфраструктурних завданнях, може також стати важливою основою для навчання наступного покоління моделей. Кожне завершення агентом інженерного завдання може стати даними для навчання наступного покоління моделей.
Наразі випадки з GLM-5.3-Flash ще не досягли справжньої рекурсивної самовдосконалення. Але Тан Цзе вважає, що мінімальний цикл вже з’явився.
Модель оптимізує систему, а система обслуговує модель.
