İki hafta, 100.000 yerli AI hızlandırıcı, kendi modelinizi optimize etmeye başlayın.Yazan: APPSO
Kaynak: Wall Street Journal
Tam olarak şimdi, ZhiPu GLM baş bilim insanı Tang Jie, X platformunda GLM-5.3-Flash çıkarım sistemi optimizasyonu hakkında bir araştırma paylaştı.
O, GLM-5.3-Flash'in yerel AI hızlandırıcıda ilk kez çalıştırılmasından tam üretim trafiğini taşıyana kadar yalnızca iki hafta sürdüğünü açıkladı. Bu süreçte, sistemin uçtan uca veri throughput kapasitesi 3,2 kat arttı.

唐杰’i en çok etkileyen şey, sadece altyapı mühendislerinin değil, GLM-5.3 ile çalışan bir Infra Agent’in de büyük ölçüde optimizasyon çalışmalarını tamamlamasıydı.
“Kendi hizmetini optimize etmeye yardımcı olan bir model.” diye açıkladı Tang Jie.
Ona göre, bu, AI'nın kendi çalıştığı sistemi optimize etmeye başladığını anlamına gelir. Gerçek anlamda özyinelemeli kendi kendini geliştirme (Recursive Self-Improvement, RSI) hâlâ çok uzak olsa da, erken bir formu ortaya çıkmıştır.

ZhiPu ekibi, geçen yıl boyunca GLM'in rolünün değiştiğini de belirtti.
İlk olarak, ekip, GLM'nin kod anlama ve siber güvenlik alanlarındaki yeteneklerini araştırdı ve modelin karmaşık kodlarda açıkları analiz etmesini istedi. Ancak modelin yetenekleri arttıkça, GLM AI sistemlerinin oluşturulmasına dahil oldu.
Takım, modelin geçmişte uzman altyapı mühendisleri tarafından haftalarca tamamlanması gereken görevleri tamamladığını gözlemledi ve bu işler doğrudan sonraki nesil model eğitim ve dağıtım yöntemlerini etkiledi.
İki hafta içinde yerel hesaplama kümesi kurulumu tamamlanacak
Bir büyük modelin yeni donanımda ilk çalıştırılmasından, üretim isteklerini kararlı bir şekilde karşılayabilen bir çıkarım hizmetine dönüştürmek, büyük ölçekli sistem mühendisliği çalışmaları gerektirir.
GLM-5.3-Flash, 100.000'den fazla yerel AI hızlandırıcıdan oluşan bir kümeye dağıtıldı. Zhipu ekibi, bu dağıtımın daha önce olgun deneyimlere dayanmayan büyük bir dağıtım olduğunu belirtti.
Takım, yerel çip bellek kapasitesi ve bağlantı bant genişliği sınırlamaları, yeni model mimarisi uyumu, 1 milyon token uzunlukta bağlam desteği ve çoklu modality isteklerini işleme gibi birçok sorunu çözmek zorunda. Aynı zamanda, yerel AI hızlandırıcıların yazılım ekosistemi hâlâ gelişim aşamasında, bazı Kernel desteği yetersiz ve birçok bilgi mühendislik ekibinin kendi kendine keşfetmesi gerekiyor.
Tang Jie, bu sınırlamalar altında, GLM-5.3 tabanlı Infra Agent'in performans darboğazlarını analiz etmeye, iyileştirme önerileri sunmaya ve bazı kod değişikliklerini tamamlamaya katıldığını belirtti.
Optimizasyon süreci, sadece hesaplama kaynaklarını artırmak değil, hesaplama gücü, bellek, iletişim ve zamanlama arasında yeni bir denge bulmaktır.
ZhiPu ekibi bir dizi optimizasyon çözümü uyguladı. Örneğin, ReplaySSM ile hesaplama gücünü bellek alanına dönüştürdü, düğüm içi tensör paralelliği ile GPU belleği yükünü azalttı, INT8, FP8 ve BF16 karışık hassasiyet önbelleği ile kapasite kullanım oranını artırdı ve aynı zamanda Encode-Prefill-Decode (EPD) ayrıştırılmış mimarisini tanıttı, böylece farklı çıkarım aşamaları daha esnek şekilde planlanabildi.
Sonuç olarak, GLM-5.3-Flash'in uçtan uca hizmet performansı, ilk sürümüne kıyasla yaklaşık 3 kat artırıldı ve donanım kullanım oranı ile tek token maliyeti, ana akım NVIDIA GPU platformlarının seviyesine ulaştı.

Dağıtım tamamlandıktan sonra, GLM-5.3-Flash gerçek kullanım ortamında test edilmeye başlanacaktır. ZhiPu ekibi, bu modelin OpenCode ve OpenRouter platformlarında anonim model adı Ox-Alpha ile çalıştığını ve bir hafta içinde bu iki platformda en çok kullanılan modellerden biri haline geldiğini, altı günde 62 trilyondan fazla token işlendiğini açıkladı.
Ancak bu deneydeki gerçek değişiklik, AI'nın kod yazması değil, karmaşık sistemlerin neden performans değişikliği yaşadığını anlayabilmesidir.
Örneğin, sistem "verimlilikte %20 düşüş" geri bildirimi verdiğinde, bu yalnızca bir yerde anormallik olduğunu gösterir, ancak Agent'e hangi katmanda sorun olduğunu, mevcut varsayımın yanlış olup olmadığını ve sonraki adımın ne olduğunu doğrudan belirtmez.
Deneyimli mühendisler için bu tür kararlar uzun yılların birikimiyle oluşur. Mühendisler, ne zaman yürütme zaman çizelgesine bakacağını, ne zaman mikro performans testi çalıştıracağını ve hangi modülün çıktısını karşılaştıracağını bilir.
ZhiPu ekibi, bu mühendislik deneyimini AI tarafından çağrılabilen bir geri bildirim mekanizmasına dönüştürmeyi ve bunu "dense feedback" olarak adlandırmayı hedefliyor.

Bu mekanizmanın temel amacı, Agent'ın mühendislik karar sürecine daha yakın bilgiler elde etmesini sağlamaktır.
Model, hesaplamaların doğru olup olmadığını doğrulamak için ilgili doğruluk geri bildirimlerini alabilir; performans düşüşünün nedenlerini analiz etmek için sistem çalışması sırasında harcanan zamanı inceleyebilir; yeni optimizasyon yöntemleri denediğinde, bu yöntemlerin mevcut senaryoya uygun olup olmadığını deneylerle belirleyebilir.
ZhiPu ekibi, gerçek anlamda etkili geri bildirimin birkaç koşulu karşılaması gerektiğini düşünüyor: bu geri bildirim, spesifik soruna yeterince yakın olmalı, hızlıca elde edilebilir olmalı ve nesnel deneylerle doğrulanabilir olmalı. Aksi halde, büyük miktarda günlük veri ve endeksler, Agent'in bir sonraki adım yönünü belirlemesini zorlaştırabilir.
Model Optimizasyon Sistemi, Sistem Hizmet Modeli
Yoğun geri bildirimlerle Infra Agent, gizli sorunları tanımlama sistemine dahil olmaya başladı.
KDA bağlamında paralel yolunda, Agent uzun bağlam hesaplamalarının doğruluğunu etkileyen bir sorun tespit etti.
Farklı bağlamsal parçalar arasında durum matrislerinin sürekli olarak birleştirilmesi nedeniyle, TF32 hesaplamaları tarafından oluşturulan yuvarlama hataları, dizinin uzunluğu arttıkça birikir ve nihayetinde hesaplama sonuçlarında sapmalara neden olur.
Agent, farklı yürütme yollarının sonuçlarını karşılaştırarak sorunu durum yayılımı ve birleştirme süreçlerindeki hassasiyet işleme ile ilişkilendirdi. İlgili düzeltmeler, Flash Linear Attention projesi PR #1180'e entegre edildi.
KV Transfer ile DeepEP zamanlaması arasında başka bir sorun ortaya çıktı.
Test sürecinde, Agent KV Transfer'in DeepEP Dispatch ile etkili bir çakışma oluşturmadığını ve bu nedenle bazı senaryolarda iletim maliyetinin %30'u aştığını tespit etti.
Daha sonra, Agent, Python ve C++ çağrı zincirini takip ederek, düğüm içindeki yolun Python GIL'i zamanında serbest bırakmadığını ve bu nedenle iletim görevinin zamanında ilerlememesini tespit etti.
Düzenlemeler tamamlandıktan sonra, KV Transfer ile oluşan ek maliyetler %30'un üzerindeyken şimdi %1'in altına düşmüştür.

Ayrıca, Agent bir Decode Kernel'ı optimize etti.
Kernel'in bölme yöntemi nedeniyle aynı normalizasyon hesaplaması dört kez tekrarlandığı tespit edildi. Hesaplama yapısı yeniden düzenlenerek tekrarlanan hesaplamalar azaltıldı ve bu Kernel sonunda %1,71 performans artışı sağladı.
Bu iyileştirme fikri, Agent'ın SGLang, Flash Linear Attention ve DeepGEMM gibi projelerdeki mevcut Kernel'leri öğrenmesinden kaynaklanmaktadır. Bu kodlardaki iyileştirme deneyimleri, bir "optimization skeleton" haline getirilip, mevcut sistem geri bildirimleriyle uygunluğu değerlendirilir.

Geçmişte, benzer optimizasyon deneyimleri çoğunlukla mühendislerin bireysel birikimlerine dayanıyordu.
Bu süreçte, Agent mevcut kodlardan optimizasyon yöntemleri öğrenmeye başlıyor ve bu yöntemlerin yeni donanım ve model ortamlarına uygun olup olmadığını deneylerle doğruluyor.
Tang Jie, insan mühendislerin hala hedefleri belirlemek, geri bildirim ortamları kurmak ve yüksek riskli değişiklikleri denetlemekten sorumlu olduğunu belirtti.
Ancak mühendislerin rolü, her sorunu doğrudan çözen kişiden geri bildirim sistemleri tasarlayan kişilere doğru değişiyor.
ZhiPu ekibi, gerçek altyapı görevlerine dayalı doğrulanabilir geri bildirim ortamının, bir sonraki nesil modelin eğitimi için önemli bir temel olabileceğini düşünüyor. Her bir Agent'in mühendislik görevini tamamlaması, bir sonraki nesil modelin öğrenmesi için veri haline gelebilir.
Şu anda GLM-5.3-Flash örnekleri, gerçek anlamda özyinelemeli kendi kendini geliştirme ile hâlâ uzak. Ancak Tang Jie, en küçük ölçekli bir döngünün ortaya çıktığını düşünüyor.
Model optimizasyon sistemi ve sistem hizmet modeli.
