Dalam dua minggu, 100.000 accelerator AI buatan dalam negeri, sebuah permulaan untuk mengoptimalkan model sendiri.Penulis artikel: APPSO
Sumber artikel: Wall Street Journal
Baru saja, ilmuwan utama Zhipu GLM, Tang Jie, membagikan penelitian tentang optimasi sistem inferensi GLM-5.3-Flash di platform X.
Ia mengungkapkan, dari GLM-5.3-Flash pertama kali dijalankan pada akselerator AI dalam negeri hingga menyelesaikan seluruh beban lalu lintas produksi, hanya memakan waktu dua minggu. Dalam proses ini, kapasitas throughput end-to-end sistem meningkat 3,2 kali.

Yang paling mengesankan Tang Jie adalah bahwa bukan hanya insinyur infrastruktur yang menyelesaikan sejumlah besar pekerjaan optimasi, tetapi juga Infra Agent yang didorong oleh GLM-5.3.
“Sebuah model yang membantu mengoptimalkan layanan itu sendiri.” Demikian Tang Jie menggambarkan perubahan ini.
Menurutnya, ini berarti AI mulai terlibat dalam mengoptimalkan sistem yang mendukung operasinya. Meskipun masih jauh dari peningkatan mandiri rekursif (Recursive Self-Improvement, RSI) yang sebenarnya, bentuk awalnya telah muncul.

Tim ZhiPu juga menyebutkan bahwa dalam setahun terakhir, mereka mengamati peran GLM sedang berubah.
Awalnya, tim mengeksplorasi kemampuan GLM dalam pemahaman kode dan keamanan siber, dengan harapan agar model dapat membantu menganalisis kerentanan dalam kode yang kompleks. Namun, seiring peningkatan kemampuan model, GLM mulai terlibat dalam membangun sistem AI itu sendiri.
Tim tersebut menyatakan bahwa mereka pernah mengamati model menyelesaikan tugas-tugas yang sebelumnya memerlukan tim insinyur infrastruktur berpengalaman selama beberapa minggu, dan pekerjaan ini secara langsung memengaruhi cara pelatihan dan peluncuran model generasi berikutnya.
Penyelesaian penempatan klaster komputasi domestik dalam dua minggu
Mendorong model besar dari peluncuran pertama di perangkat keras baru hingga menjadi layanan inferensi yang stabil untuk menangani permintaan produksi memerlukan banyak pekerjaan rekayasa sistem.
GLM-5.3-Flash kali ini dijalankan pada kluster yang terdiri dari lebih dari 100.000 accelerator AI buatan dalam negeri. Tim Zhipu menyatakan bahwa ini adalah deploy besar-besaran yang sebelumnya tidak memiliki referensi pengalaman yang matang.
Tim perlu menyelesaikan beberapa masalah, termasuk kapasitas memori GPU chip domestik dan batasan bandwidth interkoneksi, adaptasi arsitektur model baru, dukungan konteks panjang 1 juta token, serta penanganan permintaan multimodal, dll. Sementara itu, ekosistem perangkat lunak akselerator AI domestik masih dalam tahap pengembangan, sebagian kernel belum didukung, dan banyak informasi juga perlu dieksplorasi secara mandiri oleh tim teknik.
Tang Jie menyatakan bahwa, dalam kondisi pembatasan ini, Infra Agent yang didorong oleh GLM-5.3 berpartisipasi dalam proses optimasi sistem inferensi, membantu menganalisis bottleneck kinerja, mengusulkan solusi optimasi, dan menyelesaikan sebagian perubahan kode.
Proses optimasi keseluruhan bukan sekadar menambah sumber daya komputasi, tetapi mencari keseimbangan baru antara daya komputasi, memori, komunikasi, dan penjadwalan.
Tim ZhiPu menerapkan serangkaian solusi optimasi. Misalnya, menggunakan ReplaySSM untuk menukar komputasi dengan ruang memori, menerapkan tensor paralel di dalam node untuk mengurangi tekanan memori GPU, meningkatkan efisiensi penggunaan kapasitas melalui cache presisi campuran INT8, FP8, dan BF16, serta memperkenalkan arsitektur terpisah Encode-Prefill-Decode (EPD) yang memungkinkan penjadwalan lebih fleksibel pada berbagai tahap inferensi.
Secara akhir, kinerja layanan end-to-end GLM-5.3-Flash meningkat sekitar 3 kali dibandingkan versi awal, dengan pemanfaatan perangkat keras dan biaya per token mencapai tingkat yang mendekati platform NVIDIA GPU utama.

Setelah deploy, GLM-5.3-Flash juga menjalani uji coba di lingkungan penggunaan nyata. Tim Zhipu menjelaskan bahwa model ini sebelumnya berjalan di platform OpenCode dan OpenRouter dengan nama model anonim Ox-Alpha, dan dalam satu minggu menjadi salah satu model dengan penggunaan tertinggi di kedua platform, memproses lebih dari 62 triliun token dalam enam hari.
Namun, perubahan sejati dalam eksperimen ini bukan hanya membuat AI menulis kode, tetapi membuat AI mampu memahami mengapa sistem kompleks mengalami perubahan kinerja.
Misalnya, ketika sistem memberikan umpan balik "penurunan throughput 20%", itu hanya menunjukkan adanya anomali di suatu tempat, tetapi tidak secara langsung memberi tahu Agent lapisan mana yang bermasalah, apakah asumsi saat ini salah, dan apa yang harus diverifikasi selanjutnya.
Bagi insinyur berpengalaman, penilaian semacam ini bergantung pada pengalaman jangka panjang. Insinyur tahu kapan harus memeriksa garis waktu eksekusi, kapan menjalankan mikro-benchmark, dan mana modul yang outputnya harus dibandingkan.
Tim ZhiPu berharap mengubah pengalaman teknik ini menjadi mekanisme umpan balik yang dapat dipanggil oleh AI, dan menyebutnya sebagai «dense feedback».

Inti dari mekanisme ini adalah memberikan Agent informasi yang lebih mendekati proses penilaian teknis.
Ketika model perlu mengonfirmasi apakah perhitungan benar, ia dapat memperoleh umpan balik tentang kebenaran yang sesuai; ketika model perlu menganalisis penyebab penurunan kinerja, ia dapat melihat konsumsi waktu selama proses berjalan sistem; ketika model mencoba solusi optimasi baru, ia dapat menilai apakah solusi tersebut cocok untuk skenario saat ini melalui eksperimen.
Tim ZhiPu percaya bahwa umpan balik yang benar-benar efektif harus memenuhi beberapa kondisi: harus cukup dekat dengan masalah spesifik, dapat diperoleh dengan cepat, dan dapat diverifikasi melalui eksperimen objektif. Jika tidak, log dan indikator dalam jumlah besar justru dapat membuat Agent kesulitan menentukan arah tindakan selanjutnya.
Sistem optimasi model, layanan sistem model
Dengan bantuan dense feedback, Infra Agent mulai terlibat dalam mengidentifikasi masalah tersembunyi dalam sistem penalaran.
Dalam konteks jalur paralel KDA, Agent menemukan masalah yang memengaruhi akurasi perhitungan konteks panjang.
Karena diperlukan penggabungan matriks status secara terus-menerus antara shard konteks yang berbeda, kesalahan pembulatan yang dihasilkan oleh perhitungan TF32 akan terakumulasi seiring bertambahnya panjang urutan, sehingga menyebabkan penyimpangan hasil perhitungan.
Agen memposisikan masalah pada pemrosesan presisi dalam proses penyebaran dan penggabungan status dengan membandingkan hasil dari berbagai jalur eksekusi. Perbaikan terkait telah digabungkan ke dalam PR #1180 proyek Flash Linear Attention.
Masalah lain muncul antara KV Transfer dan jadwal DeepEP.
Selama pengujian, Agent menemukan bahwa KV Transfer tidak memiliki tumpang tindih efektif dengan DeepEP Dispatch, menyebabkan biaya transfer melebihi 30% dalam beberapa skenario.
Selanjutnya, Agent melanjutkan analisis sepanjang rantai panggilan Python dan C++, menemukan bahwa jalur di dalam node tidak melepaskan Python GIL secara tepat waktu, sehingga tugas transmisi tidak dapat berjalan secara tepat waktu.
Setelah pembaruan selesai, overhead tambahan dari KV Transfer berkurang dari lebih dari 30% menjadi di bawah 1%.

Selain itu, Agent juga mengoptimalkan sebuah Decode Kernel.
Ia menemukan bahwa karena masalah cara pemotongan Kernel, perhitungan normalisasi yang sama dieksekusi berulang kali sebanyak empat kali. Dengan mengatur ulang struktur perhitungan untuk mengurangi perhitungan berulang, Kernel ini akhirnya mendapatkan peningkatan kinerja sebesar 1,71 kali.
Gagasan optimasi ini berasal dari pembelajaran Agent terhadap Kernel yang ada dalam proyek-proyek seperti SGLang, Flash Linear Attention, dan DeepGEMM. Pengalaman optimasi dari kode-kode tersebut dirangkum menjadi "optimization skeleton", lalu dipertimbangkan kesesuaiannya berdasarkan umpan balik sistem saat ini.

Di masa lalu, pengalaman optimasi serupa sebagian besar bergantung pada akumulasi pribadi insinyur.
Dalam proses ini, Agent mulai dapat belajar metode optimasi dari kode yang sudah ada, lalu menguji secara eksperimen apakah metode-metode tersebut cocok untuk lingkungan perangkat keras dan model baru.
Tang Jie menyatakan bahwa insinyur manusia tetap bertanggung jawab menetapkan tujuan, membangun lingkaran umpan balik, serta meninjau perubahan berisiko tinggi.
Namun peran insinyur sedang berubah, dari orang yang secara langsung menyelesaikan setiap masalah, perlahan beralih menjadi perancang sistem umpan balik.
Tim ZhiPu percaya bahwa lingkungan umpan balik yang dapat diverifikasi yang didasarkan pada tugas infrastruktur nyata juga mungkin menjadi fondasi penting dalam melatih model generasi berikutnya. Setiap kali Agent menyelesaikan tugas teknik, hal itu dapat menjadi data pembelajaran untuk model generasi berikutnya.
Saat ini, kasus GLM-5.3-Flash masih jauh dari peningkatan diri rekursif sejati. Namun, Tang Jie percaya bahwa satu siklus skala minimum telah muncul.
Sistem mengoptimalkan model, sementara layanan sistem mendukung model.
