ZhipuAI Berjaya Melaksanakan 100,000 Pemercepat AI Tempatan Dalam Dua Minggu

iconMetaEra
Kongsi
AI summary iconRingkasan
ZhipuAI melaksanakan sistem inferensia GLM-5.3-Flashnya pada satu cluster lebih daripada 100,000 akselerator AI tempatan dalam masa hanya dua minggu, menurut berita AI + crypto. Throughput end-to-end sistem ini meningkat sebanyak 3.2 kali, dengan Infra Agent yang digerakkan AI mengendalikan tugas-tugas pengoptimuman yang biasanya dilakukan oleh jurutera senior. Berita on-chain menonjolkan integrasi pantas AI ke dalam infrastruktur, menunjukkan bagaimana automasi sedang membentuk semula alur kerja teknikal. Pelaksanaan ini mencerminkan semangat yang semakin meningkat dalam sektor AI + crypto di China.
Dalam masa dua minggu, 100,000 unit akselerator AI tempatan, satu permulaan untuk mengoptimumkan model sendiri.

Penulis artikel: APPSO

Sumber artikel: Wall Street Journal

Baru sahaja, ilmuwan utama Zhipu GLM, Tang Jie, berkongsi sebuah kajian mengenai pengoptimuman sistem inferensi GLM-5.3-Flash di platform X.

Dia mengungkapkan, dari pelaksanaan pertama GLM-5.3-Flash pada akselerator AI tempatan hingga menyelesaikan pembebanan keseluruhan trafik pengeluaran, hanya mengambil masa dua minggu. Dalam proses ini, kapasiti throughput end-to-end sistem meningkat sebanyak 3.2 kali.

Yang paling memberi kesan kepada Tang Jie ialah, bukan hanya jurutera infrastruktur yang menyelesaikan banyak kerja pengoptimuman, tetapi juga Infra Agent yang digerakkan oleh GLM-5.3.

「Sebuah model yang membantu mengoptimumkan perkhidmatan itu sendiri.」 kata Tang Jie menggambarkan perubahan ini.

Menurutnya, ini bermakna AI mulai terlibat dalam mengoptimumkan sistem yang menampung operasinya sendiri. Walaupun masih jauh dari peningkatan diri rekursif sejati (Recursive Self-Improvement, RSI), bentuk awal telah muncul.

Pasukan ZhiPu juga menyebut bahawa dalam setahun terakhir, mereka memperhatikan bahawa peranan GLM sedang berubah.

Pada awalnya, pasukan mengkaji kemampuan GLM dalam pemahaman kod dan keselamatan siber, dengan harapan agar model dapat membantu menganalisis lubang keamanan dalam kod yang kompleks. Namun, seiring peningkatan kemampuan model, GLM mula terlibat dalam membina sistem AI itu sendiri.

Pasukan tersebut menyatakan bahawa mereka pernah memperhatikan model menyelesaikan tugas-tugas yang sebelumnya memerlukan pasukan jurutera infrastruktur berpengalaman berbulan-bulan, dan tugas-tugas ini secara langsung mempengaruhi cara latihan dan penghantaran model generasi seterusnya.

Selesaikan penempatan kluster komputasi tempatan dalam dua minggu

Membawa model besar dari peneraan pertama pada peranti keras baharu hingga ke perkhidmatan inferens yang mampu menangani permintaan pengeluaran secara stabil memerlukan banyak kerja kejuruteraan sistem.

GLM-5.3-Flash kali ini dilaksanakan pada kluster yang terdiri daripada lebih daripada 100,000 unit akselerator AI tempatan. Pasukan Zhipu menyatakan bahawa ini adalah pelaksanaan berskala besar yang sebelum ini tidak mempunyai pengalaman matang sebagai rujukan.

Pasukan perlu menyelesaikan pelbagai isu, termasuk kapasiti memori paparan cip tempatan dan had lebar pita perhubungan, penyesuaian arsitektur model baharu, sokongan konteks panjang 1 juta token, serta pemprosesan permintaan multimodal. Sementara itu, ekosistem perisian akselerator AI tempatan masih dalam peringkat pembangunan, dengan sebahagian sokongan Kernel yang tidak mencukupi, dan banyak maklumat perlu diteliti oleh pasukan kejuruteraan sendiri.

Tang Jie menyatakan bahawa, di bawah batasan-batasan ini, Infra Agent yang didorong oleh GLM-5.3 terlibat dalam proses pengoptimuman sistem inferens, membantu menganalisis bottleneck prestasi, mencadangkan penyelesaian pengoptimuman, dan menyelesaikan sebahagian perubahan kod.

Proses pengoptimuman keseluruhan bukan sekadar menambah sumber pengiraan, tetapi mencari keseimbangan baharu antara kuasa pengiraan, memori, komunikasi, dan penjadualan.

Pasukan ZhiPu telah mengamalkan siri penambahbaikan. Sebagai contoh, menggunakan ReplaySSM untuk menukar pengiraan dengan ruang memori, mengurangkan tekanan memori GPU melalui paralelisme tensor di dalam nod, meningkatkan penggunaan kapasiti melalui cache presisi campuran INT8, FP8, dan BF16, serta memperkenalkan arsitektur berasingan Encode-Prefill-Decode (EPD) untuk membolehkan penjadualan yang lebih fleksibel pada setiap peringkat inferens.

Secara keseluruhan, prestasi perkhidmatan end-to-end GLM-5.3-Flash meningkat sebanyak kira-kira 3 kali ganda berbanding versi asal, dengan pemanfaatan peranti keras dan kos se-token mencapai tahap yang hampir setara dengan platform NVIDIA GPU utama.

Selepas pelaksanaan, GLM-5.3-Flash juga telah memasuki ujian persekitaran penggunaan sebenar. Pasukan Zhipu menjelaskan bahawa model ini sebelum ini berjalan di platform OpenCode dan OpenRouter dengan nama model anonim Ox-Alpha, dan dalam seminggu menjadi salah satu model dengan penggunaan tertinggi di kedua-dua platform, memproses lebih daripada 62 trilion token dalam enam hari.

Namun, perubahan sebenar dalam eksperimen ini bukan sahaja membolehkan AI menulis kod, tetapi juga membolehkan AI memahami mengapa sistem kompleks mengalami perubahan prestasi.

Sebagai contoh, apabila sistem memberikan maklum balas "pengeluaran menurun 20%", ia hanya menunjukkan bahawa terdapat kecacatan di suatu tempat, tetapi tidak dapat secara langsung memberitahu Agen lapisan mana yang bermasalah, sama ada andaian semasa adalah salah, dan apa yang perlu disahkan seterusnya.

Bagi jurutera berpengalaman, penilaian semacam ini bergantung pada pengalaman jangka panjang. Jurutera tahu kapan harus memeriksa garis masa pelaksanaan, kapan menjalankan ujian mikro, dan modul mana yang perlu dibandingkan outputnya.

Pasukan ZhiPu berharap untuk menerjemahkan pengalaman kejuruteraan ini menjadi mekanisme umpan balik yang boleh dipanggil oleh AI, dan memanggilnya sebagai「umpan balik padat」.

Inti mekanisme ini adalah membolehkan Agent mendapat maklumat yang lebih hampir dengan proses penilaian kejuruteraan.

Apabila model perlu mengesahkan sama ada pengiraan adalah betul, ia boleh mendapatkan umpan balik kebenaran yang berkaitan; apabila model perlu menganalisis sebab penurunan prestasi, ia boleh melihat penggunaan masa semasa proses operasi sistem; apabila model mencuba skema pengoptimuman baharu, ia boleh menilai sama ada skema tersebut sesuai dengan situasi semasa melalui eksperimen.

Pasukan ZhiPu percaya bahawa maklum balas yang benar-benar berkesan perlu memenuhi beberapa syarat: ia mesti cukup dekat dengan masalah spesifik, boleh diperoleh dengan pantas, dan boleh diverifikasi melalui eksperimen objektif. Jika tidak, log dan indikator yang banyak malah mungkin menyulitkan agen untuk menentukan arah tindakan seterusnya.

Sistem pengoptimuman model, perkhidmatan sistem model

Dengan bantuan dense feedback, Infra Agent mula terlibat dalam mengesan masalah tersembunyi dalam sistem penalaran.

Dalam konteks laluan selari KDA, Agen menemui isu yang mempengaruhi ketepatan pengiraan konteks panjang.

Kerana perlu menggabungkan matriks status antara cakera konteks yang berbeza, ralat pembundaran yang dihasilkan oleh pengiraan TF32 akan terus bertambah seiring dengan peningkatan panjang urutan, akhirnya menyebabkan penyimpangan dalam hasil pengiraan.

Agen telah mengesan isu dalam pemprosesan ketepatan dalam proses penyebaran dan penggabungan keadaan dengan membandingkan hasil lintasan pelaksanaan yang berbeza. Pembaikan berkaitan telah digabungkan ke dalam PR projek Flash Linear Attention #1180.

Masalah lain muncul antara KV Transfer dan jadual DeepEP.

Semasa pengujian, Agent mendapati KV Transfer tidak membentuk tindih yang berkesan dengan DeepEP Dispatch, menyebabkan kos penghantaran melebihi 30% dalam beberapa senario.

Selepas itu, Agent meneruskan analisis sepanjang rantai panggilan Python dan C++, dan mendapati laluan di dalam nod tidak melepaskan GIL Python dengan segera, menyebabkan tugas penghantaran tidak boleh diproses dengan segera.

Selepas pengubahsuaian selesai, beban tambahan daripada KV Transfer dikurangkan daripada lebih 30% kepada kurang daripada 1%.

Selain itu, Agent juga mengoptimumkan satu Decode Kernel.

Ia menemui bahawa kerana masalah cara pemotongan Kernel, pengiraan normalisasi yang sama dijalankan semula empat kali. Dengan menyusun semula struktur pengiraan dan mengurangkan pengiraan berulang, Kernel ini akhirnya mendapat peningkatan prestasi sebanyak 1.71 kali.

Gagasan pengoptimuman ini berasal daripada agen yang mempelajari Kernel sedia ada dalam projek seperti SGLang, Flash Linear Attention, dan DeepGEMM. Ia merumuskan pengalaman pengoptimuman daripada kod-kod tersebut menjadi「skeleton pengoptimuman」, kemudian menggabungkannya dengan maklum balas sistem semasa untuk menilai kesesuaiannya.

Dahulu, pengalaman pengoptimuman serupa bergantung terutama pada pengalaman peribadi jurutera.

Dalam proses ini, Agent mula dapat belajar kaedah pengoptimuman daripada kod yang sedia ada, kemudian mengesahkan melalui eksperimen sama ada kaedah-kaedah ini sesuai dengan peranti dan persekitaran model baharu.

Tang Jie menyatakan bahawa jurutera manusia masih bertanggungjawab menetapkan matlamat, membina persekitaran maklum balas, dan mengulas perubahan berisiko tinggi.

Namun, peranan jurutera sedang berubah, daripada orang yang secara langsung menyelesaikan setiap masalah, kepada orang yang merekabentuk sistem maklum balas.

Pasukan ZhiPu percaya bahawa persekitaran umpan balik yang boleh diverifikasi berdasarkan tugas infrastruktur sebenar mungkin juga menjadi asas penting dalam melatih model generasi seterusnya. Setiap kali Agent menyelesaikan tugas kejuruteraan, ia boleh menjadi data pembelajaran untuk model generasi seterusnya.

Sekarang, kes GLM-5.3-Flash masih jauh daripada peningkatan diri berulang secara sebenar. Namun, Tang Jie percaya bahawa satu kitaran berskala minimum telah muncul.

Sistem mengoptimumkan model, sementara perkhidmatan sistem memodelkan.

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.