Natapos ng ZhipuAI ang pag-deploy ng 100,000 lokal na AI accelerator sa loob ng dalawang linggo

iconMetaEra
I-share
AI summary iconSummary
Ipinatupad ng ZhipuAI ang kanyang GLM-5.3-Flash inference system sa isang cluster ng higit sa 100,000 lokal na AI accelerator sa loob ng dalawang linggo, ayon sa AI + crypto news. Dumami ng 3.2 beses ang end-to-end throughput ng sistema, habang ang AI-driven Infra Agent ang nangangasiwa sa mga gawain sa optimisasyon na karaniwang ginagawa ng mga senior engineer. Ang on-chain news ay naglalabas ng mabilis na integrasyon ng AI sa infrastraktura, ipinapakita kung paano binabago ng automation ang mga teknikal na workflow. Ang pagpapatupad ay nagpapakita ng lumalaking momentum sa sektor ng AI + crypto news sa China.
Dalawang linggo, 100,000 lokal na AI accelerator, isang simula sa pag-optimize ng kanilang sariling model.

May-akda ng artikulo: APPSO

Pinagkunan: Wall Street Journal

Kasalukuyang, ang pangunahing siyentipiko ni Zhipu GLM, si Tang Jie, ay nagbahagi ng isang pag-aaral tungkol sa pag-optimize ng GLM-5.3-Flash inference system sa platform na X.

Ipinakita niya na mula sa unang pagpapatakbo ng GLM-5.3-Flash sa lokal na AI accelerator, hanggang sa pagkakaroon ng buong produksyon na trapiko, natapos lamang sa dalawang linggo. Sa prosesong ito, tumataas ang end-to-end throughput ng sistema ng 3.2 beses.

Ang pinakamalalim na pagkakaunawa ni Tang Jie ay ang hindi lamang ang mga inhinyero ng infrastraktura ang nagawa ang malaking bilang ng mga pagpapabuti, kundi isang Infra Agent na dinisenyo ng GLM-5.3.

“Isang modelo na nakakatulong sa pag-optimize ng sariling serbisyo.” Ganito inilarawan ni Tang Jie ang pagbabago.

Sa kanyang pananaw, ibig sabihin nito ay ang AI ay nagsisimulang makilahok sa pag-optimize ng mga sistema na nagtataguyod ng kanilang sariling pagpapatakbo. Bagaman malayo pa sa totoong recursive self-improvement (RSI), isang maagang anyo na ang nakikita.

Binanggit din ng team ng ZhiPu na noong nakaraang taon, napansin nila na ang papel ng GLM ay nagbabago.

Una, tinuklas ng koponan ang kakayahan ng GLM sa pag-unawa sa code at sa larangan ng cybersecurity, na may hangarin na tulungan ang modelo sa pag-analisa ng mga vulnerabilities sa komplikadong code. Ngunit habang tumataas ang kakayahan ng modelo, nagsimula na ang GLM na maging bahagi ng pagbuo ng mga AI system mismo.

Sinabi ng koponan na sila ay nakakita ng mga modelo na nakakumpleto ng ilang gawain na dati ay nangangailangan ng ilang linggo ng paggawa ng isang ekspertong koponan ng infrastruktura, at ang mga gawaing ito ay direktang nakakaapekto sa paraan ng pag-train at pag-deploy ng mga susunod na modelo.

Tapos ang pag-deploy ng lokal na cluster ng computing power sa loob ng dalawang linggo

Kailangan ng maraming sistemang inhinyeri upang i-advance ang unang pagpapatakbo ng isang malaking modelo sa bagong hardware patungo sa isang paghahatid ng pagpapatakbo na kaya nang maglaan ng mga produksyon na kahilingan.

Ang GLM-5.3-Flash ay ginagana sa isang cluster na binubuo ng higit sa 100,000 lokal na AI accelerator. Sinabi ng team ng Zhipu na ito ay isang malawakang deployment na walang sapat na nakaraang karanasan bilang gabay.

Kailangan ng koponan na lutasin ang maraming problema, kabilang ang limitasyon sa kapasidad ng memorya ng lokal na chip at bandwidth ng pag-uugnay, pag-adapt sa bagong arkitektura ng modelo, suporta sa 1 milyong token na mahabang konteksto, at paghahandle ng maramihang modalidad na kahilingan. Samantala, ang software ecosystem ng lokal na AI accelerator ay nasa pag-unlad pa, may kakulangan sa ilang Kernel, at karamihan sa mga materyales ay kailangang masuri ng engineering team nang sarili.

Sinabi ni Tang Jie na sa ilalim ng mga limitasyong ito, ang Infra Agent na drivern ng GLM-5.3 ay nakilahok sa proseso ng pag-optimize ng sistema ng pag-iisip, tumutulong sa pagsusuri ng mga bottleneck sa performance, pagproponga ng mga solusyon sa pag-optimize, at pagkumpleto ng ilang pagbabago sa code.

Hindi lamang ito simpleng pagdaragdag ng mga yunit ng kompyutasyon, kundi paghahanap ng bagong balanse sa pagitan ng computing power, memorya, komunikasyon, at scheduling.

Ginamit ng team ng Zhipu ang isang serye ng mga pagpapabuti. Halimbawa, gamit ang ReplaySSM para palitan ang computation para sa memory space, ang tensor parallelism sa loob ng node upang bawasan ang presyur sa VRAM, ang mixed-precision caching gamit ang INT8, FP8, at BF16 upang pataasin ang paggamit ng kapasidad, at samantala, ipinakilala ang separadong arkitekturang Encode-Prefill-Decode (EPD) upang magbigay ng mas fleksibleng scheduling sa iba’t ibang yugto ng inference.

Sa huli, ang end-to-end na performance ng GLM-5.3-Flash ay tumataas ng halos 3 beses kumpara sa orihinal na bersyon, at ang paggamit ng hardware at gastos bawat token ay nakamit ang antas ng mga pangunahing NVIDIA GPU platform.

Matapos ang deployment, pinasubok ang GLM-5.3-Flash sa tunay na paggamit. Ipinaliwanag ng team ng Zhipu na ang modelo ay nagpapatakbo na bilang anonymous model na Ox-Alpha sa mga platform na OpenCode at OpenRouter, at naging isa sa mga pinakamalaking modelo sa loob ng isang linggo, na nagproseso ng higit sa 62 trilyon na token sa loob ng anim na araw.

Gayunpaman, ang tunay na pagbabago sa eksperimentong ito ay hindi lamang ang pagpapagawa ng code ng AI, kundi ang pagkakaroon ng kakayahang maunawaan ng AI kung bakit nagkakaroon ng pagbabago sa performance ang mga komplikadong sistema.

Halimbawa, kapag binabalik ng sistema ang “pagbaba ng throughput ng 20%”, ito ay nagpapakita lamang na may anomaly sa isang lugar, ngunit hindi direktang nagpapahayag kung anong layer ang may problema, kung mali ang kasalukuyang aksiyon, at ano ang susunod na dapat i-verify.

Para sa mga karanasan na inhinyero, ang ganitong pagpapasya ay nakabatay sa matagalang karanasan. Alam ng mga inhinyero kung kailan tingnan ang execution timeline, kailan jalurin ang microbenchmarking, at alin sa mga module ang dapat ihambing ang output.

Gusto ng team ng Zhipu na isalin ang kanilang karanasan sa paggawa sa isang feedback mechanism na maaaring i-call ng AI, at tinatawag ito bilang “dense feedback”.

Ang core ng mekanismong ito ay pagbibigay sa Agent ng impormasyon na mas malapit sa proseso ng engineering judgment.

Kapag kailangan ng modelo na patunayan kung tama ang kalkulasyon, maaari itong makakuha ng katumpakan na feedback; kapag kailangan ng modelo na analisahin ang dahilan ng pagbaba ng performance, maaari itong tingnan ang oras na ginugol sa proseso ng sistema; kapag subukan ng modelo ang bagong optimisasyon, maaari itong gamitin ang eksperimento upang masuri kung ang solusyon ay angkop sa kasalukuyang sitwasyon.

Naniniwala ang team ng Zhipu na ang totoong epektibong feedback ay kailangang matugunan ang ilang kondisyon: dapat sapat na malapit sa partikular na problema, maaaring makuha nang mabilis, at maaaring patunayan sa pamamagitan ng obhetibong eksperimento. Kung hindi, ang malaking dami ng mga log at mga indikador ay maaaring magdulot ng kahirapan sa pagtukoy ng susunod na hakbang ng Agent.

Model Optimization System, System Service Model

Sa tulong ng dense feedback, nagsimula ang Infra Agent na makilahok sa pagtataya ng mga nakatagong problema sa sistema ng pag-iisip.

Sa konteksto ng KDA parallel path, natuklasan ng Agent ang isang problema na nakakaapekto sa pagkakatumpak ng pagkalkula ng mahabang konteksto.

Dahil sa patuloy na pagpapagsama ng state matrix sa pagitan ng iba’t ibang context shards, ang rounding error mula sa TF32 computation ay tumutubo kasabay ng pagdami ng sequence length, na nagdudulot sa huli ng pagkakaiba sa resulta ng computation.

Ang agent ay naglokalis sa pagkakamali sa pagtrato ng precision sa proseso ng pagpropaganda at pagpapagsama ng estado sa pamamagitan ng paghahambing ng mga resulta ng iba't ibang path ng pagpapatupad. Ang kaugnay na pagpapabuti ay naisama na sa PR #1180 ng Flash Linear Attention project.

Isang iba pang problema ang lumabas sa pagitan ng KV Transfer at DeepEP scheduling.

Sa proseso ng pagsubok, natuklasan ng Agent na ang KV Transfer ay hindi nakakapag-ugnay nang epektibo sa DeepEP Dispatch, na nagresulta sa pagtaas ng transfer overhead sa ilang mga skenaryo ng higit sa 30%.

Pagkatapos ay patuloy ni Agent ang pagsusuri sa pagkakasunod-sunod ng pagtawag sa Python at C++, at natuklasan niya na ang mga path sa loob ng node ay hindi agad inilabas ang Python GIL, na nagiging dahilan kung bakit hindi agad naunlad ang mga gawain sa pagpapadala.

Pagkatapos ng pagbabago, ang karagdagang gastos mula sa KV Transfer ay bumaba mula sa higit sa 30% patungo sa mas mababa sa 1%.

Dagdag pa, pinabuti ng Agent ang isang Decode Kernel.

Nakita nito na dahil sa problema sa paghahati ng Kernel, ang parehong grupo ng normalisasyon computation ay ginagawa nang apat na beses. Sa pamamagitan ng pag-organisa muli ng istruktura ng computation at pagbabawas sa pag-uulit ng computation, natamo ng Kernel ang 1.71倍 na pagpapabuti sa performance.

Ang ideyang ito ay batay sa pag-aaral ng Agent sa mga existing kernel ng mga proyekto tulad ng SGLang, Flash Linear Attention, at DeepGEMM. Ipinapakita nito ang mga optimisasyon na natutunan mula sa mga code na ito bilang isang “optimization skeleton,” at ginagamit ang feedback mula sa kasalukuyang sistema upang matukoy kung ito ay angkop.

Noong nakaraan, ang mga katulad na karanasan sa pagpapabuti ay nagmumula sa personal na karanasan ng mga inhinyero.

Sa proseso na ito, nagsisimula na ang Agent na matutunan ang mga paraan ng pag-optimize mula sa umiiral na code, at pagkatapos ay i-verify ang mga paraang ito sa pamamagitan ng mga eksperimento kung angkop ba sila sa mga bagong hardware at model environment.

Sinabi ni Tang Jie na ang mga inhinyero na tao ay patuloy na responsable sa pagtatakda ng mga layunin, pagbuo ng mga environment ng feedback, at pagsusuri sa mga mataas na panganib na pagbabago.

Ngunit ang papel ng mga inhinyero ay nagbabago, mula sa pagiging tagapaglutas ng bawat problema, patungo sa pagdidisenyo ng mga sistema ng feedback.

Sa palagay ng team ng ZhiPu, ang isang verifiable feedback environment na batay sa mga tunay na infrastruktural na gawain ay maaari ring maging mahalagang pundasyon sa pagtatrain ng susunod na henerasyon ng mga modelo. Bawat pagkakataon na matapos ng Agent ang isang teknikal na gawain, maaaring maging data para sa pag-aaral ng susunod na henerasyon ng mga modelo.

Sa kasalukuyan, ang mga kaso ng GLM-5.3-Flash ay may malayong distansya mula sa tunay na rekursibong pagpapabuti. Ngunit naniniwala si Tang Jie na ang isang pinakamaliit na siklo ay nangyari na.

Ang sistemang pinapabuti ang modelo, habang ang serbisyo ng sistema ay nagpapalago sa modelo.

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.