Ang Z.ai ng China, ang kumpanya na dating kilala bilang Zhipu AI, ay inilabas ang GLM-5.3-Flash noong Agosto 26, gawing unang natively multimodal na modelo sa GLM-5 series. Ang paglulunsad ay nakatutok sa mga dahilan na higit pa sa modelo mismo: ito ay tumatakbo nang buo sa mga lokal na prodyusadong AI accelerator, isang malinaw na pagpapakita na ang Chinese hardware ay kayang harapin ang mga seryosong malalaking workload.
Mahalaga ang oras. Ang mga kontrol sa pag-export mula sa US ay naglimita sa pagkakaroon ng mga pinakamalalaking chip ni NVIDIA para sa mga buyer mula sa China, na nagpilit sa mga kumpanya tulad ng Z.ai na bumuo ng mga solusyon batay sa kanilang available na mga yaman.
Ano ang tunay na ginagawa ng model
Gumagamit ang GLM-5.3-Flash ng hybrid arkitektura na nagkakaisa ng sparse at linear attention, isang desisyon na nagpapababa nang malaki sa mga kagamitan sa kompyutasyon. Ang modelo ay may kabuuang 320 bilyong parameter ngunit pinapagana lamang ang 18 bilyon bawat token, kaya ito ay nakakakuha ng malaking base ng kaalaman nang hindi nagbabayad ng buong gastos sa kompyutasyon sa bawat inference.
Ang context window ay nasa 1 milyong tokens, nagpapakita na ito ay isa sa pinakamahabang available sa anumang open model. Ang native na suporta para sa mga input ng imahe at video ay nagiging totoong multimodal mula sa antas ng arkitektura, hindi bilang idinagdag na kakayahan.
Sa DeepSWE v1.1 coding benchmark, nakakuha ang GLM-5.3-Flash ng 63.4, kumpara sa 46.2 para sa nakaraang modelo na GLM-5.2. Nakakuha rin ang modelo ng 57 sa Artificial Analysis Intelligence Index.
Ang presyo ay agresibo. Ang pag-access sa API ay nagkakahalaga ng $0.15 bawat milyong input tokens at $0.50 bawat milyong output tokens, kasama ang mga cached input na available sa $0.03. Ipinapaliwanag ng Z.ai ang gastos bilang halos isang-sampu ng ilang mga kompetitor.
Mga chip ng Tsina na gumagawa ng totoong trabaho
I-deploy ng Z.ai ang GLM-5.3-Flash sa mga cluster ng mga AI accelerator na gawa sa bansa, pagkatapos ay bumuo ng mga custom na serving stack at nag-apply ng mga teknik na quantization na disenyo para sa hardware na iyon. Ang resulta ay isang tatlong beses na pagpapabuti sa end-to-end na performance kumpara sa isang mas pangkalahatang paraan ng deployment.
Ang modelo ay kasama ang mga open weights sa ilalim ng lisensya ng MIT, available sa parehong FP8 at BF16 formats sa Hugging Face at ModelScope. Ang MIT ay isa sa pinakamalayang uri ng lisensya: maaaring gamitin, baguhin, at ipamahagi ng mga developer at kumpanya ang mga weights para sa komersyal na layunin nang walang limitasyon.
