Ipinakilala ng Zhipu ang kanilang pinakabagong modelo na GLM-5.3-Flash, na dati ay ipinakalabas nang anonymous bilang Ox Alpha sa isang test platform nang libre, at nakakuha ng higit sa 50 trilyon na token sa loob ng 5 araw. Ginamit ang modelo sa higit sa 100,000 na lokal na chip cluster para sa inference service, kung saan ang hardware efficiency at cost per token ay naging katumbas na ng NVIDIA GPU. Sa aspeto ng performance, nakakuha ang modelo ng marka na 57 sa AA Comprehensive Intelligence Index, na pareho na sa Claude Opus 4.8. Sa presyo, ang bawat milyong token ng input ay ₱0.80 at output ay ₱2.80, na mas mababa kaysa sa mga kalaban. Ang arkitektura ay gumagamit ng hybrid na disenyo ng sparse at linear attention, at ito ang unang native multimodal model sa GLM-5 series. Sa ilalim ng pambansang trend ng pagtaas ng presyo ng mga AI model, kinuha ng Zhipu ang mababang presyo bilang estratehiya upang makakuha ng merkado.May-akda ng artikulo, pinagmulan: LatePost
Agosto 26, tinatanggap ng Zhipu: Ang anonymous model na Ox Alpha (kilala sa Chinese community bilang “Niu Lai”), na nagdulot ng malaking diskusyon sa developer community, ay ang kanilang pinakabagong ipinakilalang GLM-5.3-Flash. Ang code name ng model ay nakuha mula sa kamakailang popularyong pelikula sa bansa na “Niu Lai”.
Bago ang opisyal na paglalabas, ang modelo ay ipinakalabas nang pambayad sa OpenRouter at OpenCode para sa libreng pagsubok, at nakalikom ng higit sa 50 trilyon na token sa loob ng 5 araw, na nagpapalit ng rekord sa paglago ng trapiko sa parehong mga platform, at kasalukuyang mas higit pa sa dalawang beses ang paggamit kumpara sa DeepSeek. Ngunit ang totoong nagpapalabas ng pansin sa merkado ay ang isang detalye na inilahad ng Zhipu: ang lahat ng trapikong ito ay pinapagana ng mga lokal na chip.
Ipinahayag ng ZhiPu na ginamit ang higit sa 100,000 na lokal na chip cluster para sa serbisyo ng inference ng modelo, “nabawasan na ang hardware efficiency at cost per token hanggang sa antas ng mga pangunahing NVIDIA GPU.”
Agad na nag-post ang semiconductor research firm na SemiAnalysis sa X: "Lahat ng traffic ay tinataguyod ng mga lokal na chip, at ang hardware efficiency at cost per token ay naging kapareho na ng NVIDIA GPUs. Pagkatapos ng pagpapahayag ng Jalapeño (OpenAI's in-house inference chip) kahapon, muli ring sinubok ang CUDA moat."

100,000 lokal na kart: Mula sa pagsubok hanggang sa produksyon, inilarawan ng Zhipu ang mga detalye ng pag-deploy ng cluster na ito ng lokal na chip.
Ang pangunahing hadlang sa isang chip ay ang kapasidad at bandwidth ng memorya, na nagiging lalong mahirap sa suporta sa haba ng konteksto hanggang 1 milyon na token. Para dito, binuo ng Zhipu ang isang espesyalisadong inference engine batay sa SGLang, na gumagamit ng teknolohiya tulad ng W8A8 quantization, mixed-cache quantization sa INT8/FP8/BF16, at tensor parallelism sa loob ng node, at ipinakilala ang production-grade separadong arkitekturang Encode–Prefill–Decode (EPD), na hinati ang multimodal encoding, prompt prefilling, at token-by-token decoding sa mga hiwalay na work pool na maaaring iskedyulang independiyente.
Sinabi ng Zhipu na ang pagganap ng end-to-end service ay tumataas ng 3 beses kumpara sa initial baseline sa parehong hardware.
Ayon sa LatePost, ang mga supplier ng mga chip na ito ay maaaring mula sa Huawei, Moore Threads, at Hygon. Hindi nagbigay ng komento ang Zhipu, at ang mga teknikal na dokumento ay hindi naglalaman ng tiyak na modelo ng chip.
Lahat ng libreng trapiko ng 100 trilyon na token araw-araw ay tumatakbo sa mga lokal na chip, ayon sa SemiAnalysis sa kanilang komento, kung saan dati ay may paniniwala na ang mga pinakamataas na advanced lab lamang ang may kakayahang magkaroon ng kapasidad sa pagkalkula na 100 trilyon na token araw-araw.

Ang modelo mismo: Ipinapahiwatig sa DeepSeek, ang presyo ay 1/40 ng Claude Opus 4.8. Ang sukat ng mga parameter ng GLM-5.3-Flash ay 320B kabuuang parameter at 18B aktibong parameter, na halos 40% ng sukat ng nakaraang flagship na GLM-5.3, at halos katumbas ng DeepSeek V4 Flash.
Sa aspeto ng performance, ayon sa pormal na pagsusuri ng Zhipu, ang GLM-5.3-Flash ay nakakuha ng 57 puntos sa Artificial Analysis Intelligence Index (AA Comprehensive Intelligence Index), na hihigit sa nakaraang flagship na GLM-5.2, katumbas ng Claude Opus 4.8 ng Anthropic, at mas mataas kaysa sa 53 puntos ng opisyal na bersyon ng DeepSeek flagship model na V4 Pro.

Sa pagtatakda ng presyo, ang GLM-5.3-Flash ay ₱0.80 bawat milyong token sa input, ₱2.80 sa output, at ₱0.23 para sa cache hit, na isang-sampu ng presyo ng GLM-5.3. Magkakaroon ng kalahating presyo sa unang dalawang linggo ng paglulunsad.
Ibinigay ng Zhipu na ang GLM-5.3-Flash ay may presyo na 1/10 ng GLM-5.3, 1/20 ng GLM-5.3 sa loob ng limitadong panahon na diskwento, at 1/40 ng Claude Opus 4.8.
Mas mura ang GLM-5.3-Flash kumpara sa DeepSeek V4 Flash pagkatapos ng pagbabago ng presyo (1.5 yuan ang input at 4.5 yuan ang output sa panahon ng mababang demand) sa karamihan ng karaniwang paggamit.

Inovasyon sa arkitektura: Ang mga parameter at layer ay halos nabawasan ng kalahati—ang GLM-5.3-Flash ay gumagamit ng iba’t ibang disenyo ng arkitektura kumpara sa GLM-5.3, na siya ang pangunahing dahilan kung bakit ito ay makakamit ng mas mataas na performance sa mas mababang gastos.
Kumpara sa GLM-4.5, ang GLM-5.3-Flash ay may katulad na kabuuang bilang ng parametro (355B kumpara sa 320B), ngunit ang bilang ng aktibong parametro ay bumaba mula sa 32B hanggang 18B, at ang bilang ng layers ay bumaba mula sa 92 hanggang 45, halos nabawasan sa kalahati.
Sinabi ng Zhipu na ang GLM-5.3-Flash ay ang unang open-source state-of-the-art model na gumagamit ng hybrid architecture ng sparse at linear attention. Kumpara sa GLM-5.3, bumaba ang computation ng attention at ang laki ng KV cache nito ng 3.01 beses at 4.44 beses, ayon sa pagkakasunod-sunod.
Bukod dito, ang modelo ay ang unang native multimodal na modelo sa serye ng GLM-5 na sumusuporta sa input ng imahe at video, at ang unang bagong modelo na isinilang mula nang maging pangunahing pagsisikap ng Zhipu ang coding.

Ang paglunsad ng GLM-5.3-Flash ay nangyari pagkatapos ng isang serye ng pagsabay na pagtaas ng presyo sa merkado ng AI model sa China.
Ang presyo ng output ng Kimi K3 ay umabot sa 100 yuan bawat milyong token, higit sa tatlong beses ang presyo ng nakaraang modelo K2.6; matapos ang pagtaas ng presyo ng Zhipu sa unang kalahati ng taon, ang presyo ng output ay umabot din sa 28 yuan; ang DeepSeek V4 Pro ay tumaas mula sa 6 yuan hanggang 13.5 yuan, at 27 yuan sa peak hours; ang output price ng DeepSeek V4 Flash ay tumaas mula sa 2 yuan hanggang 4.5 yuan, at 9 yuan sa peak hours.
Ang direkta epekto ng pagtaas ng presyo ay ang paglabas ng demand. Sinabi ng LatePost na pagkatapos ma-increase ang presyo ng DeepSeek V4 Flash, bumaba ang bilang ng mga pagtawag sa OpenCode platform ng kalahati, at ang bahaging demand na ito ay naging bagong espasyo para sa paglago ng mga lokal na manufacturer ng model.
Ang pricing strategy ng GLM-5.3-Flash ay direktang tumutukoy sa puwang na ito.
