Zhipu melancarkan model terbaru GLM-5.3-Flash, yang sebelumnya dibuka percuma secara anonim sebagai Ox Alpha di platform ujian, dengan trafik melebihi 50 trilion token dalam 5 hari. Model ini menggunakan lebih daripada 100,000 unit cip tempatan untuk perkhidmatan inferens, dengan kecekapan peranti dan kos setiap token telah mencapai tahap yang sepadan dengan GPU NVIDIA. Dari segi prestasi, model ini mendapat skor 57 dalam Indeks Kecerdasan AA, sejajar dengan Claude Opus 4.8. Dari segi harga, input sejuta token berharga 0.8 yuan dan output 2.8 yuan, jauh lebih rendah berbanding pesaing. Arsitektur menggunakan reka bentuk hibrid perhatian jarang dan linear, menjadikannya model multimodal asli pertama dalam siri GLM-5. Dalam konteks kenaikan harga model AI tempatan secara kolektif, Zhipu mengambil strategi harga rendah untuk merebut pasaran.Penulis artikel, sumber: LatePost
Pada 26 Ogos, Zhipu secara rasmi mengesahkan: model anonim Ox Alpha (dikenali sebagai "Niu Lai" dalam komuniti Cina), yang sebelum ini menarik perhatian besar dalam komuniti pembangun, ialah GLM-5.3-Flash terbaharu mereka. Kod model ini terinspirasi daripada filem terkini yang sedang ditayangkan di China, "Niu Lai".
Model ini dibuka secara percuma untuk ujian anonim sebelum pelancaran rasmi di OpenRouter dan OpenCode, dengan jumlah trafik melebihi 50 trilion token dalam masa lima hari, memecahkan rekod pertumbuhan trafik kedua-dua platform, dan penggunaan semasa telah melebihi dua kali ganda DeepSeek. Namun, perkara yang benar-benar menarik perhatian pasaran ialah butiran yang kemudian diumumkan oleh Zhipu: keseluruhan trafik ini disokong sepenuhnya oleh cip buatan tempatan.
ZhiPu menyatakan dalam dokumen teknikal rasmi bahawa lebih daripada 100,000 unit cluster cip tempatan digunakan untuk perkhidmatan inferens model ini, "kecekapan peranti dan kos setiap token telah mencapai tahap yang sepadan dengan GPU NVIDIA utama."
Institut penyelidikan semikonduktor SemiAnalysis segera memposting ulasan di platform X: “Semua trafik ditangani oleh cip buatan tempatan, kecekapan peranti dan kos per token kini setara dengan GPU NVIDIA. Selepas pengumuman Jalapeño (cip inferens buatan OpenAI) semalam, parit CUDA sekali lagi diuji.”

100,000 unit kad tempatan: Dari ujian hingga pengeluaran, Zhipu menggambarkan butiran penyebaran kumpulan cip tempatan ini dalam dokumen teknikal.
Penghala utama pada satu cip ialah kapasiti dan lebar pita memori, yang menjadikan penyokongan panjang konteks sehingga 1 juta token sangat mencabar. Untuk tujuan ini, Zhipu membina enjin inferens khas berdasarkan SGLang, menggunakan teknik seperti kuantisasi W8A8, kuantisasi cache campuran INT8/FP8/BF16, dan paralelisme tensor dalam nod, serta memperkenalkan arsitektur terpisah Encode–Prefill–Decode (EPD) peringkat pengeluaran, yang memisahkan pengkodean multimodal, pra-isian prompt, dan dekod token demi token kepada kolam kerja yang boleh dijadualkan secara berasingan.
ZhiPu menyatakan bahawa prestasi perkhidmatan end-to-end meningkat tiga kali ganda berbanding garis dasar awal pada peranti yang sama.
Menurut laporan LatePost, pemasok cip ini kemungkinan berasal dari Huawei, Moore Threads, dan Hygon. Zhipu secara rasmi tidak memberikan komen, dan dokumen teknikal tidak menyatakan model cip yang spesifik.
SemiAnalysis dalam ulasannya secara khusus menunjukkan bahawa sebelum ini terdapat pandangan yang berpendapat bahawa hanya makmal terkemuka dan maju sahaja yang memiliki kapasiti pengiraan sebanyak 100 trilion token sehari, "manakala di sini, laluan percuma 100 trilion token sehari semuanya berjalan di atas cip tempatan."

Model itu sendiri: dibandingkan dengan DeepSeek, harganya 1/40 daripada Claude Opus 4.8. Skala parameter GLM-5.3-Flash ialah 320B jumlah parameter, 18B parameter yang diaktifkan, dan jumlah parameter kira-kira 40% daripada flagship generasi sebelumnya, GLM-5.3, hampir sepadan dengan DeepSeek V4 Flash.
Dari segi prestasi, penilaian rasmi Zhipu menunjukkan bahawa GLM-5.3-Flash memperoleh 57 poin dalam Artificial Analysis Intelligence Index (AA Comprehensive Intelligence Index), melebihi model unggul sebelumnya, GLM-5.2, sejajar dengan Claude Opus 4.8 daripada Anthropic, dan lebih tinggi daripada versi rasmi model unggul DeepSeek V4 Pro yang mendapat 53 poin.

Dalam hal penentuan harga, GLM-5.3-Flash mengenakan bayaran 0.8 yuan setiap juta token input, 2.8 yuan setiap juta token output, dan harga kejayaan cache 0.23 yuan, iaitu sepuluh peratus daripada GLM-5.3. Harga separuh diberlakukan semasa dua minggu pertama pelancaran.
ZhiPu menyatakan bahawa GLM-5.3-Flash ditetapkan pada harga 1/10 daripada GLM-5.3, dan 1/20 daripada GLM-5.3 semasa diskaun terhad, serta 1/40 daripada Claude Opus 4.8.
Berbanding dengan DeepSeek V4 Flash selepas penyesuaian harga (masukan 1.5 yuan, keluaran 4.5 yuan pada waktu rendah), GLM-5.3-Flash lebih murah dalam kebanyakan skenario panggilan biasa.

Inovasi arsitektur: Parameter dan bilangan lapisan hampir separuhnya dikurangkan. GLM-5.3-Flash menggunakan reka bentuk arsitektur yang berbeza sepenuhnya dengan GLM-5.3, yang menjadi sebab utama ia mampu mencapai prestasi lebih tinggi dengan kos yang lebih rendah.
Berbanding dengan GLM-4.5, jumlah parameter keseluruhan GLM-5.3-Flash hampir sama (355B berbanding 320B), tetapi jumlah parameter yang diaktifkan turun daripada 32B kepada 18B, dan bilangan lapisan berkurang daripada 92 kepada 45, hampir separuh.
Zhipu menyatakan bahawa GLM-5.3-Flash adalah model terkini open-source pertama yang menggunakan arsitektur hibrida perhatian jarang dan perhatian linear. Berbanding GLM-5.3, jumlah pengiraan perhatian dan saiz cache KV masing-masing berkurang sebanyak 3.01 kali dan 4.44 kali.
Selain itu, model ini merupakan model multimodal asli pertama dalam siri GLM-5, menyokong input gambar dan video, serta merupakan model baru pertama yang dilancarkan oleh Zhipu selepas fokus strategiknya pada coding.

Pelan keluar dengan harga rendah dalam gelombang kenaikan harga, pelancaran GLM-5.3-Flash berlaku selepas satu gelombang kenaikan harga kolektif di pasaran model AI China.
Harga output Kimi K3 mencapai 100 yuan setiap juta token, melebihi tiga kali ganda daripada generasi sebelumnya K2.6; harga output ZhiPu mencapai 28 yuan selepas kenaikan harga pada separuh pertama tahun ini; harga output DeepSeek V4 Pro meningkat dari 6 yuan kepada 13.5 yuan, dan 27 yuan pada masa puncak; harga output DeepSeek V4 Flash meningkat dari 2 yuan kepada 4.5 yuan, dan 9 yuan pada masa puncak.
Akibat langsung kenaikan harga ialah permintaan yang meluap. The LatePost menunjukkan bahawa selepas peningkatan harga DeepSeek V4 Flash, jumlah panggilan di platform OpenCode turun separuh, dan permintaan ini menjadi ruang pertumbuhan baharu bagi pengeluar model tempatan.
Strategi penentuan harga GLM-5.3-Flash secara tepat menargetkan jurang ini.
