Zhipu meluncurkan model terbaru GLM-5.3-Flash, yang sebelumnya dirilis secara anonim sebagai Ox Alpha di platform pengujian secara gratis, dengan volume lalu lintas melebihi 50 triliun token dalam 5 hari. Model ini menggunakan lebih dari 100.000 chip domestik untuk layanan inferensi, dengan efisiensi perangkat keras dan biaya per token yang telah setara dengan GPU NVIDIA. Dari segi kinerja, model ini mendapatkan skor 57 pada indeks kecerdasan AA, sejajar dengan Claude Opus 4.8. Harganya, input satu juta token seharga 0,8 yuan dan output seharga 2,8 yuan, jauh lebih rendah dibanding pesaing. Arsitektur mengadopsi desain hibrida sparse dan linear attention, menjadi model multimodal asli pertama dalam seri GLM-5. Di tengah kenaikan harga kolektif model AI domestik, Zhipu memanfaatkan strategi harga rendah untuk merebut pasar.Penulis artikel, sumber: LatePost
Pada 26 Agustus, Zhipu secara resmi mengonfirmasi: model anonim Ox Alpha (dikenal di komunitas Tiongkok sebagai "Niu Lai") yang sebelumnya memicu perdebatan sengit di komunitas pengembang, adalah GLM-5.3-Flash terbaru mereka. Kode model ini terinspirasi dari film populer terbaru di Tiongkok, "Niu Lai".
Model ini secara anonim dibuka untuk pengujian gratis di OpenRouter dan OpenCode sebelum peluncuran resmi, dengan volume lalu lintas mencapai lebih dari 50 triliun token dalam 5 hari, memecahkan rekor pertumbuhan lalu lintas di kedua platform tersebut, dan penggunaan saat ini telah melebihi dua kali lipat DeepSeek. Namun, hal yang benar-benar menarik perhatian pasar adalah detail yang diungkapkan oleh Zhipu selanjutnya: seluruh lalu lintas ini didukung oleh chip buatan dalam negeri.
ZhiPu menyatakan dalam dokumen teknis resminya bahwa lebih dari 100.000 chip domestik digunakan dalam klaster untuk layanan inferensi model ini, "efisiensi perangkat keras dan biaya per token telah mencapai tingkat yang sebanding dengan GPU NVIDIA utama."
Lembaga riset semikonduktor SemiAnalysis segera mengomentari di platform X: “Semua lalu lintas ditangani oleh chip buatan dalam negeri, efisiensi perangkat keras dan biaya per token kini sebanding dengan GPU NVIDIA. Setelah pengumuman Jalapeño (chip inferensi buatan OpenAI) kemarin, parit CUDA kembali diuji.”

100.000 kartu buatan dalam negeri: Zhipu mendeskripsikan detail penempatan kluster chip buatan dalam negeri ini dalam dokumen teknis.
Tantangan utama pada satu chip adalah kapasitas dan bandwidth memori, yang membuat dukungan untuk panjang konteks hingga 1 juta token menjadi sangat sulit. Untuk ini, Zhipu membangun mesin inferensi khusus berbasis SGLang, menggunakan teknik seperti kuantisasi W8A8, kuantisasi cache campuran INT8/FP8/BF16, dan paralelisme tensor dalam node, serta memperkenalkan arsitektur terpisah produksi Encode–Prefill–Decode (EPD) yang memisahkan encoding multimodal, prefiling prompt, dan decoding token-per-token menjadi pool pekerjaan yang dapat dijadwalkan secara independen.
ZhiPu menyatakan bahwa kinerja layanan end-to-end meningkat tiga kali lipat dibandingkan baseline awal pada perangkat keras yang sama.
Menurut informasi dari LatePost, pemasok chip ini kemungkinan berasal dari Huawei, Moore Threads, dan Hygon. Zhipu secara resmi tidak memberikan komentar, dan dokumen teknis juga tidak menyebutkan model chip spesifik.
SemiAnalysis secara khusus menunjukkan dalam komentarnya bahwa sebelumnya ada pandangan yang menyatakan hanya laboratorium mutakhir kelas atas yang mampu memiliki skala komputasi 100 triliun token per hari, "sedangkan di sini, lalu lintas gratis 100 triliun token per hari semuanya berjalan di chip buatan dalam negeri."

Model itu sendiri: dibandingkan dengan DeepSeek, harganya 1/40 dari Claude Opus 4.8. GLM-5.3-Flash memiliki total parameter 320B dan parameter aktif 18B, dengan jumlah parameter sekitar 40% dari flagship generasi sebelumnya, GLM-5.3, hampir sebanding dengan DeepSeek V4 Flash.
Dalam hal kinerja, evaluasi resmi Zhipu menunjukkan bahwa GLM-5.3-Flash mendapatkan skor 57 pada Artificial Analysis Intelligence Index (AA Intelligence Index), melebihi generasi sebelumnya, GLM-5.2, sejajar dengan Claude Opus 4.8 dari Anthropic, serta lebih tinggi daripada versi resmi model unggulan DeepSeek V4 Pro yang mendapat skor 53.

Dalam hal penetapan harga, GLM-5.3-Flash dikenakan biaya 0,8 yuan per juta token input, 2,8 yuan per juta token output, dan harga cache hit 0,23 yuan, yaitu sepertiga dari GLM-5.3. Selama dua minggu pertama peluncuran, harga diberikan setengahnya.
ZhiPu menyatakan bahwa GLM-5.3-Flash dihargai sepertiga dari GLM-5.3, dan selama diskon terbatas, menjadi satu per dua puluh dari GLM-5.3, serta satu per empat puluh dari Claude Opus 4.8.
Dibandingkan dengan DeepSeek V4 Flash setelah penyesuaian harga (masukan 1,5 yuan, keluaran 4,5 yuan), GLM-5.3-Flash lebih murah di sebagian besar skenario pemanggilan umum.

Inovasi arsitektur: Parameter dan jumlah lapisan hampir berkurang setengah. GLM-5.3-Flash menggunakan desain arsitektur yang sama sekali berbeda dari GLM-5.3, yang menjadi alasan utama mengapa ia dapat mencapai kinerja lebih tinggi dengan biaya lebih rendah.
Dibandingkan dengan GLM-4.5, total parameter GLM-5.3-Flash hampir sama (355B vs. 320B), tetapi jumlah parameter yang diaktifkan turun dari 32B menjadi 18B, dan jumlah lapisan berkurang dari 92 menjadi 45, hampir setengahnya.
Zhipu menyatakan bahwa GLM-5.3-Flash adalah model terdepan open-source pertama yang mengadopsi arsitektur hibrida sparse attention dan linear attention. Dibandingkan dengan GLM-5.3, jumlah perhitungan perhatian dan ukuran cache KV masing-masing berkurang sebesar 3,01 kali dan 4,44 kali.
Selain itu, model ini merupakan model multimodal pertama dalam seri GLM-5 yang mendukung input gambar dan video, serta merupakan model baru pertama yang diluncurkan oleh Zhipu setelah fokus strategisnya pada coding.

Peluncuran GLM-5.3-Flash terjadi setelah serangkaian kenaikan harga di pasar model AI Tiongkok.
Harga output Kimi K3 mencapai hingga 100 yuan per juta token, lebih dari tiga kali lipat dari pendahulunya K2.6; harga output ZhiPu setelah kenaikan harga pada paruh pertama tahun ini juga mencapai 28 yuan; DeepSeek V4 Pro naik dari 6 yuan menjadi 13,5 yuan, dengan harga puncak 27 yuan; harga output DeepSeek V4 Flash naik dari 2 yuan menjadi 4,5 yuan, dengan harga puncak 9 yuan.
Dampak langsung dari kenaikan harga adalah meluapnya permintaan. The LatePost menunjukkan bahwa setelah kenaikan harga DeepSeek V4 Flash, volume panggilan di platform OpenCode turun setengahnya, dan permintaan ini menjadi ruang pertumbuhan baru bagi produsen model lokal.
Strategi penetapan harga GLM-5.3-Flash tepat sasaran pada celah ini.
