Z.ai Tiongkok, perusahaan yang sebelumnya dikenal sebagai Zhipu AI, merilis GLM-5.3-Flash pada 26 Agustus, menjadikannya model multimodal asli pertama dalam seri GLM-5. Peluncuran ini patut diperhatikan bukan hanya karena modelnya sendiri: ia berjalan sepenuhnya pada akselerator AI buatan dalam negeri, sebuah demonstrasi tegas bahwa perangkat keras Tiongkok mampu menangani beban kerja skala besar yang serius.
Waktunya penting. Kontrol ekspor dari AS telah membatasi akses terhadap chip paling canggih NVIDIA bagi pembeli Tiongkok, mendorong perusahaan seperti Z.ai untuk membangun solusi berdasarkan apa yang mereka miliki.
Apa yang sebenarnya dilakukan model
GLM-5.3-Flash menggunakan arsitektur hibrida yang menggabungkan perhatian jarang dan linier, yang merupakan pilihan desain untuk secara signifikan mengurangi kebutuhan komputasi. Model ini memiliki total 320 miliar parameter, tetapi hanya mengaktifkan 18 miliar per token, artinya model memanfaatkan basis pengetahuan yang sangat besar tanpa menanggung biaya komputasi penuh pada setiap inferensi.
Jendela konteks berada pada 1 juta token, menempatkannya di antara yang terpanjang yang tersedia di mana pun model terbuka. Dukungan asli untuk input gambar dan video membuatnya benar-benar multimodal sejak tingkat arsitektur, bukan sebagai kemampuan yang ditambahkan secara tambahan.
Pada benchmark pemrograman DeepSWE v1.1, GLM-5.3-Flash mendapat skor 63,4, dibandingkan dengan 46,2 untuk pendahulunya, GLM-5.2. Model ini juga mendapat skor 57 pada Indeks Kecerdasan Analisis Artifisial.
Harga bersifat agresif. Biaya akses API adalah $0,15 per juta token masukan dan $0,50 per juta token keluaran, dengan input yang di-cache tersedia seharga $0,03. Z.ai menggambarkan biaya ini sekitar sepertiga dari beberapa opsi pesaing.
Chip Cina yang sedang bekerja nyata
Z.ai menerapkan GLM-5.3-Flash di seluruh cluster akselerator AI buatan dalam negeri, kemudian membangun stack pelayanan khusus dan menerapkan teknik kuantisasi yang disesuaikan dengan perangkat keras tersebut. Hasilnya adalah peningkatan tiga kali lipat dalam kinerja end-to-end dibandingkan pendekatan penerapan yang lebih umum.
Model ini dilengkapi dengan bobot terbuka di bawah lisensi MIT, tersedia dalam format FP8 dan BF16 di Hugging Face dan ModelScope. MIT adalah salah satu lisensi paling fleksibel: pengembang dan perusahaan dapat menggunakan, memodifikasi, dan mendistribusikan bobot tersebut secara komersial tanpa batasan.
