ZhiPu ra mắt mô hình mới nhất GLM-5.3-Flash, trước đó mô hình này đã được mở miễn phí trên nền tảng thử nghiệm dưới tên ẩn Ox Alpha, trong 5 ngày đạt lưu lượng vượt 50 nghìn tỷ token. Mô hình được sử dụng hơn 100.000 chip nội địa để phục vụ suy luận, hiệu suất phần cứng và chi phí trên mỗi token đã tương đương với GPU NVIDIA. Về hiệu năng, mô hình này đạt điểm 57 trong chỉ số thông minh tổng hợp AA, ngang bằng với Claude Opus 4.8. Về giá cả, đầu vào 0,8 nhân dân tệ mỗi triệu token, đầu ra 2,8 nhân dân tệ mỗi triệu token, thấp hơn nhiều so với đối thủ. Kiến trúc sử dụng thiết kế lai giữa sự thưa thớt và sự chú ý tuyến tính, là mô hình đa phương tiện bản địa đầu tiên trong dòng GLM-5. Trong bối cảnh các mô hình AI trong nước đồng loạt tăng giá, ZhiPu đang tận dụng chiến lược giá thấp để chiếm lĩnh thị trường.Tác giả bài viết, nguồn: LaterPost
Ngày 26 tháng 8, Zhipu chính thức xác nhận: Mô hình ẩn danh Ox Alpha (được cộng đồng Trung Quốc gọi là "Niulai"), từng gây tranh luận sôi nổi trong cộng đồng nhà phát triển, chính là GLM-5.3-Flash mới nhất của họ. Mã hiệu mô hình lấy cảm hứng từ bộ phim đang ăn khách gần đây ở Trung Quốc "Niulai".
Trước khi chính thức ra mắt, mô hình này đã được mở miễn phí để thử nghiệm dưới dạng ẩn danh trên OpenRouter và OpenCode, trong vòng 5 ngày, lưu lượng truy cập tích lũy vượt quá 50 nghìn tỷ token, phá vỡ kỷ lục tăng trưởng lưu lượng của cả hai nền tảng, và hiện tại lượng sử dụng đã vượt hơn hai lần so với DeepSeek. Tuy nhiên, điểm gây chú ý thực sự trên thị trường là chi tiết mà Zhipu sau đó tiết lộ: toàn bộ lưu lượng này đều được xử lý bởi các chip trong nước.
ZhiPu cho biết trong tài liệu kỹ thuật chính thức rằng đã sử dụng hơn 100.000 chip trong nước để phục vụ dịch vụ suy luận mô hình này, “hiệu suất phần cứng và chi phí trên mỗi token đã đạt mức tương đương với GPU NVIDIA phổ biến”.
Cơ quan nghiên cứu bán dẫn SemiAnalysis ngay lập tức đăng bài bình luận trên nền tảng X: “Tất cả lưu lượng đều được xử lý bởi chip trong nước, hiệu suất phần cứng và chi phí trên mỗi token đã có thể sánh ngang với GPU của NVIDIA. Sau khi Jalapeño (chip suy luận tự phát triển của OpenAI) được công bố hôm qua, hàng rào CUDA lại một lần nữa bị thử thách.”

100.000 thẻ trong nước: Từ thử nghiệm đến sản xuất, Zhipu đã mô tả chi tiết việc triển khai cụm chip trong nước trong tài liệu kỹ thuật.
Điểm nghẽn chính của một chip đơn lẻ nằm ở dung lượng và băng thông bộ nhớ, đặc biệt khó khăn khi hỗ trợ độ dài ngữ cảnh lên đến 1 triệu token. Để giải quyết vấn đề này, Zhipu đã xây dựng một động cơ suy luận chuyên dụng dựa trên SGLang, sử dụng các kỹ thuật như lượng tử hóa W8A8, lượng tử hóa bộ đệm hỗn hợp INT8/FP8/BF16 và song song tensor trong nút, đồng thời áp dụng kiến trúc tách biệt sản xuất Encode–Prefill–Decode (EPD), tách riêng các công việc mã hóa đa phương tiện, tiền điền prompt và giải mã từng token thành các hồ công việc có thể lập lịch độc lập.
ZhiPu cho biết, hiệu suất dịch vụ end-to-end đã tăng gấp 3 lần so với baseline ban đầu trên cùng một phần cứng.
Theo thông tin từ LatePost, nhà cung cấp lô chip này có thể đến từ Huawei, Moore Threads và Hygon. ZhiPu chính thức không bình luận về vấn đề này, và tài liệu kỹ thuật cũng không nêu rõ mô hình chip cụ thể.
SemiAnalysis trong bình luận đặc biệt chỉ ra rằng, trước đây có quan điểm cho rằng chỉ các phòng thí nghiệm tiên tiến hàng đầu mới có quy mô tính toán 100 nghìn tỷ token mỗi ngày, “trong khi lượng lưu lượng miễn phí 100 nghìn tỷ token mỗi ngày này hoàn toàn chạy trên chip trong nước.”

Mô hình本身: So sánh với DeepSeek, giá cả bằng 1/40 so với Claude Opus 4.8. Kích thước tham số của GLM-5.3-Flash là 320B tổng tham số, 18B tham số kích hoạt, lượng tham số khoảng 40% so với thế hệ trước là GLM-5.3, gần tương đương với DeepSeek V4 Flash.
Về hiệu năng, đánh giá chính thức từ Zhipu cho thấy GLM-5.3-Flash đạt 57 điểm trên chỉ số Artificial Analysis Intelligence Index (AA), vượt trội so với thế hệ trước là GLM-5.2, ngang bằng với Claude Opus 4.8 của Anthropic và cao hơn phiên bản chính thức của mô hình đỉnh cao DeepSeek V4 Pro với 53 điểm.

Về giá cả, GLM-5.3-Flash có giá 0,8 nhân dân tệ cho mỗi triệu token đầu vào, 2,8 nhân dân tệ cho mỗi triệu token đầu ra, và giá khớp cache là 0,23 nhân dân tệ, bằng một phần mười so với GLM-5.3. Trong hai tuần đầu tiên ra mắt, giá sẽ được giảm một nửa.
ZhiPu cho biết, GLM-5.3-Flash có giá bằng 1/10 so với GLM-5.3, và trong chương trình giảm giá giới hạn thời gian, giá chỉ bằng 1/20 so với GLM-5.3, tương đương 1/40 so với Claude Opus 4.8.
So với DeepSeek V4 Flash sau khi điều chỉnh giá (nhập 1,5 nhân dân tệ vào giờ thấp điểm, xuất 4,5 nhân dân tệ), GLM-5.3-Flash rẻ hơn trong hầu hết các kịch bản gọi thông thường.

Sự đổi mới kiến trúc: Số lượng tham số và lớp gần như giảm một nửa. GLM-5.3-Flash sử dụng thiết kế kiến trúc hoàn toàn khác với GLM-5.3, đây cũng là lý do cốt lõi giúp nó đạt hiệu suất cao hơn với chi phí thấp hơn.
So với GLM-4.5, GLM-5.3-Flash có tổng số tham số tương đương (355B so với 320B), nhưng số tham số kích hoạt giảm từ 32B xuống 18B, số lớp giảm từ 92 xuống 45, gần như giảm một nửa.
ZhiPu cho biết, GLM-5.3-Flash là mô hình mở前沿 đầu tiên sử dụng kiến trúc lai giữa sự chú ý thưa thớt và sự chú ý tuyến tính. So với GLM-5.3, lượng tính toán chú ý và kích thước bộ nhớ đệm KV của nó lần lượt giảm 3,01 lần và 4,44 lần.
Ngoài ra, mô hình này là mô hình đa phương tiện bản địa đầu tiên trong chuỗi GLM-5, hỗ trợ đầu vào hình ảnh và video, đồng thời cũng là mô hình mới đầu tiên được ra mắt kể từ khi Zhipu tập trung chiến lược vào coding.

Việc ra mắt GLM-5.3-Flash diễn ra sau một đợt tăng giá chung trên thị trường mô hình AI của Trung Quốc.
Giá đầu ra của Kimi K3 lên tới 100 nhân dân tệ mỗi triệu token, vượt hơn ba lần so với thế hệ trước K2.6; giá đầu ra của ZhiPu cũng đạt 28 nhân dân tệ sau đợt tăng giá vào nửa đầu năm; DeepSeek V4 Pro tăng từ 6 nhân dân tệ lên 13,5 nhân dân tệ, lên tới 27 nhân dân tệ trong giờ cao điểm; giá đầu ra của DeepSeek V4 Flash tăng từ 2 nhân dân tệ lên 4,5 nhân dân tệ, lên tới 9 nhân dân tệ trong giờ cao điểm.
Việc tăng giá trực tiếp dẫn đến sự tràn ra của nhu cầu. The LatePost chỉ ra rằng sau khi DeepSeek V4 Flash tăng giá, lượng gọi API trên nền tảng OpenCode đã giảm một nửa, phần nhu cầu này trở thành không gian tăng trưởng mới cho các nhà phát triển mô hình trong nước.
Chiến lược định giá của GLM-5.3-Flash chính là nhắm vào khoảng trống này.
