Z.ai của Trung Quốc, công ty từng được biết đến với tên Zhipu AI, đã ra mắt GLM-5.3-Flash vào ngày 26 tháng 8, trở thành mô hình đa phương tiện bản địa đầu tiên trong chuỗi GLM-5. Việc ra mắt này đáng chú ý không chỉ vì bản thân mô hình: nó chạy hoàn toàn trên các bộ xử lý AI sản xuất trong nước, minh chứng rõ ràng rằng phần cứng Trung Quốc có thể xử lý các tác vụ quy mô lớn nghiêm túc.
Thời điểm có ý nghĩa quan trọng. Các biện pháp kiểm soát xuất khẩu từ Hoa Kỳ đã hạn chế quyền truy cập vào các con chip tiên tiến nhất của NVIDIA đối với người mua Trung Quốc, buộc các công ty như Z.ai phải xây dựng giải pháp dựa trên những gì họ có.
Mô hình thực sự làm gì
GLM-5.3-Flash sử dụng kiến trúc lai kết hợp sự chú ý thưa và tuyến tính, đây là lựa chọn thiết kế giúp giảm đáng kể yêu cầu tính toán. Mô hình có tổng cộng 320 tỷ tham số nhưng chỉ kích hoạt 18 tỷ tham số trên mỗi token, nghĩa là nó tận dụng cơ sở tri thức khổng lồ mà không phải trả chi phí tính toán đầy đủ cho mỗi lần suy luận.
Cửa sổ ngữ cảnh nằm ở mức 1 triệu token, đặt nó vào nhóm các mô hình mở có độ dài dài nhất hiện có. Hỗ trợ bản địa cho đầu vào hình ảnh và video khiến nó thực sự đa phương thức từ cấp độ kiến trúc, chứ không phải là khả năng được thêm vào sau.
Trên bảng đánh giá mã hóa DeepSWE v1.1, GLM-5.3-Flash đạt 63,4, so với 46,2 của người tiền nhiệm GLM-5.2. Mô hình này cũng đạt 57 trên Chỉ số Trí tuệ Phân tích Nhân tạo.
Giá cả rất cạnh tranh. Chi phí truy cập API là 0,15 USD mỗi triệu token đầu vào và 0,50 USD mỗi triệu token đầu ra, với các token đầu vào được lưu trong bộ nhớ đệm chỉ với 0,03 USD. Z.ai mô tả chi phí này khoảng một phần mười so với một số lựa chọn cạnh tranh khác.
Chip Trung Quốc đang thực hiện công việc thực tế
Z.ai đã triển khai GLM-5.3-Flash trên các cụm bộ tăng tốc AI được sản xuất trong nước, sau đó xây dựng các stack phục vụ tùy chỉnh và áp dụng các kỹ thuật lượng tử hóa được điều chỉnh phù hợp với phần cứng đó. Kết quả là hiệu suất toàn diện được cải thiện ba lần so với cách triển khai mang tính tổng quát hơn.
Mô hình được cung cấp với trọng số mở theo giấy phép MIT, có sẵn ở cả định dạng FP8 và BF16 trên Hugging Face và ModelScope. MIT là một trong những giấy phép cho phép nhiều nhất: các nhà phát triển và công ty có thể sử dụng, sửa đổi và phân phối trọng số này cho mục đích thương mại mà không bị hạn chế.
