ChainThink thông báo, ngày 5 tháng 8, theo tin chính thức, Ant Ling (inclusionAI) chính thức mở trọng số Ling-3.0-flash, đồng thời cung cấp phiên bản gốc BF16 và phiên bản lượng tử hóa FP8.
Cả hai phiên bản đều sử dụng giấy phép MIT, đã được triển khai trên Hugging Face và ModelScope, hỗ trợ tự triển khai thông qua SGLang hoặc vLLM.
Trong đó, phiên bản BF16 chiếm khoảng 255 GB, phiên bản FP8 chiếm khoảng 128 GB, kích thước gần như giảm một nửa. FP8 lưu trữ tham số với độ chính xác thấp hơn, giúp giảm ngưỡng yêu cầu về bộ nhớ lưu trữ và bộ nhớ GPU;
Trong 4 bài kiểm tra được liệt kê chính thức, chênh lệch lớn nhất giữa FP8 và BF16 là 1,57 điểm.
Ling-3.0-flash có tổng số tham số là 12,4 tỷ, mỗi lần tạo kích hoạt 5,1 tỷ tham số, hỗ trợ ngữ cảnh lên đến 256.000 Token, chủ yếu hướng đến các tác vụ Agent như lập trình, tìm kiếm, nghiên cứu sâu và gọi công cụ.
The official evaluation shows that this model achieves or exceeds the previous trillion-parameter model, Ring-2.6-1T, on most benchmarks.
