ChainThink thông báo, ngày 8 tháng 8, theo thông tin từ dự án mã nguồn mở kimi-k3-in-c của nhà phát triển, một nhà phát triển đã thử chạy mô hình Kimi K3 với 2,78 nghìn tỷ tham số trên thiết bị chỉ có 8GB bộ nhớ.
Dự án này có kích thước khoảng 176KB, được viết thuần bằng C99, không phụ thuộc vào GPU, CUDA, PyTorch hoặc BLAS, có thể thực hiện suy luận mô hình thông qua CPU.
Nó tận dụng kiến trúc MoE của Kimi K3, chỉ kích hoạt 16 trong số 896 chuyên gia mỗi lớp, do đó không cần tải toàn bộ trọng số mô hình khoảng 1,56 TB vào bộ nhớ, mà thay vào đó lưu trữ phần lớn trọng số chuyên gia trên ổ cứng NVMe và đọc chúng theo nhu cầu suy luận thời gian thực.
Hiện tại, giải pháp này vẫn có những hạn chế về hiệu năng rõ rệt: ở chế độ 8GB RAM, thời gian tạo một token khoảng 32,7 giây và cần gần 1,7TB không gian lưu trữ tốc độ cao.
Các nhà phát triển cho biết, giải pháp này gần hơn với việc khám phá thí nghiệm về hướng tối ưu hóa hạ tầng suy luận mô hình lớn và hiện chưa có giá trị sử dụng trong sản xuất.
