ChainThink 消息,8 月 8 日,據開發者開源項目 kimi-k3-in-c 資訊,有開發者嘗試讓 2.78 萬億參數的 Kimi K3 模型在僅 8GB 記憶體設備上運行。
該項目體積約 176 KB,採用純 C99 編寫,不依賴 GPU、CUDA、PyTorch 或 BLAS,可通過 CPU 完成模型推理。
其實現利用 Kimi K3 的 MoE 架構,每層 896 個專家中僅激活 16 個,因此無需將約 1.56TB 完整模型權重載入內存,而是將大部分專家權重存儲在 NVMe 硬盤中,並按推理需求實時讀取。
目前該方案仍存在明顯的性能限制:在 8GB 記憶體模式下,生成一個 token 約需 32.7 秒,同時需要接近 1.7TB 高速儲存空間。
開發者表示,該方案更接近於大模型推理基礎設施優化方向的實驗探索,尚不具備生產使用價值。
