開發者優化 Kimi K3,使其可在 8GB RAM 上運行 Open-Source C 引擎

iconChainthink
分享
AI summary icon精華摘要
一個項目公告顯示,開發者已優化 Kimi K3,使其能在 8GB RAM 上運行,並使用開源 C99 推理引擎。該解決方案命名為 kimi-k3-in-c,避免了對 GPU 和 PyTorch 的依賴,僅依賴 CPU 推理。它在每一層激活 896 個專家中的 16 個,並將權重存儲於 NVMe。鏈上新聞強調了 32.7 秒的代幣時間和 1.7TB 的存儲需求。該工具尚未達到生產就緒狀態。

ChainThink 消息,8 月 8 日,據開發者開源項目 kimi-k3-in-c 資訊,有開發者嘗試讓 2.78 萬億參數的 Kimi K3 模型在僅 8GB 記憶體設備上運行。

該項目體積約 176 KB,採用純 C99 編寫,不依賴 GPU、CUDA、PyTorch 或 BLAS,可通過 CPU 完成模型推理。

其實現利用 Kimi K3 的 MoE 架構,每層 896 個專家中僅激活 16 個,因此無需將約 1.56TB 完整模型權重載入內存,而是將大部分專家權重存儲在 NVMe 硬盤中,並按推理需求實時讀取。

目前該方案仍存在明顯的性能限制:在 8GB 記憶體模式下,生成一個 token 約需 32.7 秒,同時需要接近 1.7TB 高速儲存空間。

開發者表示,該方案更接近於大模型推理基礎設施優化方向的實驗探索,尚不具備生產使用價值。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露