火星財經訊,8 月 8 日,有開發者近日開源項目 kimi-k3-in-c,嘗試讓擁有 2.78 兆參數的 Kimi K3 模型在僅 8GB 記憶體的設備上運行。該項目僅 176KB,採用純 C99 編寫,不依賴 GPU、CUDA、PyTorch 或 BLAS,僅通過 CPU 即可完成模型推論。 該方案利用 Kimi K3 的 MoE(混合專家)架構特性。雖然模型總參數規模達到 2.78T,但每層 896 個專家中僅激活 16 個,因此開發者未將完整約 1.56TB 模型權重載入記憶體,而是將大部分專家權重存儲在 NVMe 硬碟中,根據推論需求即時讀取;同時,部分密集層(dense trunk)亦採用逐層流式載入方式。 不過,該方案目前仍存在明顯性能限制。在 8GB 記憶體模式下,模型生成一個 token 大約需要 32.7 秒,同時需要接近 1.7TB 高速存儲空間支援。 開發者表示,這一方案目前更像是一次對大模型推論基礎設施優化方向的實驗探索,並不具備實際生產使用價值,但其透過「硬碟流式載入+MoE 稀疏激活」的方式,為未來低成本運行超大規模模型提供了一種新思路。
開發者開源 C 引擎,可在 8GB RAM 上運行 2.78T 參數的 Kimi K3
MarsBit分享
一位開發者發布了一個名為 kimi-k3-in-c 的項目公告,使 2.78 兆參數的 Kimi K3 模型能在 8GB RAM 上運行。這個 176KB 的 C99 項目僅使用 CPU 推理,每層激活 896 個專家中的 16 個。它按需從 NVMe 存儲加載權重,但每個標記需要 32.7 秒,並要求 1.7TB 的高速存儲。該開發者稱這是一次鏈上值得關注的實驗,尚未準備好投入生產。
來源:顯示原文
免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。
虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款和風險披露 。