source avatarNeilXbt

分享

大多數人認為最大的模型需要最多的 VRAM! 但實際上,使用 AirLLM,擁有 2.8 兆參數的 Kimi K3 所需的 VRAM 比一個 70B 密集模型還少。 原因是 K3 是一種稀疏的專家混合模型,因此 AirLLM 僅流式傳輸每個 token 實際路由到的特定專家,而非載入完整的密集層。 再加上一次僅將一層載入 GPU。 這就是為何 DeepSeek-V3(671B)能運行在 12GB 上,而 2.8 兆參數的模型能在低於 4GB 的記憶體中運行,且無需量化、無需蒸餾、也無需剪枝。 請收藏以免遺失! 倉庫:https://t.co/dO2TABPfqr 關注 @neil_xbt 以獲取更多資訊!

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露