大多數人認為最大的模型需要最多的 VRAM! 但實際上,使用 AirLLM,擁有 2.8 兆參數的 Kimi K3 所需的 VRAM 比一個 70B 密集模型還少。 原因是 K3 是一種稀疏的專家混合模型,因此 AirLLM 僅流式傳輸每個 token 實際路由到的特定專家,而非載入完整的密集層。 再加上一次僅將一層載入 GPU。 這就是為何 DeepSeek-V3(671B)能運行在 12GB 上,而 2.8 兆參數的模型能在低於 4GB 的記憶體中運行,且無需量化、無需蒸餾、也無需剪枝。 請收藏以免遺失! 倉庫:https://t.co/dO2TABPfqr 關注 @neil_xbt 以獲取更多資訊!

