ChainThinkのメッセージによると、8月8日、開発者によるオープンソースプロジェクトkimi-k3-in-cの情報によると、開発者が2.78兆パラメータのKimi K3モデルを8GBメモリのデバイス上で動作させようとしています。
このプロジェクトのサイズは約176KBで、純粋なC99で記述されており、GPU、CUDA、PyTorch、BLASに依存せず、CPUだけでモデル推論が可能です。
これは、Kimi K3のMoEアーキテクチャを活用し、各層の896人のエキスパートのうち16人だけを活性化することで、約1.56TBの完全なモデル重みをメモリに読み込む必要なく、大部分のエキスパート重みをNVMeハードディスクに保存し、推論の要請に応じてリアルタイムで読み込むことを実現しています。
現在、このソリューションには依然として顕著なパフォーマンス制限があります:8GBメモリモードでは、1つのトークンを生成するのに約32.7秒かかり、約1.7TBの高速ストレージ空間が必要です。
開発者によると、この方案は大規模モデル推論インフラの最適化方向への実験的探求に近いものであり、現在のところ実用化の価値はないとされています。
