Mensagem do ChainThink, 8 de agosto: de acordo com o projeto de código aberto kimi-k3-in-c dos desenvolvedores, um desenvolvedor tentou executar o modelo Kimi K3 com 2,78 trilhões de parâmetros em um dispositivo com apenas 8 GB de memória.
O projeto tem aproximadamente 176 KB, é escrito em C99 puro e não depende de GPU, CUDA, PyTorch ou BLAS, podendo realizar inferência do modelo apenas com CPU.
Ele aproveita a arquitetura MoE do Kimi K3, ativando apenas 16 especialistas entre os 896 por camada, portanto, não é necessário carregar os pesos completos do modelo de cerca de 1,56 TB na memória; em vez disso, a maioria dos pesos dos especialistas é armazenada no disco NVMe e lida em tempo real conforme a necessidade de inferência.
Atualmente, este plano ainda apresenta limitações de desempenho significativas: no modo de 8 GB de memória, a geração de um token leva cerca de 32,7 segundos e requer quase 1,7 TB de espaço de armazenamento de alta velocidade.
Os desenvolvedores afirmam que o projeto está mais próximo de uma exploração experimental na direção da otimização da infraestrutura de inferência de grandes modelos e ainda não possui valor de uso em produção.
