Mensaje de ChainThink, 8 de agosto: según la información del proyecto de código abierto del desarrollador kimi-k3-in-c, un desarrollador intentó hacer funcionar el modelo Kimi K3 con 2,78 billones de parámetros en un dispositivo con solo 8 GB de memoria.
El proyecto tiene un tamaño de aproximadamente 176 KB, está escrito en C99 puro y no depende de GPU, CUDA, PyTorch ni BLAS; puede realizar inferencia del modelo mediante CPU.
Su implementación aprovecha la arquitectura MoE de Kimi K3, activando solo 16 expertos de cada capa de 896, por lo que no es necesario cargar en memoria los pesos completos del modelo de aproximadamente 1,56 TB; en su lugar, la mayoría de los pesos de los expertos se almacenan en discos NVMe y se leen en tiempo real según las necesidades de inferencia.
Actualmente, este方案 aún presenta limitaciones de rendimiento significativas: en modo de 8 GB de memoria, se requieren aproximadamente 32.7 segundos para generar un token, además de necesitar cerca de 1.7 TB de espacio de almacenamiento de alta velocidad.
Los desarrolladores indican que este方案 es más una exploración experimental en la dirección de la optimización de la infraestructura de inferencia de modelos grandes y aún no tiene valor para uso en producción.
