El desarrollador abre el código fuente del motor C para ejecutar Kimi K3 con 2,78T parámetros en 8 GB de RAM

icon MarsBit
Compartir
AI summary iconResumen
Un desarrollador lanzó un anuncio de proyecto titulado kimi-k3-in-c, que permite ejecutar el modelo Kimi K3 de 2,78 billones de parámetros en 8 GB de RAM. El proyecto C99 de 176 KB utiliza inferencia solo con CPU, activando 16 de los 896 expertos por capa. Carga los pesos desde el almacenamiento NVMe según sea necesario, pero requiere 32,7 segundos por token y 1,7 TB de almacenamiento rápido. El desarrollador lo llamó un experimento digno de nota en la cadena, aún no listo para producción.

Noticia de Huoxing Caijing: el 8 de agosto, un desarrollador lanzó recientemente el proyecto open-source kimi-k3-in-c, intentando hacer funcionar el modelo Kimi K3 con 2.78 billones de parámetros en un dispositivo con solo 8 GB de memoria. El proyecto ocupa solo 176 KB, está escrito completamente en C99, no depende de GPU, CUDA, PyTorch ni BLAS, y realiza la inferencia del modelo únicamente mediante CPU. Esta solución aprovecha las características de la arquitectura MoE (Mixture of Experts) de Kimi K3. Aunque el modelo tiene un tamaño total de 2.78T parámetros, solo se activan 16 de los 896 expertos por capa; por lo tanto, el desarrollador no cargó en memoria los pesos completos del modelo, que suman aproximadamente 1.56 TB, sino que almacenó la mayor parte de los pesos de los expertos en un disco NVMe, leyéndolos en tiempo real según las necesidades de inferencia. Al mismo tiempo, algunas capas densas (dense trunk) también se cargan de forma fluída por capas. Sin embargo, esta solución aún presenta limitaciones de rendimiento evidentes. En modo de 8 GB de memoria, el modelo tarda aproximadamente 32.7 segundos en generar un token y requiere cerca de 1.7 TB de espacio de almacenamiento de alta velocidad. El desarrollador indicó que esta solución es actualmente más bien una exploración experimental sobre la dirección de optimización de la infraestructura de inferencia para modelos grandes, y no tiene valor práctico para uso en producción; sin embargo, su enfoque de “carga fluída desde disco + activación dispersa MoE” ofrece una nueva perspectiva para ejecutar modelos ultramasivos a bajo costo en el futuro.

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.