Message de ChainThink, le 8 août : selon les informations du projet open source kimi-k3-in-c des développeurs, un développeur a tenté de faire fonctionner le modèle Kimi K3 de 2,78 billions de paramètres sur un appareil disposant de seulement 8 Go de mémoire.
Le projet pèse environ 176 Ko, est écrit entièrement en C99 et ne dépend ni de GPU, ni de CUDA, ni de PyTorch, ni de BLAS ; l'inférence du modèle peut être effectuée via CPU.
Il exploite l'architecture MoE de Kimi K3, n'activant que 16 experts parmi les 896 par couche, ce qui permet d'éviter de charger les 1,56 To complets des poids du modèle en mémoire, en stockant plutôt la majorité des poids des experts sur un disque NVMe et en les lisant en temps réel selon les besoins de l'inférence.
Ce scénario présente encore des limites de performance évidentes : en mode 8 Go de mémoire, la génération d'un token prend environ 32,7 secondes et nécessite près de 1,7 To d'espace de stockage haut débit.
Les développeurs indiquent que cette solution constitue une exploration expérimentale plus proche de l'optimisation des infrastructures d'inférence de grands modèles et ne possède pas encore de valeur de production.
