Le développeur open source un moteur C pour exécuter Kimi K3 avec 2,78 T de paramètres sur 8 Go de RAM

icon MarsBit
Partager
AI summary iconRésumé
Un développeur a publié une annonce de projet intitulée kimi-k3-in-c, permettant d'exécuter le modèle Kimi K3 de 2,78 billions de paramètres sur 8 Go de RAM. Ce projet C99 de 176 Ko utilise une inférence uniquement CPU, activant 16 des 896 experts par couche. Il charge les poids depuis le stockage NVMe à la demande, mais nécessite 32,7 secondes par token et 1,7 To de stockage rapide. Le développeur l'a qualifié d'expérience digne d'être mentionnée sur la chaîne, encore non prête pour la production.

Selon Mars Finance, le 8 août, un développeur a récemment open-sourcé le projet kimi-k3-in-c, visant à faire fonctionner le modèle Kimi K3 de 2,78 billions de paramètres sur un appareil disposant de seulement 8 Go de mémoire. Ce projet, de seulement 176 Ko, est entièrement écrit en C99 pur, ne dépend ni de GPU, ni de CUDA, ni de PyTorch, ni de BLAS, et effectue l'inférence du modèle uniquement via le CPU. Cette solution exploite les caractéristiques de l'architecture MoE (Mixture of Experts) de Kimi K3. Bien que le modèle compte au total 2,78 T de paramètres, seuls 16 experts parmi les 896 de chaque couche sont activés ; ainsi, le développeur n'a pas chargé en mémoire l'ensemble des poids du modèle, d'environ 1,56 To, mais a stocké la majeure partie des poids des experts sur un disque NVMe, les lisant en temps réel selon les besoins d'inférence. Par ailleurs, certaines couches denses (dense trunk) sont également chargées de manière fluide couche par couche. Cependant, cette solution présente encore des limitations de performance évidentes. En mode 8 Go de mémoire, le modèle met environ 32,7 secondes pour générer un token et nécessite près de 1,7 To d'espace de stockage haute vitesse. Le développeur indique que cette approche ressemble davantage à une exploration expérimentale des orientations d'optimisation des infrastructures d'inférence pour les grands modèles et n'a pas de valeur pratique pour une utilisation en production. Toutefois, son utilisation du « chargement fluide via disque + activation sparse MoE » offre une nouvelle piste pour faire fonctionner à moindre coût des modèles ultra-massifs à l'avenir.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.