La plupart des gens pensent que les plus grands modèles nécessitent le plus de VRAM ! En réalité, avec AirLLM, Kimi K3, un modèle de 2,8 billions de paramètres, nécessite moins de VRAM qu’un modèle dense de 70 milliards de paramètres. La raison en est que K3 est un modèle sparse mixture-of-experts : AirLLM stream uniquement les experts spécifiques auxquels un token est réellement routé, au lieu de charger une couche dense complète. Associé au chargement d’une seule couche sur le GPU à la fois. C’est ainsi que DeepSeek-V3 (671 milliards) tient dans 12 Go et qu’un modèle de 2,8 billions de paramètres tient en moins de 4 Go, sans quantification, sans distillation et sans élagage. Mettez en favoris pour ne pas le perdre ! Repo : https://t.co/dO2TABPfqr Suivez @neil_xbt pour plus d’informations !
NeilXbtPartager
Source:Afficher l'original
Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations.
Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.