ChainThink annonce que, le 5 août, selon les informations officielles, InclusionAI a officiellement mis à disposition les poids de Ling-3.0-flash, avec une version originale BF16 et une version quantifiée FP8.
Les deux versions sont sous licence MIT, disponibles sur Hugging Face et ModelScope, et prennent en charge le déploiement autonome via SGLang ou vLLM.
Parmi ceux-ci, la version BF16 occupe environ 255 Go, tandis que la version FP8 occupe environ 128 Go, soit un volume presque divisé par deux. FP8 stocke les paramètres avec une précision inférieure, réduisant ainsi les exigences en matière de stockage et de mémoire vidéo.
L'écart maximal entre FP8 et BF16 sur les 4 tests listés par l'officiel est de 1,57 points.
Ling-3.0-flash compte un total de 124 milliards de paramètres, avec 5,1 milliards de paramètres activés à chaque génération, et prend en charge un contexte de 256 000 tokens, principalement destiné aux tâches d'agent telles que la programmation, la recherche, l'analyse approfondie et l'appel d'outils.
Les évaluations officielles indiquent que ce modèle atteint ou dépasse le modèle précédent de mille milliards de paramètres, Ring-2.6-1T, sur la plupart des benchmarks.
