Mensaje de ChainThink, 5 de agosto: según el anuncio oficial, InclusionAI ha lanzado oficialmente los pesos de Ling-3.0-flash, disponibles en versión original BF16 y versión cuantizada FP8.
Ambas versiones utilizan la licencia MIT, ya están disponibles en Hugging Face y ModelScope, y admiten despliegue propio mediante SGLang o vLLM.
Entre ellos, la versión BF16 ocupa aproximadamente 255 GB, mientras que la versión FP8 ocupa unos 128 GB, reduciendo casi a la mitad el tamaño. FP8 guarda los parámetros con menor precisión, lo que reduce el umbral de almacenamiento y memoria de GPU;
En las 4 pruebas listadas oficialmente, la diferencia máxima entre FP8 y BF16 fue de 1.57 puntos.
Ling-3.0-flash tiene un total de 124 mil millones de parámetros, activa 5.1 mil millones de parámetros por generación, admite un contexto de 256.000 tokens y está principalmente orientado a tareas de Agentes como programación, búsqueda, investigación profunda y llamadas a herramientas.
Según la evaluación oficial, el modelo alcanza o supera al modelo anterior de un billón de parámetros, Ring-2.6-1T, en la mayoría de los benchmarks.
