ChainThink mensagem, 5 de agosto, segundo informações oficiais, a inclusionAI lançou oficialmente os pesos do Ling-3.0-flash, disponibilizando ao mesmo tempo a versão original BF16 e a versão quantizada FP8.
Ambas as versões utilizam a licença MIT, já estão disponíveis no Hugging Face e ModelScope, e suportam implantação própria por meio do SGLang ou vLLM.
Entre eles, a versão BF16 ocupa cerca de 255 GB, enquanto a versão FP8 ocupa cerca de 128 GB, reduzindo o tamanho quase pela metade. A FP8 armazena parâmetros com menor precisão, reduzindo os requisitos de armazenamento e memória de vídeo;
Na lista oficial de 4 testes, a diferença máxima entre FP8 e BF16 foi de 1,57 pontos.
Ling-3.0-flash possui um total de 124 bilhões de parâmetros, ativando 5,1 bilhões de parâmetros por geração, com suporte a contexto de 256.000 tokens, voltado principalmente para tarefas de agente como programação, busca, pesquisa aprofundada e chamada de ferramentas.
A avaliação oficial indica que o modelo atinge ou supera o modelo anterior de um trilhão de parâmetros, Ring-2.6-1T, na maioria dos benchmarks.
