ChainThink сообщает, 5 августа, согласно официальным данным, Ant Bailing (inclusionAI) официально открыл веса Ling-3.0-flash, предложив как оригинальную версию BF16, так и квантованную версию FP8.
Обе версии используют лицензию MIT, уже доступны на Hugging Face и ModelScope, поддерживают самостоятельное развертывание через SGLang или vLLM.
При этом версия BF16 занимает около 255 ГБ, а версия FP8 — около 128 ГБ, что почти вдвое меньше. FP8 сохраняет параметры с меньшей точностью, снижая требования к хранилищу и видеопамяти;
В четырех официально указанных тестах максимальная разница между FP8 и BF16 составила 1,57 балла.
Ling-3.0-flash имеет общее количество параметров 124 миллиарда, при каждом генерировании активируются 5,1 миллиарда параметров, поддерживает контекст до 256 000 токенов и в первую очередь ориентирован на задачи агентов, такие как программирование, поиск, глубокие исследования и вызов инструментов.
Официальные тесты показывают, что эта модель достигает или превосходит предыдущую модель с триллионом параметров Ring-2.6-1T по большинству базовых показателей.
