ChainThink повідомляє, 5 серпня, за офіційними даними, Antelope AI (inclusionAI) офіційно відкрив ваги Ling-3.0-flash, а також надав оригінал BF16 та квантовану версію FP8.
Обидві версії використовують ліцензію MIT, вже доступні на Hugging Face та ModelScope, підтримують самостійне розгортання через SGLang або vLLM.
Зокрема, розмір BF16 становить близько 255 ГБ, а FP8 — близько 128 ГБ, що майже вдвічі менше. FP8 зберігає параметри з нижчою точністю, що знижує вимоги до обсягу пам’яті та відеопам’яті;
У чотирьох офіційно визначених тестах максимальна різниця між FP8 та BF16 становить 1,57 бала.
Ling-3.0-flash має загальну кількість параметрів 124 мільярди, під час кожного генерування активується 5,1 мільярда параметрів, підтримує контекст до 256 000 токенів і призначений переважно для завдань агента, таких як програмування, пошук, глибоке дослідження та виклик інструментів.
Офіційні тести показали, що ця модель досягає або перевищує попередню трильйонну модель Ring-2.6-1T за більшістю базових показників.
