За даними Beating Monitoring, DeepSeek у співпраці з Пекінським університетом опублікувала технічний звіт про фреймворк прискорення випадкового відбору DSpark та відкрила повний стек коду DeepSpec. Наразі DSpark вже впроваджено в онлайн-бізнес-процеси DeepSeek-V4. За умови безвтратного виведення DSpark підвищує швидкість генерації для одного користувача у версії Flash на 60–85%, а у версії Pro — на 57–78%. DSpark перевершив базовий показник однотокенного багатогілкового прогнозування (MTP-1), значно підвищивши загальну пропускну здатність системи за строгих обмежень затримки. Раніше багатотокенний випадковий відбір важко було реалізувати в продакшн-середовищі. Автoreгресивні моделі-чернетки генерували занадто повільно, а паралельні моделі-чернетки, через незалежне прогнозування на кожній позиції, мали надзвичайно низький рівень прийняття для другої половини довгих послідовностей. Якщо в умовах високої паралельності сліпу перевіряти багатотокенну чернетку, велика модель витрачатиме величезну кількість обчислювальних ресурсів на перевірку помилок, які обов’язково будуть відхилені, що призводило до серйозного падіння загальної пропускної здатності системи. Тому в індустрії онлайн-застосування обмежувалися лише однотокенним прогнозуванням (MTP-1). DSpark подолав обмеження зниження пропускної здатності при високій паралельності. DSpark спочатку використовує паралельну основну мережу DFlash для генерації прихованих станів, а потім додає надзвичайно легкий марковський заголовок. Марковський заголовок за допомогою таблиць пошуку та однієї матричної операції з надзвичайно низькою вартістю послідовно вводить зв’язки між сусідніми словами. Крім того, система інтегрує заголовок прогнозування впевненості та алгоритм постериорної калібрування. Щоб повністю сумісно працювати з нульовою вартістю планування в продакшн-середовищі та запобігти витоку майбутньої інформації, планувальник використовує асинхронний механізм, використовуючи історичні прогнози на два кроки назад для динамічного визначення довжини обрізання кандидатських слів, повністю запобігаючи великим моделям перевіряти ризиковані помилки в кінцях під час високого навантаження. Крім DSpark, бібліотека DeepSpec, яку DeepSeek відкрила, має вбудовану підтримку таких відкритих великих моделей, як Qwen3 та Gemma. DeepSpec надає повний набір інструментів Python — від завантаження підказок, перебудови кешу великої моделі, навчання моделей-чернеток до базового оцінювання. Розробники можуть безпосередньо використовувати відкритий код для налаштування та розгортання спеціалізованих модулів прискорення для різних відкритих великих моделей локально.
DeepSeek відкриває джерела фреймворку DeepSpec, збільшуючи швидкість моделі V4 до 85%
MarsBitПоділитися
DeepSeek відкрила код фреймворку DeepSpec та запустила систему прискорення DSpark, що збільшило швидкість DeepSeek-V4 до 85%. Фреймворк підвищує продуктивність версій Flash і Pro на 60–78% без втрати якості. DSpark використовує DFlash та легковаговий марківський головний модуль для зменшення частоти відмов та збільшення пропускної здатності. DeepSpec підтримує Qwen3 та Gemma, надаючи повний Python-інструментарій для локального розгортання. Це оновлення приносить нові токени та є ключовою подією щодо запуску токенів для розробників і трейдерів.
Джерело:Показати оригінал
Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації.
Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.