DeepSeek open-source le cadre DeepSpec, augmentant la vitesse du modèle V4 jusqu'à 85 %

icon MarsBit
Partager
AI summary iconRésumé
DeepSeek a open-sourcé le cadre DeepSpec et lancé le système d'accélération DSpark, augmentant la vitesse de DeepSeek-V4 jusqu'à 85 %. Ce cadre améliore les versions Flash et Pro de 60 % à 78 % sans perte de qualité. DSpark utilise DFlash et une tête Markov légère pour réduire les taux de rejet et augmenter le débit. DeepSpec prend en charge Qwen3 et Gemma, offrant une chaîne d'outils Python complète pour un déploiement local. Cette mise à jour introduit de nouvelles listings de jetons et constitue un événement d'actualité majeur pour les développeurs et les traders.

Selon les données de Beating Monitoring, DeepSeek, en collaboration avec l'Université de Pékin, a publié un rapport technique sur le cadre d'accélération par échantillonnage spéculatif DSpark et a open-sourcé la bibliothèque complète DeepSpec. DSpark est déjà déployé dans les services en ligne de DeepSeek-V4. Sans perte de qualité de sortie, DSpark augmente la vitesse de génération pour un seul utilisateur de 60 % à 85 % pour la version Flash et de 57 % à 78 % pour la version Pro. DSpark dépasse la ligne de base MTP-1 (Multi-Token Prediction-1) et augmente significativement le débit global du système sous des contraintes de latence strictes. Auparavant, l'échantillonnage spéculatif multi-token était difficile à déployer en production. Les modèles de brouillon autoregressifs étaient trop lents, tandis que les modèles de brouillon parallèles, en raison de prédictions indépendantes à chaque position, présentaient un taux d'acceptation extrêmement faible pour la seconde moitié des séquences longues. En cas de forte concurrence, valider aveuglément plusieurs tokens de brouillon faisait gaspiller une grande partie des ressources de calcul du modèle pour vérifier des erreurs inévitables, entraînant une chute sévère du débit global du système ; par conséquent, l'industrie se limitait généralement à la prédiction mono-token (MTP-1) en production. DSpark surmonte ce goulot d'étranglement de débit sous forte concurrence. DSpark utilise d'abord un réseau principal parallèle DFlash pour générer des états cachés, puis ajoute une tête de Markov extrêmement légère. Cette tête de Markov injecte de manière séquentielle, à un coût très faible, les dépendances entre mots adjacents via une table de recherche et une seule multiplication matricielle. Le système intègre également une tête de prédiction de confiance et un algorithme de calibration a posteriori. Pour assurer une compatibilité parfaite avec le planificateur à coût nul en production et éviter toute fuite d'informations futures, le planificateur utilise un mécanisme asynchrone qui détermine dynamiquement la longueur du découpage des candidats en se basant sur les prédictions historiques deux étapes en arrière, éliminant ainsi complètement la vérification par le modèle principal des erreurs à haut risque en fin de séquence sous charge élevée. Outre DSpark, la bibliothèque DeepSpec open-sourcée par DeepSeek prend en charge nativement des modèles grands ouverts tels que Qwen3 et Gemma. DeepSpec fournit une chaîne d'outils Python complète allant du téléchargement des prompts, à la reconstruction du cache du modèle, en passant par l'entraînement du modèle de brouillon jusqu'à l'évaluation comparative. Les développeurs peuvent directement utiliser les scripts open-source pour personnaliser et déployer localement des modules d'accélération dédiés à différents modèles grands ouverts.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.