DeepSeek lanza abiertamente el marco DeepSpec, aumentando la velocidad del modelo V4 hasta en un 85%

icon MarsBit
Compartir
AI summary iconResumen
DeepSeek ha abierto el código del marco DeepSpec y lanzado el sistema de aceleración DSpark, aumentando la velocidad de DeepSeek-V4 hasta en un 85%. El marco mejora las versiones Flash y Pro entre un 60% y un 78% sin pérdida de calidad. DSpark utiliza DFlash y una cabeza de Markov ligera para reducir las tasas de rechazo y aumentar el rendimiento. DeepSpec admite Qwen3 y Gemma, ofreciendo una cadena de herramientas Python completa para implementación local. Esta actualización trae nuevas listas de tokens y marca un evento clave de lanzamiento de tokens para desarrolladores y operadores.

Según el monitoreo de Beating, DeepSeek, en colaboración con la Universidad de Pekín, publicó un informe técnico sobre el marco de aceleración de muestreo especulativo DSpark y lanzó como código abierto la biblioteca completa DeepSpec. Actualmente, DSpark ya se ha implementado en los servicios en línea de DeepSeek-V4. Sin comprometer la calidad de la salida, DSpark aumenta la velocidad de generación para usuarios individuales en un 60% a 85% en la versión Flash y en un 57% a 78% en la versión Pro. DSpark supera la línea base original de predicción múltiple de token único (MTP-1), aumentando significativamente el rendimiento general del sistema bajo restricciones estrictas de latencia. Anteriormente, el muestreo especulativo de múltiples tokens era difícil de implementar en entornos de producción en línea. Los modelos de borrador autoregresivos generaban demasiado lento, mientras que los modelos de borrador paralelos, al predecir independientemente cada posición, lograban tasas de aceptación extremadamente bajas en la segunda mitad de secuencias largas. Si se verificaban ciegamente múltiples tokens de borrador bajo alta concurrencia, los modelos grandes desperdiciarían una gran cantidad de capacidad de cómputo validando errores que inevitablemente serían rechazados, provocando una caída severa del rendimiento general del sistema; por ello, la industria se limitaba casi exclusivamente a la predicción de un solo token (MTP-1) en producción. DSpark supera el cuello de botella de degradación del rendimiento bajo alta concurrencia. DSpark primero utiliza la red principal paralela DFlash para generar estados ocultos, luego añade una cabeza de Markov extremadamente ligera. Esta cabeza de Markov inyecta serialmente la correlación entre palabras adyacentes con un costo mínimo mediante búsqueda en tabla y una sola multiplicación matricial. Además, el sistema integra una cabeza de predicción de confianza y un algoritmo de calibración posterior. Para garantizar una compatibilidad perfecta con la programación sin sobrecarga en entornos de producción y evitar fugas de información futura, el programador emplea un mecanismo asíncrono que utiliza predicciones históricas dos pasos antes para decidir dinámicamente la longitud del recorte de tokens candidatos, eliminando por completo la posibilidad de que el modelo grande valide errores de cola de alto riesgo bajo carga pesada. Además de DSpark, la biblioteca DeepSpec lanzada como código abierto por DeepSeek admite directamente modelos grandes abiertos como Qwen3 y Gemma. DeepSpec ofrece una completa cadena de herramientas Python que abarca desde la descarga de prompts, la reconstrucción del caché del modelo grande, el entrenamiento del modelo de borrador hasta la evaluación de referencia. Los desarrolladores pueden utilizar directamente los scripts abiertos para personalizar y desplegar módulos de aceleración exclusivos para diferentes modelos grandes abiertos en sus entornos locales.

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.