DeepSeek lança abertamente o framework DeepSpec, aumentando a velocidade do modelo V4 em até 85%

icon MarsBit
Compartilhar
AI summary iconResumo
DeepSeek lançou o framework DeepSpec como código aberto e introduziu o sistema de aceleração DSpark, aumentando a velocidade do DeepSeek-V4 em até 85%. O framework melhora as versões Flash e Pro em 60%-78% sem perda de qualidade. O DSpark utiliza o DFlash e uma cabeça de Markov leve para reduzir taxas de rejeição e aumentar o throughput. O DeepSpec suporta Qwen3 e Gemma, oferecendo uma cadeia de ferramentas Python completa para implantação local. Esta atualização traz novas listagens de tokens e marca um importante evento de lançamento de token para desenvolvedores e traders.

De acordo com o monitoramento da Beating, a DeepSeek, em parceria com a Universidade de Pequim, publicou um relatório técnico sobre o framework de aceleração por amostragem especulativa DSpark e liberou o repositório de código completo DeepSpec. Atualmente, o DSpark já está implantado nos serviços online do DeepSeek-V4. Sem comprometer a qualidade da saída, o DSpark aumenta a velocidade de geração para usuários únicos em 60% a 85% na versão Flash e em 57% a 78% na versão Pro. O DSpark supera a linha de base original de previsão multibranch de um único token (MTP-1), aumentando significativamente o throughput do sistema sob restrições rigorosas de latência. Anteriormente, a amostragem especulativa de múltiplos tokens era difícil de implementar em ambientes de produção online. Modelos de rascunho autoregressivos eram muito lentos, enquanto modelos de rascunho paralelos, por preverem independentemente cada posição, apresentavam taxas de aceitação extremamente baixas na segunda metade de sequências longas. Se múltiplos tokens de rascunho fossem verificados cegamente sob alta concorrência, o modelo grande desperdiçaria grande parte da capacidade computacional validando erros destinados a serem rejeitados, levando a uma queda severa no throughput do sistema; por isso, a indústria limitava-se, em produção, à previsão de um único token (MTP-1). O DSpark supera o gargalo de degradação de throughput sob alta concorrência. Primeiramente, o DSpark utiliza a rede principal paralela DFlash para gerar estados ocultos, seguido por uma cabeça de Markov extremamente leve. A cabeça de Markov injeta, com custo mínimo, a correlação entre palavras adjacentes por meio de consulta em tabela e uma única multiplicação matricial. Além disso, o sistema integra uma cabeça de previsão de confiança e um algoritmo de calibração póserior. Para garantir compatibilidade perfeita com o agendamento de zero sobrecarga em ambientes de produção e evitar vazamento de informações futuras, o agendador emprega um mecanismo assíncrono que utiliza previsões históricas de dois passos à frente para determinar dinamicamente o comprimento do corte dos tokens candidatos, eliminando completamente a possibilidade de o modelo grande validar tokens finais de alto risco sob carga pesada. Além do DSpark, o repositório DeepSpec liberado pela DeepSeek oferece suporte integrado a modelos grandes abertos como Qwen3 e Gemma. O DeepSpec fornece uma cadeia completa de ferramentas Python, desde o download de prompts, reconstrução do cache do modelo grande, treinamento do modelo de rascunho até avaliação de referência. Desenvolvedores podem diretamente utilizar os scripts abertos para personalizar e implantar módulos de aceleração exclusivos para diferentes modelos grandes abertos em seu ambiente local.

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.