DeepSeek lança o modelo V4.1-Flash com 552 bilhões de parâmetros e janela de contexto de 1 milhão de tokens

iconCryptoBriefing
Compartilhar
AI summary iconResumo
DeepSeek lançou um novo token em 10 de setembro com o modelo V4.1-Flash, apresentando 552B parâmetros e uma janela de contexto de 1M tokens. O modelo utiliza arquitetura MoE, ativando 8B para entrada e 16B para saída. Ele adiciona um design assimétrico Causal Encoder-Decoder e reduz o uso de cache KV em 75%. O modelo supera o DeepSeek V4-Pro e agora está acessível via API com preços atualizados a partir de 14 de setembro. Os pesos foram abertos no Hugging Face sob licença MIT, oferecendo novidades sobre o lançamento de tokens para desenvolvedores e traders.

DeepSeek acaba de lançar um modelo que processa um milhão de tokens de contexto, ativando menos parâmetros do que alguns modelos de código aberto lançados há dois anos. O V4.1-Flash, lançado em 10 de setembro, representa a mais recente tentativa da startup chinesa de inteligência artificial de reescrever a economia dos modelos de linguagem grandes.

O modelo empacota 552 bilhões de parâmetros em uma arquitetura Mixture-of-Experts (MoE), mas ativa apenas cerca de 8 bilhões para tarefas de entrada e 16 bilhões para saída. O resultado é um modelo que supera amplamente o que sua pegada de computação ativa sugeriria.

A arquitetura que torna possível

O V4.1-Flash introduz o que a DeepSeek chama de arquitetura assimétrica Causal Encoder-Decoder, processando a entrada e gerando a saída por meio de caminhos diferentes otimizados para cada tarefa, em vez de executar tudo por meio de um único pipeline.

Anúncio

A janela de contexto se estende até 1 milhão de tokens. Suportar esse contexto massivo é um cache KV que consome aproximadamente 890 bytes por token, cerca de um quarto do que o modelo anterior V4-Flash exigia.

Essa redução de cache é mais importante do que pode parecer. O cache KV é o gargalo de memória que determina quantos usuários simultâneos um modelo pode atender e por quanto tempo suas conversas podem durar. Reduzi-lo em 75% significa que os operadores podem atender aproximadamente quatro vezes mais usuários no mesmo hardware, ou lidar com contextos quatro vezes mais longos sem atualizar seus clusters de GPU.

Em benchmarks, a DeepSeek afirma que o V4.1-Flash supera o próprio modelo V4-Pro da empresa e compete diretamente com o GPT-5.6 e o Kimi K3. A empresa já está redirecionando solicitações do V4-Pro para o novo modelo, com preços atualizados entrando em vigor em 14 de setembro.

Pesos abertos, estratégia aberta

DeepSeek lançou os pesos do modelo sob licença MIT no Hugging Face. O novo modelo está acessível por meio da API da DeepSeek no endpoint “deepseek-flash”. A combinação de pesos abertos e acesso à API cria um caminho de adoção em duas vias: desenvolvedores que desejam executar inferência em sua própria infraestrutura podem baixar e implantar localmente, enquanto aqueles que preferem serviços gerenciados podem chamar a API nos novos níveis de preços da DeepSeek.

Implicações da IPO e posicionamento competitivo

O cronograma do lançamento do V4.1-Flash não é acidental. Espera-se que o DeepSeek entre publicamente no Mercado STAR de Xangai, e demonstrar contínua impulsão técnica é o tipo de coisa que torna as apresentações de roadshow mais convincentes.

A compreensão multimodal integrada no V4.1-Flash, abrangendo dados visuais e de texto, reduz as oportunidades de diferenciação disponíveis para concorrentes, incluindo a OpenAI e a Moonshot AI, que desenvolve o Kimi K3.

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.