DeepSeek acaba de lançar um modelo que processa um milhão de tokens de contexto, ativando menos parâmetros do que alguns modelos de código aberto lançados há dois anos. O V4.1-Flash, lançado em 10 de setembro, representa a mais recente tentativa da startup chinesa de inteligência artificial de reescrever a economia dos modelos de linguagem grandes.
O modelo empacota 552 bilhões de parâmetros em uma arquitetura Mixture-of-Experts (MoE), mas ativa apenas cerca de 8 bilhões para tarefas de entrada e 16 bilhões para saída. O resultado é um modelo que supera amplamente o que sua pegada de computação ativa sugeriria.
A arquitetura que torna possível
O V4.1-Flash introduz o que a DeepSeek chama de arquitetura assimétrica Causal Encoder-Decoder, processando a entrada e gerando a saída por meio de caminhos diferentes otimizados para cada tarefa, em vez de executar tudo por meio de um único pipeline.
A janela de contexto se estende até 1 milhão de tokens. Suportar esse contexto massivo é um cache KV que consome aproximadamente 890 bytes por token, cerca de um quarto do que o modelo anterior V4-Flash exigia.
Essa redução de cache é mais importante do que pode parecer. O cache KV é o gargalo de memória que determina quantos usuários simultâneos um modelo pode atender e por quanto tempo suas conversas podem durar. Reduzi-lo em 75% significa que os operadores podem atender aproximadamente quatro vezes mais usuários no mesmo hardware, ou lidar com contextos quatro vezes mais longos sem atualizar seus clusters de GPU.
Em benchmarks, a DeepSeek afirma que o V4.1-Flash supera o próprio modelo V4-Pro da empresa e compete diretamente com o GPT-5.6 e o Kimi K3. A empresa já está redirecionando solicitações do V4-Pro para o novo modelo, com preços atualizados entrando em vigor em 14 de setembro.
Pesos abertos, estratégia aberta
DeepSeek lançou os pesos do modelo sob licença MIT no Hugging Face. O novo modelo está acessível por meio da API da DeepSeek no endpoint “deepseek-flash”. A combinação de pesos abertos e acesso à API cria um caminho de adoção em duas vias: desenvolvedores que desejam executar inferência em sua própria infraestrutura podem baixar e implantar localmente, enquanto aqueles que preferem serviços gerenciados podem chamar a API nos novos níveis de preços da DeepSeek.
Implicações da IPO e posicionamento competitivo
O cronograma do lançamento do V4.1-Flash não é acidental. Espera-se que o DeepSeek entre publicamente no Mercado STAR de Xangai, e demonstrar contínua impulsão técnica é o tipo de coisa que torna as apresentações de roadshow mais convincentes.
A compreensão multimodal integrada no V4.1-Flash, abrangendo dados visuais e de texto, reduz as oportunidades de diferenciação disponíveis para concorrentes, incluindo a OpenAI e a Moonshot AI, que desenvolve o Kimi K3.
