DeepSeek vient de lancer un modèle capable de traiter un million de jetons de contexte tout en activant moins de paramètres que certains modèles open source publiés il y a deux ans. Le V4.1-Flash, lancé le 10 septembre, représente la dernière tentative de cette startup chinoise d’IA de réécrire l’économie des grands modèles de langage.
Le modèle intègre 552 milliards de paramètres dans une architecture Mixture-of-Experts (MoE), mais n'active que environ 8 milliards pour les tâches d'entrée et 16 milliards pour les sorties. Le résultat est un modèle dont les performances dépassent largement ce que laissait prévoir son empreinte de calcul active.
L'architecture qui permet son fonctionnement
V4.1-Flash introduit ce que DeepSeek appelle une architecture asymétrique Encodeur-Décodeur causal, traitant les entrées et générant les sorties via des chemins distincts optimisés pour chaque tâche, plutôt que de passer tout par un seul pipeline.
La fenêtre de contexte s'étend jusqu'à 1 million de jetons. Prendre en charge ce contexte massif nécessite un cache KV qui consomme environ 890 octets par jeton, soit environ un quart de ce que requérait le modèle précédent V4-Flash.
Cette réduction du cache est plus importante qu'elle n'y paraît. Le cache KV est le goulot d'étranglement mémoire qui détermine le nombre d'utilisateurs simultanés qu'un modèle peut servir et la durée de leurs conversations. Le réduire de 75 % permet aux opérateurs de servir environ quatre fois plus d'utilisateurs sur le même matériel, ou de gérer des contextes quatre fois plus longs sans mettre à niveau leurs clusters GPU.
Sur les benchmarks, DeepSeek affirme que V4.1-Flash surpasse le modèle V4-Pro de l'entreprise et se compare directement à GPT-5.6 et Kimi K3. L'entreprise redirige déjà les requêtes du V4-Pro vers le nouveau modèle, avec une nouvelle tarification en vigueur le 14 septembre.
Poids ouverts, stratégie ouverte
DeepSeek a publié les poids du modèle sous licence MIT sur Hugging Face. Le nouveau modèle est accessible via l'API de DeepSeek sous le point d'extrémité « deepseek-flash ». La combinaison des poids ouverts et de l'accès à l'API crée une voie d'adoption en deux volets : les développeurs qui souhaitent exécuter l'inférence sur leur propre infrastructure peuvent télécharger et déployer localement, tandis que ceux qui préfèrent les services gérés peuvent appeler l'API aux nouveaux tarifs de DeepSeek.
Implications de l'IPO et positionnement concurrentiel
La date de lancement de V4.1-Flash n'est pas accidentelle. On s'attend à ce que DeepSeek soit coté sur le marché STAR de Shanghai, et démontrer une dynamique technique continue est le genre de chose qui rend les présentations de roadshow plus convaincantes.
La compréhension multimodale intégrée à V4.1-Flash, couvrant à la fois les données visuelles et textuelles, réduit les opportunités de différenciation pour les concurrents, notamment OpenAI et Moonshot AI, qui développe Kimi K3.
