DeepSeek lance le modèle V4.1-Flash avec 552 milliards de paramètres et une fenêtre de contexte de 1 million de jetons

iconCryptoBriefing
Partager
AI summary iconRésumé
DeepSeek a lancé un nouveau token le 10 septembre avec le modèle V4.1-Flash, doté de 552 milliards de paramètres et d'une fenêtre de contexte de 1 million de jetons. Le modèle utilise une architecture MoE, activant 8 milliards de paramètres pour l'entrée et 16 milliards pour la sortie. Il intègre une conception asymétrique Causal Encoder-Decoder et réduit l'utilisation du cache KV de 75 %. Ce modèle surpasse DeepSeek V4-Pro et est désormais accessible via une API avec une tarification mise à jour à partir du 14 septembre. Les poids sont open-source sur Hugging Face sous licence MIT, offrant de nouvelles informations sur le lancement de jetons aux développeurs et aux traders.

DeepSeek vient de lancer un modèle capable de traiter un million de jetons de contexte tout en activant moins de paramètres que certains modèles open source publiés il y a deux ans. Le V4.1-Flash, lancé le 10 septembre, représente la dernière tentative de cette startup chinoise d’IA de réécrire l’économie des grands modèles de langage.

Le modèle intègre 552 milliards de paramètres dans une architecture Mixture-of-Experts (MoE), mais n'active que environ 8 milliards pour les tâches d'entrée et 16 milliards pour les sorties. Le résultat est un modèle dont les performances dépassent largement ce que laissait prévoir son empreinte de calcul active.

L'architecture qui permet son fonctionnement

V4.1-Flash introduit ce que DeepSeek appelle une architecture asymétrique Encodeur-Décodeur causal, traitant les entrées et générant les sorties via des chemins distincts optimisés pour chaque tâche, plutôt que de passer tout par un seul pipeline.

Publicité

La fenêtre de contexte s'étend jusqu'à 1 million de jetons. Prendre en charge ce contexte massif nécessite un cache KV qui consomme environ 890 octets par jeton, soit environ un quart de ce que requérait le modèle précédent V4-Flash.

Cette réduction du cache est plus importante qu'elle n'y paraît. Le cache KV est le goulot d'étranglement mémoire qui détermine le nombre d'utilisateurs simultanés qu'un modèle peut servir et la durée de leurs conversations. Le réduire de 75 % permet aux opérateurs de servir environ quatre fois plus d'utilisateurs sur le même matériel, ou de gérer des contextes quatre fois plus longs sans mettre à niveau leurs clusters GPU.

Sur les benchmarks, DeepSeek affirme que V4.1-Flash surpasse le modèle V4-Pro de l'entreprise et se compare directement à GPT-5.6 et Kimi K3. L'entreprise redirige déjà les requêtes du V4-Pro vers le nouveau modèle, avec une nouvelle tarification en vigueur le 14 septembre.

Poids ouverts, stratégie ouverte

DeepSeek a publié les poids du modèle sous licence MIT sur Hugging Face. Le nouveau modèle est accessible via l'API de DeepSeek sous le point d'extrémité « deepseek-flash ». La combinaison des poids ouverts et de l'accès à l'API crée une voie d'adoption en deux volets : les développeurs qui souhaitent exécuter l'inférence sur leur propre infrastructure peuvent télécharger et déployer localement, tandis que ceux qui préfèrent les services gérés peuvent appeler l'API aux nouveaux tarifs de DeepSeek.

Implications de l'IPO et positionnement concurrentiel

La date de lancement de V4.1-Flash n'est pas accidentelle. On s'attend à ce que DeepSeek soit coté sur le marché STAR de Shanghai, et démontrer une dynamique technique continue est le genre de chose qui rend les présentations de roadshow plus convaincantes.

La compréhension multimodale intégrée à V4.1-Flash, couvrant à la fois les données visuelles et textuelles, réduit les opportunités de différenciation pour les concurrents, notamment OpenAI et Moonshot AI, qui développe Kimi K3.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.