Mardi soir, DeepSeek La plateforme ouverte publie un avis annonçant un nouvel ajustement des prix de l'API pour les grands modèles, avec cette fois-ci une baisse bienvenue.

Prix en heures creuses : entrée (cache hit) 0,02 yuan, entrée (cache miss) 1 yuan, sortie 4 yuan (unités : yuan / million de tokens). Les prix en heures de pointe restent deux fois plus élevés qu'en heures creuses : 0,04 yuan pour le cache hit, 2 yuan pour le cache miss et 8 yuan pour la sortie.

Cet ajustement concerne uniquement la série V4-Flash ; les prix de la série V4-Pro, plus haut de gamme, restent inchangés. Les nouveaux prix entreront en vigueur le 10 septembre à 12:00 (heure de Pékin).
L'officiel précise également que les heures de pointe sont de 9:00 à 12:00 et de 14:00 à 18:00, heure de Pékin, du lundi au vendredi, le reste du temps étant considéré comme hors pointe.
Précédemment, DeepSeek La hausse a suscité un large débat. L'explication officielle donnée est de mieux répartir les ressources et d'encourager les utilisateurs à ajuster les horaires d'exécution des tâches. À l'extérieur, on pense généralement que DeepSeek V4 Flash 0731 offre un excellent rapport qualité-prix, attirant un grand nombre d'appels provenant d'utilisateurs du monde entier, ainsi que DeepSeek Insuffisance de puissance de calcul.
En comparaison verticale, avant la hausse des prix au 17 août à minuit, Flash était facturé à un tarif uniforme de 0,02 yuan (cache hit) / 1 yuan (cache miss) / 2 yuan (output). Voici les nouveaux prix :

Autrement dit, les deux prix du côté entrée sont revenus à leur niveau avant l'augmentation, tandis que la sortie reste deux fois supérieure à ce niveau. Si l'on calcule l'écart en se basant sur les pics : le nouveau prix maximal est de 0,04 / 2 / 8 yuans, contre 0,02 / 1 / 2 yuans avant l'augmentation, soit respectivement 2 fois, 2 fois et 4 fois plus élevé.
Ainsi, la capacité des utilisateurs à retrouver réellement l’état où ils pouvaient « utiliser sans restriction » dépend de trois variables propres à leur application : le taux de命中 du cache, le ratio entrée/sortie et le degré de possibilité de décalage des tâches. Pour les scénarios présentant un taux de命中 du cache élevé, tels que les longs contextes, les instructions système fixes et les appels en boucle d’Agent, la réduction sera nette ; en revanche, pour les scénarios axés principalement sur la génération de sortie, l’impact sera limité. Il est bien connu que DeepSeek Le taux de命中 du cache de l'API est relativement élevé, donc les retours actuels sont plutôt optimistes.
Cette réduction n'est pas un événement isolé, hier après-midi, DeepSeek Annonce dans le groupe de discussion officiel : le test interne de la version intermédiaire V4.1 Flash est ouvert : le nom du modèle est deepseek-v4.1-flash-expires-on-0910, l'URL de base reste inchangée, avec un limite de 20 requêtes simultanées par compte, et la facturation reste identique à celle de V4 Flash.
Outre la multimodalité native et la vitesse d'inférence extrêmement rapide, l'entreprise officielle indique que les coûts ont été réduits grâce à une mise à niveau de l'architecture. Il est donc évident que les optimisations techniques et ingénieries propres au grand modèle DeepSeek Nous avons constamment cherché à améliorer le problème des coûts d'inférence.
Le nom du modèle "expires-on-0910" indique que le nouveau modèle expirera et sera désactivé automatiquement le 10 septembre — le même jour que l'entrée en vigueur de la réduction de prix.
Ce mois-ci, les entreprises de pointe en IA ont mis à jour leurs grands modèles, DeepSeek Si la version stable V4.1 apporte une amélioration significative des performances, associée à cette réduction de prix, cela pourrait déclencher une nouvelle vague importante.
Cet article provient du compte WeChat « Machine Heart » (ID : almosthuman2014), auteur : Machine Heart dédiée aux grands modèles, édité par l'équipe éditoriale de Machine Heart
