DeepSeek lance son dernier modèle V4-Flash, avec un coût par tâche d'environ 3 cents, le plus bas parmi les grands modèles主流. Le prix de V4-Flash est fixé à 0,14 dollar par million de tokens d'entrée et 0,28 dollar par million de tokens de sortie ; le coût global est bien inférieur à celui des concurrents, soit environ 1/105 du coût de Claude Fable 5 d'Anthropic. DeepSeek prépare son IPO, et son revenu annuel récurrent provenant de ses services API cloud atteint déjà 4 à 5 milliards de dollars, avec une marge brute supérieure à 50 %. La concurrence dans le secteur de l'IA évolue désormais de la performance des modèles vers la compétition sur les coûts d'inférence et l'efficacité commerciale, ce qui devrait entraîner une réduction d'un ordre de grandeur du coût marginal pour les entreprises déployant des applications d'IA.Auteur et source de l'article : Wall Street Journal
DeepSeek lance son dernier modèle V4-Flash, ramenant à nouveau la compétition sur les coûts des modèles d'IA au premier plan.
Selon les dernières estimations de l'institut de recherche Artificial Analysis, le coût moyen par tâche accomplie par V4-Flash n'est que d'environ 3 cents de dollar américain, le plus bas parmi les grands modèles dominants mondiaux actuels, soit environ 1/105 du coût de Claude Fable 5 d'Anthropic. Cela signifie que, pour de nombreuses tâches générales, le coût marginal du déploiement d'applications IA par les entreprises pourrait encore diminuer, ravivant à nouveau le débat sur le rendement des énormes investissements en capital dans l'IA.
Il est à noter que le lancement de V4-Flash intervient alors que DeepSeek accélère son processus de commercialisation. Selon des sources informées, DeepSeek préparerait un potentiel IPO. Son revenu récurrent annuel (ARR) généré par les services cloud d’API de modèles d’IA atteint déjà 400 à 500 millions de dollars, avec une marge brute supérieure à 50 %.
V4-Flash, lancé lors de cette mise à jour, poursuit la stratégie éprouvée de l'entreprise en matière de coûts réduits et d'efficacité accrue, renforçant ainsi sa stratégie de compétitivité fondée sur le prix et l'efficacité.
V4-Flash : le coût par tâche est de seulement 3 cents, offrant le meilleur rapport qualité-prix parmi les modèles principaux mondiaux
Selon les données d'Artificial Analysis, le prix de V4-Flash est de 0,14 $ par million de tokens d'entrée et de 0,28 $ par million de tokens de sortie.
Cependant, l'institution souligne que le « coût par tâche accomplie (Cost per Task) » reflète mieux le coût réel d'utilisation du modèle que le prix affiché seul. Ce indicateur prend en compte le total des jetons d'entrée et de sortie consommés par le modèle pour accomplir une même tâche, ce qui le rend plus pertinent.
Selon ce calcul, le coût moyen par tâche de V4-Flash est d'environ 3 cents de dollar américain, le plus bas parmi les modèles principaux mondiaux.
Pour comparaison, Moonshot AI's Kimi K3 coûte environ 0,86 dollar américain, OpenAI GPT-5.6 Sol environ 1,86 dollar américain, et Anthropic Claude Fable 5 environ 3,15 dollars américains. Le coût de V4-Flash représente seulement environ 1/105 de celui-ci.
Artificial Analysis souligne davantage que, même si le prix unitaire du token est faible, un modèle qui nécessite de générer plus de contenu ou de passer par plus d'étapes d'interaction lors de l'exécution d'une tâche peut finir par coûter plus cher qu'un modèle plus onéreux mais plus efficace. Ainsi, le « coût par tâche accomplie » reflète mieux que tout indicateur de prix unique le rapport qualité-prix du modèle.
Sortie à bas prix : la concurrence dans l'IA passe de la course aux performances à la course à la rentabilité
Contrairement au classement des performances, l'avantage coût de V4-Flash attire davantage l'attention du marché.
Au cours de la dernière année, le centre de la concurrence dans l'industrie de l'IA a progressivement évolué de la capacité des modèles vers le coût d'inférence et l'efficacité de la commercialisation. À mesure que l'échelle des applications IA des entreprises continue de s'étendre, le coût d'exécution des modèles devient un facteur crucial dans les décisions d'achat.
Lorsqu’un modèle peut accomplir une tâche pour environ 3 cents américains, tandis que certains modèles haut de gamme coûtent plusieurs dollars, les entreprises peuvent voir leur coût total d’utilisation diminuer d’un ordre de grandeur lors du déploiement dans des scénarios fréquents tels que le service client, l’automatisation bureautique et l’assistance au codage.
Cela soulève à nouveau la question qui intéresse Wall Street : les investissements massifs en IA pourront-ils enfin générer un retour commercial suffisant ?
Au début de 2025, après le lancement du modèle R1 par DeepSeek, le marché a réévalué la nécessité d'investir dans les infrastructures mondiales d'IA, provoquant de fortes fluctuations des actions technologiques. Aujourd'hui, V4-Flash met à nouveau le coût d'exécution extrêmement faible au cœur de son argumentaire, ce qui signifie que la concurrence dans l'IA évolue davantage de « qui a le modèle le plus puissant » vers « qui peut offrir des capacités suffisamment bonnes à moindre coût ». La discussion sur le retour sur investissement dans l'IA risque de s'intensifier à nouveau.
