DeepSeek a publié V4-Pro-0813 le 13 août 2026 et, dans la même annonce, révisé les tarifs de son API à partir du 16 août à 16 h UTC. La sortie de V4-Pro passe de 0,87 dollar le million de jetons à 1,98 en heures creuses et 3,96 en heures pleines, et les jetons servis depuis le cache grimpent jusqu'à 1 100 pour cent. Les heures pleines vont de 01h00 à 04h00 et de 06h00 à 10h00 UTC, ce qui laisse 17 heures sur 24 au tarif bas. L'entreprise dit vouloir allouer ses ressources plus raisonnablement. Si votre modèle de coût reposait sur un cache quasi gratuit, il est temps de le rouvrir.
The short answer
DeepSeek a publié V4-Pro-0813 le 13 août 2026 et révisé les tarifs de son API à compter du 16 août à 16 h UTC. La sortie de V4-Pro passe de 0,87 dollar le million de jetons à 1,98 en heures creuses et 3,96 en heures pleines, l'entrée hors cache de 0,435 à 0,66 et 1,32, et le cache de 0,003625 à 0,022 et 0,044. Les heures pleines vont de 01h00 à 04h00 et de 06h00 à 10h00 UTC. L'entreprise dit vouloir allouer ses ressources plus raisonnablement. Harness v0.1 sort en parallèle sous licence MIT.
La plupart des annonces de modèles cette année allaient dans le même sens : des jetons moins chers, des niveaux moins chers, tout moins cher. Celle-ci va dans l'autre sens, et la raison invoquée mérite une lecture attentive.
Ce qui a été annoncé
Le 13 août 2026, DeepSeek a publié V4-Pro-0813, une mise à jour de son modèle phare, ainsi qu'une nouvelle grille tarifaire applicable le 16 août à 16 h UTC.
Côté modèle, c'est une progression classique. Terminal Bench 2.1 passe de 72,1 à 87,9. DeepSWE passe de 12,8 à 62,7, ce qui tient moins du gain que de l'apparition d'une capacité. Sur l'Intelligence Index d'Artificial Analysis, le modèle passe de 45 à 53, nettement derrière Claude Opus 5 à 63 mais bien remonté dans le classement. DeepSeek a également publié Harness v0.1, une architecture modulaire à greffons pour agents autonomes, en avant-première développeur sous licence MIT.
C'est du côté du prix que se trouve l'information.
La nouvelle facture
L'ancienne structure était un tarif unique. La nouvelle est une horloge.
Les heures pleines vont de 01h00 à 04h00 et de 06h00 à 10h00 UTC. Les heures creuses couvrent le reste, à exactement la moitié du tarif plein, ce qui laisse 17 heures sur 24 au chiffre bas. Sur V4-Pro, l'entrée hors cache passe de 0,435 dollar le million de jetons à 0,66 en creux et 1,32 en plein. La sortie passe de 0,87 à 1,98 et 3,96. V4-Flash suit le même schéma, l'entrée passant de 0,14 à une fourchette de 0,22 à 0,44, la sortie de 0,28 à 0,66 puis 1,32.
La ligne que personne ne met en titre est celle du cache. Sur V4-Pro, elle passe de 0,003625 dollar le million de jetons à 0,022 en heures creuses et 0,044 en heures pleines. Les montants absolus restent minuscules, mais c'est de là que vient le chiffre de 1 100 pour cent repris dans la presse, et c'est la ligne la plus susceptible de surprendre une vraie facture. Le cache de prompt est ce sur quoi reposent les usages intensifs : un long prompt système, un document récupéré, un historique de conversation, renvoyés à chaque tour et facturés jusqu'ici près de zéro. L'écart entre entrée en cache et entrée hors cache vient de se resserrer fortement.
La raison affichée, et celle qui est dessous
DeepSeek explique vouloir allouer ses ressources plus raisonnablement et amener ses clients à planifier leurs traitements selon leur besoin réel. Regardez le mécanisme plutôt que la formulation et les deux concordent. Une entreprise qui court après la marge augmente le tarif unique. Une entreprise à court de capacité de service construit une horloge heures pleines et heures creuses, parce qu'une horloge est un instrument de déplacement de charge et que la moitié du prix suffit à faire bouger les traitements par lots.
Les analystes cités au moment de l'annonce l'ont dit sans diplomatie : la demande a monté, l'offre non, donc le prix monte. La presse note aussi une levée de fonds en cours et une préparation d'introduction en bourse, ce qui relève du contexte plus que de la cause.
Ce qui rend l'épisode notable, c'est la direction par rapport au reste du marché. La même semaine a vu un modèle de milieu de gamme Google lancé à la moitié de son propre tarif catalogue et un niveau de service OpenAI qui se bat sur le débit brut. L'inférence bon marché est traitée depuis deux ans comme une tendance permanente à sens unique. C'est une courbe d'offre, et une courbe d'offre se déplace dans les deux sens.
Ce que nous ferions cette semaine
Rouvrez le modèle de coût, en commençant par la ligne du cache. Si votre estimation par requête supposait une entrée en cache quasi gratuite, elle coûte désormais six à douze fois plus selon l'heure, et une charge qui renvoie un prompt système de 40 000 jetons à chaque tour va le sentir. Recalculez au tarif heures pleines, puisque c'est le pire cas que vous paierez réellement.
Regardez ensuite ce qui peut se déplacer. Les heures creuses couvrent 17 heures sur 24 et les deux blocs pleins tombent entre 01h00 et 10h00 UTC : réindexation nocturne, campagnes d'évaluation, reprises d'historique et classification en masse se replanifient généralement sans que personne ne s'en aperçoive. C'est cinquante pour cent d'économie pour le prix d'une modification de cron. Le trafic interactif n'est pas candidat, puisque vous ne choisissez pas l'heure d'arrivée d'un utilisateur.
Enfin, traitez le niveau tarifaire comme de la configuration et instrumentez l'heure. Si votre facturation dépend maintenant de l'horloge, vos tableaux de bord de coût doivent le savoir aussi, sans quoi la première facture surprenante prendra une journée à expliquer.
Sources et pour aller plus loin
- Deepseek ships improved V4 Pro, open-sources its agent software, and raises API prices, The Decoder, 13 août 2026
- DeepSeek raises some V4 prices by more than 10x as AI demand strains capacity, InfoWorld, août 2026
- DeepSeek Launches V4-Pro and Raises API Prices by as Much as 1,100%, Caixin Global, 14 août 2026
- DeepSeek raising API prices by up to 1,100% starting Aug. 16, Quartz, 13 août 2026
- DeepSeek's AI models are about to cost four times more, Engadget, août 2026
- Tarifs de l'API DeepSeek, documentation officielle
Questions fréquentes
Qu est-ce qui change exactement, et quand ?
Les nouveaux tarifs prennent effet le 16 août 2026 à 16 h UTC et introduisent une horloge à deux niveaux. Les heures pleines vont de 01h00 à 04h00 et de 06h00 à 10h00 UTC, les heures creuses couvrent le reste, et le tarif creux vaut exactement la moitié du tarif plein. Sur V4-Pro, l'entrée hors cache passe de 0,435 dollar le million de jetons à 0,66 en creux et 1,32 en plein. La sortie passe de 0,87 à 1,98 et 3,96. V4-Flash suit la même logique, l'entrée passant de 0,14 à une fourchette de 0,22 à 0,44 et la sortie de 0,28 à 0,66 puis 1,32.
D où vient le chiffre de 1 100 pour cent ?
Du prix des jetons servis depuis le cache, la ligne que presque personne ne regarde. Sur V4-Pro, un jeton d'entrée en cache passe de 0,003625 dollar le million à 0,022 en heures creuses et 0,044 en heures pleines. En pourcentage, c'est le plus gros mouvement de l'annonce, et la fourchette rapportée sur l'ensemble des modèles et des niveaux va d'environ 52 pour cent à 1 100 pour cent. Cela compte plus qu'il n'y paraît, car le cache de prompt est justement ce sur quoi s'appuient les gros usages : un long prompt système ou un document récupéré, renvoyé à chaque tour, facturé jusqu'ici presque rien.
Pourquoi augmenter quand tout le monde baisse ?
La raison avancée par DeepSeek est d'allouer ses ressources plus raisonnablement et d'inciter les clients à planifier leurs traitements selon leur besoin réel, ce qui est un argument de capacité et non de marge. La forme du changement va dans ce sens : une entreprise qui court après le chiffre d'affaires augmente le tarif unique, une entreprise à court de capacité de service construit une horloge heures pleines et heures creuses pour déplacer la charge. Les analystes cités autour de l'annonce l'ont dit plus crûment : la demande a monté, l'offre non, donc le prix monte. La presse note aussi une levée de fonds et une préparation d'introduction en bourse.
Faut-il déplacer nos traitements par lots en heures creuses ?
Si le travail est réellement asynchrone, oui, car l'économie est exactement de moitié et la fenêtre pleine est étroite. Sept heures sur vingt-quatre seulement sont en tarif plein, et les deux blocs tiennent entre 01h00 et 10h00 UTC, soit la matinée européenne et l'après-midi asiatique. Une réindexation nocturne, une campagne d'évaluation, une reprise d'historique ou une classification en masse peuvent être replanifiées sans que personne ne le remarque. Le trafic interactif est un autre sujet, puisque vous ne choisissez pas l'heure d'arrivée d'un utilisateur, et faire patienter une personne pour économiser deux dollars le million de jetons est rarement un bon arbitrage.
Quoi d autre est sorti avec le modèle ?
Deux choses à retenir. V4-Pro-0813 affiche des progrès nets : Terminal Bench 2.1 passe de 72,1 à 87,9 et DeepSWE de 12,8 à 62,7, tandis que l'Intelligence Index d'Artificial Analysis passe de 45 à 53, encore derrière Claude Opus 5 à 63. Séparément, DeepSeek a publié Harness v0.1 en avant-première développeur sous licence MIT, une architecture modulaire à greffons pour exécuter des agents autonomes. La licence est le point intéressant, car MIT signifie que cet échafaudage d'agents est réellement réutilisable en dehors de l'API DeepSeek.