Retour au blog
17 août 2026Sergei Solod13 min de lecture

DeepSeek a augmenté ses prix — j’ai trouvé le même V4 Flash moins cher que l’ancien tarif

Le 17 août, mes dépenses sur l’API DeepSeek ont soudainement atteint environ cinq fois leur niveau habituel. J’ai ensuite trouvé et testé un autre fournisseur proposant le même checkpoint DeepSeek-V4-Flash-0731 à des prix environ 45% inférieurs aux anciens tarifs de DeepSeek.

DeepSeekRunwareAPI LLMInfrastructure IAModèles open-weight

Le matin du 17 août, j’ai ouvert mes statistiques d’utilisation de l’API et j’ai d’abord pensé que j’avais fait une erreur quelque part.

DeepSeek consommait mon budget environ cinq fois plus vite que d’habitude.

Je savais qu’un changement de prix arrivait. DeepSeek l’avait annoncé quelques jours auparavant, mais je l’avais classé mentalement comme une hausse ordinaire : 20%, 50%, peut-être le double.

Pas à ce niveau.

Ce n’était pas un bug de facturation. Les nouveaux tarifs étaient bien entrés en vigueur. DeepSeek a officiellement basculé V4 Flash et V4 Pro vers un système de prix peak/off-peak à partir du 16 août à 16:00 UTC, soit déjà le 17 août en Chine. Reuters avait indiqué avant la modification que les hausses, selon le modèle, le type de token et l’heure, iraient de 50% à 1,100%. Le calendrier figure dans le journal des changements de l’API DeepSeek.

C’est à ce moment qu’une autre nouvelle sur DeepSeek est devenue soudainement beaucoup plus intéressante : les poids du modèle sont publics. Si d’autres entreprises peuvent exécuter le même modèle elles-mêmes, pourquoi devrais-je obligatoirement acheter l’inférence directement à DeepSeek ?

Combien coûtait DeepSeek avant, et combien coûte-t-il maintenant ?

Avant le changement de tarif, DeepSeek V4 Flash coûtait :

DeepSeek V4 FlashAncien prix par 1M de tokens
Input, cache miss$0.14
Cached input$0.0028
Output$0.28

Ces chiffres sont encore visibles sur une ancienne page tarifaire de DeepSeek, et Reuters citait également les mêmes prix le 3 août.

Le deepseek-v4-flash officiel, correspondant à DeepSeek-V4-Flash-0731, coûte désormais :

Off-peakPeak
Input, cache miss$0.22$0.44
Cached input$0.007$0.014
Output$0.66$1.32

Les périodes peak vont de 01:00 à 04:00 UTC et de 06:00 à 10:00 UTC selon la page tarifaire actuelle de DeepSeek.

Mon observation d’une facture environ cinq fois plus élevée ne signifie donc pas que chaque catégorie de tokens a été multipliée exactement par cinq. Par rapport aux anciens prix :

  • l’input en cache miss pendant les périodes peak est passé de $0.14 à $0.44, soit 3.14× ;
  • l’output est passé de $0.28 à $1.32, soit 4.71× ;
  • le cache hit est passé de $0.0028 à $0.014, soit exactement .

Pour un workload qui génère beaucoup d’output, une hausse réelle proche de cinq fois est donc tout à fait plausible.

J’ai d’abord cherché un autre vendeur du même modèle

J’aurais pu abandonner DeepSeek. Le marché des LLM est vaste : Qwen, GLM, Kimi, MiniMax, Mistral et beaucoup d’autres.

Mais changer de modèle ajoute une variable. Il faut revalider les réponses, la compatibilité des prompts, la longueur des générations, le comportement sur les longs contextes, les paramètres de sampling et le reste.

Je voulais commencer par une option plus simple.

Puis-je garder DeepSeek V4 Flash tout en cessant d’acheter son inference à DeepSeek ?

Il faut ici être précis sur les termes. DeepSeek n’a pas simplement publié le « code source du réseau neuronal » comme on publierait le code source d’une application. Il est plus exact de dire que DeepSeek a publié les poids du modèle et les éléments nécessaires pour les exécuter.

Le dépôt officiel deepseek-ai/DeepSeek-V4-Flash-0731 est accessible publiquement sur Hugging Face. Le dépôt et les poids sont sous licence MIT, et DeepSeek fournit même un exemple d’exécution via vLLM sur un nœud équipé de quatre GB300.

Cela change complètement l’économie du service. Un fournisseur tiers n’est pas obligé d’acheter des tokens à DeepSeek pour les revendre avec une marge. Il peut exécuter les poids ouverts sur sa propre infrastructure et vendre du calcul effectué sur son propre matériel.

Bien sûr, dire « lancez simplement DeepSeek en local » rend la tâche trompeusement simple. Le dépôt 0731 fait environ 167 GB et l’exemple officiel de deployment utilise quatre GB300. Ce n’est pas un docker compose up sur un VPS à $20. Les fichiers sont visibles sur la page des fichiers du modèle.

Pour une société d’inférence disposant d’un cluster GPU, le problème est différent. La licence cesse d’être l’obstacle principal. Restent le matériel, l’électricité, le taux d’utilisation des GPU, le batching, le software stack et l’efficacité de l’inférence.

J’ai trouvé Runware

Après une recherche assez longue, Runware s’est imposé comme l’une des options les plus intéressantes.

Comment ai-je trouvé Runware ? Avec ma méthode de recherche préférée. J’ai d’abord demandé à une IA de rédiger un prompt détaillé pour rechercher le fournisseur d’inférence le moins cher mais néanmoins crédible pour ce modèle précis. J’ai ensuite lancé environ 15 à 20 recherches séparées avec ce prompt, rassemblé tous les résultats, tout placé dans un dernier chat et demandé une comparaison des candidats afin de faire ressortir le meilleur. Ce n’est qu’après cela que j’ai vérifié le gagnant manuellement : page du modèle, tarifs, documentation et API.

L’IA m’a aidé à élargir la recherche, mais elle n’a pas pris la décision finale à ma place. Runware a passé ma vérification manuelle, je l’ai connecté moi-même, et la recommandation de cet article repose sur ce test personnel.

Le service propose actuellement le checkpoint exact DeepSeek-V4-Flash-0731 avec un contexte de 1M, et non un modèle anonyme simplement présenté comme « compatible avec DeepSeek ». Sa page modèle affiche :

RunwarePrix par 1M de tokens
Input$0.076
Cached input$0.014
Output$0.153

J’ai d’abord cru avoir mal lu la virgule décimale.

Mais la comparaison la plus utile n’est pas avec les nouveaux prix élevés de DeepSeek. Elle est avec les anciens prix, qui semblaient déjà très bas.

L’ancien input de DeepSeek coûtait $0.14. Chez Runware, il coûte $0.076. Runware est donc environ 45.7% moins cher, et l’ancien tarif DeepSeek était environ 1.84× plus élevé.

L’ancien output coûtait $0.28. Runware facture $0.153. Runware est environ 45.4% moins cher, et l’ancien DeepSeek était environ 1.83× plus cher.

Après une forte hausse des prix, j’ai trouvé une API tierce qui sert le même checkpoint V4 Flash 0731 et qui n’est pas seulement moins chère que le nouveau DeepSeek : elle coûte presque deux fois moins que l’ancien DeepSeek bon marché.

Face aux tarifs officiels actuels, l’écart est encore plus marqué. En off-peak, Runware est environ 2.9× moins cher pour l’input en cache miss et 4.3× moins cher pour l’output. En peak, les écarts sont d’environ 5.8× et 8.6×.

Il existe toutefois une exception importante : les cache hits peu coûteux. DeepSeek facture actuellement $0.007/M pour le cached input en off-peak, contre $0.014/M chez Runware. Un workload dominé par les cache hits ne peut donc pas être comparé uniquement à partir des prix standard input/output.

Un prix bas ne sert à rien si l’API ne fonctionne pas

Une grille tarifaire ne me suffit pas. Une LLM API à $0.000001 par requête est inutile si la moitié des requêtes échoue.

J’ai donc branché Runware et commencé à envoyer de vraies requêtes.

J’ai conservé deux captures du usage dashboard. La première affichait :

790 requests
56 success
734 errors

Pris seul, ce résultat est catastrophique. Plus tard, le dashboard affichait :

1,570 requests
836 success
734 errors

Entre les deux mesures, les compteurs ont donc évolué exactement de :

+780 requests
+780 successful
+0 new errors

Je n’utilise pas ce test comme preuve d’un uptime de 99.999%. Ces données ne démontrent rien de tel, et ces deux captures ne permettent pas non plus de déterminer la cause des 734 premières erreurs.

Ce que je peux affirmer est plus limité : sur les 780 requêtes suivantes, le compteur des succès a augmenté de 780 tandis que celui des erreurs n’a pas bougé.

L’API était également rapide pendant cette fenêtre de test. Dans la partie visible du journal, la plupart des appels réussis se terminaient en une fraction de seconde à environ 1.5 seconde. Le coût de petites requêtes visibles était souvent d’environ $0.000005–$0.000018. Après des centaines d’appels réussis, le dashboard n’affichait toujours qu’environ un centime de dépense totale.

À partir de là, Runware n’était plus pour moi une simple ligne dans un tableau comparatif. J’avais réellement connecté l’API, elle produisait des réponses, et mon trafic de test coûtait presque rien.

Ce n’est pas une publicité — et je ne teste Runware que depuis un jour

Je préfère le préciser clairement, car un passage positif consacré à un seul fournisseur peut facilement ressembler à du contenu sponsorisé. Ce n’est pas le cas. Runware ne m’a pas contacté et je n’ai pas contacté Runware. Personne chez eux ne m’a demandé d’écrire cet article.

Je n’utilise par ailleurs le service que depuis un jour. Dans une semaine ou un mois, je pourrai parfaitement partir si des problèmes apparaissent sur la fiabilité, la qualité des réponses, les prix ou autre chose. Ce n’est pas un verdict à long terme.

J’ai quitté immédiatement l’API officielle de DeepSeek devenue chère, parce que je ne voulais pas continuer à brûler du budget aux nouveaux tarifs pendant que j’évaluais des alternatives. J’ai donc déplacé le trafic et commencé à tester Runware tout de suite.

Pour l’instant, je suis très satisfait de ce choix. Au moment où je terminais cet article, Runware avait déjà traité 1 000 requêtes d’IA avec succès pour moi. Cela ne prouve toujours ni l’uptime futur ni les performances à n’importe quelle échelle, mais cela suffit pour dire qu’il ne s’agit pas d’un fournisseur repéré uniquement sur une grille tarifaire : je l’utilise réellement.

Ma recommandation reste donc volontairement limitée : j’ai vérifié Runware moi-même, il fonctionne bien pour moi aujourd’hui et, à l’heure actuelle, je conseille de l’essayer. Si le service change, mon avis pourra changer aussi.

DeepSeek a peut-être créé son propre concurrent sur les prix

À partir d’ici, il s’agit de mon interprétation, pas d’un fait directement observé.

DeepSeek s’est placé dans une situation commerciale inhabituelle. L’entreprise a à la fois lancé un modèle très compétitif et donné au marché la possibilité de l’exécuter indépendamment.

Tant que l’API officielle de DeepSeek était extrêmement bon marché, cette tension était presque invisible. Pourquoi chercher le cluster GPU d’un tiers lorsque DeepSeek vendait elle-même l’inférence à $0.14/$0.28 ?

Après la hausse, le calcul change. Si l’API officielle monte à $0.44 pour l’input et $1.32 pour l’output en peak, tandis qu’un fournisseur indépendant propose le même checkpoint public à $0.076/$0.153, l’incitation économique à tester l’alternative devient très forte.

Ce n’est pas un loophole accidentel. La licence MIT des poids publiés autorise un usage très large, y compris commercial, et le dépôt officiel contient des instructions pour exécuter soi-même le modèle.

C’est pourquoi je ne décrirais pas Runware simplement comme un « revendeur de tokens DeepSeek ». Le schéma suivant est plus fidèle :

DeepSeek
    │
    ├── API officielle DeepSeek
    │
    └── poids ouverts de DeepSeek V4 Flash
                   │
                   ├── infrastructure Runware
                   ├── autres fournisseurs d’inférence
                   └── votre propre cluster GPU

Le même modèle n’est plus lié à un seul vendeur d’inférence.

Publier les poids était-il une erreur commerciale ?

Je ne le présenterais pas comme un fait.

Il serait trop simpliste de dire que DeepSeek a ouvert son modèle, que des concurrents peuvent désormais le vendre moins cher et que DeepSeek va donc forcément perdre de l’argent. Nous ne connaissons pas l’économie interne de l’entreprise.

Une stratégie open-weight peut offrir d’autres avantages :

  • une diffusion plus large du modèle ;
  • davantage d’intégrations ;
  • plus d’influence sur l’écosystème ;
  • la possibilité de devenir un standard de fait dans des produits tiers ;
  • plus de développeurs ;
  • une adoption en entreprise ;
  • une forte visibilité dans la recherche ;
  • une pression accrue sur les concurrents.

Reuters a également souligné l’importance accordée par les développeurs chinois aux approches open-weight pour obtenir une large adoption auprès des développeurs dans sa couverture du marché chinois de l’IA.

Il est donc trop tôt pour moi de qualifier la décision d’erreur commerciale. En revanche, je suis à l’aise avec une conclusion plus précise :

En ouvrant les poids, DeepSeek a volontairement renoncé à un monopole sur l’inférence de son propre modèle.

Lorsque l’API officielle devient beaucoup plus chère, les conséquences de ce choix deviennent plus visibles. DeepSeek ne concurrence alors plus seulement Qwen, OpenAI, Anthropic ou Moonshot. D’une certaine façon, l’entreprise concurrence aussi des sociétés qui vendent l’inférence de son propre modèle ouvert.

Pour les acheteurs d’API, c’est excellent. Pour la stratégie de monétisation, c’est nettement plus complexe.

Pourquoi je n’héberge pas DeepSeek moi-même

La question suivante est évidente : si des entreprises tierces peuvent faire tourner DeepSeek et vendre de l’inférence, pourquoi ne pas le faire moi-même ?

Parce qu’il existe un fossé énorme entre « le modèle est téléchargeable gratuitement » et « l’inférence est gratuite ».

Les poids se téléchargent. Pas les GPU.

Il faut acheter ou louer du matériel coûteux, disposer de suffisamment de VRAM, charger un checkpoint énorme, configurer l’inference engine, le batching, le KV cache, le monitoring, le scaling et la redondance, puis disposer d’assez de trafic pour éviter que les GPU restent inutilisés la plupart du temps.

L’exemple officiel de DeepSeek pour V4 Flash 0731 utilise un nœud avec quatre GB300.

Pour un fournisseur spécialisé, cet investissement peut avoir du sens puisque le coût de l’infrastructure est réparti entre de nombreux clients. Pour un développeur seul, payer $0.076 par million de tokens d’input peut être beaucoup plus rationnel que d’investir une somme importante dans des GPU puis d’essayer de maintenir leur taux d’utilisation.

Pour l’instant, je préfère acheter l’inférence. Mais je comprends beaucoup mieux ce que j’achète réellement.

La principale leçon que j’ai tirée de cette matinée

Au début de la journée, je considérais DeepSeek comme une API SaaS classique : il existe un modèle DeepSeek, donc DeepSeek décide combien coûte son utilisation.

Le soir, mon modèle mental avait changé : il existe un checkpoint DeepSeek et un marché concurrentiel d’entreprises prêtes à l’exécuter pour moi.

Ce sont deux marchés fondamentalement différents.

Avec un modèle fermé, le prix de l’API est largement contrôlé par le propriétaire du modèle. Avec des poids ouverts sous une licence permissive, le prix de l’inférence est aussi façonné par la concurrence entre fournisseurs d’infrastructure.

Le 17 août, cette différence est devenue très concrète pour moi. L’ancien DeepSeek V4 Flash coûtait $0.14 en input et $0.28 en output. Le nouveau tarif officiel atteint $0.44/$1.32 en peak. Runware propose actuellement DeepSeek-V4-Flash-0731 à $0.076/$0.153.

J’ai moi-même testé cette API, et elle a fonctionné pour le trafic que je lui ai envoyé.

Ces prix seront-ils identiques dans un mois ? Je ne le sais pas. Le même fournisseur supportera-t-il n’importe quelle échelle et n’importe quel profil de trafic ? Je ne l’ai pas démontré non plus.

Mais une chose a changé pour moi : après cette hausse, je ne considère plus automatiquement l’API officielle du créateur d’un modèle open-weight comme le meilleur endroit où acheter de l’inférence.

Mon premier réflexe est désormais de vérifier qui d’autre peut exécuter les mêmes poids et combien il facture pour cela.