Pourquoi DeepSeek a relevé les prix API jusqu'à 1 100 % après l'offensive open-weight chinoise

Du 12 au 17 août, développeurs et responsables achats ont vu trois mouvements contradictoires : DeepSeek a relevé les prix API jusqu'à 1 100 % sur certaines tranches, Alibaba a ouvert pour la première fois les poids d'un phare à 2,4 billions de paramètres, et Zhipu a livré GLM-5.3 avec environ 6x de gains sur les benchmarks de code, sur le même modèle de base. La conclusion : les laboratoires chinois passent de la seule guerre des prix à une guerre pour le pouvoir de tarifer. Cet article contient une chronologie, trois tableaux de données, une matrice de prix et un runbook de sélection en cinq étapes.

Visualisation abstraite d'une sphère de réseau neuronal et de lignes de connexion, évoquant les grands modèles de langage et les publications open-weight

Sommaire

Trois pièges que les développeurs rencontreront d'abord

  1. Le titre 1 100 % est exact mais incomplet. Les médias ont cité 11x, 1 100 % et 350 % comme s'ils décrivaient la même facture. Ce n'est pas le cas. Ces chiffres correspondent à des postes différents : entrée cache-hit, sortie et entrée cache-miss. Traiter le titre comme toute la facture surestime ou sous-estime le coût réel.
  2. L'API officielle n'est plus automatiquement le chemin le moins cher. Aux heures de pointe, l'API officielle DeepSeek cote désormais au-dessus de plusieurs revendeurs tiers (GMI Cloud, Novita et d'autres listent actuellement V4 Pro sous le nouveau tarif de pointe DeepSeek). Par défaut, le canal officiel n'est plus une hypothèse de coût sûre.
  3. Poids ouverts ne signifie plus Apache 2.0. Alibaba a publié un checkpoint 2.4T sous une licence personnalisée Qwen3.8-Max License : toute activité Model-as-a-Service ou AI Work Assistant gagnant plus de $50 million sur une période de 12 mois doit négocier une licence commerciale séparée ; les produits avec 100M+ utilisateurs actifs mensuels ou $20M+ de revenus mensuels doivent afficher le nom du modèle de façon proéminente. Les affirmations selon lesquelles la licence interdit les téléchargements depuis les États-Unis, l'UE, le Royaume-Uni et la Corée du Sud sont fausses. Le texte publié n'a aucune clause géographique.

Chronologie : ce qui s'est passé, et quand

DateÉvénement
16 juillet 2026Moonshot AI ouvre les poids de Kimi K3 (2.8T paramètres), attirant un examen de sécurité américain
2-3 août 2026Alibaba prévisualise puis lance Qwen3.8-Max en API hébergée
10 août 2026Meta publie Muse Glimmer (30B, Apache 2.0) et annonce des poids ouverts pour le phare Muse Spark 1.2
12 août 2026Alibaba publie les poids ouverts Qwen3.8-2.4T-A95B sur Hugging Face/ModelScope ; xAI livre Grok 4.6
13 août 2026DeepSeek-V4-Pro passe en GA et annonce une hausse au 17 août ; Google livre Gemini 3.7 Flash à prix réduit
14 août 2026Zhipu livre GLM-5.3 en réutilisant la base 743B de GLM-5.2
17 août 2026, 00:00 heure de PékinLa nouvelle tarification DeepSeek entre en vigueur

En reculant encore : le 30 juillet, OpenAI a baissé les prix de son palier le moins cher (GPT-5.6 Luna, moins 80 %), puis les 6-7 août a fait de Luna le défaut gratuit avec des chats texte illimités. Pendant que les laboratoires chinois relevaient les prix et ouvraient des poids phares, les laboratoires américains baissaient les prix et passaient au gratuit côté grand public, au même moment. Ce n'est pas une coïncidence ; ce sont deux faces de la même bataille tarifaire.

Les chiffres : ce qui a vraiment changé

Hausse DeepSeek, palier par palier (effective le 17 août, 00:00 heure de Pékin ; les heures de pointe sont 9-12 et 14-18 heure de Pékin)

Poste de facturation (par 1M tokens)Ancien prixNouveau creuxNouvelle pointeHausse de pointe
V4-Flash cache hit (entrée)¥0.02¥0.05¥0.10~400%
V4-Flash cache miss (entrée)¥1.0¥1.5¥3.0200%
V4-Flash sortie¥2.0¥4.5¥9.0350%
V4-Pro cache hit (entrée)¥0.025¥0.15¥0.30~1,100%
V4-Pro cache miss (entrée)¥3.0¥4.5¥9.0200%
V4-Pro sortie¥6.0¥13.5¥27.0350%
Le chiffre 1 100 % cité partout s'applique spécifiquement au tarif d'entrée cache-hit en heures de pointe, le palier qui partait le plus près de zéro. Les prix de sortie, qui pèsent davantage sur la plupart des factures réelles, ont augmenté de 350 %. Une modélisation de coûts indépendante a trouvé qu'une charge lourde réaliste (environ 84M tokens/mois, surtout en heures creuses, moitié cache hits) voit une hausse de facture plus proche de 1.8x.

Qwen3.8-2.4T-A95B (poids ouverts Qwen3.8-Max) : spécifications clés

SpécificationDétail
Paramètres2.4T au total, 95B actifs par token (MoE, 512 experts, 10 routés + 1 partagé)
Fenêtre de contexte262,144 tokens natifs (checkpoint ouvert), extensible à ~1.01M ; la version Max hébergée vaut 1M par défaut
Cadence de sortieAperçu 2 août → API en ligne 3 août → poids ouverts 12 août
Tarif API (international)$2/M entrée, $6/M sortie
LicencePas Apache 2.0 — une licence personnalisée Qwen3.8-Max License
Pourquoi ça comptePremière fois qu'Alibaba ouvre un phare de palier Max ; Qwen3.5/3.6/3.7 Max restaient API uniquement

GLM-5.3 vs GLM-5.2 : même modèle de base, post-training seulement

BenchmarkGLM-5.2GLM-5.3Écart
Terminal-Bench 3.04.6%28.3%+23.7 pts
DeepSWE v1.146.2%66.9%+20.7 pts
Agents' Last Exam (CLI)23.8%28.5%+4.7 pts
CyberGym77.2%84.5%+7.3 pts
AutomationBench26.2%48.2%+22.0 pts
Ce sont les chiffres déclarés par Zhipu — aucune reprise tierce indépendante n'a encore été publiée. GLM-5.3 reste derrière GPT-5.6 Sol (34.6%) et Claude Fable 5 (33.7%) sur Terminal-Bench 3.0 ; c'est un résultat open-weight de premier plan, pas une victoire frontier nette.

Découpage des trois stratégies

DeepSeek : du tarif unique au tarif selon l'heure — c'est un problème de capacité

La lecture la plus facile du geste DeepSeek est que le modèle chinois le moins cher a cédé à la pression sur les marges. En regardant la structure, cela ressemble davantage à une entreprise qui rend visibles, pour la première fois, ses contraintes de calcul dans la grille tarifaire. L'ancien tarif plat, toujours bas, fonctionnait comme outil d'acquisition tant que la capacité GPU suivait la demande. Une fois l'usage devenu exponentiel et la capacité non, quelque chose devait devenir explicite — et « encourager une planification plus flexible des charges » dans l'annonce officielle est du langage d'entreprise pour « notre calcul de pointe est désormais rare, veuillez décaler vous-même ».

Un détail que la couverture internationale a surtout manqué : aux heures de pointe, le prix de l'API officielle DeepSeek est désormais plus élevé que celui de plusieurs revendeurs tiers (GMI Cloud, Novita et d'autres listent actuellement V4 Pro sous le nouveau tarif de pointe DeepSeek). L'hypothèse selon laquelle l'API officielle est toujours le moyen le moins cher d'exécuter DeepSeek est brisée pour la première fois.

Alibaba : les poids ouverts achètent la bienveillance de l'écosystème ; une licence personnalisée protège le plafond de revenus

L'ouverture des poids de Qwen3.8-Max n'est pas un acte de générosité simple. Alibaba a fait deux choses en même temps : publier le checkpoint complet à 2.4T paramètres en téléchargement gratuit, et y attacher une licence personnalisée — pas l'Apache 2.0 permissif des plus petits Qwen — qui oblige toute activité Model-as-a-Service ou AI Work Assistant gagnant plus de $50 million sur une période de 12 mois à négocier une licence commerciale séparée, et oblige les produits avec 100M+ utilisateurs actifs mensuels ou $20M+ de revenus mensuels à afficher le nom du modèle de façon proéminente.

La logique : donner les poids pour gagner l'esprit des développeurs (surtout à l'international, où un modèle made-in-China hésite encore chez les acheteurs entreprise), tout en gardant un levier tarifaire sur la poignée d'entreprises capables de construire un métier d'inférence concurrent par-dessus. C'est un pari matériellement différent de Muse Glimmer de Meta, qui part sous Apache 2.0 sans restriction.

Une rumeur à tuer explicitement : des affirmations ont circulé en ligne selon lesquelles la licence d'Alibaba interdirait les téléchargements depuis les États-Unis, l'UE, le Royaume-Uni et la Corée du Sud. C'est faux. Le texte de licence publié ne contient aucune clause géographique ou territoriale.

GLM-5.3 : pas de nouveau modèle de base, seulement un plus gros pari post-training

Le fait le plus intéressant sur GLM-5.3 n'est pas le score, c'est la méthode : même base 743B paramètres que GLM-5.2, pas de réentraînement, et un saut d'environ 6x sur Terminal-Bench 3.0 (4.6% → 28.3%) uniquement en montant l'échelle des environnements d'apprentissage par renforcement en post-training. Cela confirme une tendance qui se construit depuis des mois dans l'industrie — alors que les scaling laws du préentraînement montrent des rendements décroissants, l'échelle RL du post-training devient un levier de performance indépendant, avec un plancher de coût bien plus bas que le réentraînement d'un nouveau modèle de fondation. C'est une barrière d'entrée nettement plus basse, et c'est pourquoi des laboratoires de milieu de tableau sans budgets de calcul à l'échelle OpenAI peuvent encore refermer l'écart sur les benchmarks agentiques et de code.

Face à face : DeepSeek est-il encore le phare le moins cher ?

ModèleEntrée (par 1M tokens)Sortie (par 1M tokens)Poids ouverts ?
DeepSeek V4-Pro (pointe)¥9.0 (~$1.26)¥27.0 (~$3.78)Non
DeepSeek V4-Pro (creux)¥4.5 (~$0.63)¥13.5 (~$1.89)Non
Qwen3.8-Max (API internationale)$2.00$6.00Oui (licence personnalisée)
OpenAI GPT-5.6 Luna$0.20$1.20Non
Claude Opus 5 (implicite, selon le ratio de comparaison d'Alibaba)~$5.00~$25.00Non
Conversion RMB-USD à environ ¥7.15/$1, approximative. Même après la hausse, le tarif creux de DeepSeek V4-Pro reste bien sous Claude Opus 5, mais ce n'est plus l'option la moins chère tout court — la tarification internationale de Qwen3.8-Max et Luna d'OpenAI passent désormais sous le tarif creux DeepSeek. « Modèle chinois = modèle le moins cher » valait pour l'essentiel de 2025 et début 2026 ; ce n'est plus une hypothèse sûre.

Ce qui est contesté ou non vérifié

Pourquoi ça compte : deux guerres des prix en parallèle

Sur à peu près le mois écoulé, les laboratoires chinois de tête ont enchaîné des sorties majeures à un rythme que la presse financière intérieure appelle « trois mises à jour de modèle par semaine » — DeepSeek, Alibaba et Zhipu, plus Kimi K3 de Moonshot (poids ouverts le 16 juillet, 2.8T paramètres) et MiniMax H3 avant eux. La couverture chinoise cadre largement cela comme des sorties open-weight chinoises qui forcent une retarification mondiale de l'industrie IA.

Pendant ce temps, les laboratoires américains jouent le contraire côté grand public : OpenAI a baissé de 80 % son palier le moins cher (30 juillet) puis a rendu ce modèle gratuit et illimité pour tous une semaine plus tard (6-7 août) ; Google a livré un modèle orienté code à la moitié du prix de son prédécesseur vieux de trois semaines (13 août). Donc pendant que les laboratoires chinois ouvrent des phares et introduisent une tarification étagée, plus haute, en haut de pile là où le calcul manque, les laboratoires américains courent vers le gratuit et le bon marché côté consommateur.

Il y a aussi une couche géopolitique à nommer avec soin. L'ouverture des poids de Kimi K3 de Moonshot en juillet avait déjà attiré un examen de sécurité américain ; le choix par Alibaba de cette fenêtre précise pour ouvrir un phare 2.4T a été lu par certains analystes comme un geste pour verrouiller l'esprit international et un récit de parité technologique avant un éventuel durcissement réglementaire. C'est une interprétation informée, pas un fait confirmé.

Faits techniques citables

Runbook de sélection en cinq étapes

Étape 1 Découper le trafic actuel selon les fenêtres de pointe de Pékin (9-12 et 14-18) et estimer la part de pointe Étape 2 Tarifer séparément l'entrée cache-hit, l'entrée cache-miss et la sortie ; ne pas appliquer 1,100% à toute la facture Étape 3 Comparer V4-Pro pointe ¥9/¥27 et creux ¥4.5/¥13.5 avec Qwen3.8-Max international $2/$6, Luna $0.20/$1.20 et Claude Opus 5 à environ $5/$25 Étape 4 Avant de télécharger Qwen3.8-2.4T-A95B, vérifier le seuil MaaS / AI Work Assistant $50M de revenus glissants et le déclencheur d'affichage 100M MAU / $20M de revenus mensuels Étape 5 Piloter GLM-5.3 sur de vraies tâches de code longue durée ; traiter les scores fournisseur comme non vérifiés, faire un A/B, et évaluer la planification en heures creuses plus un routage hybride local/cloud

FAQ

Q : DeepSeek reste-t-il moins cher que GPT-5.6 ou Claude après la hausse ?

A : Son tarif heures creuses reste moins cher que Claude Opus 5, mais ce n'est plus l'option la moins chère dans l'ensemble — GPT-5.6 Luna d'OpenAI ($0.20/$1.20 par million de tokens) et la tarification internationale Qwen3.8-Max d'Alibaba ($2/$6) passent désormais sous les nouveaux tarifs creux DeepSeek sur au moins une dimension. DeepSeek reste relativement bon marché pour un modèle de classe frontier, simplement ce n'est plus le moins cher tout court.

Q : Puis-je utiliser gratuitement les poids ouverts d'Alibaba Qwen3.8-Max dans un produit commercial ?

A : Oui, dans la plupart des cas — les projets personnels et l'usage interne en entreprise ne sont pas concernés. La restriction s'applique seulement si vous exploitez une activité Model-as-a-Service ou AI Work Assistant qui a gagné plus de $50 million sur une période de 12 mois consécutifs ; ce palier exige une licence commerciale séparée auprès d'Alibaba.

Q : Qwen3.8-Max est-il interdit ou restreint pour les utilisateurs des États-Unis, de l'UE ou du Royaume-Uni ?

A : Non. Cette affirmation a circulé en ligne mais elle est fausse — la licence publiée ne contient aucune restriction géographique. Les restrictions sont fondées sur le chiffre d'affaires (liées à l'argent que gagne votre service), pas au lieu où vous ou vos utilisateurs vous trouvez.

Q : Quelle est vraiment la différence entre GLM-5.3 et GLM-5.2 ?

A : Rien au niveau du modèle de base — les deux utilisent le même modèle de fondation à 743 milliards de paramètres. Les gains de performance (environ 6x sur Terminal-Bench 3.0) viennent entièrement de la montée en échelle de l'apprentissage par renforcement pendant le post-training, sans réentraînement du modèle de base.

Q : Meta va-t-il vraiment ouvrir les poids de son modèle phare, pas seulement le plus petit Muse Glimmer ?

A : Pas encore. Muse Glimmer est un modèle distillé 30B, pas le vrai phare de Meta. Le PDG Mark Zuckerberg a annoncé des poids ouverts pour le plus grand modèle fermé Muse Spark 1.2, ce qui — si cela arrive — en ferait le premier modèle américain de palier phare publié ouvertement. À la date de ce texte, cette publication n'a pas eu lieu ; à traiter comme une intention déclarée, pas un fait confirmé.

En résumé

En cinq jours, DeepSeek a inscrit la rareté de capacité dans une grille selon l'heure, Alibaba a attaché une licence personnalisée à un dépôt open-weight phare, et Zhipu a montré que le seul post-training peut faire bouger les scores de code sans nouveau modèle de base. Les trois jeux diffèrent, mais tous concourent sur le pouvoir de tarifer plutôt que sur qui reste le moins cher. Si vous faites du batching en heures creuses, de l'évaluation des poids Qwen ou un agent de code longue durée GLM-5.3 entièrement sur un ordinateur portable, un VPS Linux générique ou une console d'API cloud, vous héritez d'une volatilité de facture de pointe, de boucles interrompues par la mise en veille, et d'aucun moyen natif de garder Xcode, Fastlane et notarytool sur la même machine. Pour les équipes qui ont besoin d'un agent 7×24 sans surveillance plus une CI iOS ou une passerelle OpenClaw à côté de la nouvelle pile multi-modèles, louer un nœud Mac cloud M4 VPSMAC — macOS natif, SSH plus launchd, sur le même réseau que votre chaîne d'outils distante — est en général plus stable qu'un appareil personnel ou un VPS Linux.

Sources : Annonce tarifaire officielle DeepSeek, recoupée avec Wall Street CN, IT Home, AIGC.cn et V2EX · Dépôts officiels Qwen d'Alibaba (Hugging Face / ModelScope) et reportage du South China Morning Post sur la licence · Page technique officielle GLM-5.3 de Zhipu (Z.ai), plus VentureBeat et StableLearn · Blog officiel Meta AI Research et couverture VentureBeat de Muse Glimmer · Médias financiers chinois (Yicai, Sohu Finance) sur le rythme du cycle de sorties open-weight en Chine

Données à jour au 2026-08-17. Les prix, conditions de licence et chiffres de benchmark reflètent les informations publiques à la date de publication. Vérifier les derniers tarifs et licences officiels avant republication. Les détails signalés ci-dessus comme non vérifiés (affirmations sur les puces domestiques, le rapport de vulnérabilité Cursor et les rumeurs de contrôle à l'exportation) n'ont pas été confirmés de façon indépendante.