Pourquoi DeepSeek a relevé les prix API jusqu'à 1 100 % après l'offensive open-weight chinoise
Du 12 au 17 août, développeurs et responsables achats ont vu trois mouvements contradictoires : DeepSeek a relevé les prix API jusqu'à 1 100 % sur certaines tranches, Alibaba a ouvert pour la première fois les poids d'un phare à 2,4 billions de paramètres, et Zhipu a livré GLM-5.3 avec environ 6x de gains sur les benchmarks de code, sur le même modèle de base. La conclusion : les laboratoires chinois passent de la seule guerre des prix à une guerre pour le pouvoir de tarifer. Cet article contient une chronologie, trois tableaux de données, une matrice de prix et un runbook de sélection en cinq étapes.
Sommaire
Trois pièges que les développeurs rencontreront d'abord
- Le titre 1 100 % est exact mais incomplet. Les médias ont cité 11x, 1 100 % et 350 % comme s'ils décrivaient la même facture. Ce n'est pas le cas. Ces chiffres correspondent à des postes différents : entrée cache-hit, sortie et entrée cache-miss. Traiter le titre comme toute la facture surestime ou sous-estime le coût réel.
- L'API officielle n'est plus automatiquement le chemin le moins cher. Aux heures de pointe, l'API officielle DeepSeek cote désormais au-dessus de plusieurs revendeurs tiers (GMI Cloud, Novita et d'autres listent actuellement V4 Pro sous le nouveau tarif de pointe DeepSeek). Par défaut, le canal officiel n'est plus une hypothèse de coût sûre.
- Poids ouverts ne signifie plus Apache 2.0. Alibaba a publié un checkpoint 2.4T sous une licence personnalisée Qwen3.8-Max License : toute activité Model-as-a-Service ou AI Work Assistant gagnant plus de $50 million sur une période de 12 mois doit négocier une licence commerciale séparée ; les produits avec 100M+ utilisateurs actifs mensuels ou $20M+ de revenus mensuels doivent afficher le nom du modèle de façon proéminente. Les affirmations selon lesquelles la licence interdit les téléchargements depuis les États-Unis, l'UE, le Royaume-Uni et la Corée du Sud sont fausses. Le texte publié n'a aucune clause géographique.
Chronologie : ce qui s'est passé, et quand
| Date | Événement |
|---|---|
| 16 juillet 2026 | Moonshot AI ouvre les poids de Kimi K3 (2.8T paramètres), attirant un examen de sécurité américain |
| 2-3 août 2026 | Alibaba prévisualise puis lance Qwen3.8-Max en API hébergée |
| 10 août 2026 | Meta publie Muse Glimmer (30B, Apache 2.0) et annonce des poids ouverts pour le phare Muse Spark 1.2 |
| 12 août 2026 | Alibaba publie les poids ouverts Qwen3.8-2.4T-A95B sur Hugging Face/ModelScope ; xAI livre Grok 4.6 |
| 13 août 2026 | DeepSeek-V4-Pro passe en GA et annonce une hausse au 17 août ; Google livre Gemini 3.7 Flash à prix réduit |
| 14 août 2026 | Zhipu livre GLM-5.3 en réutilisant la base 743B de GLM-5.2 |
| 17 août 2026, 00:00 heure de Pékin | La nouvelle tarification DeepSeek entre en vigueur |
En reculant encore : le 30 juillet, OpenAI a baissé les prix de son palier le moins cher (GPT-5.6 Luna, moins 80 %), puis les 6-7 août a fait de Luna le défaut gratuit avec des chats texte illimités. Pendant que les laboratoires chinois relevaient les prix et ouvraient des poids phares, les laboratoires américains baissaient les prix et passaient au gratuit côté grand public, au même moment. Ce n'est pas une coïncidence ; ce sont deux faces de la même bataille tarifaire.
Les chiffres : ce qui a vraiment changé
Hausse DeepSeek, palier par palier (effective le 17 août, 00:00 heure de Pékin ; les heures de pointe sont 9-12 et 14-18 heure de Pékin)
| Poste de facturation (par 1M tokens) | Ancien prix | Nouveau creux | Nouvelle pointe | Hausse de pointe |
|---|---|---|---|---|
| V4-Flash cache hit (entrée) | ¥0.02 | ¥0.05 | ¥0.10 | ~400% |
| V4-Flash cache miss (entrée) | ¥1.0 | ¥1.5 | ¥3.0 | 200% |
| V4-Flash sortie | ¥2.0 | ¥4.5 | ¥9.0 | 350% |
| V4-Pro cache hit (entrée) | ¥0.025 | ¥0.15 | ¥0.30 | ~1,100% |
| V4-Pro cache miss (entrée) | ¥3.0 | ¥4.5 | ¥9.0 | 200% |
| V4-Pro sortie | ¥6.0 | ¥13.5 | ¥27.0 | 350% |
Le chiffre 1 100 % cité partout s'applique spécifiquement au tarif d'entrée cache-hit en heures de pointe, le palier qui partait le plus près de zéro. Les prix de sortie, qui pèsent davantage sur la plupart des factures réelles, ont augmenté de 350 %. Une modélisation de coûts indépendante a trouvé qu'une charge lourde réaliste (environ 84M tokens/mois, surtout en heures creuses, moitié cache hits) voit une hausse de facture plus proche de 1.8x.
Qwen3.8-2.4T-A95B (poids ouverts Qwen3.8-Max) : spécifications clés
| Spécification | Détail |
|---|---|
| Paramètres | 2.4T au total, 95B actifs par token (MoE, 512 experts, 10 routés + 1 partagé) |
| Fenêtre de contexte | 262,144 tokens natifs (checkpoint ouvert), extensible à ~1.01M ; la version Max hébergée vaut 1M par défaut |
| Cadence de sortie | Aperçu 2 août → API en ligne 3 août → poids ouverts 12 août |
| Tarif API (international) | $2/M entrée, $6/M sortie |
| Licence | Pas Apache 2.0 — une licence personnalisée Qwen3.8-Max License |
| Pourquoi ça compte | Première fois qu'Alibaba ouvre un phare de palier Max ; Qwen3.5/3.6/3.7 Max restaient API uniquement |
GLM-5.3 vs GLM-5.2 : même modèle de base, post-training seulement
| Benchmark | GLM-5.2 | GLM-5.3 | Écart |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6% | 28.3% | +23.7 pts |
| DeepSWE v1.1 | 46.2% | 66.9% | +20.7 pts |
| Agents' Last Exam (CLI) | 23.8% | 28.5% | +4.7 pts |
| CyberGym | 77.2% | 84.5% | +7.3 pts |
| AutomationBench | 26.2% | 48.2% | +22.0 pts |
Ce sont les chiffres déclarés par Zhipu — aucune reprise tierce indépendante n'a encore été publiée. GLM-5.3 reste derrière GPT-5.6 Sol (34.6%) et Claude Fable 5 (33.7%) sur Terminal-Bench 3.0 ; c'est un résultat open-weight de premier plan, pas une victoire frontier nette.
Découpage des trois stratégies
DeepSeek : du tarif unique au tarif selon l'heure — c'est un problème de capacité
La lecture la plus facile du geste DeepSeek est que le modèle chinois le moins cher a cédé à la pression sur les marges. En regardant la structure, cela ressemble davantage à une entreprise qui rend visibles, pour la première fois, ses contraintes de calcul dans la grille tarifaire. L'ancien tarif plat, toujours bas, fonctionnait comme outil d'acquisition tant que la capacité GPU suivait la demande. Une fois l'usage devenu exponentiel et la capacité non, quelque chose devait devenir explicite — et « encourager une planification plus flexible des charges » dans l'annonce officielle est du langage d'entreprise pour « notre calcul de pointe est désormais rare, veuillez décaler vous-même ».
Un détail que la couverture internationale a surtout manqué : aux heures de pointe, le prix de l'API officielle DeepSeek est désormais plus élevé que celui de plusieurs revendeurs tiers (GMI Cloud, Novita et d'autres listent actuellement V4 Pro sous le nouveau tarif de pointe DeepSeek). L'hypothèse selon laquelle l'API officielle est toujours le moyen le moins cher d'exécuter DeepSeek est brisée pour la première fois.
Alibaba : les poids ouverts achètent la bienveillance de l'écosystème ; une licence personnalisée protège le plafond de revenus
L'ouverture des poids de Qwen3.8-Max n'est pas un acte de générosité simple. Alibaba a fait deux choses en même temps : publier le checkpoint complet à 2.4T paramètres en téléchargement gratuit, et y attacher une licence personnalisée — pas l'Apache 2.0 permissif des plus petits Qwen — qui oblige toute activité Model-as-a-Service ou AI Work Assistant gagnant plus de $50 million sur une période de 12 mois à négocier une licence commerciale séparée, et oblige les produits avec 100M+ utilisateurs actifs mensuels ou $20M+ de revenus mensuels à afficher le nom du modèle de façon proéminente.
La logique : donner les poids pour gagner l'esprit des développeurs (surtout à l'international, où un modèle made-in-China hésite encore chez les acheteurs entreprise), tout en gardant un levier tarifaire sur la poignée d'entreprises capables de construire un métier d'inférence concurrent par-dessus. C'est un pari matériellement différent de Muse Glimmer de Meta, qui part sous Apache 2.0 sans restriction.
Une rumeur à tuer explicitement : des affirmations ont circulé en ligne selon lesquelles la licence d'Alibaba interdirait les téléchargements depuis les États-Unis, l'UE, le Royaume-Uni et la Corée du Sud. C'est faux. Le texte de licence publié ne contient aucune clause géographique ou territoriale.
GLM-5.3 : pas de nouveau modèle de base, seulement un plus gros pari post-training
Le fait le plus intéressant sur GLM-5.3 n'est pas le score, c'est la méthode : même base 743B paramètres que GLM-5.2, pas de réentraînement, et un saut d'environ 6x sur Terminal-Bench 3.0 (4.6% → 28.3%) uniquement en montant l'échelle des environnements d'apprentissage par renforcement en post-training. Cela confirme une tendance qui se construit depuis des mois dans l'industrie — alors que les scaling laws du préentraînement montrent des rendements décroissants, l'échelle RL du post-training devient un levier de performance indépendant, avec un plancher de coût bien plus bas que le réentraînement d'un nouveau modèle de fondation. C'est une barrière d'entrée nettement plus basse, et c'est pourquoi des laboratoires de milieu de tableau sans budgets de calcul à l'échelle OpenAI peuvent encore refermer l'écart sur les benchmarks agentiques et de code.
Face à face : DeepSeek est-il encore le phare le moins cher ?
| Modèle | Entrée (par 1M tokens) | Sortie (par 1M tokens) | Poids ouverts ? |
|---|---|---|---|
| DeepSeek V4-Pro (pointe) | ¥9.0 (~$1.26) | ¥27.0 (~$3.78) | Non |
| DeepSeek V4-Pro (creux) | ¥4.5 (~$0.63) | ¥13.5 (~$1.89) | Non |
| Qwen3.8-Max (API internationale) | $2.00 | $6.00 | Oui (licence personnalisée) |
| OpenAI GPT-5.6 Luna | $0.20 | $1.20 | Non |
| Claude Opus 5 (implicite, selon le ratio de comparaison d'Alibaba) | ~$5.00 | ~$25.00 | Non |
Conversion RMB-USD à environ ¥7.15/$1, approximative. Même après la hausse, le tarif creux de DeepSeek V4-Pro reste bien sous Claude Opus 5, mais ce n'est plus l'option la moins chère tout court — la tarification internationale de Qwen3.8-Max et Luna d'OpenAI passent désormais sous le tarif creux DeepSeek. « Modèle chinois = modèle le moins cher » valait pour l'essentiel de 2025 et début 2026 ; ce n'est plus une hypothèse sûre.
Ce qui est contesté ou non vérifié
- Le titre 1 100 % est techniquement exact mais trompeur sans contexte. Il s'applique seulement au tarif d'entrée cache-hit en heures de pointe. Les prix de sortie — le coût qui domine la plupart des factures réelles — ont augmenté de 350 %.
- Les affirmations selon lesquelles Qwen3.8-Max tourne sur les puces internes Zhenwu M890 d'Alibaba (rapportées par plusieurs médias financiers chinois comme preuve d'une pile d'inférence 100 % silicium domestique, incluant Zhenwu M890 et le supernœud Pangu AL128) n'ont été confirmées ni par la documentation technique d'Alibaba ni par des benchmarks tiers. À traiter comme un reportage proche du fournisseur, non vérifié, jusqu'à confirmation.
- La découverte rapportée par GLM-5.3 d'une vulnérabilité grave dans Cursor vient du reportage de VentureBeat et de la divulgation de Zhipu ; les détails techniques n'ont pas été rendus publics, donc à lire comme un constat de sécurité d'origine fournisseur, non audité de façon indépendante.
- Les reports selon lesquels le ministère chinois du Commerce préparerait des contrôles à l'exportation de rétorsion sur les technologies IA/semi-conducteurs sont spéculatifs et sourcés à des articles non confirmés, pas à une annonce officielle. À traiter comme contexte, pas comme fait établi.
Pourquoi ça compte : deux guerres des prix en parallèle
Sur à peu près le mois écoulé, les laboratoires chinois de tête ont enchaîné des sorties majeures à un rythme que la presse financière intérieure appelle « trois mises à jour de modèle par semaine » — DeepSeek, Alibaba et Zhipu, plus Kimi K3 de Moonshot (poids ouverts le 16 juillet, 2.8T paramètres) et MiniMax H3 avant eux. La couverture chinoise cadre largement cela comme des sorties open-weight chinoises qui forcent une retarification mondiale de l'industrie IA.
Pendant ce temps, les laboratoires américains jouent le contraire côté grand public : OpenAI a baissé de 80 % son palier le moins cher (30 juillet) puis a rendu ce modèle gratuit et illimité pour tous une semaine plus tard (6-7 août) ; Google a livré un modèle orienté code à la moitié du prix de son prédécesseur vieux de trois semaines (13 août). Donc pendant que les laboratoires chinois ouvrent des phares et introduisent une tarification étagée, plus haute, en haut de pile là où le calcul manque, les laboratoires américains courent vers le gratuit et le bon marché côté consommateur.
Il y a aussi une couche géopolitique à nommer avec soin. L'ouverture des poids de Kimi K3 de Moonshot en juillet avait déjà attiré un examen de sécurité américain ; le choix par Alibaba de cette fenêtre précise pour ouvrir un phare 2.4T a été lu par certains analystes comme un geste pour verrouiller l'esprit international et un récit de parité technologique avant un éventuel durcissement réglementaire. C'est une interprétation informée, pas un fait confirmé.
Faits techniques citables
- Hausse de pointe DeepSeek : l'entrée cache-hit V4-Pro est passée de ¥0.025 à ¥0.30, environ 1,100% en pointe ; la sortie est passée de ¥6.0 à ¥27.0, 350%. Une modélisation indépendante place une facture lourde réaliste plus près de 1.8x.
- Specs Qwen3.8-Max : 2.4T paramètres au total, 95B actifs (MoE, 512 experts, 10 routés + 1 partagé) ; checkpoint ouvert natif 262,144 tokens, extensible à ~1.01M ; API internationale $2/$6 par million de tokens.
- Saut post-training GLM-5.3 : même base 743B ; Terminal-Bench 3.0 de 4.6% à 28.3% (environ 6x), toujours derrière GPT-5.6 Sol à 34.6% et Claude Fable 5 à 33.7%.
Runbook de sélection en cinq étapes
FAQ
Q : DeepSeek reste-t-il moins cher que GPT-5.6 ou Claude après la hausse ?
A : Son tarif heures creuses reste moins cher que Claude Opus 5, mais ce n'est plus l'option la moins chère dans l'ensemble — GPT-5.6 Luna d'OpenAI ($0.20/$1.20 par million de tokens) et la tarification internationale Qwen3.8-Max d'Alibaba ($2/$6) passent désormais sous les nouveaux tarifs creux DeepSeek sur au moins une dimension. DeepSeek reste relativement bon marché pour un modèle de classe frontier, simplement ce n'est plus le moins cher tout court.
Q : Puis-je utiliser gratuitement les poids ouverts d'Alibaba Qwen3.8-Max dans un produit commercial ?
A : Oui, dans la plupart des cas — les projets personnels et l'usage interne en entreprise ne sont pas concernés. La restriction s'applique seulement si vous exploitez une activité Model-as-a-Service ou AI Work Assistant qui a gagné plus de $50 million sur une période de 12 mois consécutifs ; ce palier exige une licence commerciale séparée auprès d'Alibaba.
Q : Qwen3.8-Max est-il interdit ou restreint pour les utilisateurs des États-Unis, de l'UE ou du Royaume-Uni ?
A : Non. Cette affirmation a circulé en ligne mais elle est fausse — la licence publiée ne contient aucune restriction géographique. Les restrictions sont fondées sur le chiffre d'affaires (liées à l'argent que gagne votre service), pas au lieu où vous ou vos utilisateurs vous trouvez.
Q : Quelle est vraiment la différence entre GLM-5.3 et GLM-5.2 ?
A : Rien au niveau du modèle de base — les deux utilisent le même modèle de fondation à 743 milliards de paramètres. Les gains de performance (environ 6x sur Terminal-Bench 3.0) viennent entièrement de la montée en échelle de l'apprentissage par renforcement pendant le post-training, sans réentraînement du modèle de base.
Q : Meta va-t-il vraiment ouvrir les poids de son modèle phare, pas seulement le plus petit Muse Glimmer ?
A : Pas encore. Muse Glimmer est un modèle distillé 30B, pas le vrai phare de Meta. Le PDG Mark Zuckerberg a annoncé des poids ouverts pour le plus grand modèle fermé Muse Spark 1.2, ce qui — si cela arrive — en ferait le premier modèle américain de palier phare publié ouvertement. À la date de ce texte, cette publication n'a pas eu lieu ; à traiter comme une intention déclarée, pas un fait confirmé.
En résumé
En cinq jours, DeepSeek a inscrit la rareté de capacité dans une grille selon l'heure, Alibaba a attaché une licence personnalisée à un dépôt open-weight phare, et Zhipu a montré que le seul post-training peut faire bouger les scores de code sans nouveau modèle de base. Les trois jeux diffèrent, mais tous concourent sur le pouvoir de tarifer plutôt que sur qui reste le moins cher. Si vous faites du batching en heures creuses, de l'évaluation des poids Qwen ou un agent de code longue durée GLM-5.3 entièrement sur un ordinateur portable, un VPS Linux générique ou une console d'API cloud, vous héritez d'une volatilité de facture de pointe, de boucles interrompues par la mise en veille, et d'aucun moyen natif de garder Xcode, Fastlane et notarytool sur la même machine. Pour les équipes qui ont besoin d'un agent 7×24 sans surveillance plus une CI iOS ou une passerelle OpenClaw à côté de la nouvelle pile multi-modèles, louer un nœud Mac cloud M4 VPSMAC — macOS natif, SSH plus launchd, sur le même réseau que votre chaîne d'outils distante — est en général plus stable qu'un appareil personnel ou un VPS Linux.
Sources : Annonce tarifaire officielle DeepSeek, recoupée avec Wall Street CN, IT Home, AIGC.cn et V2EX · Dépôts officiels Qwen d'Alibaba (Hugging Face / ModelScope) et reportage du South China Morning Post sur la licence · Page technique officielle GLM-5.3 de Zhipu (Z.ai), plus VentureBeat et StableLearn · Blog officiel Meta AI Research et couverture VentureBeat de Muse Glimmer · Médias financiers chinois (Yicai, Sohu Finance) sur le rythme du cycle de sorties open-weight en Chine
Données à jour au 2026-08-17. Les prix, conditions de licence et chiffres de benchmark reflètent les informations publiques à la date de publication. Vérifier les derniers tarifs et licences officiels avant republication. Les détails signalés ci-dessus comme non vérifiés (affirmations sur les puces domestiques, le rapport de vulnérabilité Cursor et les rumeurs de contrôle à l'exportation) n'ont pas été confirmés de façon indépendante.