DeepSeek V4 version complète (juillet 2026) : tarifs, benchmarks et comparaison GPT-5.6
Le 20 juillet 2026, DeepSeek V4 passe en disponibilité générale (GA) — trois mois après la preview. Pour les développeurs IA et décideurs modèles, cela signifie : agents renforcés, tarifs heures pleines/creuses inédits, SWE-bench Verified à 80,6 % et échéance de migration le 24 juillet. Ce guide couvre la chronologie, l architecture CSA/HCA/mHC, les benchmarks, les grilles tarifaires, la migration code et une matrice face à GPT-5.6 et Claude Fable 5.
Sommaire
deepseek-chat le 24 juillet. V4-Pro atteint 80,6 % SWE-bench Verified (record open weight), contexte 1M avec 10 % de KV-cache vs V3.2 — sortie dès 0,87 $/M (heures creuses).Points de friction : pourquoi la GA change la donne
- API legacy coupée dans quelques jours :
deepseek-chatetdeepseek-reasoners arrêtent le 24 juillet 2026 à 15h59 UTC. Sans migration, risque d interruption production — pas seulement de surcoût. - Tarifs heures pleines pénalisent les pipelines 24h/24 : en semaine 09h00–12h00 et 14h00–18h00 (Pékin), les tarifs doublent. Des boucles Agent sans planification peuvent doubler la facture, même si les heures creuses restent très compétitives.
- Choix de modèle sans matrice coût/performance : Claude Fable 5 mène SWE-bench Pro (80,3 %) mais coûte ~50 $/M en sortie ; V4-Pro obtient 38 vs 50 points sur Strategy & Ops pour 0,03 $ vs 3,48 $ par tâche (116× moins cher). Sans routage, les équipes brûlent du budget sur du closed source.
I. Chronologie : de la preview à la version complète
| Date | Événement |
|---|---|
| 24 avr. 2026 | Preview V4 + poids ouverts (MIT) : V4-Pro (1,6T) et V4-Flash (284B) |
| Mai 2026 | Versions production V4-Flash et V4-Pro, API disponible |
| Juin 2026 | Sortie V4-Pro −75 % permanente (0,87 $/M) — zone frontier la moins chère |
| 29 juin 2026 | E-mail API : GA mi-juillet + premiers détails heures pleines/creuses |
| 19 juil. 2026 | Tests gris GA ; presse « version complète demain » |
| 20 juil. 2026 | GA officielle |
| 24 juil. 2026 | deepseek-chat / deepseek-reasoner hors ligne définitivement |
En une phrase : même architecture MoE qu en avril — la GA apporte stabilité, optimisation agent et tarification disciplinée au lieu du « quasi gratuit ».
II. Architecture : rendre 1M tokens viable
Famille de modèles
| Spécification | V4-Pro | V4-Flash |
|---|---|---|
| Paramètres totaux | 1,6T | 284B |
| Actifs par token | 49B (3 %) | 13B (4,6 %) |
| Couches Transformer | 61 | 43 |
| Fenêtre de contexte | 1 000 000 tokens | 1 000 000 tokens |
| Sortie max | 384K | 384K |
| Précision | FP4 (experts) + FP8 | FP4 + FP8 |
| Pré-entraînement | 33T+ tokens | 32T+ tokens |
| Licence | MIT | MIT |
① CSA + HCA — attention hybride remplaçant la MLA
- CSA (Compressed Sparse Attention) : KV compressé 4× via gating Softmax ; indexeur FP4 « Lightning » top-1024 (Pro) ou top-512 (Flash) ; fenêtre glissante 128 tokens.
- HCA (Heavily Compressed Attention) : compression 128× puis attention dense globale ; Flash : 2 premières couches HCA, puis alternance CSA/HCA.
À 1M tokens : seulement 27 % des FLOPs vs V3.2 ; KV-cache 10 % (Flash : 7 %).
② mHC — hyper-connexions contraintes sur variété
Quatre canaux résiduels avec matrice mixte doublement stochastique (polytope de Birkhoff) — gradients stables sur 61 couches profondes.
③ Optimiseur Muon
Entraînement Muon au lieu d AdamW : orthogonalisation Newton-Schulz → convergence plus rapide sur MoE à grande échelle.
Trois modes de raisonnement
| Mode | Caractéristique | Usage |
|---|---|---|
| Non-think | Sans CoT, rapide | Routage, FAQ, classification |
| Think High | Raisonnement explicite | Debug code, complexité moyenne |
| Think Max | Effort maximal | Maths, agents multi-étapes (384K+) |
Échantillonnage recommandé (officiel) : temperature=1.0, top_p=1.0.
III. Benchmarks : victoires et limites
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % ★ record open weight | 96,0 % | N/D | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3 206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
Coût réel (Artificial Analysis, Strategy & Ops) : Fable 5 — 50 pts, 3,48 $/tâche ; V4-Pro — 38 pts, 0,03 $/tâche (116× moins cher). V4-Flash reste sous 0,04 $/tâche sur les six indices.
⚠️ Données partiellement auto-déclarées ; validez en pilot réel.
IV. DeepSeek V4 vs GPT-5.6 vs Claude Fable 5
| Dimension | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Poids ouverts / auto-hébergement | ✅ MIT | ❌ | ❌ |
| Contexte 1M | ✅ | non confirmé | ✅ |
| Meilleur code repo (SWE-bench Pro) | Second tier | Second tier | ✅ Leader |
| Algorithmes / LiveCodeBench | ✅ Leader | Fort | — |
| Sortie (heures creuses) | 0,87 $/M | ~15 $/M | ~50 $/M |
| Sortie (heures pleines) | 1,74 $/M | — | — |
| Souveraineté des données | ✅ Self-host possible | ❌ | ❌ |
V. Tarifs heures pleines/creuses
| Modèle | Poste | Heures creuses | Heures pleines (×2) |
|---|---|---|---|
| V4-Pro | Entrée cache hit | ¥0,025 / 0,0035 $ / 1M | ×2 |
| V4-Pro | Entrée cache miss | ¥3,00 / 0,435 $ / 1M | ¥6,00 / 0,87 $ |
| V4-Pro | Sortie | ¥6,00 / 0,87 $ / 1M | ¥12,00 / 1,74 $ |
| V4-Flash | Entrée cache hit | ¥0,02 / 0,0028 $ / 1M | ×2 |
| V4-Flash | Entrée cache miss | ¥1,00 / 0,14 $ / 1M | ¥2,00 / 0,28 $ |
| V4-Flash | Sortie | ¥2,00 / 0,28 $ / 1M | ¥4,00 / 0,56 $ |
Heures pleines (Pékin) : semaine 09h00–12h00 et 14h00–18h00.
Conseils d économie
- Planifier batchs (docs, revue code) après 18h00 ou avant 09h00.
- Mettre en cache les prompts système — hit Flash à 0,0028 $/M.
- Flash pour routage/intent, Pro pour raisonnement lourd (60–80 % d économie typique).
- DeepSeek notifie les changements tarifaires 24 h à l avance.
Même en heures pleines : sortie V4-Pro 1,74 $/M = 8,6× moins cher qu Opus 4.8 (15 $/M) ou GPT-5.6 Sol (~15 $/M).
VI. Migration API — deadline 24 juillet ⚠️
| Ancien | Nouveau | Note |
|---|---|---|
deepseek-chat | deepseek-v4-flash (Non-think) | Remplacement direct chat |
deepseek-reasoner | deepseek-v4-flash (Think) ou deepseek-v4-pro | Pro pour raisonnement plus fort |
OpenAI SDK (Python)
SDK Anthropic
VII. Matrice de choix
| Scénario | Recommandation | Raison |
|---|---|---|
| Budget / volume API / self-host | V4-Pro ou V4-Flash | 0,87 $/M sortie, MIT, 1M contexte |
| Code repo maximal | Claude Fable 5 | 80,3 % SWE-bench Pro |
| Agents terminal/shell | GPT-5.6 Sol | Terminal-Bench 85,1 % |
| Docs/logs massifs bon marché | V4-Flash | Cache hit 0,0028 $/M entrée |
| Algorithmes / compétition | V4-Pro | LiveCodeBench 93,5 %, Elo 3 206 |
| Conformité / pas de cloud | V4-Pro self-host | MIT, inférence privée |
EEAT — faits vérifiables
- Échelle MoE : 1,6T total, 49B actifs — 3 % de sparsité par token.
- Efficacité KV : 1M tokens avec 10 % de mémoire KV vs V3.2 (Flash : 7 %).
- Code open weight : SWE-bench Verified 80,6 %, meilleur score open weight avec Gemini 3.1 Pro.
- Levier coût : Strategy & Ops 0,03 $ vs 3,48 $ par tâche (116×).
- Majoration heures pleines : double tarif en semaine ; heures creuses sous tout flagship closed source.
VIII. Runbook migration en 5 étapes
IX. Questions fréquentes
Q : Quoi de neuf en GA vs preview ?
R : Optimisation agents/maths/code, tarifs heures pleines, noms legacy arrêtés le 24 juillet. Architecture identique.
Q : Comment économiser sur les heures pleines ?
R : Heures creuses, cache, Flash en first-pass — section V.
Q : Migration obligatoire ?
R : Oui avant le 24/07 15h59 UTC. Remplacer chat/reasoner par v4-flash ou v4-pro.
Q : V4-Pro vs GPT-5.6 ?
R : V4 moins cher et self-hostable ; GPT-5.6 meilleur sur agents terminal. 0,87 $/M vs ~15 $/M.
Q : Self-hosting réaliste ?
R : Poids MIT disponibles ; MoE 1,6T exige GPU/NPU — voir guide inférence Mac cloud.
Q : Modes de raisonnement ?
R : Non-think, Think High, Think Max — temperature=1.0, top_p=1.0.
Conclusion
DeepSeek V4 GA marque le passage du « quasi gratuit preview » à une plateforme open weight production avec tarification disciplinée. La valeur n est pas de battre Claude Fable 5 immédiatement, mais d offrir une performance frontier à 1/10 à 1/100 du coût closed source — avec un contexte 1M qui fonctionne réellement et une licence MIT pour la conformité.
Faire tourner des pipelines Agent uniquement sur laptop, VPS Linux ou postes de dev mixtes expose à interruptions veille, clés API mélangées aux dépôts prod et absence de toolchain Apple (Xcode, Fastlane, notarytool) pour CI iOS parallèle. Pour des agents DeepSeek V4 7j/7 plus gateway OpenClaw et builds macOS natifs, VPSMAC Mac cloud M4 — SSH, launchd, clés isolées — est une base production plus stable qu un setup DIY ou API seule sans environnement auditable.
Sources : Docs API DeepSeek · arXiv:2606.19348 · HuggingFace · Artificial Analysis · LLMReference
Données au 20 juillet 2026. Benchmarks partiellement auto-déclarés ; vérifier docs officielles avant mise en production.