DeepSeek V4-Flash-0731 : benchmarks et prix expliqués (2026)
Si votre stack Agent repose encore sur des API flagship fermées, la montée en version officielle de V4-Flash le 31 juillet 2026 change la structure de coûts : même architecture 284B/13B avec post-entraînement renouvelé, scores Agent devant la preview V4-Pro plus grande, tarifs listes à une fraction de Claude Opus 4.8. Pour équipes API et achats — chronologie, tableaux prix et concurrents, CSA+HCA, réserves Harness, Artificial Analysis, « kill line », cinq faits techniques, Runbook 5 étapes, cinq FAQ — données au 5 août 2026.
Sommaire
Points de friction : pourquoi V4-Flash-0731 force à revoir le routage API
- Version officielle API-only ; app et web inchangés. V4-Flash-0731 du 31 juillet est une bêta API-only. Les surfaces grand public restent sur d'anciennes builds. Croire que « tout a basculé » crée une fracture UX/API.
- Scores liés à Harness non publié ; DeepSeek met en garde. Terminal Bench 2.0 à 82,7 (devant V4-Pro preview 67,9) mesuré uniquement en mode minimal Harness non encore public. Jusqu'à reproduction par Claude Code, Cursor, etc. : traiter comme « vendor + framework spécifique ».
- Pas de date pour V4-Pro officiel ni Harness public. Médias chinois citent GA 10–20 août sans source ; changelog : « dès que possible ». Pro flagship et framework Agent maison absents pour workflows Harness production.
Chronologie : preview avril → version « officielle » juillet
- 24 avril 2026 : preview V4 open-weight — V4-Pro (1,6T/49B), V4-Flash (284B/13B), contexte 1M, MIT.
- 24 juillet 2026 : alias
deepseek-chatetdeepseek-reasonerretirés ; nomenclature V4. - 27 juillet 2026 : Moonshot AI open weights Kimi K3 (2,8T) sur Hugging Face.
- 31 juillet 2026 : DeepSeek-V4-Flash-0731 bêta API officielle ; poids synchronisés ; changelog nomme Harness. API seulement.
- Au 5 août 2026 : V4-Pro officiel toujours « dès que possible » ; 10–20 août non confirmé par DeepSeek.
Données clés : tarifs et specs
| Modèle | Statut | Total / actif | Contexte | Entrée (cache miss/hit, par 1M tokens) | Sortie (par 1M tokens) | Licence |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | Officiel (31/07/2026) | 284B / 13B | 1M | 0,14 $ / 0,0028 $ | 0,28 $ | MIT |
| DeepSeek-V4-Pro | Preview (officiel pending) | 1,6T / 49B | 1M | 0,435 $ / 0,003625 $ | 0,87 $ | MIT |
| Kimi K3 | Open weights (27/07/2026) | 2,8T / ~104B | ~1,05M | 3,00 $ / 0,30 $ | 15,00 $ | Kimi K3 License |
| GLM-5.2 | Open (juin 2026) | ~744B / ~40B | 1M | Non vérifié ici | Non vérifié ici | MIT |
| Qwen3.8-Max | API GA (poids pending) | 2,4T / 95B | 1M | 2,00 $ / ~0,17-0,25 $ | 6,00 $ | Open weights promis |
DeepSeek a annoncé une majoration 2× heures de pointe (Pékin 9–12h, 14–18h), sans date. Selon 21st Century Business Herald vs Claude Opus 4.8 : entrée cache miss ~36×, cache hit 179×, sortie 89× moins cher.
Même architecture, post-entraînement renforcé
Même modèle 284B — gains du re-training
V4-Flash-0731 est identique en taille et structure à la preview d'avril ; DeepSeek attribue tout le saut au post-entraînement. Le Flash 284B/13B bat la preview V4-Pro 1,6T/49B sur plusieurs benchmarks Agent.
CSA+HCA, mHC, Muon
- Attention hybride (DSA) : CSA + HCA ;
- mHC : hyper-connexions à contrainte de variété ;
- Optimiseur Muon : à 1M tokens, V4-Pro 27% FLOPs et 10% KV de V3.2 (officiel).
Harness : premier framework Agent maison
Changelog 31 juillet : DeepSeek Harness — réponse à Claude Code. Scores Agent (Terminal Bench 2.0, Toolathlon) en mode minimal Harness (max, top_p=0,95, temperature=1,0). « Scores extrêmement sensibles au harness. »
Comparaison : Artificial Analysis et concurrents
| Modèle | Labo | Release / poids | Total | Intelligence Index | Coût/tâche |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | DeepSeek | 31/07/2026 | 284B | 50 | 0,03 $ |
| Kimi K3 | Moonshot AI | 16/07 / 27/07 | 2,8T | 57 | 0,86 $ |
| GLM-5.2 | Zhipu / Z.ai | 06/2026 | ~744B | ~1 pt au-dessus Flash | Non vérifié |
| Qwen3.8-Max | Alibaba | 02/08/2026 GA | 2,4T | Non vérifié | Non vérifié |
| GPT-5.6 Sol | OpenAI | Fermé | — | 9+ pts au-dessus Flash | 1,86 $ |
| Claude Fable 5 | Anthropic | Fermé | — | 9+ pts au-dessus Flash | 3,15 $ |
Sur Artificial Analysis, V4-Flash n'a pas l'index le plus haut mais coût/tâche ~1/29 Kimi K3, 1/62 GPT-5.6 Sol, 1/105 Claude Fable 5. DeepSeek vise « intelligence suffisante + prix extrême » — preview #1 OpenRouter sept semaines.
Controverses : bons scores ≠ pas de réserves
- Dépendance Harness : framework non publié.
- Usabilité : faible taux cache hit, timeouts classificateur sécurité (21st Century Business Herald).
- Rumeurs de date : 10–20 août non confirmé.
- Rumeurs de financement : ~7,4 Md$ , ~48,7 Md$ valorisation — médias « selon sources », non vérifié.
Contexte : « Liang Baikai », « Liang Sheng », kill line
Quand V4-Pro a manqué mi-juillet, la communauté chinoise a surnommé Liang Wenfeng « Liang Baikai » (promesse vide). Après V4-Flash-0731, retour à « Liang Sheng ». « Kill line » (斩杀线) : performance suffisante + prix plancher — qui ne bat ni ne sous-enchérit perd en pertinence. Explique GPT-5.6 Luna −80 %. Le 31 juillet, pas de mouvement majeur Nvidia, Broadcom, AMD.
Faits techniques citables (EEAT)
- Architecture identique : 284B / 13B actif, 100 % post-entraînement.
- Scores Agent : Terminal Bench 2.0 82,7 vs preview 67,9 (Harness minimal, vendor).
- Multiples prix : vs Opus 4.8 miss 36×, hit 179×, sortie 89×.
- Efficacité : 1M tokens FLOPs 27%, KV 10% de V3.2.
- Artificial Analysis : index 50, 0,03 $/tâche.
Runbook migration API en 5 étapes
Étape 2 Mapping — deepseek-chat → deepseek-v4-flash (Non-think) ; reasoner → v4-flash Think High ou v4-pro
Étape 3 Config — base_url https://api.deepseek.com ; réflexion temperature=1.0, top_p=1.0 ; deepseek-v4-flash → build 0731
Étape 4 Pilote — 20 tâches Agent chacune ; tokens, cache, qualité, $/tâche ; hors Harness
Étape 5 Hybride — volume V4-Flash-0731 ; raisonnement dur Pro preview ou fermé ; surveiller 2× peak
FAQ
Quelle est la plus grande différence entre DeepSeek V4 et V3.2 ?
Contexte natif 1M tokens, FLOPs/KV long contexte fortement réduits ; V4 optimisé Agent (Claude Code, OpenCode).
V4 Flash ou V4 Pro au quotidien ?
Gros volumes et pipelines Agent : V4-Flash-0731 (scores Agent devant preview V4-Pro). Raisonnement profond : preview V4-Pro jusqu'à version officielle.
Puis-je utiliser V4 Pro officiel ?
Au 5 août 2026 non. Seule V4-Flash-0731, API-only. V4-Pro et Harness « dès que possible » ; 10–20 août rumeur non confirmée.
Peut-on faire confiance aux benchmarks publiés ?
SWE-bench Verified relativement crédible. Terminal Bench 2.0 via Harness non publié — attendre reproduction indépendante.
Impact concret pour les développeurs ?
Pas de changement de code format OpenAI/Anthropic — deepseek-v4-flash pointe vers 0731. Anciens noms retirés le 24 juillet.
Sources : docs API DeepSeek · rapport technique V4 · Artificial Analysis · 21st Century Business Herald · Hugging Face
Le déploiement API-only ne couvre pas les boucles Agent 7×24, la toolchain Apple (Xcode, Fastlane, notarytool) ni l'inférence air-gapped co-localisée. Self-host V4-Flash avec antirez ds4 sur portable (~160 Go poids, 128 Go+ Apple Silicon) : veille interrompue, clés mélangées aux repos prod. Pour Flash self-host + CI iOS ou gateways OpenClaw : louer des nœuds Mac cloud VPSMAC M4 — macOS natif, SSH + launchd, 128/256/512 Go — plus stable qu'un Linux VPS ou matériel perso.
Données au 05/08/2026. Benchmarks incluant résultats vendor et Harness. Tarifs et statut V4-Pro/Harness susceptibles de changer — consulter la doc officielle avant production.