DeepSeek V4-Flash-0731 : benchmarks et prix expliqués (2026)

Si votre stack Agent repose encore sur des API flagship fermées, la montée en version officielle de V4-Flash le 31 juillet 2026 change la structure de coûts : même architecture 284B/13B avec post-entraînement renouvelé, scores Agent devant la preview V4-Pro plus grande, tarifs listes à une fraction de Claude Opus 4.8. Pour équipes API et achats — chronologie, tableaux prix et concurrents, CSA+HCA, réserves Harness, Artificial Analysis, « kill line », cinq faits techniques, Runbook 5 étapes, cinq FAQ — données au 5 août 2026.

Schéma d'architecture DeepSeek V4 : attention sparse et routage MoE

Sommaire

Points de friction : pourquoi V4-Flash-0731 force à revoir le routage API

  1. Version officielle API-only ; app et web inchangés. V4-Flash-0731 du 31 juillet est une bêta API-only. Les surfaces grand public restent sur d'anciennes builds. Croire que « tout a basculé » crée une fracture UX/API.
  2. Scores liés à Harness non publié ; DeepSeek met en garde. Terminal Bench 2.0 à 82,7 (devant V4-Pro preview 67,9) mesuré uniquement en mode minimal Harness non encore public. Jusqu'à reproduction par Claude Code, Cursor, etc. : traiter comme « vendor + framework spécifique ».
  3. Pas de date pour V4-Pro officiel ni Harness public. Médias chinois citent GA 10–20 août sans source ; changelog : « dès que possible ». Pro flagship et framework Agent maison absents pour workflows Harness production.

Chronologie : preview avril → version « officielle » juillet

Données clés : tarifs et specs

ModèleStatutTotal / actifContexteEntrée (cache miss/hit, par 1M tokens)Sortie (par 1M tokens)Licence
DeepSeek-V4-Flash-0731Officiel (31/07/2026)284B / 13B1M0,14 $ / 0,0028 $0,28 $MIT
DeepSeek-V4-ProPreview (officiel pending)1,6T / 49B1M0,435 $ / 0,003625 $0,87 $MIT
Kimi K3Open weights (27/07/2026)2,8T / ~104B~1,05M3,00 $ / 0,30 $15,00 $Kimi K3 License
GLM-5.2Open (juin 2026)~744B / ~40B1MNon vérifié iciNon vérifié iciMIT
Qwen3.8-MaxAPI GA (poids pending)2,4T / 95B1M2,00 $ / ~0,17-0,25 $6,00 $Open weights promis

DeepSeek a annoncé une majoration 2× heures de pointe (Pékin 9–12h, 14–18h), sans date. Selon 21st Century Business Herald vs Claude Opus 4.8 : entrée cache miss ~36×, cache hit 179×, sortie 89× moins cher.

Même architecture, post-entraînement renforcé

Même modèle 284B — gains du re-training

V4-Flash-0731 est identique en taille et structure à la preview d'avril ; DeepSeek attribue tout le saut au post-entraînement. Le Flash 284B/13B bat la preview V4-Pro 1,6T/49B sur plusieurs benchmarks Agent.

CSA+HCA, mHC, Muon

Harness : premier framework Agent maison

Changelog 31 juillet : DeepSeek Harness — réponse à Claude Code. Scores Agent (Terminal Bench 2.0, Toolathlon) en mode minimal Harness (max, top_p=0,95, temperature=1,0). « Scores extrêmement sensibles au harness. »

Comparaison : Artificial Analysis et concurrents

ModèleLaboRelease / poidsTotalIntelligence IndexCoût/tâche
DeepSeek-V4-Flash-0731DeepSeek31/07/2026284B500,03 $
Kimi K3Moonshot AI16/07 / 27/072,8T570,86 $
GLM-5.2Zhipu / Z.ai06/2026~744B~1 pt au-dessus FlashNon vérifié
Qwen3.8-MaxAlibaba02/08/2026 GA2,4TNon vérifiéNon vérifié
GPT-5.6 SolOpenAIFermé9+ pts au-dessus Flash1,86 $
Claude Fable 5AnthropicFermé9+ pts au-dessus Flash3,15 $

Sur Artificial Analysis, V4-Flash n'a pas l'index le plus haut mais coût/tâche ~1/29 Kimi K3, 1/62 GPT-5.6 Sol, 1/105 Claude Fable 5. DeepSeek vise « intelligence suffisante + prix extrême » — preview #1 OpenRouter sept semaines.

Controverses : bons scores ≠ pas de réserves

Contexte : « Liang Baikai », « Liang Sheng », kill line

Quand V4-Pro a manqué mi-juillet, la communauté chinoise a surnommé Liang Wenfeng « Liang Baikai » (promesse vide). Après V4-Flash-0731, retour à « Liang Sheng ». « Kill line » (斩杀线) : performance suffisante + prix plancher — qui ne bat ni ne sous-enchérit perd en pertinence. Explique GPT-5.6 Luna −80 %. Le 31 juillet, pas de mouvement majeur Nvidia, Broadcom, AMD.

Faits techniques citables (EEAT)

Runbook migration API en 5 étapes

Étape 1 Audit — grep deepseek-chat / deepseek-reasoner ; lister routes Agent
Étape 2 Mapping — deepseek-chat → deepseek-v4-flash (Non-think) ; reasoner → v4-flash Think High ou v4-pro
Étape 3 Config — base_url https://api.deepseek.com ; réflexion temperature=1.0, top_p=1.0 ; deepseek-v4-flash → build 0731
Étape 4 Pilote — 20 tâches Agent chacune ; tokens, cache, qualité, $/tâche ; hors Harness
Étape 5 Hybride — volume V4-Flash-0731 ; raisonnement dur Pro preview ou fermé ; surveiller 2× peak

FAQ

Quelle est la plus grande différence entre DeepSeek V4 et V3.2 ?

Contexte natif 1M tokens, FLOPs/KV long contexte fortement réduits ; V4 optimisé Agent (Claude Code, OpenCode).

V4 Flash ou V4 Pro au quotidien ?

Gros volumes et pipelines Agent : V4-Flash-0731 (scores Agent devant preview V4-Pro). Raisonnement profond : preview V4-Pro jusqu'à version officielle.

Puis-je utiliser V4 Pro officiel ?

Au 5 août 2026 non. Seule V4-Flash-0731, API-only. V4-Pro et Harness « dès que possible » ; 10–20 août rumeur non confirmée.

Peut-on faire confiance aux benchmarks publiés ?

SWE-bench Verified relativement crédible. Terminal Bench 2.0 via Harness non publié — attendre reproduction indépendante.

Impact concret pour les développeurs ?

Pas de changement de code format OpenAI/Anthropic — deepseek-v4-flash pointe vers 0731. Anciens noms retirés le 24 juillet.

Sources : docs API DeepSeek · rapport technique V4 · Artificial Analysis · 21st Century Business Herald · Hugging Face

Le déploiement API-only ne couvre pas les boucles Agent 7×24, la toolchain Apple (Xcode, Fastlane, notarytool) ni l'inférence air-gapped co-localisée. Self-host V4-Flash avec antirez ds4 sur portable (~160 Go poids, 128 Go+ Apple Silicon) : veille interrompue, clés mélangées aux repos prod. Pour Flash self-host + CI iOS ou gateways OpenClaw : louer des nœuds Mac cloud VPSMAC M4 — macOS natif, SSH + launchd, 128/256/512 Go — plus stable qu'un Linux VPS ou matériel perso.

Données au 05/08/2026. Benchmarks incluant résultats vendor et Harness. Tarifs et statut V4-Pro/Harness susceptibles de changer — consulter la doc officielle avant production.