DeepSeek V4-Flash-0731: Benchmarks und Preise erklärt (2026)
Wenn Ihr Agent-Stack noch Closed-Source-Flagship-APIs nutzt, ändert DeepSeeks Upgrade von V4-Flash am 31. Juli 2026 die Kostenstruktur: gleiche 284B/13B-Architektur nur mit neuem Post-Training, Agent-Benchmarks schlagen das größere V4-Pro-Preview, Listenpreise ein Bruchteil von Claude Opus 4.8. Für API-Teams und Beschaffung — Timeline, Preis- und Wettbewerbstabellen, CSA+HCA-Architektur, Harness-Hinweise, Artificial Analysis, „Kill Line“, fünf technische Fakten, 5-Schritte-Runbook, fünf FAQs — Stand 5. August 2026.
Inhaltsverzeichnis
Schmerzpunkte: Warum V4-Flash-0731 API-Routing neu bewertet
- Offizielle Version nur API; App und Web unverändert. V4-Flash-0731 vom 31. Juli ist API-only-Beta. Consumer-Oberflächen laufen älter. Wer „alles umgestellt“ annimmt, trennt UX von API-Qualität und kann das Modell nicht mit Laien validieren.
- Scores hängen von unreleased Harness ab; DeepSeek warnt vor blindem Vertrauen. Terminal Bench 2.0 mit 82,7 (über V4-Pro-Preview 67,9) wurde vollständig im noch nicht veröffentlichten Harness-Minimalmodus gemessen. Bis Claude Code, Cursor etc. reproduzieren: „Vendor plus Framework“ behandeln.
- Kein Datum für V4-Pro offiziell oder public Harness. Chinesische Medien nennen 10.–20. August GA aus anonymen Quellen; Changelog sagt nur „so schnell wie möglich“. Flagship Pro und Agent-Framework fehlen für Production-Harness-Workflows.
Timeline: April-Preview bis Juli „offiziell“
- 24. April 2026: V4-Preview open-weight — V4-Pro (1,6T/49B), V4-Flash (284B/13B), 1M Kontext, MIT.
- 24. Juli 2026: Legacy
deepseek-chatunddeepseek-reasonerabgeschaltet; V4-Namensgebung. - 27. Juli 2026: Moonshot AI Kimi K3 (2,8T) open weights auf Hugging Face — Wettbewerbsdruck.
- 31. Juli 2026: DeepSeek-V4-Flash-0731 offizielle API-Beta; Weights synchron; Changelog nennt Harness erstmals. Nur API.
- Stand 5. August 2026: V4-Pro offiziell weiter „so schnell wie möglich“; 10.–20. August von DeepSeek nicht bestätigt.
Kerndaten: Preise und Specs
| Modell | Status | Gesamt / aktiv | Kontext | Input (Cache-Miss/Hit, pro 1M Token) | Output (pro 1M Token) | Lizenz |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | Offiziell (31.07.2026) | 284B / 13B | 1M | $0,14 / $0,0028 | $0,28 | MIT |
| DeepSeek-V4-Pro | Preview (offiziell ausstehend) | 1,6T / 49B | 1M | $0,435 / $0,003625 | $0,87 | MIT |
| Kimi K3 | Open weights (27.07.2026) | 2,8T / ~104B | ~1,05M | $3,00 / $0,30 | $15,00 | Kimi K3 License |
| GLM-5.2 | Open (Juni 2026) | ~744B / ~40B | 1M | Hier nicht verifiziert | Hier nicht verifiziert | MIT |
| Qwen3.8-Max | API GA (Weights ausstehend) | 2,4T / 95B | 1M | $2,00 / ~$0,17-0,25 | $6,00 | Open weights versprochen |
DeepSeek kündigte 2× Peak-Hour-Zuschlag an (Peking 9–12, 14–18 Uhr), ohne Datum. Laut 21st Century Business Herald vs Claude Opus 4.8: Cache-Miss-Input ~36×, Cache-Hit 179×, Output 89× günstiger.
Architektur unverändert, Post-Training stärker
Gleiches 284B-Modell — Gewinn aus Re-Training
V4-Flash-0731 ist identisch in Größe und Struktur zum April-Preview; DeepSeek: gesamter Sprung aus Post-Training. 284B/13B Flash schlägt 1,6T/49B V4-Pro-Preview auf Agent-Benchmarks — Post-Training 2026 nähert sich Skalierung.
CSA+HCA, mHC, Muon
- Hybrid-Attention (DSA): CSA + HCA, weniger Long-Context-Compute;
- mHC: manifold-constrained Hyper-Connections;
- Muon-Optimizer: bessere Konvergenz. Bei 1M Kontext: V4-Pro 27% FLOPs und 10% KV von V3.2 (offiziell).
Harness: erstes hauseigenes Agent-Framework
Changelog 31. Juli: DeepSeek Harness — Gegenstück zu Claude Code. Agent-Scores (Terminal Bench 2.0, Toolathlon) mit Harness Minimalmodus (max, top_p=0,95, temperature=1,0). Hinweis: „Scores extrem harness-sensitiv.“
Vergleich: Artificial Analysis und Wettbewerber
| Modell | Lab | Release / Weights | Gesamt | Intelligence Index | Kosten/Task |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | DeepSeek | 31.07.2026 | 284B | 50 | $0,03 |
| Kimi K3 | Moonshot AI | 16.07. / 27.07. | 2,8T | 57 | $0,86 |
| GLM-5.2 | Zhipu / Z.ai | 06/2026 | ~744B | ~1 Pkt. über Flash | Nicht verifiziert |
| Qwen3.8-Max | Alibaba | 02.08.2026 GA | 2,4T | Nicht verifiziert | Nicht verifiziert |
| GPT-5.6 Sol | OpenAI | Closed | — | 9+ Pkt. über Flash | $1,86 |
| Claude Fable 5 | Anthropic | Closed | — | 9+ Pkt. über Flash | $3,15 |
Artificial Analysis: V4-Flash nicht höchster Index (hinter Kimi K3, GLM-5.2), aber Kosten/Task ~1/29 Kimi K3, 1/62 GPT-5.6 Sol, 1/105 Claude Fable 5. DeepSeek: „genug Intelligenz + extrem niedriger Preis“ — Preview sieben Wochen OpenRouter-Nutzungsführung.
Kontroversen: Gute Scores ≠ keine Vorbehalte
- Harness-Abhängigkeit: unreleased Framework, nicht auf Claude Code/Cursor übertragbar.
- Usability: niedrige Cache-Hit-Raten, Safety-Classifier-Timeouts (21st Century Business Herald).
- Release-Gerüchte: 10.–20. August unbestätigt.
- Finanzierungsgerüchte: ~7,4 Mrd. USD, ~48,7 Mrd. Bewertung — Medien „laut Berichten“, nicht verifiziert.
Hintergrund: „Liang Baikai“, „Liang Sheng“, Kill Line
Als V4-Pro Mitte Juli fehlte, nannte die Community Gründer Liang Wenfeng „Liang Baikai“ (leeres Versprechen). Nach V4-Flash-0731 wieder „Liang Sheng“. „Kill Line“ (斩杀线): „genug Performance + Tiefpreis“ setzt eine Schwelle — wer weder klar gewinnt noch unterbietet, verliert Relevanz. Erklärt GPT-5.6 Luna ~80 % Preissenkung. Am 31. Juli keine großen Bewegungen bei Nvidia, Broadcom, AMD — Markt gewöhnt an DeepSeek-Effizienz.
Zitierbare technische Fakten (EEAT)
- Architektur gleich: 284B / 13B aktiv, 100 % Post-Training.
- Agent-Scores: Terminal Bench 2.0 82,7 vs V4-Pro-Preview 67,9 (Harness minimal, Vendor).
- Preisfaktoren: vs Opus 4.8 Cache-Miss 36×, Hit 179×, Output 89×.
- Effizienz: 1M Kontext FLOPs 27%, KV 10% von V3.2.
- Artificial Analysis: Index 50, $0,03/Task.
Fünf-Schritte-API-Migrations-Runbook
Step 2 Mapping — deepseek-chat → deepseek-v4-flash (Non-think); deepseek-reasoner → v4-flash Think High oder v4-pro
Step 3 Konfiguration — base_url https://api.deepseek.com; Denkmodus temperature=1.0, top_p=1.0; deepseek-v4-flash → Build 0731
Step 4 Pilot — je 20 Agent-Aufgaben; Token, Cache, Qualität, $/Task; außerhalb Harness vergleichen
Step 5 Hybrid — Bulk V4-Flash-0731; hartes Reasoning Pro-Preview oder Closed-Source; 2× Peak überwachen
FAQ
Was ist der größte Unterschied zwischen DeepSeek V4 und V3.2?
Native 1M-Token-Kontext, deutlich niedrigere Long-Context-FLOPs/KV; V4 für Agent-Tools wie Claude Code und OpenCode optimiert.
V4 Flash oder V4 Pro im Alltag?
Großvolumen und Agent-Pipelines: V4-Flash-0731 (Agent-Scores schlagen V4-Pro-Preview). Tiefes Reasoning mit Budget: V4-Pro-Preview bis offizielle Version.
Kann ich V4 Pro offiziell nutzen?
Stand 5. August 2026 nein. Nur V4-Flash-0731, API-only. V4-Pro und Harness „so schnell wie möglich“; 10.–20. August unbestätigt.
Sind die Benchmark-Zahlen vertrauenswürdig?
SWE-bench Verified relativ glaubwürdig. Terminal Bench 2.0 mit unreleased Harness — unabhängige Reproduktion abwarten.
Was bedeutet das für Entwickler?
Kein Code-Change bei OpenAI/Anthropic-Format — deepseek-v4-flash zeigt auf 0731. Alte Namen seit 24. Juli deaktiviert.
Quellen: DeepSeek API-Docs · V4-Technical-Report · Artificial Analysis · 21st Century Business Herald · Hugging Face
Reine API-Deployments decken 7×24-Agent-Loops, Apple-Toolchain (Xcode, Fastlane, notarytool) oder Air-Gap-Inferenz nicht ab. V4-Flash mit antirez ds4 auf dem Laptop (~160 GB Weights, 128 GB+ Apple Silicon) bedeutet Sleep-Unterbrechungen und vermischte Keys. Für Self-Hosting plus iOS-CI oder OpenClaw: VPSMAC M4 Mac Cloud Nodes mieten — native macOS, SSH + launchd, 128/256/512 GB — stabiler als Privathardware oder Linux-VPS.
Stand: 2026-08-05. Benchmarks inkl. Vendor- und Harness-spezifischer Ergebnisse. Preise und V4-Pro/Harness-Status können sich ändern — vor Produktion offizielle Docs prüfen.