DeepSeek V4-Flash-0731: Benchmarks und Preise erklärt (2026)

Wenn Ihr Agent-Stack noch Closed-Source-Flagship-APIs nutzt, ändert DeepSeeks Upgrade von V4-Flash am 31. Juli 2026 die Kostenstruktur: gleiche 284B/13B-Architektur nur mit neuem Post-Training, Agent-Benchmarks schlagen das größere V4-Pro-Preview, Listenpreise ein Bruchteil von Claude Opus 4.8. Für API-Teams und Beschaffung — Timeline, Preis- und Wettbewerbstabellen, CSA+HCA-Architektur, Harness-Hinweise, Artificial Analysis, „Kill Line“, fünf technische Fakten, 5-Schritte-Runbook, fünf FAQs — Stand 5. August 2026.

DeepSeek V4 Neuronales Netzwerk: Sparse Attention und MoE-Routing visualisiert

Inhaltsverzeichnis

Schmerzpunkte: Warum V4-Flash-0731 API-Routing neu bewertet

  1. Offizielle Version nur API; App und Web unverändert. V4-Flash-0731 vom 31. Juli ist API-only-Beta. Consumer-Oberflächen laufen älter. Wer „alles umgestellt“ annimmt, trennt UX von API-Qualität und kann das Modell nicht mit Laien validieren.
  2. Scores hängen von unreleased Harness ab; DeepSeek warnt vor blindem Vertrauen. Terminal Bench 2.0 mit 82,7 (über V4-Pro-Preview 67,9) wurde vollständig im noch nicht veröffentlichten Harness-Minimalmodus gemessen. Bis Claude Code, Cursor etc. reproduzieren: „Vendor plus Framework“ behandeln.
  3. Kein Datum für V4-Pro offiziell oder public Harness. Chinesische Medien nennen 10.–20. August GA aus anonymen Quellen; Changelog sagt nur „so schnell wie möglich“. Flagship Pro und Agent-Framework fehlen für Production-Harness-Workflows.

Timeline: April-Preview bis Juli „offiziell“

Kerndaten: Preise und Specs

ModellStatusGesamt / aktivKontextInput (Cache-Miss/Hit, pro 1M Token)Output (pro 1M Token)Lizenz
DeepSeek-V4-Flash-0731Offiziell (31.07.2026)284B / 13B1M$0,14 / $0,0028$0,28MIT
DeepSeek-V4-ProPreview (offiziell ausstehend)1,6T / 49B1M$0,435 / $0,003625$0,87MIT
Kimi K3Open weights (27.07.2026)2,8T / ~104B~1,05M$3,00 / $0,30$15,00Kimi K3 License
GLM-5.2Open (Juni 2026)~744B / ~40B1MHier nicht verifiziertHier nicht verifiziertMIT
Qwen3.8-MaxAPI GA (Weights ausstehend)2,4T / 95B1M$2,00 / ~$0,17-0,25$6,00Open weights versprochen

DeepSeek kündigte 2× Peak-Hour-Zuschlag an (Peking 9–12, 14–18 Uhr), ohne Datum. Laut 21st Century Business Herald vs Claude Opus 4.8: Cache-Miss-Input ~36×, Cache-Hit 179×, Output 89× günstiger.

Architektur unverändert, Post-Training stärker

Gleiches 284B-Modell — Gewinn aus Re-Training

V4-Flash-0731 ist identisch in Größe und Struktur zum April-Preview; DeepSeek: gesamter Sprung aus Post-Training. 284B/13B Flash schlägt 1,6T/49B V4-Pro-Preview auf Agent-Benchmarks — Post-Training 2026 nähert sich Skalierung.

CSA+HCA, mHC, Muon

Harness: erstes hauseigenes Agent-Framework

Changelog 31. Juli: DeepSeek Harness — Gegenstück zu Claude Code. Agent-Scores (Terminal Bench 2.0, Toolathlon) mit Harness Minimalmodus (max, top_p=0,95, temperature=1,0). Hinweis: „Scores extrem harness-sensitiv.“

Vergleich: Artificial Analysis und Wettbewerber

ModellLabRelease / WeightsGesamtIntelligence IndexKosten/Task
DeepSeek-V4-Flash-0731DeepSeek31.07.2026284B50$0,03
Kimi K3Moonshot AI16.07. / 27.07.2,8T57$0,86
GLM-5.2Zhipu / Z.ai06/2026~744B~1 Pkt. über FlashNicht verifiziert
Qwen3.8-MaxAlibaba02.08.2026 GA2,4TNicht verifiziertNicht verifiziert
GPT-5.6 SolOpenAIClosed9+ Pkt. über Flash$1,86
Claude Fable 5AnthropicClosed9+ Pkt. über Flash$3,15

Artificial Analysis: V4-Flash nicht höchster Index (hinter Kimi K3, GLM-5.2), aber Kosten/Task ~1/29 Kimi K3, 1/62 GPT-5.6 Sol, 1/105 Claude Fable 5. DeepSeek: „genug Intelligenz + extrem niedriger Preis“ — Preview sieben Wochen OpenRouter-Nutzungsführung.

Kontroversen: Gute Scores ≠ keine Vorbehalte

Hintergrund: „Liang Baikai“, „Liang Sheng“, Kill Line

Als V4-Pro Mitte Juli fehlte, nannte die Community Gründer Liang Wenfeng „Liang Baikai“ (leeres Versprechen). Nach V4-Flash-0731 wieder „Liang Sheng“. „Kill Line“ (斩杀线): „genug Performance + Tiefpreis“ setzt eine Schwelle — wer weder klar gewinnt noch unterbietet, verliert Relevanz. Erklärt GPT-5.6 Luna ~80 % Preissenkung. Am 31. Juli keine großen Bewegungen bei Nvidia, Broadcom, AMD — Markt gewöhnt an DeepSeek-Effizienz.

Zitierbare technische Fakten (EEAT)

Fünf-Schritte-API-Migrations-Runbook

Step 1 Audit — deepseek-chat / deepseek-reasoner grep; alle Agent-Gateway-Routen listen
Step 2 Mapping — deepseek-chat → deepseek-v4-flash (Non-think); deepseek-reasoner → v4-flash Think High oder v4-pro
Step 3 Konfiguration — base_url https://api.deepseek.com; Denkmodus temperature=1.0, top_p=1.0; deepseek-v4-flash → Build 0731
Step 4 Pilot — je 20 Agent-Aufgaben; Token, Cache, Qualität, $/Task; außerhalb Harness vergleichen
Step 5 Hybrid — Bulk V4-Flash-0731; hartes Reasoning Pro-Preview oder Closed-Source; 2× Peak überwachen

FAQ

Was ist der größte Unterschied zwischen DeepSeek V4 und V3.2?

Native 1M-Token-Kontext, deutlich niedrigere Long-Context-FLOPs/KV; V4 für Agent-Tools wie Claude Code und OpenCode optimiert.

V4 Flash oder V4 Pro im Alltag?

Großvolumen und Agent-Pipelines: V4-Flash-0731 (Agent-Scores schlagen V4-Pro-Preview). Tiefes Reasoning mit Budget: V4-Pro-Preview bis offizielle Version.

Kann ich V4 Pro offiziell nutzen?

Stand 5. August 2026 nein. Nur V4-Flash-0731, API-only. V4-Pro und Harness „so schnell wie möglich“; 10.–20. August unbestätigt.

Sind die Benchmark-Zahlen vertrauenswürdig?

SWE-bench Verified relativ glaubwürdig. Terminal Bench 2.0 mit unreleased Harness — unabhängige Reproduktion abwarten.

Was bedeutet das für Entwickler?

Kein Code-Change bei OpenAI/Anthropic-Format — deepseek-v4-flash zeigt auf 0731. Alte Namen seit 24. Juli deaktiviert.

Quellen: DeepSeek API-Docs · V4-Technical-Report · Artificial Analysis · 21st Century Business Herald · Hugging Face

Reine API-Deployments decken 7×24-Agent-Loops, Apple-Toolchain (Xcode, Fastlane, notarytool) oder Air-Gap-Inferenz nicht ab. V4-Flash mit antirez ds4 auf dem Laptop (~160 GB Weights, 128 GB+ Apple Silicon) bedeutet Sleep-Unterbrechungen und vermischte Keys. Für Self-Hosting plus iOS-CI oder OpenClaw: VPSMAC M4 Mac Cloud Nodes mieten — native macOS, SSH + launchd, 128/256/512 GB — stabiler als Privathardware oder Linux-VPS.

Stand: 2026-08-05. Benchmarks inkl. Vendor- und Harness-spezifischer Ergebnisse. Preise und V4-Pro/Harness-Status können sich ändern — vor Produktion offizielle Docs prüfen.