DeepSeek V4 Vollversion (Juli 2026): Preise, Benchmarks & Vergleich mit GPT-5.6
Am 20. Juli 2026 ist DeepSeek V4 in die General Availability (GA) gegangen — drei Monate nach der Preview. Für AI-Entwickler und Modell-Entscheider bedeutet das: Agent-Upgrades, erstmals Spitzen-Tal-API-Preise, SWE-bench Verified 80,6 % und eine harte Migrationsfrist am 24. Juli. Dieser Leitfaden deckt Zeitlinie, CSA/HCA/mHC-Architektur, Benchmarks, Preistabellen, Code-Migration und eine Entscheidungsmatrix gegen GPT-5.6 und Claude Fable 5 ab.
Inhaltsverzeichnis
deepseek-chat am 24. Juli. V4-Pro liefert 80,6 % SWE-bench Verified (Open-Weight-Rekord), 1M Kontext mit 10 % KV-Cache von V3.2 — Output ab $0,87/M (Off-Peak).Schmerzpunkte: Warum GA jetzt alles neu sortiert
- Legacy-API bricht in Tagen ab:
deepseek-chatunddeepseek-reasonerenden am 24. Juli 2026, 15:59 UTC. Wer nicht migriert, riskiert Produktions-Ausfall — nicht nur höhere Kosten. - Spitzen-Tal-Preise verschärfen 24/7-Pipelines: Werktags 09:00–12:00 und 14:00–18:00 Peking-Zeit verdoppeln sich Raten. Agent-Loops ohne Scheduling können die Rechnung verdoppeln, obwohl Off-Peak weiterhin extrem günstig bleibt.
- Modellwahl ohne Kosteneffizienz-Matrix: Claude Fable 5 führt SWE-bench Pro (80,3 %), kostet aber ~$50/M Output; V4-Pro liefert 38 vs. 50 Punkte bei Strategy-&-Ops-Tasks für $0,03 vs. $3,48 pro Aufgabe (116× günstiger). Ohne Routing-Strategie verbrennen Teams Budget an Closed Source.
I. Zeitlinie: Von Preview zur Vollversion
| Datum | Ereignis |
|---|---|
| 24. Apr. 2026 | V4-Preview + Open Weights (MIT): V4-Pro (1,6T) und V4-Flash (284B) |
| Mai 2026 | Produktions-tuned V4-Flash und V4-Pro, API live |
| Juni 2026 | V4-Pro Output dauerhaft −75 % ($0,87/M); historisch günstigste Frontier-Zone |
| 29. Juni 2026 | E-Mail an alle API-Nutzer: GA Mitte Juli + erste Spitzen-Tal-Details |
| 19. Juli 2026 | GA-Grau-Tests; Medienberichte „Vollversion morgen“ |
| 20. Juli 2026 | GA offiziell live |
| 24. Juli 2026 | deepseek-chat / deepseek-reasoner permanent offline |
Ein Satz: Die Architektur ist dieselbe MoE-Basis wie im April — GA bringt Stabilität, Agent-Optimierung und erstmals disziplinierte Spitzen-Tal-Preise statt „fast gratis“.
II. Architektur: Wie 1M Token praktikabel wird
Modell-Familie
| Spezifikation | V4-Pro | V4-Flash |
|---|---|---|
| Gesamtparameter | 1,6T | 284B |
| Aktiv pro Token | 49B (3 %) | 13B (4,6 %) |
| Transformer-Schichten | 61 | 43 |
| Kontextfenster | 1.000.000 tokens | 1.000.000 tokens |
| Max. Output | 384K | 384K |
| Präzision | FP4 (Experten) + FP8 | FP4 + FP8 |
| Pretraining | 33T+ tokens | 32T+ tokens |
| Lizenz | MIT | MIT |
① CSA + HCA — Hybrid-Attention statt MLA
DeepSeek V4 ersetzt die MLA aus V2/V3 durch zwei komplementäre Mechanismen:
- CSA (Compressed Sparse Attention): KV 4× via Softmax-Gating komprimiert; FP4 „Lightning Indexer“ wählt top-1024 (Pro) bzw. top-512 (Flash); 128-Token-Sliding-Window für Recency.
- HCA (Heavily Compressed Attention): 128× Kompression, dann globale Dense-Attention für Fernabhängigkeiten; bei Flash erste 2 Layer HCA, danach CSA/HCA alternierend.
Effekt bei 1M Kontext: nur 27 % der FLOPs vs. V3.2; KV-Cache 10 % (Flash: 7 %) — das macht lange Kontexte wirtschaftlich servierbar.
② mHC — Manifold-Constrained Hyper-Connections
Vier Kanäle Residual-Stream mit doppelt-stochastischer Mischmatrix (Birkhoff-Polytop) stabilisieren Gradienten durch 61 tiefe Layer — tiefere Netze ohne klassische Residual-Dilution.
③ Muon-Optimierer
Training mit Muon statt AdamW: Newton-Schulz-Orthogonalisierung der Gradienten → schnellere Konvergenz und stabilere Runs bei MoE-Scale.
Drei Reasoning-Modi
| Modus | Eigenschaft | Einsatz |
|---|---|---|
| Non-think | Keine CoT, schnell | Routing, FAQ, Klassifikation |
| Think High | Explizites Reasoning | Code-Debug, mittlere Komplexität |
| Think Max | Maximale Reasoning-Tiefe | Mathe, Multi-Step-Agenten (384K+ Kontext) |
Empfohlene Sampling-Parameter (offiziell): temperature=1.0, top_p=1.0 — alle Modi.
III. Benchmarks: Wo V4-Pro gewinnt — und wo nicht
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % ★ Open-Weight-Rekord | 96,0 % | k. A. | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3.206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
Kosten-Realität (Artificial Analysis, Strategy & Ops): Fable 5 — 50 Punkte, $3,48/Aufgabe; V4-Pro — 38 Punkte, $0,03/Aufgabe (116× günstiger bei ~24 % Score-Differenz). V4-Flash liegt bei allen sechs Index-Kategorien unter $0,04/Aufgabe.
⚠️ Benchmarks teils Hersteller-Selbstmeldungen; unabhängige Reproduktionen laufen — Pilot-Tasks entscheiden lassen.
IV. DeepSeek V4 vs. GPT-5.6 vs. Claude Fable 5
| Dimension | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open Weights / Self-Host | ✅ MIT | ❌ | ❌ |
| 1M Kontext | ✅ | nicht bestätigt | ✅ |
| Top Coding (SWE-bench Pro) | Zweite Liga | Zweite Liga | ✅ Führend |
| Algorithmen / LiveCodeBench | ✅ Führend | Stark | — |
| Output (Off-Peak) | $0,87/M | ~$15/M | ~$50/M |
| Output (Peak) | $1,74/M | — | — |
| Datensouveränität | ✅ Self-Host möglich | ❌ | ❌ |
V. Spitzen-Tal-Preise: Sparen ohne Leistungsverlust
Erstmals differenziert DeepSeek nach Tageszeit — ähnlich Stromtarifen.
| Modell | Position | Off-Peak | Peak (2×) |
|---|---|---|---|
| V4-Pro | Input Cache-Hit | ¥0,025 / $0,0035 / 1M | 2× |
| V4-Pro | Input Cache-Miss | ¥3,00 / $0,435 / 1M | ¥6,00 / $0,87 |
| V4-Pro | Output | ¥6,00 / $0,87 / 1M | ¥12,00 / $1,74 |
| V4-Flash | Input Cache-Hit | ¥0,02 / $0,0028 / 1M | 2× |
| V4-Flash | Input Cache-Miss | ¥1,00 / $0,14 / 1M | ¥2,00 / $0,28 |
| V4-Flash | Output | ¥2,00 / $0,28 / 1M | ¥4,00 / $0,56 |
Peak (Peking): Werktags 09:00–12:00 und 14:00–18:00.
Spartipps
- Batch-Jobs (Docs, Code-Review, Labeling) nach 18:00 oder vor 09:00 schedulen.
- Statische System-Prompts cachen — V4-Flash Cache-Hit nur $0,0028/M.
- Flash für Routing/Intent, Pro nur für schwere Reasoning-Pfade (60–80 % Kostensenkung typisch).
- DeepSeek mailt Preisänderungen 24 h vorher — Account-E-Mail überwachen.
Selbst im Peak: V4-Pro Output $1,74/M ist 8,6× günstiger als Claude Opus 4.8 ($15/M) oder GPT-5.6 Sol (~$15/M).
VI. API-Migration — Deadline 24. Juli ⚠️
| Alt | Neu | Hinweis |
|---|---|---|
deepseek-chat | deepseek-v4-flash (Non-think) | Drop-in für Chat |
deepseek-reasoner | deepseek-v4-flash (Think) oder deepseek-v4-pro | Stärkeres Reasoning mit Pro |
OpenAI SDK (Python)
Anthropic SDK
VII. Entscheidungsmatrix: Welches Modell wann?
| Szenario | Empfehlung | Grund |
|---|---|---|
| Budget / hohe API-Frequenz / Self-Host | V4-Pro oder V4-Flash | $0,87/M Output, MIT, 1M Kontext |
| Maximales Repo-Level-Coding | Claude Fable 5 | 80,3 % SWE-bench Pro |
| Terminal-/Shell-Agenten | GPT-5.6 Sol | Terminal-Bench 85,1 % |
| Massen-Dokumente / Logs günstig | V4-Flash | Cache-Hit $0,0028/M Input |
| Algorithmen / Wettbewerbsprogrammierung | V4-Pro | LiveCodeBench 93,5 %, Elo 3.206 |
| Compliance / keine Cloud-Daten | V4-Pro self-hosted | MIT, private Inferenz |
EEAT — harte Fakten
- MoE-Scale: 1,6T gesamt, 49B aktiv — 3 % Sparsity pro Token.
- KV-Effizienz: 1M Kontext mit 10 % KV-Speicher vs. V3.2 (Flash: 7 %).
- Open-Weight-Coding: SWE-bench Verified 80,6 %, geteilt mit Gemini 3.1 Pro als Bestwert unter Open Weights.
- Kostenhebel: Strategy-&-Ops $0,03 vs. $3,48 pro Task (116×).
- Peak-Surcharge: Werktags-Doppelpreis, Off-Peak weiterhin unter jedem Closed-Source-Flaggschiff.
VIII. 5-Schritte-Migrations-Runbook
IX. Häufige Fragen (FAQ)
F: Was ist neu in GA vs. Preview?
A: Agent-/Mathe-/Code-Optimierung, Spitzen-Tal-Preise, Legacy-Namen enden 24. Juli. Architektur unverändert.
F: Wie spare ich bei Spitzen-Tal?
A: Off-Peak schedulen, Cache-Hits maximieren, Flash als First-Pass — siehe Abschnitt V.
F: Muss ich migrieren?
A: Ja, bis 24.07. 15:59 UTC. Ersetzen Sie chat/reasoner durch v4-flash oder v4-pro.
F: V4-Pro vs. GPT-5.6?
A: V4 günstiger und self-hostable; GPT-5.6 stärker bei Terminal-Agenten. Output $0,87/M vs. ~$15/M.
F: Self-Hosting realistisch?
A: MIT-Gewichte verfügbar; 1,6T MoE braucht dedizierte GPU/NPU — siehe Mac-Cloud-Inferenz-Leitfaden.
F: Reasoning-Modi?
A: Non-think, Think High, Think Max — Sampling temperature=1.0, top_p=1.0.
Fazit
DeepSeek V4 GA ist kein Marketing-Relaunch, sondern der Übergang von „fast gratis Preview“ zu einer produktionsreifen Open-Weight-Plattform mit disziplinierter Preislogik. Der Wert liegt nicht darin, Claude Fable 5 sofort zu schlagen, sondern Frontier-Nähe zu 1/10 bis 1/100 der Closed-Source-Kosten — mit 1M Kontext, der technisch funktioniert, und MIT-Lizenz für Compliance-Teams.
Wer Agent-Pipelines nur auf Laptop, Linux-VPS oder gemischten Dev-Maschinen betreibt, kämpft mit Schlafmodus-Unterbrechungen, unsicherer Key-Lagerung neben Produktions-Repos und fehlender Apple-Toolchain (Xcode, Fastlane, notarytool) für parallele iOS-CI. Für 7×24 DeepSeek-V4-Agenten plus OpenClaw-Gateway und native macOS-Builds ist VPSMAC M4 Mac Cloud — SSH, launchd, isolierte Keys — die stabilere Produktionsbasis als DIY-Hardware oder reine API-only-Setups ohne auditierbare Laufzeitumgebung.
Quellen: DeepSeek API Docs · arXiv:2606.19348 · HuggingFace · Artificial Analysis · LLMReference
Datenstand: 20. Juli 2026. Benchmarks teils DeepSeek-Selbstmeldungen; Preise und Fristen vor Go-Live in offiziellen Docs prüfen.