DeepSeek V4 Vollversion (Juli 2026): Preise, Benchmarks & Vergleich mit GPT-5.6

Am 20. Juli 2026 ist DeepSeek V4 in die General Availability (GA) gegangen — drei Monate nach der Preview. Für AI-Entwickler und Modell-Entscheider bedeutet das: Agent-Upgrades, erstmals Spitzen-Tal-API-Preise, SWE-bench Verified 80,6 % und eine harte Migrationsfrist am 24. Juli. Dieser Leitfaden deckt Zeitlinie, CSA/HCA/mHC-Architektur, Benchmarks, Preistabellen, Code-Migration und eine Entscheidungsmatrix gegen GPT-5.6 und Claude Fable 5 ab.

Abstrakte Visualisierung eines grossen Mixture-of-Experts-Modells mit langem Kontextfenster, symbolisch für DeepSeek V4 GA

Inhaltsverzeichnis

Kurzfassung: DeepSeek V4 GA optimiert Agent-, Mathe- und Code-Fähigkeiten, führt werktags Spitzen-Tal-Preise ein und stoppt deepseek-chat am 24. Juli. V4-Pro liefert 80,6 % SWE-bench Verified (Open-Weight-Rekord), 1M Kontext mit 10 % KV-Cache von V3.2 — Output ab $0,87/M (Off-Peak).

Schmerzpunkte: Warum GA jetzt alles neu sortiert

  1. Legacy-API bricht in Tagen ab: deepseek-chat und deepseek-reasoner enden am 24. Juli 2026, 15:59 UTC. Wer nicht migriert, riskiert Produktions-Ausfall — nicht nur höhere Kosten.
  2. Spitzen-Tal-Preise verschärfen 24/7-Pipelines: Werktags 09:00–12:00 und 14:00–18:00 Peking-Zeit verdoppeln sich Raten. Agent-Loops ohne Scheduling können die Rechnung verdoppeln, obwohl Off-Peak weiterhin extrem günstig bleibt.
  3. Modellwahl ohne Kosteneffizienz-Matrix: Claude Fable 5 führt SWE-bench Pro (80,3 %), kostet aber ~$50/M Output; V4-Pro liefert 38 vs. 50 Punkte bei Strategy-&-Ops-Tasks für $0,03 vs. $3,48 pro Aufgabe (116× günstiger). Ohne Routing-Strategie verbrennen Teams Budget an Closed Source.

I. Zeitlinie: Von Preview zur Vollversion

DatumEreignis
24. Apr. 2026V4-Preview + Open Weights (MIT): V4-Pro (1,6T) und V4-Flash (284B)
Mai 2026Produktions-tuned V4-Flash und V4-Pro, API live
Juni 2026V4-Pro Output dauerhaft −75 % ($0,87/M); historisch günstigste Frontier-Zone
29. Juni 2026E-Mail an alle API-Nutzer: GA Mitte Juli + erste Spitzen-Tal-Details
19. Juli 2026GA-Grau-Tests; Medienberichte „Vollversion morgen“
20. Juli 2026GA offiziell live
24. Juli 2026deepseek-chat / deepseek-reasoner permanent offline
Ein Satz: Die Architektur ist dieselbe MoE-Basis wie im April — GA bringt Stabilität, Agent-Optimierung und erstmals disziplinierte Spitzen-Tal-Preise statt „fast gratis“.

II. Architektur: Wie 1M Token praktikabel wird

Modell-Familie

SpezifikationV4-ProV4-Flash
Gesamtparameter1,6T284B
Aktiv pro Token49B (3 %)13B (4,6 %)
Transformer-Schichten6143
Kontextfenster1.000.000 tokens1.000.000 tokens
Max. Output384K384K
PräzisionFP4 (Experten) + FP8FP4 + FP8
Pretraining33T+ tokens32T+ tokens
LizenzMITMIT

① CSA + HCA — Hybrid-Attention statt MLA

DeepSeek V4 ersetzt die MLA aus V2/V3 durch zwei komplementäre Mechanismen:

Effekt bei 1M Kontext: nur 27 % der FLOPs vs. V3.2; KV-Cache 10 % (Flash: 7 %) — das macht lange Kontexte wirtschaftlich servierbar.

② mHC — Manifold-Constrained Hyper-Connections

Vier Kanäle Residual-Stream mit doppelt-stochastischer Mischmatrix (Birkhoff-Polytop) stabilisieren Gradienten durch 61 tiefe Layer — tiefere Netze ohne klassische Residual-Dilution.

③ Muon-Optimierer

Training mit Muon statt AdamW: Newton-Schulz-Orthogonalisierung der Gradienten → schnellere Konvergenz und stabilere Runs bei MoE-Scale.

Drei Reasoning-Modi

ModusEigenschaftEinsatz
Non-thinkKeine CoT, schnellRouting, FAQ, Klassifikation
Think HighExplizites ReasoningCode-Debug, mittlere Komplexität
Think MaxMaximale Reasoning-TiefeMathe, Multi-Step-Agenten (384K+ Kontext)

Empfohlene Sampling-Parameter (offiziell): temperature=1.0, top_p=1.0 — alle Modi.

III. Benchmarks: Wo V4-Pro gewinnt — und wo nicht

BenchmarkDeepSeek V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80,6 % ★ Open-Weight-Rekord96,0 %k. A.~69 %
SWE-bench Pro55,4 %80,3 %78,1 %69,2 %
LiveCodeBench (Pass@1)93,5 %88,1 %87,4 %83,2 %
Codeforces Elo3.206
Terminal-Bench 2.183,9 %88,0 %85,1 %82,7 %

Kosten-Realität (Artificial Analysis, Strategy & Ops): Fable 5 — 50 Punkte, $3,48/Aufgabe; V4-Pro — 38 Punkte, $0,03/Aufgabe (116× günstiger bei ~24 % Score-Differenz). V4-Flash liegt bei allen sechs Index-Kategorien unter $0,04/Aufgabe.

⚠️ Benchmarks teils Hersteller-Selbstmeldungen; unabhängige Reproduktionen laufen — Pilot-Tasks entscheiden lassen.

IV. DeepSeek V4 vs. GPT-5.6 vs. Claude Fable 5

DimensionDeepSeek V4-ProGPT-5.6 SolClaude Fable 5
Open Weights / Self-Host✅ MIT
1M Kontextnicht bestätigt
Top Coding (SWE-bench Pro)Zweite LigaZweite Liga✅ Führend
Algorithmen / LiveCodeBench✅ FührendStark
Output (Off-Peak)$0,87/M~$15/M~$50/M
Output (Peak)$1,74/M
Datensouveränität✅ Self-Host möglich

V. Spitzen-Tal-Preise: Sparen ohne Leistungsverlust

Erstmals differenziert DeepSeek nach Tageszeit — ähnlich Stromtarifen.

ModellPositionOff-PeakPeak (2×)
V4-ProInput Cache-Hit¥0,025 / $0,0035 / 1M
V4-ProInput Cache-Miss¥3,00 / $0,435 / 1M¥6,00 / $0,87
V4-ProOutput¥6,00 / $0,87 / 1M¥12,00 / $1,74
V4-FlashInput Cache-Hit¥0,02 / $0,0028 / 1M
V4-FlashInput Cache-Miss¥1,00 / $0,14 / 1M¥2,00 / $0,28
V4-FlashOutput¥2,00 / $0,28 / 1M¥4,00 / $0,56

Peak (Peking): Werktags 09:00–12:00 und 14:00–18:00.

Spartipps

  1. Batch-Jobs (Docs, Code-Review, Labeling) nach 18:00 oder vor 09:00 schedulen.
  2. Statische System-Prompts cachen — V4-Flash Cache-Hit nur $0,0028/M.
  3. Flash für Routing/Intent, Pro nur für schwere Reasoning-Pfade (60–80 % Kostensenkung typisch).
  4. DeepSeek mailt Preisänderungen 24 h vorher — Account-E-Mail überwachen.

Selbst im Peak: V4-Pro Output $1,74/M ist 8,6× günstiger als Claude Opus 4.8 ($15/M) oder GPT-5.6 Sol (~$15/M).

VI. API-Migration — Deadline 24. Juli ⚠️

AltNeuHinweis
deepseek-chatdeepseek-v4-flash (Non-think)Drop-in für Chat
deepseek-reasonerdeepseek-v4-flash (Think) oder deepseek-v4-proStärkeres Reasoning mit Pro

OpenAI SDK (Python)

from openai import OpenAI client = OpenAI( api_key="your_deepseek_api_key", base_url="https://api.deepseek.com" ) # ❌ Alt — ab 24.07. tot # client.chat.completions.create(model="deepseek-chat", messages=[...]) # ✅ Neu response = client.chat.completions.create( model="deepseek-v4-pro", # oder deepseek-v4-flash messages=[{"role": "user", "content": "Analysiere dieses Repo..."}] ) # ✅ Think-Modus (ersetzt deepseek-reasoner) response = client.chat.completions.create( model="deepseek-v4-pro", messages=[{"role": "user", "content": "Schritt für Schritt..."}], extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}} )

Anthropic SDK

import anthropic client = anthropic.Anthropic( api_key="your_deepseek_api_key", base_url="https://api.deepseek.com" ) message = client.messages.create( model="deepseek-v4-pro", max_tokens=4096, messages=[{"role": "user", "content": "Was ändert sich in V4 GA?"}] )

VII. Entscheidungsmatrix: Welches Modell wann?

SzenarioEmpfehlungGrund
Budget / hohe API-Frequenz / Self-HostV4-Pro oder V4-Flash$0,87/M Output, MIT, 1M Kontext
Maximales Repo-Level-CodingClaude Fable 580,3 % SWE-bench Pro
Terminal-/Shell-AgentenGPT-5.6 SolTerminal-Bench 85,1 %
Massen-Dokumente / Logs günstigV4-FlashCache-Hit $0,0028/M Input
Algorithmen / WettbewerbsprogrammierungV4-ProLiveCodeBench 93,5 %, Elo 3.206
Compliance / keine Cloud-DatenV4-Pro self-hostedMIT, private Inferenz

EEAT — harte Fakten

VIII. 5-Schritte-Migrations-Runbook

Schritt 1 Codebase nach deepseek-chat / deepseek-reasoner scannen; Staging-Keys isolieren Schritt 2 Mapping: Chat → deepseek-v4-flash; Reasoning → deepseek-v4-pro oder Flash+thinking Schritt 3 SDK: base_url=https://api.deepseek.com, model=deepseek-v4-pro oder deepseek-v4-flash Schritt 4 Spitzen-Tal: Batch nach 18:00 Peking; System-Prompt-Cache aktivieren; Flash→Pro-Routing Schritt 5 20 Pilot-Tasks vor 24.07.; Qualität/Token/Kosten loggen; Produktion schalten

IX. Häufige Fragen (FAQ)

F: Was ist neu in GA vs. Preview?

A: Agent-/Mathe-/Code-Optimierung, Spitzen-Tal-Preise, Legacy-Namen enden 24. Juli. Architektur unverändert.

F: Wie spare ich bei Spitzen-Tal?

A: Off-Peak schedulen, Cache-Hits maximieren, Flash als First-Pass — siehe Abschnitt V.

F: Muss ich migrieren?

A: Ja, bis 24.07. 15:59 UTC. Ersetzen Sie chat/reasoner durch v4-flash oder v4-pro.

F: V4-Pro vs. GPT-5.6?

A: V4 günstiger und self-hostable; GPT-5.6 stärker bei Terminal-Agenten. Output $0,87/M vs. ~$15/M.

F: Self-Hosting realistisch?

A: MIT-Gewichte verfügbar; 1,6T MoE braucht dedizierte GPU/NPU — siehe Mac-Cloud-Inferenz-Leitfaden.

F: Reasoning-Modi?

A: Non-think, Think High, Think Max — Sampling temperature=1.0, top_p=1.0.

Fazit

DeepSeek V4 GA ist kein Marketing-Relaunch, sondern der Übergang von „fast gratis Preview“ zu einer produktionsreifen Open-Weight-Plattform mit disziplinierter Preislogik. Der Wert liegt nicht darin, Claude Fable 5 sofort zu schlagen, sondern Frontier-Nähe zu 1/10 bis 1/100 der Closed-Source-Kosten — mit 1M Kontext, der technisch funktioniert, und MIT-Lizenz für Compliance-Teams.

Wer Agent-Pipelines nur auf Laptop, Linux-VPS oder gemischten Dev-Maschinen betreibt, kämpft mit Schlafmodus-Unterbrechungen, unsicherer Key-Lagerung neben Produktions-Repos und fehlender Apple-Toolchain (Xcode, Fastlane, notarytool) für parallele iOS-CI. Für 7×24 DeepSeek-V4-Agenten plus OpenClaw-Gateway und native macOS-Builds ist VPSMAC M4 Mac Cloud — SSH, launchd, isolierte Keys — die stabilere Produktionsbasis als DIY-Hardware oder reine API-only-Setups ohne auditierbare Laufzeitumgebung.

Quellen: DeepSeek API Docs · arXiv:2606.19348 · HuggingFace · Artificial Analysis · LLMReference

Datenstand: 20. Juli 2026. Benchmarks teils DeepSeek-Selbstmeldungen; Preise und Fristen vor Go-Live in offiziellen Docs prüfen.