Warum DeepSeek die API-Preise um bis zu 1.100 % erhöhte – nach Chinas Open-Weight-Offensive

Entwickler und Einkaufsverantwortliche verbrachten den 12. bis 17. August mit drei Schritten, die sich widersprechen: DeepSeek erhöhte API-Preise auf bestimmten Stufen um bis zu 1.100 %, Alibaba veröffentlichte erstmals Open Weights eines 2,4-Billionen-Parameter-Flaggschiffs, und Zhipu lieferte GLM-5.3 mit rund 6x Coding-Benchmark-Gewinn auf demselben Basismodell. Die Schlussfolgerung: Chinas Labore wechseln vom reinen Preiswettbewerb zum Wettbewerb um Preisgestaltungsmacht. Dieser Artikel enthält eine Zeitlinie, drei Datentabellen, eine direkte Preismatrix und ein Fünf-Schritte-Auswahl-Runbook.

Abstrakte Visualisierung einer neuronalen Netzkugel mit Verbindungslinien, Sinnbild für große Sprachmodelle und Open-Weight-Veröffentlichungen

Inhalt

Drei Fallstricke, die Entwickler zuerst treffen

  1. Die Headline 1.100 % ist zutreffend, aber unvollständig. Medien zitierten 11x, 1.100 % und 350 %, als beschrieben sie dieselbe Rechnung. Das tun sie nicht. Diese Zahlen gehören zu unterschiedlichen Positionen: Cache-Hit-Input, Output und Cache-Miss-Input. Wer die Headline als ganze Rechnung nimmt, überschätzt oder unterschätzt die realen Kosten.
  2. Die offizielle API ist nicht mehr automatisch der günstigste Weg. Zu Peak-Stunden liegt DeepSeeks offizielle API nun über mehreren Drittanbieter-Resellern (GMI Cloud, Novita und andere listen V4 Pro derzeit unter DeepSeeks neuem Peak-Tarif). Der Default über den offiziellen Kanal ist keine sichere Kostenannahme mehr.
  3. Open Weights bedeuten nicht mehr Apache 2.0. Alibaba veröffentlichte einen 2.4T-Checkpoint unter einer eigenen Qwen3.8-Max License: jedes Model-as-a-Service- oder AI-Work-Assistant-Geschäft mit über $50 million in einem beliebigen 12-Monats-Zeitraum muss eine separate kommerzielle Lizenz verhandeln; Produkte mit 100M+ monatlich aktiven Nutzern oder $20M+ Monatsumsatz müssen den Modellnamen prominent anzeigen. Behauptungen, die Lizenz verbiete Downloads aus den USA, der EU, dem Vereinigten Königreich und Südkorea, sind falsch. Der veröffentlichte Text hat keine geografische Klausel.

Zeitlinie: was wann passierte

DatumEreignis
16. Juli 2026Moonshot AI veröffentlicht Open Weights von Kimi K3 (2.8T Parameter) und zieht US-Sicherheitsprüfung auf sich
2.–3. August 2026Alibaba kündigt Qwen3.8-Max an und startet es als gehostete API
10. August 2026Meta veröffentlicht Muse Glimmer (30B, Apache 2.0) und kündigt Open Weights für das Flaggschiff Muse Spark 1.2 an
12. August 2026Alibaba veröffentlicht Qwen3.8-2.4T-A95B Open Weights auf Hugging Face/ModelScope; xAI liefert Grok 4.6
13. August 2026DeepSeek-V4-Pro geht GA und kündigt eine Preiserhöhung zum 17. August an; Google liefert rabattiertes Gemini 3.7 Flash
14. August 2026Zhipu liefert GLM-5.3 und nutzt die 743B-Basis von GLM-5.2 weiter
17. August 2026, 00:00 Uhr Peking-ZeitDeepSeeks neue Preise treten in Kraft

Weiter herausgezoomt: Am 30. Juli senkte OpenAI die Preise der günstigsten Stufe (GPT-5.6 Luna, minus 80 %), dann machte Luna am 6.–7. August den kostenlosen Default mit unbegrenzten Textchats. Während chinesische Labore Preise anhoben und Flaggschiff-Gewichte öffneten, senkten US-Labore Preise und gingen auf der Verbraucherebene zur selben Zeit ins Kostenlose. Das ist kein Zufall; es sind zwei Seiten desselben Preiskampfs.

Die Zahlen: was sich tatsächlich geändert hat

DeepSeeks Preiserhöhung, Stufe für Stufe (wirksam 17. August, 00:00 Uhr Peking-Zeit; Peak-Stunden sind 9-12 und 14-18 Uhr Peking-Zeit)

Abrechnungsposition (pro 1M Tokens)Alter PreisNeue NebenzeitNeuer PeakPeak-Anstieg
V4-Flash Cache-Hit (Input)¥0.02¥0.05¥0.10~400%
V4-Flash Cache-Miss (Input)¥1.0¥1.5¥3.0200%
V4-Flash Output¥2.0¥4.5¥9.0350%
V4-Pro Cache-Hit (Input)¥0.025¥0.15¥0.30~1,100%
V4-Pro Cache-Miss (Input)¥3.0¥4.5¥9.0200%
V4-Pro Output¥6.0¥13.5¥27.0350%
Die Headline-Zahl 1.100 % gilt speziell für Peak-Cache-Hit-Input-Preise, die Stufe, die am nächsten am Kostenlosen lag. Output-Preise, die für die meisten realen Rechnungen stärker wiegen, stiegen um 350 %. Unabhängige Kostenmodellierung fand, dass eine realistische Schwerlast (etwa 84M Tokens/Monat, überwiegend Nebenzeit, zur Hälfte Cache-Hits) einen Rechnungsanstieg näher bei 1.8x sieht.

Qwen3.8-2.4T-A95B (Qwen3.8-Max Open Weights): Kernspezifikationen

SpezifikationDetail
Parameter2.4T gesamt, 95B aktiv pro Token (MoE, 512 Experts, 10 geroutet + 1 shared)
Kontextfenster262,144 Tokens nativ (offener Checkpoint), erweiterbar auf ~1.01M; gehostete Max-Version defaultet auf 1M
Release-TaktVorschau 2. August → API live 3. August → Open Weights 12. August
API-Preise (international)$2/M Input, $6/M Output
LizenzNicht Apache 2.0 — eine eigene Qwen3.8-Max License
Warum es zähltErstmals hat Alibaba ein Max-Flaggschiff als Open Weights veröffentlicht; Qwen3.5/3.6/3.7 Max blieben API-only

GLM-5.3 vs. GLM-5.2: dasselbe Basismodell, nur Post-Training

BenchmarkGLM-5.2GLM-5.3Änderung
Terminal-Bench 3.04.6%28.3%+23.7 pts
DeepSWE v1.146.2%66.9%+20.7 pts
Agents' Last Exam (CLI)23.8%28.5%+4.7 pts
CyberGym77.2%84.5%+7.3 pts
AutomationBench26.2%48.2%+22.0 pts
Das sind Zhipus eigene gemeldete Zahlen — eine unabhängige Drittprüfung wurde noch nicht veröffentlicht. GLM-5.3 liegt auf Terminal-Bench 3.0 weiter hinter GPT-5.6 Sol (34.6%) und Claude Fable 5 (33.7%); es ist ein Spitzenergebnis unter Open-Weight-Modellen, kein klarer Frontier-Sieg.

Die drei Strategien im Detail

DeepSeek: von Einheitspreis zu Tageszeit-Preis — das ist ein Kapazitätsproblem

Die einfachste Fehldeutung von DeepSeeks Schritt ist, Chinas günstigstes Modell sei dem Margendruck erlegen. Die Struktur liest sich eher so, als mache das Unternehmen seine Rechenengpässe zum ersten Mal im Preisblatt sichtbar. DeepSeeks alter, immer günstiger Einheitspreis funktionierte als Kundengewinnung, solange die GPU-Kapazität mit der Nachfrage mithielt. Als die Nutzung exponentiell wuchs und die Kapazität nicht, musste etwas explizit werden — und „flexiblere Workload-Planung fördern“ in der offiziellen Ankündigung ist Konzernsprache für „unsere Peak-Rechenleistung ist knapp, bitte verlagern Sie die Last selbst“.

Ein Detail, das die internationale Berichterstattung meist übersah: Zu Peak-Stunden liegt DeepSeeks eigene offizielle API-Preis nun über mehreren Drittanbieter-Resellern (GMI Cloud, Novita und andere listen V4 Pro derzeit unter DeepSeeks neuem Peak-Tarif). Die Annahme, die offizielle API sei immer der günstigste Weg, DeepSeek zu betreiben, ist zum ersten Mal gebrochen.

Alibaba: Open Weights kaufen Ökosystem-Wohlwollen; eine Custom-Lizenz schützt die Umsatzdecke

Das Open-Weighting von Qwen3.8-Max ist keine schlichte Großzügigkeit. Alibaba tat zwei Dinge gleichzeitig: Es veröffentlichte den vollständigen 2.4T-Parameter-Checkpoint zum kostenlosen Download und hängte eine eigene Lizenz daran — nicht das permissive Apache 2.0 der kleineren Qwen-Modelle —, die jedes Model-as-a-Service- oder AI-Work-Assistant-Geschäft mit über $50 million in einem beliebigen 12-Monats-Zeitraum zu einer separaten kommerziellen Lizenz verpflichtet und Produkte mit 100M+ monatlich aktiven Nutzern oder $20M+ Monatsumsatz zwingt, den Modellnamen prominent anzuzeigen.

Die Logik: Die Gewichte hergeben, um Entwickler-Mindshare zu gewinnen (besonders international, wo ein Made-in-China-Modell bei Enterprise-Käufern noch Zögern auslöst), und gleichzeitig Preishebel über die wenigen Firmen behalten, die darauf ein konkurrierendes Inferenzgeschäft bauen können. Das ist ein wesentlich anderer Einsatz als Metas Muse Glimmer, das unter uneingeschränktem Apache 2.0 erscheint.

Ein Gerücht, das ausdrücklich tot ist: Online kursierte, Alibabas Lizenz verbiete Downloads aus den USA, der EU, dem Vereinigten Königreich und Südkorea. Das ist falsch. Der veröffentlichte Lizenztext enthält keinerlei geografische oder territoriale Klausel.

GLM-5.3: kein neues Basismodell, nur eine größere Post-Training-Wette

Die interessanteste Tatsache zu GLM-5.3 ist nicht der Score, sondern die Methode: dieselbe 743B-Parameter-Basis wie GLM-5.2, kein erneutes Training und ein rund 6x-Sprung auf Terminal-Bench 3.0 (4.6% → 28.3%) allein durch Skalierung der Reinforcement-Learning-Umgebungen im Post-Training. Das bestätigt einen Trend, der sich seit Monaten industrieweit aufbaut — während Pretraining-Scaling-Laws abnehmende Erträge zeigen, wird Post-Training-RL-Skalierung zu einem eigenständigen Leistungshebel mit deutlich niedrigerer Kostenschwelle als das Neutrainieren eines Foundation-Modells. Das ist eine spürbar niedrigere Einstiegshürde und erklärt, warum mittlere Labore ohne OpenAI-skalierte Rechenbudgets die Lücke bei agentischen und Coding-Benchmarks noch schließen können.

Direktvergleich: Ist DeepSeek noch das günstigste Frontier-Modell?

ModellInput (pro 1M Tokens)Output (pro 1M Tokens)Open Weights?
DeepSeek V4-Pro (Peak)¥9.0 (~$1.26)¥27.0 (~$3.78)Nein
DeepSeek V4-Pro (Nebenzeit)¥4.5 (~$0.63)¥13.5 (~$1.89)Nein
Qwen3.8-Max (internationale API)$2.00$6.00Ja (Custom-Lizenz)
OpenAI GPT-5.6 Luna$0.20$1.20Nein
Claude Opus 5 (impliziert, laut Alibabas eigenem Vergleichsverhältnis)~$5.00~$25.00Nein
RMB-zu-USD-Umrechnung bei etwa ¥7.15/$1, näherungsweise. Auch nach der Erhöhung liegt DeepSeek V4-Pro in der Nebenzeit weiter deutlich unter Claude Opus 5, ist aber nicht mehr die eindeutig günstigste Option — sowohl die internationale Preisgestaltung von Qwen3.8-Max als auch OpenAIs Luna unterbieten DeepSeeks Nebenzeiten-Tarif. „Chinesisches Modell = günstigstes Modell“ galt den Großteil von 2025 und Anfang 2026; das ist keine sichere Annahme mehr.

Was umstritten oder unverifiziert ist

Warum das zählt: zwei Preiskriege parallel

Über etwa den vergangenen Monat haben Chinas Top-Labore Major-Releases in einem Takt ausgeliefert, den inländische Finanzmedien „drei Modell-Updates pro Woche“ nennen — DeepSeek, Alibaba und Zhipu, plus Moonshots Kimi K3 (Open Weights 16. Juli, 2.8T Parameter) und zuvor MiniMax H3. Die chinesische Berichterstattung rahmt das weitgehend so, dass chinesische Open-Weight-Releases eine globale Neubepreisung der KI-Branche erzwingen.

US-Labore fahren auf der Verbraucherebene den gegenteiligen Play: OpenAI senkte die Preise der günstigsten Stufe um 80 % (30. Juli) und machte dieses Modell eine Woche später kostenlos und unbegrenzt für alle Nutzer (6.–7. August); Google lieferte ein coding-fokussiertes Modell zum halben Preis seines drei Wochen alten Vorgängers (13. August). Während chinesische Labore Flaggschiffe öffnen und gestufte, höhere Preise am rechenknappen oberen Ende einführen, rennen US-Labore am Verbraucherende Richtung kostenlos und günstig.

Es gibt auch eine geopolitische Schicht, die vorsichtig zu benennen ist. Moonshots Kimi-K3-Open-Weighting im Juli zog bereits US-Sicherheitsprüfung auf sich; dass Alibaba genau dieses Fenster wählte, um ein 2.4T-Flaggschiff zu öffnen, haben manche Analysten als Schritt gelesen, internationalen Mindshare und eine Narrative technologischer Parität festzuzurren, bevor eine mögliche regulatorische Verschärfung greift. Das ist eine informierte Interpretation, keine bestätigte Tatsache.

Zitierbare technische Fakten

Fünf-Schritte-Auswahl-Runbook

Schritt 1 Aktuellen Traffic gegen Pekinger Peak-Fenster (9-12 und 14-18 Uhr) aufteilen und Peak-Anteil schätzen Schritt 2 Cache-Hit-Input, Cache-Miss-Input und Output getrennt bepreisen; 1,100% nicht auf die ganze Rechnung anwenden Schritt 3 V4-Pro Peak ¥9/¥27 und Nebenzeit ¥4.5/¥13.5 mit Qwen3.8-Max international $2/$6, Luna $0.20/$1.20 und Claude Opus 5 mit etwa $5/$25 vergleichen Schritt 4 Vor dem Download von Qwen3.8-2.4T-A95B MaaS- / AI-Work-Assistant-$50M-Trailing-Revenue und den 100M-MAU- / $20M-Monatsumsatz-Anzeige-Trigger prüfen Schritt 5 GLM-5.3 auf echten langlaufenden Coding-Aufgaben pilotieren; Hersteller-Scores als unverifiziert behandeln, A/B fahren und Nebenzeiten-Planung plus hybrides Lokal-/Cloud-Routing bewerten

FAQ

Q: Ist DeepSeek nach der Preiserhöhung immer noch günstiger als GPT-5.6 oder Claude?

A: Der Nebenzeiten-Tarif bleibt günstiger als Claude Opus 5, aber DeepSeek ist nicht mehr die eindeutig günstigste Option insgesamt — OpenAIs GPT-5.6 Luna ($0.20/$1.20 pro Million Tokens) und Alibabas internationale Qwen3.8-Max-Preisgestaltung ($2/$6) unterbieten DeepSeeks neue Nebenzeiten mindestens in einer Dimension. DeepSeek bleibt für ein Frontier-Modell relativ günstig, nur nicht mehr das eindeutig günstigste.

Q: Kann ich die offenen Gewichte von Alibaba Qwen3.8-Max kostenlos in einem kommerziellen Produkt nutzen?

A: Ja, in den meisten Fällen — persönliche Projekte und interne Unternehmensnutzung sind nicht betroffen. Die Einschränkung gilt nur, wenn Sie ein Model-as-a-Service- oder AI-Work-Assistant-Geschäft betreiben, das in einem beliebigen zusammenhängenden 12-Monats-Zeitraum über $50 million verdient hat; diese Stufe erfordert eine separate kommerzielle Lizenz von Alibaba.

Q: Ist Qwen3.8-Max für Nutzer in den USA, der EU oder dem Vereinigten Königreich gesperrt oder eingeschränkt?

A: Nein. Diese Behauptung kursierte online, ist aber falsch — die veröffentlichte Lizenz enthält keinerlei geografische Beschränkung. Die Einschränkungen sind umsatzbasiert (an den Umsatz Ihres Dienstes gebunden), nicht an den Standort von Ihnen oder Ihren Nutzern.

Q: Was unterscheidet GLM-5.3 tatsächlich von GLM-5.2?

A: Auf Ebene des Basismodells nichts — beide nutzen dasselbe Foundation-Modell mit 743 Milliarden Parametern. Die Leistungsgewinne (rund 6x auf Terminal-Bench 3.0) stammen vollständig aus der Skalierung des Reinforcement Learning im Post-Training, ohne erneutes Training des Basismodells.

Q: Wird Meta wirklich sein Flaggschiff-Modell öffnen, nicht nur das kleinere Muse Glimmer?

A: Noch nicht. Muse Glimmer ist ein destilliertes 30B-Modell, nicht Metas echtes Flaggschiff. CEO Mark Zuckerberg hat offene Gewichte für das größere, geschlossene Muse Spark 1.2 angekündigt, was — falls es geschieht — das erste US-Flaggschiff wäre, das offen erscheint. Zum Zeitpunkt dieses Texts ist diese Veröffentlichung nicht erfolgt; als erklärte Absicht behandeln, nicht als bestätigte Tatsache.

Fazit

In fünf Tagen schrieb DeepSeek Kapazitätsknappheit in ein tageszeitabhängiges Preisblatt, Alibaba hängte eine Custom-Lizenz an einen Flaggschiff-Open-Weight-Drop, und Zhipu zeigte, dass Post-Training allein Coding-Scores ohne neues Basismodell bewegen kann. Die drei Plays unterscheiden sich, konkurrieren aber alle um Preisgestaltungsmacht statt darum, wer am günstigsten bleibt. Wer Nebenzeiten-Batching, Qwen-Gewichts-Evaluation oder einen GLM-5.3-langlaufenden Coding-Agenten vollständig auf einem Laptop, einem generischen Linux-VPS oder einer Cloud-API-Konsole fährt, erbt Peak-Rechnungsvolatilität, schlafunterbrochene Loops und keinen nativen Weg, Xcode, Fastlane und notarytool auf derselben Maschine zu halten. Für Teams, die einen 7×24 unbeaufsichtigten Agenten plus iOS-CI oder ein OpenClaw-Gateway neben dem neuen Mixed-Model-Stack brauchen, ist die Miete eines VPSMAC-M4-Mac-Cloud-Knotens — natives macOS, SSH plus launchd, im selben Netz wie Ihre Remote-Toolchain — in der Regel stabiler als ein persönliches Gerät oder ein Linux-VPS.

Quellen: Offizielle DeepSeek-Preisankündigung, gegenchecked gegen Wall Street CN, IT Home, AIGC.cn und V2EX · Offizielle Alibaba-Qwen-Repositories (Hugging Face / ModelScope) und South China Morning Post zur Lizenz · Offizielle GLM-5.3-Technikseite von Zhipu (Z.ai), plus VentureBeat und StableLearn · Offizieller Meta-AI-Research-Blog und VentureBeat zu Muse Glimmer · Chinesische Finanzmedien (Yicai, Sohu Finance) zum Takt von Chinas Open-Weight-Release-Zyklus

Datenstand: 2026-08-17. Preise, Lizenzbedingungen und Benchmark-Zahlen spiegeln öffentlich verfügbare Informationen zum Veröffentlichungszeitpunkt. Vor einer Weiterveröffentlichung die neuesten offiziellen Preise und Lizenzbedingungen prüfen. Oben als unverifiziert markierte Details (inländische Chip-Behauptungen, der Cursor-Schwachstellenbericht und Exportkontroll-Gerüchte) wurden nicht unabhängig bestätigt.