Ist Qwen3.8-Max Open Source? Was Alibaba diese Woche wirklich veröffentlicht hat
Kurzantwort: noch nicht. Am 3. August 2026 GA-veröffentlichte Alibaba Qwen3.8-Max (2,4T gesamt, 95B aktiv, Arena Text #5) und taggte es auf qwen.ai als Open-Source — Gewichte fehlen auf Hugging Face. Dieser Artikel liefert Zeitstrahl, Benchmark-Tabelle, Kimi K3/DeepSeek V4-Vergleich, Open-Source-Debatte plus 5-Schritte-API-Runbook und 5 FAQs.
Inhaltsverzeichnis
Schmerzpunkte: Drei Dinge, die Entwickler nach dem Qwen3.8-Max-Launch prüfen müssen
- Das Open-Source-Label kam vor den Gewichten. qwen.ai markierte Qwen3.8-Max am GA-Tag als Open-Source — Repository, Lizenz und festes Datum auf Hugging Face/ModelScope fehlen. Nur „nächste Woche“ (ca. 10. August). Compliance-Risiko, wenn man es schon als open behandelt.
- Alle Benchmarks sind vendor-run. PaperBench, QwenSWEBench, RecreationBench sind Inhouse-Suiten; Arena 1.496 Punkte sind „Preliminary“. Artificial Analysis hat GA-Werte nicht reproduziert. Eigenes A/B vor Produktionsmigration.
- Transparenzlücken der Preview bis GA. Preview vom 19. Juli: kein aktiver Parametercount, Produktionsautomatisierung verboten. GA ergänzte 95B; einziger unabhängiger Blindtest (269-Dateien-Architektur): Kimi K3 83/100, Qwen3.8-Max Preview 80/100 — Peers, kein Sweep.
Zeitstrahl: Was shipped wurde — und was nicht
- 16. Juli 2026 — Moonshot AI veröffentlicht Kimi K3 (2,8T MoE, 16/896 Experten aktiv) mit unabhängigen Benchmarks und Technical Report.
- 19. Juli 2026 — Qwen3.8-Max Preview über Token Plan/Qoder/QoderWork zu 10 % des Standardpreises; kein aktiver Parametercount, keine Benchmark-Tabelle, ToS verbietet Produktionsautomatisierung.
- 27. Juli 2026 — Kimi K3 liefert Open Weights auf Hugging Face plus Attention-Kernel und MoE-Kommunikationsbibliothek.
- 31. Juli 2026 — DeepSeek V4-Flash GA: schlägt V4-Pro auf neun Agent-/Coding-Benchmarks ohne mehr Parameter.
- 3. August 2026 — Qwen3.8-Max GA mit vollständiger Benchmark-Tabelle und Agent-Produkt Qwen Office; Alibaba HK-Aktien ~+7 %, US ~+4,5 %.
- „Nächste Woche“ (ca. 10. August) — Open Weights für Qwen3.8-Max und Qwen3.8-27B auf HF/ModelScope versprochen; kein Repo, keine Lizenz, kein Datum.
Die veröffentlichten Zahlen
| Spec | Qwen3.8-Max |
|---|---|
| GA-Datum | 3. August 2026 |
| Gesamt / aktiv | 2,4T / 95B |
| Architektur | Sparse MoE + Hybrid-Attention auf Qwen3.5-Basis |
| Kontext | 1M Token (~983K mit Thinking; 131K Max-Output) |
| Modalitäten | Text, Bild, Video |
| API-Preis | $2 / $6 pro Mio. Input/Output-Token |
| Arena Text (1. Aug.) | #5, 1.496 Punkte (Preliminary) — einziges Nicht-Anthropic-Modell in Top 8 |
| Arena Vision | #2, hinter Claude Fable 5 |
| PaperBench (Alibaba) | 93,0 (+28,2 vs. Vorgänger) |
| SWE-bench Pro (Alibaba) | 67,7 — hinter Fable 5 (80,0) |
| Open Weights | „Nächste Woche“ versprochen; nicht live |
Zeilen „Alibaba-run“ stammen aus Vendor-Material. Keine unabhängige Reproduktion der GA-Werte zum Redaktionsschluss.
Qwen3.8-Max vs. Kimi K3 vs. DeepSeek V4 vs. Claude
| Modell | Lab | Gesamt/aktiv | Kontext | Preis (in/out pro 1M) | Open Weights? | Unabhängiger Benchmark |
|---|---|---|---|---|---|---|
| Qwen3.8-Max | Alibaba | 2,4T / 95B | 1M | $2 / $6 | Versprochen, nicht shipped | Noch keine |
| Kimi K3 | Moonshot AI | 2,8T / ~50B | ~1,05M | $3 / $15 | 27. Juli shipped | AA Index ≈ 57,11 |
| DeepSeek V4-Pro | DeepSeek | 1,6T / 49B | 1M | Nicht voll publiziert | Shipped | SWE-bench Verified 80,6 % |
| DeepSeek V4-Flash | DeepSeek | Wie V4-Pro | 1M | Nicht voll publiziert | Shipped | Schlägt V4-Pro auf 9 Agent-/Coding-Benchmarks |
| Claude Opus 5 | Anthropic | Nicht offengelegt | 1M | $5 / $25 | Geschlossen | Arena Top-Tier |
| Claude Fable 5 | Anthropic | Nicht offengelegt | 1M | $10 / $50 | Geschlossen | #1 Arena Text |
Unter der Haube: Was 2,4 Billionen Parameter bedeuten
Sparse MoE: 2,4T gesamt, nur 95B pro Token aktiv — Inferenzkosten folgen der aktiven Zahl, daher $2/$6, deutlich unter Opus 5 ($5/$25) und Fable 5 ($10/$50).
Drei reasoning_effort-Stufen (low/medium/xhigh, Standard xhigh) über enable_thinking oder Anthropic-kompatibles reasoning.effort. Langhorizont-Autonomie: 16-Tage-Coding ohne Aufsicht, 500+ Schritte Chip-Design, RecreationBench Black-Box-Rebuilds — alles Alibaba-eigene Benchmarks; Teile auf GitHub qwen-code-dev-bot/oh-my-cli.
Distribution: Qwen Office, OpenAI- und Anthropic-Protokolle — Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw per base-URL-Wechsel.
Das Open-Source-Label-Problem
- Open-Source-Tag vor Gewichten — Marketing vor Artefakten.
- Alle Benchmarks vendor-run; Arena 1.496 bleibt Preliminary.
- Fußnote: Fable-5-Ergebnisse „may involve fallbacks“ ohne Methodik-Offenlegung für Alibaba-Tests.
- Preview: Produktionsautomatisierung verboten, kein aktiver Parametercount, kein Model Card, keine Safety-Eval — unabhängige Evaluatoren warnten vor Migration allein auf Ankündigung.
Zitierbare Technikdaten (EEAT)
- Parameter & Kosten: 2,4T gesamt, 95B aktiv; API $2/M Input, $6/M Output.
- Arena & Blindtest: Arena Text #5 mit 1.496 (1. Aug., Preliminary); Architektur-Blindtest Kimi K3 83/100, Qwen Preview 80/100.
- Kontext & Multimodal: 1M Token (~983K mit Thinking); Arena Vision #2 hinter Fable 5.
5-Schritte-Integrations-Runbook
FAQ
Ist Qwen3.8-Max jetzt Open Source?
Nein. API ist live, Gewichte nicht auf HF/ModelScope. Open-Source-Tag beschreibt Absicht — „nächste Woche“ ohne festes Datum.
Vergleich mit Kimi K3?
Kein autoritativer Head-to-Head. Blindtest: K3 83/100 vs. Qwen 80/100. K3 hat öffentliche Gewichte und AA-Score; Qwen3.8-Max günstigere API und breiteres Multimodal.
Brauche ich ein Rechenzentrum für 2,4T?
Für das Vollmodell ja. API umgeht das. Qwen3.8-27B ist das realistische lokale Ziel.
Alibaba-Benchmarks vertrauen?
Als Vendor-Claims behandeln. Auf Dritt-Reproduktion oder eigene Workloads warten.
Warum relevant ohne Qwen-Nutzung?
Qwen treibt generative KI in Apple Intelligence für China on-device (iPhone 15+).
Fazit
Qwen3.8-Max ist Alibabas erstes Open-Weight-Versprechen auf Max-Niveau — 2,4T/95B „big total, small active“ bei $2/$6 ist bewusste Agent-Ökosystem-Strategie. Das Open-Source-Label ist noch Versprechen; Scores warten auf unabhängige Reproduktion. Qwen Code oder OpenClaw nur auf privatem Laptop oder Linux-VPS bedeutet Sleep-Unterbrechungen, vermischte API-Keys und Prod-Repos, keine Apple-Toolchain (Xcode, Fastlane, notarytool) auf derselben Maschine. Teams mit 7×24 unbeaufsichtigten Agenten plus iOS-CI oder OpenClaw-Gateway sollten VPSMAC M4-Mac-Cloud (native macOS, SSH+launchd) gegenüber Laptop/Linux-VPS bevorzugen.
Quellen: Alibaba Cloud · Arena.ai · CNBC / TechCrunch
Datenstand: 2026-08-04. Benchmarks mit Quelle (Alibaba-intern/Arena vorläufig/unabhängig). Offizielle Ankündigungen prüfen.