Ist Qwen3.8-Max Open Source? Was Alibaba diese Woche wirklich veröffentlicht hat

Kurzantwort: noch nicht. Am 3. August 2026 GA-veröffentlichte Alibaba Qwen3.8-Max (2,4T gesamt, 95B aktiv, Arena Text #5) und taggte es auf qwen.ai als Open-Source — Gewichte fehlen auf Hugging Face. Dieser Artikel liefert Zeitstrahl, Benchmark-Tabelle, Kimi K3/DeepSeek V4-Vergleich, Open-Source-Debatte plus 5-Schritte-API-Runbook und 5 FAQs.

Abstrakte Visualisierung eines neuronalen Netzes für Qwen3.8-Max MoE und Arena-Ranking

Inhaltsverzeichnis

Schmerzpunkte: Drei Dinge, die Entwickler nach dem Qwen3.8-Max-Launch prüfen müssen

  1. Das Open-Source-Label kam vor den Gewichten. qwen.ai markierte Qwen3.8-Max am GA-Tag als Open-Source — Repository, Lizenz und festes Datum auf Hugging Face/ModelScope fehlen. Nur „nächste Woche“ (ca. 10. August). Compliance-Risiko, wenn man es schon als open behandelt.
  2. Alle Benchmarks sind vendor-run. PaperBench, QwenSWEBench, RecreationBench sind Inhouse-Suiten; Arena 1.496 Punkte sind „Preliminary“. Artificial Analysis hat GA-Werte nicht reproduziert. Eigenes A/B vor Produktionsmigration.
  3. Transparenzlücken der Preview bis GA. Preview vom 19. Juli: kein aktiver Parametercount, Produktionsautomatisierung verboten. GA ergänzte 95B; einziger unabhängiger Blindtest (269-Dateien-Architektur): Kimi K3 83/100, Qwen3.8-Max Preview 80/100 — Peers, kein Sweep.

Zeitstrahl: Was shipped wurde — und was nicht

Die veröffentlichten Zahlen

SpecQwen3.8-Max
GA-Datum3. August 2026
Gesamt / aktiv2,4T / 95B
ArchitekturSparse MoE + Hybrid-Attention auf Qwen3.5-Basis
Kontext1M Token (~983K mit Thinking; 131K Max-Output)
ModalitätenText, Bild, Video
API-Preis$2 / $6 pro Mio. Input/Output-Token
Arena Text (1. Aug.)#5, 1.496 Punkte (Preliminary) — einziges Nicht-Anthropic-Modell in Top 8
Arena Vision#2, hinter Claude Fable 5
PaperBench (Alibaba)93,0 (+28,2 vs. Vorgänger)
SWE-bench Pro (Alibaba)67,7 — hinter Fable 5 (80,0)
Open Weights„Nächste Woche“ versprochen; nicht live
Zeilen „Alibaba-run“ stammen aus Vendor-Material. Keine unabhängige Reproduktion der GA-Werte zum Redaktionsschluss.

Qwen3.8-Max vs. Kimi K3 vs. DeepSeek V4 vs. Claude

ModellLabGesamt/aktivKontextPreis (in/out pro 1M)Open Weights?Unabhängiger Benchmark
Qwen3.8-MaxAlibaba2,4T / 95B1M$2 / $6Versprochen, nicht shippedNoch keine
Kimi K3Moonshot AI2,8T / ~50B~1,05M$3 / $1527. Juli shippedAA Index ≈ 57,11
DeepSeek V4-ProDeepSeek1,6T / 49B1MNicht voll publiziertShippedSWE-bench Verified 80,6 %
DeepSeek V4-FlashDeepSeekWie V4-Pro1MNicht voll publiziertShippedSchlägt V4-Pro auf 9 Agent-/Coding-Benchmarks
Claude Opus 5AnthropicNicht offengelegt1M$5 / $25GeschlossenArena Top-Tier
Claude Fable 5AnthropicNicht offengelegt1M$10 / $50Geschlossen#1 Arena Text

Unter der Haube: Was 2,4 Billionen Parameter bedeuten

Sparse MoE: 2,4T gesamt, nur 95B pro Token aktiv — Inferenzkosten folgen der aktiven Zahl, daher $2/$6, deutlich unter Opus 5 ($5/$25) und Fable 5 ($10/$50).

Drei reasoning_effort-Stufen (low/medium/xhigh, Standard xhigh) über enable_thinking oder Anthropic-kompatibles reasoning.effort. Langhorizont-Autonomie: 16-Tage-Coding ohne Aufsicht, 500+ Schritte Chip-Design, RecreationBench Black-Box-Rebuilds — alles Alibaba-eigene Benchmarks; Teile auf GitHub qwen-code-dev-bot/oh-my-cli.

Distribution: Qwen Office, OpenAI- und Anthropic-Protokolle — Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw per base-URL-Wechsel.

Das Open-Source-Label-Problem

  1. Open-Source-Tag vor Gewichten — Marketing vor Artefakten.
  2. Alle Benchmarks vendor-run; Arena 1.496 bleibt Preliminary.
  3. Fußnote: Fable-5-Ergebnisse „may involve fallbacks“ ohne Methodik-Offenlegung für Alibaba-Tests.
  4. Preview: Produktionsautomatisierung verboten, kein aktiver Parametercount, kein Model Card, keine Safety-Eval — unabhängige Evaluatoren warnten vor Migration allein auf Ankündigung.

Zitierbare Technikdaten (EEAT)

5-Schritte-Integrations-Runbook

Schritt 1 Bei Alibaba Cloud Model Studio / QwenCloud registrieren; API-Key erstellen Schritt 2 Pfad wählen: OpenAI-kompatible API oder Anthropic-Interface (Claude Code / Qwen Code / OpenClaw) Schritt 3 base_url und model=qwen3.8-max; reasoning_effort (low/medium/xhigh) einstellen Schritt 4 10–20 echte Langcode-/Agent-Tasks pilotieren; Qualität, Tokens, Cache-Hits loggen Schritt 5 Hybrid-Rollout: Langhorizont → Qwen3.8-Max; kritische Repo-Fixes → Fable 5; Qwen3.8-27B lokal evaluieren sobald Gewichte da sind

FAQ

Ist Qwen3.8-Max jetzt Open Source?

Nein. API ist live, Gewichte nicht auf HF/ModelScope. Open-Source-Tag beschreibt Absicht — „nächste Woche“ ohne festes Datum.

Vergleich mit Kimi K3?

Kein autoritativer Head-to-Head. Blindtest: K3 83/100 vs. Qwen 80/100. K3 hat öffentliche Gewichte und AA-Score; Qwen3.8-Max günstigere API und breiteres Multimodal.

Brauche ich ein Rechenzentrum für 2,4T?

Für das Vollmodell ja. API umgeht das. Qwen3.8-27B ist das realistische lokale Ziel.

Alibaba-Benchmarks vertrauen?

Als Vendor-Claims behandeln. Auf Dritt-Reproduktion oder eigene Workloads warten.

Warum relevant ohne Qwen-Nutzung?

Qwen treibt generative KI in Apple Intelligence für China on-device (iPhone 15+).

Fazit

Qwen3.8-Max ist Alibabas erstes Open-Weight-Versprechen auf Max-Niveau — 2,4T/95B „big total, small active“ bei $2/$6 ist bewusste Agent-Ökosystem-Strategie. Das Open-Source-Label ist noch Versprechen; Scores warten auf unabhängige Reproduktion. Qwen Code oder OpenClaw nur auf privatem Laptop oder Linux-VPS bedeutet Sleep-Unterbrechungen, vermischte API-Keys und Prod-Repos, keine Apple-Toolchain (Xcode, Fastlane, notarytool) auf derselben Maschine. Teams mit 7×24 unbeaufsichtigten Agenten plus iOS-CI oder OpenClaw-Gateway sollten VPSMAC M4-Mac-Cloud (native macOS, SSH+launchd) gegenüber Laptop/Linux-VPS bevorzugen.

Quellen: Alibaba Cloud · Arena.ai · CNBC / TechCrunch

Datenstand: 2026-08-04. Benchmarks mit Quelle (Alibaba-intern/Arena vorläufig/unabhängig). Offizielle Ankündigungen prüfen.