Kimi K3 Open Weights: Hugging-Face-Freigabe am 27. Juli 2026 und Self-Host-Leitfaden
Nach dem Kimi-K3-Review vom 16. Juli verschiebt sich der Entscheidungsfokus auf den 27. Juli 2026: vollständige Gewichte auf Hugging Face (Modified MIT), Tech Report und vLLM-KDA-Support. Für AI-Infrastruktur-Verantwortliche: Timeline, 2,8T-Architektur, Benchmarks, AA Index Platz 3, API $3/$15, 1,4 TB Self-Host, drei Szenarien, Checkliste, Runbook, FAQ.
Inhaltsverzeichnis
Pain Points: Warum nach dem 27.07. neu wählen?
- Open/Closed-Gap praktisch geschlossen: K3 erreicht 57,1 im Artificial Analysis Intelligence Index v4.1 — Platz 3 von 189, nur 2,8 Punkte hinter Claude Fable 5 (59,9). Mit vollständigen Gewichten entfällt die Wahl zwischen „Closed API“ und „schwachem OSS“.
- Self-Host-Kosten unterschätzt: 2,8T in 4-bit braucht 1,4 TB und 64+ Beschleuniger. Nach WAIC merken viele Teams, dass Laptops und Standard-VPS untauglich sind.
- Single-Vendor-Risiko & Halluzinationen: Anthropics US-Beschränkung vom 1. Juli zeigte API-Risiko in 90 Minuten. Moonshot gibt zu: K3 hat vs. K2.6 mehr Halluzinationen und schwächere Stabilität als Fable/Sol.
1. Timeline
| Datum | Ereignis | Bedeutung |
|---|---|---|
| 16. Juli | API live, kimi-k3 sofort nutzbar | Keine Keynote, Dev-first |
| 17.–20. Juli | WAIC 2026 | China-Kohorte: GLM-5.2, DeepSeek V4, MiniMax |
| 27. Juli | HF-Gewichte, Modified MIT, Tech Report, vLLM KDA | Erstes >2T Download-Paket |
| 27. Juli+ | Ollama/GGUF Community | Consumer-PoC, kein Full-Prod |
2. Release-Inhalt am 27. Juli
- Vollständige HF-Gewichte: 2,8T, MXFP4/MXFP8, quantisierungsfreundlich;
- Modified MIT: Forschung + Commercial mit Moonshot-Klauseln;
- Tech Report: KDA, AttnRes, Stable LatentMoE, Quantile Balancing, Per-Head Muon, SiTU;
- vLLM Day-0: KDA-Kernel + prefix caching, bis 6,3× Decode bei 1M;
- Ollama/GGUF: folgen in Tagen; volle 2,8T nicht für Mac/Laptop.
Moonshot gesteht Platz 3 ein: „K3 ist nicht das stärkste Modell der Welt — aber die open-weights-Veröffentlichung, die Closed Frontier am nächsten kommt.“
3. Spezifikationen
| Spec | Detail |
|---|---|
| Parameter | 2,8 Billionen |
| MoE | Stable LatentMoE: 896 / 16 aktiv |
| Attention | KDA + AttnRes + Gated MLA |
| Kontext | 1.048.576 Tokens |
| Modalitäten | Text, Bild, Video |
| Training | MXFP4 weights, MXFP8 activations |
| vs. K2 | 2,5× Skalierungseffizienz |
| KDA | 6,3× Decode @ 1M, KV −75% |
4. Benchmarks: Siege & Niederlagen
| Bench | K3 | Fable 5 | Sol |
|---|---|---|---|
| Frontend Code Arena | #1 | — | — |
| Automation Bench | 30,8 | 29,1 | 29,7 |
| SpreadsheetBench 2 | führt | — | — |
| BrowseComp | 91,2 | 88,0 | 90,4 |
| SWE Marathon | 42,0 | 35,0 | 39,0 |
| Terminal Bench 2.1 | 88,3 | 84,6 | 88,8 |
| Program Bench | 77,8 | 76,8 | 77,6 |
| FrontierSWE | 81,2 | 86,6 | 71,3 |
| DeepSWE | 67,5 | 70,0 | 73,0 |
| GDPval v2 Elo | hinten | vorn | vorn |
Schwächen: mehr Halluzinationen vs. K2.6; Polish/Stabilität hinter Fable/Sol. Vendor-eigene Zahlen.
5. AA Index & API-Preise
| Modell | AA Index | Rang | In $/M | Out $/M | Cache |
|---|---|---|---|---|---|
| Fable 5 | 59,9 | 1 | — | — | — |
| GPT-5.6 Sol | 58,9 | 2 | — | — | — |
| Kimi K3 | 57,1 | 3/189 | $3,00 | $15,00 | $0,30 |
AA Einzelaufgabe: K3 ~$0,94, 65,8 % günstiger als Fable 5.
6. Self-Host-Anforderungen
- 4-bit: ~1,4 TB (Ref. K2.7 Code INT4 ~577 GB);
- Prod: 64+ Beschleuniger;
- vLLM KDA + prefix caching Day-0.
EEAT-Fakten
- Grösstes downloadbares open-weights-Modell (2,8T).
- 896/16 MoE, Quantile Balancing.
- 1M flat $3/$15, KDA 6,3× @ 1M.
- AA-Task $0,94, 65,8 % unter Fable.
- Moonshot kommuniziert ehrlich Rang 3.
7. API vs. Self-Host: drei Szenarien
| Szenario | Empfehlung | Grund |
|---|---|---|
| Startup / PoC | API / OpenRouter | Null CapEx |
| Mittel / Hybrid | API + Fable/Sol | Routing nach Task |
| Enterprise / Residency | 64+ GPU + API-Fallback | Modified MIT commercial |
8. Branche & Geopolitik
WAIC 2026: Moonshot, GLM-5.2, DeepSeek V4, MiniMax. Open/Closed-Gap 2026 praktisch geschlossen. Anthropic-Restriktion (1. Juli, teils zurückgenommen) macht K3 zur Second Source. K2→K2.5→K3 = Moonshots Comeback.
9. Release-Checkliste
10. Fünf-Schritte-Runbook
11. FAQ
Wann HF?
27. Juli 2026.
Hardware?
1,4 TB + 64+ GPUs.
API vs. Self-Host?
Meist API; Enterprise mit Cluster.
AA-Rang?
57,1, Platz 3/189.
Ollama?
Tage nach 27.07.
vs. Review 16.07.?
Review=API; hier=Gewichte.
Fazit
Die Kimi-K3-open-weights-Freigabe am 27. Juli ist das erste >2T-, AA-Platz-3-, Modified-MIT-Paket — mit ehrlicher Einordnung der Schwächen. Für die meisten Teams bleibt API + Hybrid-Routing die pragmatische Q3-2026-Strategie.
K3-Agenten auf Laptop, Linux-VPS oder ohne macOS-CI scheitern an Schlaf-Unterbrechungen, gemischten API-Keys und fehlendem Xcode/Fastlane/notarytool. Für 7×24 Kimi Code + K3 mit iOS-Signing oder OpenClaw ist ein VPSMAC M4-Mac-Cloud-Knoten — natives macOS, SSH + launchd — stabiler als Consumer-Hardware.
Weiter: Kimi-K3-Test (16.07.) · Kimi API
Stand: 22.07.2026. Details zum 27.07. am HF-Repo prüfen.