Ist Kimi K3 Open Source? Moonshot AIs 2,8-Billionen-Parameter-Modell erklärt

Kurzantwort: nein, nicht nach der strengen Definition — und Moonshot AI behauptet das auch nicht. Am Abend des 27. Juli 2026 veröffentlichte das chinesische KI-Labor die vollständigen Gewichte und den technischen Bericht für Kimi K3, ein 2,8-Billionen-Parameter-Mixture-of-Experts-Modell mit 1-Million-Token-Kontextfenster und nativer Bildverständnis-Fähigkeit. Dieser Leitfaden behandelt Architektur-Innovationen, Benchmark-Vergleiche, Lizenzschwellen, Self-Hosting-Grenzen, API-Preise und ein Fünf-Schritte-Integrations-Runbook.

Abstrakte Visualisierung eines neuronalen Netzwerks für Kimi K3 als großes Open-Weight-Modell mit Mixture-of-Experts-Architektur

Inhaltsverzeichnis

Pain Points: Drei Dinge, die Sie nach K3s Vollrelease neu bewerten müssen

  1. Verwechslung Open Source vs. Open Weight: Chinesische Medien nennen K3 häufig „vollständig Open Source“, Moonshots eigene Materialien verwenden jedoch niemals „Open Source“ — durchgehend heißt es „Open Weight“. Prüft Ihr Legal-Team nach OSI-Standards, kann das Modell falsch klassifiziert werden: Trainingsdaten und vollständiger Trainingscode wurden nicht veröffentlicht.
  2. Zwei neue kommerzielle Lizenzschwellen: K3 nutzt nicht mehr die Modified-MIT-Lizenz der K2-Ära. Es handelt sich um ein vollständig individuelles Dokument mit Schwellen, die es bisher nicht gab — betreiben Sie ein Model-as-a-Service-Geschäft mit über 20 Mio. USD Umsatz in den letzten 12 Monaten oder überschreitet Ihr Produkt 100 Mio. MAU, ist eine rechtliche Prüfung vor dem Rollout nötig.
  3. Self-Hosting-Lücke vs. API-Realität: 2,8 Billionen Parameter, etwa 1,56 TB Gewichte und Moonshots Empfehlung von 64+ Beschleunigern bedeuten: „Gewichte sind öffentlich“ heißt nicht „Sie können es lokal betreiben“. Für die meisten Teams bleiben API oder OpenRouter der praktikable Weg.

Ist Kimi K3 Open Source oder nur Open Weight?

Nach der Definition der Open Source Initiative (OSI) erfordert ein wirklich Open-Source-Modell öffentliche Trainingsdaten, öffentlichen Trainingscode und eine reproduzierbare Pipeline — nicht nur die trainierten Gewichte. Kimi K3 liefert Gewichte, technischen Bericht und mehrere trainingsnahe Infrastruktur-Tools, aber weder Trainingsdaten noch vollständigen Trainingscode. Das macht es Open Weight: Jeder kann das Modell herunterladen, betreiben, feintunen und kommerziell einsetzen, aber niemand außerhalb von Moonshot kann es von Grund auf reproduzieren.

Die Lizenz selbst ist im Vergleich zur K2-Familie verschärft. Sie trägt nicht mehr die Bezeichnung „Modified MIT“ — es ist ein vollständig individuelles Dokument mit zwei kommerziellen Schwellen, die es bisher nicht gab:

  1. Model-as-a-Service-Umsatzschwelle. Betreiben Sie oder Ihre verbundenen Unternehmen ein Model-as-a-Service-Geschäft auf Basis von K3, das in den letzten 12 Monaten insgesamt über 20 Millionen Dollar Umsatz erzielt, müssen Sie vor Fortführung eine separate kommerzielle Vereinbarung mit Moonshot AI aushandeln.
  2. Attributions-Schwelle. Überschreitet Ihr Produkt oder Service 100 Millionen monatlich aktive Nutzer oder 20 Millionen Dollar Monatsumsatz, müssen Sie „Kimi K3“ prominent in der Benutzeroberfläche anzeigen.

Für fast jedes Startup, jeden Indie-Entwickler oder jedes mittelständische Unternehmen ist keine dieser Schwellen praktisch relevant — Sie können heute kommerzielle Produkte auf K3-Basis ohne Probleme ausliefern. Die Klausel, die wirklich zählt, ist die erste — und nur, wenn Ihr Geschäftsmodell K3-Inferenz in großem Maßstab im direkten Wettbewerb zur Moonshot-API weiterverkauft.

Kimi K3 auf einen Blick

SpezifikationWert
Gesamtparameter2,8 Billionen
Aktive Parameter~104 Milliarden
ArchitekturMixture-of-Experts (MoE)
Experten896 geroutete Experten, 16 pro Token aktiviert, plus Shared Experts
Attention-MechanismusKimi Delta Attention (KDA) + Gated Multi-Head Latent Attention (MLA)
Kontextfenster1.000.000 Tokens
MultimodalitätNative Bildverständnis-Fähigkeit (ViT-V2, 27 Schichten)
GewichtsformatMXFP4-Gewichte, MXFP8-Aktivierungen (Quantization-Aware Training ab der SFT-Phase)
Download-Größe~1,56 TB (Hugging Face)
LizenzIndividuelle Lizenz — Moonshot nennt es „Open Weight“, nicht „Open Source“
Erste Verfügbarkeit16. Juli 2026 (nur API)
Vollständige Gewichte veröffentlicht27. Juli 2026

Neben den Gewichten hat Moonshot drei Infrastruktur-Technologien Open Source gestellt, die K3s Training ermöglichten: MoonEP, FlashKDA und AgentEnv. Damit ist K3 das größte jemals vollständig veröffentlichte Open-Weight-Modell — ein 1,56-TB-Download, der innerhalb von dreißig Minuten Platz 1 auf Hugging Faces Trending-Liste erreichte. Moonshot bezeichnet dies durchgehend als „Open-Weight“-Release, nie als „Open Source“.

Die Architektur: Was KDA, Attention Residuals und Per-Head Muon wirklich leisten

Kimi K3 skaliert nicht nur ein bestehendes Rezept — Moonshot hat drei lange etablierte Standardkomponenten des Deep Learning neu aufgebaut: Attention, Residualverbindungen und den Optimizer.

Kimi Delta Attention (KDA): Vergessen, ein Kanal nach dem anderen

Standard-Gated DeltaNet wendet ein einzelnes skalares Vergessens-Gate auf einen gesamten Speicherzustand an — alles verfällt mit einer Rate. KDA ersetzt das durch kanalweise Gating: Jede Feature-Dimension erhält eine eigene unabhängige Verfallrate, sodas das Modell manche Features unbegrenzt behalten und andere aggressiv vergessen kann. Implementiert als chunkweise Diagonal-Plus-Low-Rank-Formulierung (DPLR) bleibt die Rekurrenz linear in der Zeit und hardware-effizient. K3 wechselt KDA-Schichten mit weniger globalen Attention-Schichten (Gated MLA) ab — dieses Hybriddesign ermöglicht das 1M-Token-Kontextfenster bei geringer KV-Cache-Größe.

Attention Residuals (AttnRes): Residualverbindungen, die wählen, was bleibt

In einem Standard-Tiefennetz akkumulieren Residualverbindungen die Ausgabe jeder Schicht gleichmäßig mit zunehmender Tiefe — und je tiefer das Netz, desto stärker verwässert sich frühe Schichtinformation. AttnRes ersetzt gleichmäßige Akkumulation durch selektive, eingabeabhängige Aggregation über alle vorherigen Schichten. Der Overhead ist minimal: ein RMSNorm und ein Pseudo-Query-Vektor pro Schicht, ein vernachlässigbarer Bruchteil der Gesamtparameter. In Tests lieferte das etwa 25 % höhere Trainingseffizienz bei unter 2 % Mehrkosten. Die Pseudo-Query-Vektoren werden auf null initialisiert, sodass der Mechanismus anfangs einer gleichmäßigen Mittelung entspricht und das frühe Training nicht destabilisiert.

Per-Head Muon: Attention-Heads unabhängig optimieren

Muon ist ein weit verbreiteter Optimizer im großskaligen Training. K3 erweitert ihn auf pro Attention-Head-Betrieb statt das gesamte Modell einheitlich zu behandeln — jeder Head erhält einen adaptiveren Konvergenzpfad. Das ist reine Trainingstechnik — für API-Nutzer unsichtbar — aber Teil des Grunds, warum K3 relativ zu geschlossenen Frontier-Modellen über seiner aktiven Parameterzahl hinaus performt.

Stable LatentMoE: Sparse by Design

K3s MoE-Schicht routet über 896 Experten und aktiviert nur 16 pro Token — etwa 1,8 % Sparsity — neben Shared Experts für Baseline-Stabilität. Um Lastungleichgewicht zu verhindern, das den Durchsatz skaliert drosselt, wendet Moonshot Quantile Balancing an und beweist eine mathematische Obergrenze redundanter Experten pro Compute-Rank — ein ausgewogener Routing-Plan existiert immer.

Drei Infrastruktur-Releases, die so wichtig sind wie die Gewichte

Moonshot veröffentlichte nicht nur eine Model Card — es Open-Source-stellte den Infrastruktur-Stack, der K3s Training ermöglichte. Das ist ein wesentlicher Grund, warum das Release bei Entwicklern gut ankam.

TechnologieFunktionKernzahlen
MoonEPHochleistungs-Kommunikationsbibliothek für extrem große, feinkörnige MoE-ModelleDupliziert überlastete Experten temporär, sodass jeder Rank gleiche Token-Anzahl erhält; beweist mathematische Obergrenze redundanter Experten pro Rank und hält Effizienz auch bei Lastungleichgewicht
FlashKDACUTLASS-basierte Kernel-Implementierung von Kimi Delta Attention (zuvor Open Source)1,72×–2,22× schnelleres Prefill auf NVIDIA H20 vs. flash-linear-attention-Baseline; automatisch als Drop-in-Backend über chunk_kda eingebunden, keine Codeänderungen nötig
AgentEnvFirecracker-MicroVM-basiertes Sandbox-System, gemeinsam mit KVCache.ai entwickeltFür massiv paralleles agentisches RL-Training; unterstützt schnelles Snapshotting, Forking und Restore. Moonshot meldet Checkpoint-Latenz ab 133 ms, Resume-Latenz ab 49 ms und bis zu 6,5× Memory-Overcommit (noch nicht unabhängig reproduziert)

Benchmarks: Kimi K3 vs. GPT-5.6, Claude und GLM-5.2

Herstellerangaben variieren stark je nach Evaluations-Setup — die folgenden Zahlen priorisieren unabhängige Drittpartei-Evaluierungen, wo verfügbar.

SWE-bench Verified (unabhängige Evaluierung, Vals AI, Stand Juli 2026)

ModellScoreRelease-Datum
Claude Opus 597 %2026-07-24
GPT-5.6 Sol96,2 %2026-07-09
Claude Fable 595 %2026-06-09
Kimi K393,4 %2026-07-16
Qwen3.7-Max79,4 %2026-05-19
DeepSeek-V476,2 %2026-04-23

Artificial Analysis Intelligence Index (neutrale Drittpartei-Gesamtbewertung, max reasoning)

Kimi K3 ist derzeit das leistungsstärkste Open-Weight-Modell am Markt nach reiner Fähigkeit, aber nicht das günstigste. Es kostet etwa 0,95 USD pro Task im Intelligence Index — rund 60 % weniger als Claude Fable 5 (~2,40 USD/Task), aber teurer als das Open-Weight-Modell GLM-5.2 (~0,47 USD/Task). Kurz: Es ist die Fähigkeits-Obergrenze der Open-Weight-Liga, nicht der Preis-Leistungs-Favorit. K3 belegt zudem Platz 1 auf Arena.ais Frontend Code Arena Leaderboard.

Zitierbare technische Fakten (EEAT)

Preise und Self-Hosting: Können Sie das wirklich selbst betreiben?

Über API

Moonshot stellt eine OpenAI-SDK-kompatible Chat-Completions-API unter https://api.moonshot.ai/v1 mit Modell-ID kimi-k3 bereit — die meisten bestehenden Integrationen benötigen nur base URL und API-Key-Wechsel.

Token-TypPreis pro Million Tokens
Input (Cache Hit)0,30 USD
Input (Cache Miss)3,00 USD
Output (inkl. Reasoning Trace)15,00 USD

Da Moonshots disaggregierte Mooncake-Serving-Architektur bei typischen Coding-Workloads Cache-Hit-Raten über 90 % hält, liegt realer Verbrauch näher an 0,30 USD als an der 3,00-USD-Headline.

Self-Hosting

Bei 2,8 Billionen Parametern über 896 Experten ist K3 für Consumer- oder die meisten Prosumer-Hardware unerreichbar. Moonshot empfiehlt Deployment auf Supernode-Konfigurationen mit 64 oder mehr Beschleunigern. Für Einzelentwickler und die meisten Unternehmen ist der praktikable Weg K3 über die offizielle API oder einen Router wie OpenRouter — sieben Anbieter hosten es bereits, meist zu Moonshots eigenen Preisen.

Das große Bild: Kimi K3 im US-China-KI-Streit

K3s Open-Weight-Release geschah nicht im luftleeren Raum. Es fiel in das Zeitfenster der World Artificial Intelligence Conference (WAIC 2026) und wenige Tage nach der Eskalation des US-China-„Model-Distillation“-Streits: Der Wissenschafts- und Technologieberater des Weißen Hauses Michael Kratsios warf Moonshot vor, eine „groß angelegte, verdeckte industrielle Destillation“ gegen Anthropics Fable-Modell zur K3-Ausbildung zu betreiben, und Finanzminister Scott Bessent drohte mit Sanktionen und Entity-List-Einstufung. Chinas Handelsministerium wies am 28. Juli öffentlich zurück und warf Washington „KI-Hegemonie“ vor. Vor diesem Hintergrund liest sich die Veröffentlichung vollständiger Gewichte, technischem Bericht und drei Infrastruktur-Technologien als bewusstes Signal — Moonshot setzt darauf, dass vollständige Offenlegung der Engineering-Arbeit die klarste Antwort auf Fragen zu seinen Methoden ist. Drei Tage nach K3 stellte Alibaba — einer von Moonshots Investoren — Qwen3.8-Max-Preview vor, ein 2,4-Billionen-Parameter-Modell, das weithin als direkte Antwort gelesen wird und das Open-Weight-Rennen in den sogenannten „3T-Club“ treibt.

Fünf-Schritte-Integrations-Runbook

Schritt 1 Bei kimi.com oder platform.kimi.ai anmelden und Moonshot-API-Key erstellen Schritt 2 Integrationsweg wählen: Web/App, offizielle API oder OpenRouter moonshotai/kimi-k3 Schritt 3 OpenAI SDK konfigurieren: base_url=https://api.moonshot.ai/v1, model=kimi-k3 Schritt 4 10–20 SWE-bench-ähnliche Long-Code-Tasks pilotieren; Qualität, Tokens und Cache Hits protokollieren Schritt 5 Hybrid-Routing deployen: Long Code/Docs an K3, Repo-Bugfixes an Fable 5, Terminal-Agenten an GPT-5.6 Sol

FAQ

Ist Kimi K3 Open Source?

Nein, nicht nach der strengen OSI-Definition. Es ist Open Weight: trainierte Gewichte, technischer Bericht und einige Infrastruktur-Tools sind öffentlich, Trainingsdaten und vollständiger Trainingscode jedoch nicht. Moonshot verwendet selbst durchgehend „Open Weight“, nie „Open Source“.

Kann ich Kimi K3 kommerziell kostenlos nutzen?

Ja, für die überwiegende Mehrheit der Anwendungsfälle. Einschränkungen gelten nur, wenn Sie ein Model-as-a-Service-Geschäft auf Basis von K3 betreiben, das in den letzten 12 Monaten über 20 Millionen Dollar Umsatz erzielt (separate Vereinbarung mit Moonshot erforderlich), oder wenn Ihr Produkt 100 Millionen monatlich aktive Nutzer oder 20 Millionen Dollar Monatsumsatz überschreitet (Anzeige von „Kimi K3“ in der UI erforderlich).

Wie viel VRAM oder Hardware brauche ich für Self-Hosting von Kimi K3?

Moonshot empfiehlt Supernode-Konfigurationen mit 64 oder mehr Beschleunigern. Das ist für Consumer- oder die meisten Prosumer-Hardware nicht realistisch — die meisten Entwickler sollten die offizielle API oder einen Hosting-Anbieter wie OpenRouter nutzen.

Wie schneidet Kimi K3 im Vergleich zu GPT-5.6 und Claude ab?

Es liegt bei unabhängigen SWE-bench Verified-Werten (93,4 % vs. 95–97 %) hinter Claude Opus 5, GPT-5.6 Sol und Claude Fable 5 und belegt Platz 3 im Artificial Analysis Intelligence Index, ist aber das stärkste verfügbare Open-Weight-Modell — vor GLM-5.2 und DeepSeek V4 Pro.

Was unterscheidet Kimi K3 von Kimi K2?

K3 hat etwa das Dreifache der Parameter von K2.5, fügt Attention Residuals und Per-Head Muon zur Architektur hinzu und erweitert Kontextfenster und Multimodalität deutlich. Die Lizenz enthält zudem eine neue Model-as-a-Service-Umsatzschwelle, die in der K2-Familie fehlte, wodurch kommerzielle Bedingungen granularer werden.

Zusammenfassung

K3s vollständiges Open-Weight-Release markiert eine neue Phase chinesischer Frontier-Modelle — von „API verfügbar“ zu „Engineering-Details prüfbar“. Es liefert echte Architektur-Innovation (KDA, AttnRes, Per-Head Muon, Stable LatentMoE), wettbewerbsfähige Benchmarks gegen geschlossene Frontier-Modelle und drei Open-Infrastruktur-Tools (MoonEP, FlashKDA, AgentEnv). Open Weight ist jedoch nicht OSI Open Source, und die zwei kommerziellen Schwellen der individuellen Lizenz verdienen sorgfältige rechtliche Prüfung.

Einen Kimi-K3-Agenten vollständig auf einem privaten Laptop oder generischen Linux-VPS zu betreiben hat echte Grenzen: Sleep unterbricht lange Loops, API-Keys vermischen sich mit Produktions-Codebases, und Apple-Toolchain-Arbeit (Xcode, Fastlane, notarytool) lässt sich nicht auf derselben Maschine kollokieren. Für Teams, die 7×24 unbeaufsichtigte Agenten brauchen — Kimi Code mit K3 und gleichzeitig iOS-CI oder OpenClaw-Gateways — ist das Mieten eines M4-Mac-Cloud-Knotens von VPSMAC (natives macOS, SSH + launchd-Daemons, gleiches Netzsegment wie Ihre Dev-Tools) typischerweise die stabilere, produktionsreife Wahl gegenüber privatem Gerät oder Linux-VPS für Hybrid-Modell-Strategien.

Quellen: Offizieller Moonshot-Blog · Kimi-API-Dokumentation · Vals AI SWE-bench Verified · Artificial Analysis Intelligence Index

Datenstand: 28. Juli 2026. Benchmarks priorisieren unabhängige Evaluierungen von Vals AI und Artificial Analysis. Modellfähigkeiten und Preise können sich ändern — vor dem Rollout gegen offizielle Dokumentation prüfen.