Kimi K3 est-il open source ? Le modèle 2,8 billions de paramètres de Moonshot AI
Réponse courte : non, pas au sens strict — et Moonshot AI ne prétend pas le contraire. Le soir du 27 juillet 2026, le laboratoire chinois a publié les poids complets et le rapport technique de Kimi K3, un modèle Mixture-of-Experts de 2,8 billions de paramètres avec une fenêtre de contexte d'un million de tokens et une compréhension visuelle native. Ce guide couvre innovations d'architecture, comparaisons de benchmarks, seuils de licence, limites d'auto-hébergement, tarifs API et un runbook d'intégration en cinq étapes.
Sommaire
Pain points : trois choses à réévaluer après la release complète de K3
- Confusion open source vs. open weight : les médias chinois qualifient souvent K3 de « fully open source », mais les documents de Moonshot n'utilisent jamais « open source » — ils disent systématiquement « open weight ». Si votre équipe juridique audite selon les standards OSI, vous pouvez mal classer le modèle : données d'entraînement et code d'entraînement complet n'ont pas été publiés.
- Deux nouveaux seuils commerciaux : K3 n'utilise plus la licence Modified MIT de l'ère K2. C'est un document entièrement sur mesure avec des seuils inédits — si vous exploitez un business Model-as-a-Service dépassant 20 M$ de revenus sur 12 mois glissants, ou si votre produit dépasse 100 M MAU, une revue juridique est nécessaire avant mise en production.
- Écart auto-hébergement vs. réalité API : 2,8 billions de paramètres, environ 1,56 To de poids, et la recommandation Moonshot de 64+ accélérateurs signifient que « poids publics » ne veut pas dire « exécutable localement ». Pour la plupart des équipes, API ou OpenRouter reste le chemin praticable.
Kimi K3 est-il open source, ou seulement open weight ?
Selon la définition de l'Open Source Initiative (OSI), un modèle véritablement open source exige des données d'entraînement publiques, du code d'entraînement public et un pipeline reproductible — pas seulement les poids entraînés. Kimi K3 livre les poids, le rapport technique et plusieurs outils infra proches de l'entraînement, mais pas les données ni le code d'entraînement complet. C'est donc open weight : chacun peut télécharger, exécuter, affiner et déployer commercialement le modèle, mais personne en dehors de Moonshot ne peut le reproduire from scratch.
La licence elle-même s'est durcie par rapport à la famille K2. Elle n'est plus « Modified MIT » — c'est un document sur mesure avec deux seuils commerciaux inédits :
- Seuil de revenus Model-as-a-Service. Si vous ou vos affiliés exploitez un business Model-as-a-Service basé sur K3 générant plus de 20 millions de dollars de revenus agrégés sur 12 mois glissants, vous devez négocier un accord commercial séparé avec Moonshot AI avant de continuer.
- Seuil d'attribution. Si votre produit ou service dépasse 100 millions d'utilisateurs actifs mensuels ou 20 millions de dollars de revenus mensuels, vous devez afficher « Kimi K3 » de façon visible dans l'interface utilisateur.
Pour presque toute startup, développeur indie ou PME, aucun de ces seuils n'est un problème pratique — vous pouvez construire et livrer des produits commerciaux sur K3 dès aujourd'hui. La clause qui compte vraiment est la première, et seulement si votre modèle économique revend l'inférence K3 à grande échelle en concurrence directe avec l'API Moonshot.
Kimi K3 en bref
| Spécification | Valeur |
|---|---|
| Paramètres totaux | 2,8 billions |
| Paramètres actifs | ~104 milliards |
| Architecture | Mixture-of-Experts (MoE) |
| Experts | 896 experts routés, 16 activés par token, plus shared experts |
| Mécanisme d'attention | Kimi Delta Attention (KDA) + Gated Multi-Head Latent Attention (MLA) |
| Fenêtre de contexte | 1 000 000 tokens |
| Multimodalité | Compréhension visuelle native (ViT-V2, 27 couches) |
| Format des poids | Poids MXFP4, activations MXFP8 (quantization-aware training dès la phase SFT) |
| Taille du téléchargement | ~1,56 To (Hugging Face) |
| Licence | Licence sur mesure — Moonshot dit « open weight », pas « open source » |
| Première disponibilité | 16 juillet 2026 (API uniquement) |
| Poids complets publiés | 27 juillet 2026 |
Avec les poids, Moonshot a open-sourcé trois technologies infra qui ont alimenté l'entraînement de K3 : MoonEP, FlashKDA et AgentEnv. K3 devient ainsi le plus grand modèle open weight jamais publié en intégralité — un téléchargement de 1,56 To n°1 sur le trending Hugging Face en trente minutes. Moonshot appelle systématiquement cela une release « open weight », jamais « open source ».
L'architecture : ce que KDA, Attention Residuals et Per-Head Muon font réellement
Kimi K3 ne se contente pas de scaler une recette existante — Moonshot a reconstruit trois composants par défaut du deep learning : l'attention, les connexions résiduelles et l'optimiseur.
Kimi Delta Attention (KDA) : oublier, un canal à la fois
Le Gated DeltaNet standard applique une porte d'oubli scalaire unique à tout un état mémoire — tout décroît au même rythme. KDA la remplace par un gating canal par canal : chaque dimension de feature a son propre taux de décroissance, le modèle peut conserver certaines features indéfiniment et en oublier d'autres agressivement. Implémenté en formulation chunkwise Diagonal-Plus-Low-Rank (DPLR), la récurrence reste linéaire dans le temps et efficace matériellement. K3 alterne couches KDA et un nombre réduit de couches d'attention globale (Gated MLA) — ce design hybride permet la fenêtre de 1M tokens tout en gardant un KV cache compact.
Attention Residuals (AttnRes) : des connexions résiduelles qui choisissent quoi garder
Dans un réseau profond standard, les connexions résiduelles accumulent uniformément la sortie de chaque couche — plus le réseau est profond, plus l'information des premières couches se dilue. AttnRes remplace l'accumulation uniforme par une agrégation sélective dépendante de l'entrée sur toutes les couches précédentes. Le surcoût est minime : un RMSNorm et un vecteur pseudo-query par couche, une fraction négligeable des paramètres totaux. En test, cela a apporté environ 25 % d'efficacité d'entraînement en plus pour moins de 2 % de coût additionnel. Les vecteurs pseudo-query sont initialisés à zéro, le mécanisme démarre équivalent à une moyenne uniforme sans destabiliser l'entraînement initial.
Per-Head Muon : optimiser les têtes d'attention indépendamment
Muon est un optimiseur largement adopté en entraînement à grande échelle. K3 l'étend pour opérer par tête d'attention plutôt que sur le modèle entier uniformément, chaque tête ayant un chemin de convergence plus adaptatif. C'est purement une technique d'entraînement — invisible pour les appelants API — mais partie de la raison pour laquelle K3 surperforme relativement à son nombre de paramètres actifs face aux modèles frontier fermés.
Stable LatentMoE : sparse by design
La couche MoE de K3 route sur 896 experts et n'en active que 16 par token — environ 1,8 % de sparsité — avec des shared experts pour la stabilité de base. Pour éviter qu'un déséquilibre de charge limite le débit à l'échelle, Moonshot applique Quantile Balancing et prouve une borne supérieure mathématique d'experts redondants par rang de calcul, garantissant qu'un plan de routage équilibré existe toujours.
Trois releases infra aussi importantes que les poids
Moonshot n'a pas seulement publié une model card — il a open-sourcé la stack infra qui a rendu l'entraînement de K3 possible, ce qui explique en partie l'accueil positif des développeurs.
| Technologie | Rôle | Chiffres clés |
|---|---|---|
| MoonEP | Bibliothèque de communication haute performance pour MoE extrêmement grands et fins | Duplique temporairement les experts surchargés pour égaliser le nombre de tokens par rang ; prouve une borne supérieure d'experts redondants par rang, maintenant l'efficacité même sous déséquilibre de charge |
| FlashKDA | Implémentation kernel CUTLASS de Kimi Delta Attention (déjà open-sourcée) | Prefill 1,72×–2,22× plus rapide sur NVIDIA H20 vs. baseline flash-linear-attention ; dispatch automatique comme backend drop-in via chunk_kda, sans changement de code |
| AgentEnv | Système sandbox basé sur microVM Firecracker, co-développé avec KVCache.ai | Conçu pour l'entraînement RL agentique massivement parallèle ; snapshot, fork et restauration rapides. Moonshot annonce une latence checkpoint jusqu'à 133 ms, reprise à 49 ms, et jusqu'à 6,5× de surcommit mémoire (pas encore reproduit indépendamment) |
Benchmarks : Kimi K3 vs. GPT-5.6, Claude et GLM-5.2
Les chiffres annoncés par les éditeurs varient fortement selon les harness d'évaluation — les tableaux ci-dessous privilégient les évaluations indépendantes tierces quand elles existent.
SWE-bench Verified (évaluation indépendante, Vals AI, juillet 2026)
| Modèle | Score | Date de sortie |
|---|---|---|
| Claude Opus 5 | 97 % | 2026-07-24 |
| GPT-5.6 Sol | 96,2 % | 2026-07-09 |
| Claude Fable 5 | 95 % | 2026-06-09 |
| Kimi K3 | 93,4 % | 2026-07-16 |
| Qwen3.7-Max | 79,4 % | 2026-05-19 |
| DeepSeek-V4 | 76,2 % | 2026-04-23 |
Artificial Analysis Intelligence Index (score composite neutre tierce partie, max reasoning)
- Claude Fable 5 (max + fallback) : 60
- GPT-5.6 Sol (max) : 59
- Kimi K3 (max) : ~57 — 3e global, 1er parmi les modèles open weight
- GLM-5.2 (max) : 51 (ancien leader open weight)
- DeepSeek V4 Pro (max) : 44
Kimi K3 est actuellement le modèle open weight le plus puissant du marché en capacité brute, mais pas le moins cher. Il coûte environ 0,95 $ par tâche sur l'Intelligence Index — environ 60 % de moins que Claude Fable 5 (~2,40 $/tâche), mais plus cher que le modèle open weight GLM-5.2 (~0,47 $/tâche). En bref : c'est le plafond de capacité du tier open weight, pas le choix valeur. K3 est aussi n°1 sur le leaderboard Frontend Code Arena d'Arena.ai.
Faits techniques citables (EEAT)
- Échelle : 2,8T paramètres totaux, ~104B actifs, 1,8 % de sparsité (16 experts sur 896 par token).
- Contexte et cache : fenêtre de 1M tokens ; le serving disaggregé Mooncake maintient des taux de cache hit au-dessus de 90 % sur les workloads coding typiques.
- Benchmarks indépendants : Vals AI SWE-bench Verified 93,4 % ; Artificial Analysis Intelligence Index ~57, 1er open weight, 3e global.
Tarifs et auto-hébergement : pouvez-vous vraiment l'exécuter vous-même ?
Via API
Moonshot expose une API Chat Completions compatible OpenAI SDK sur https://api.moonshot.ai/v1 avec l'ID modèle kimi-k3 — la plupart des intégrations existantes n'ont besoin que d'un changement de base URL et de clé API.
| Type de token | Prix par million de tokens |
|---|---|
| Input (cache hit) | 0,30 $ |
| Input (cache miss) | 3,00 $ |
| Output (trace de raisonnement incluse) | 15,00 $ |
Comme l'architecture Mooncake disaggregée de Moonshot maintient des taux de cache hit au-dessus de 90 % sur les workloads coding typiques, l'usage réel se rapproche du tarif 0,30 $ plutôt que du chiffre headline 3,00 $.
Auto-hébergement
Avec 2,8 billions de paramètres sur 896 experts, K3 est hors de portée du hardware grand public ou même prosumer. Moonshot recommande un déploiement sur supernodes avec 64 accélérateurs ou plus. Pour les développeurs individuels et la plupart des entreprises, le chemin praticable reste l'API officielle ou un routeur comme OpenRouter — sept fournisseurs l'hébergent déjà, le plus souvent aux tarifs Moonshot.
Vue d'ensemble : Kimi K3 dans le conflit IA USA-Chine
La release open weight de Kimi K3 n'a pas eu lieu dans le vide. Elle est tombée pendant la World Artificial Intelligence Conference (WAIC 2026) et quelques jours après l'escalade du conflit US-Chine sur la « distillation de modèles » : le conseiller scientifique et technologique de la Maison-Blanche Michael Kratsios a accusé Moonshot de mener une « distillation industrielle covert à grande échelle » contre le modèle Fable d'Anthropic pour entraîner K3, et le secrétaire au Trésor Scott Bessent a évoqué sanctions et inscription Entity List. Le ministère chinois du Commerce a riposté publiquement le 28 juillet, accusant Washington d'« hégémonisme IA » et menaçant de contre-mesures. Dans ce contexte, publier poids complets, rapport technique et trois technologies infra se lit comme un signal délibéré — Moonshot parie que montrer son travail d'ingénierie en détail est la réponse la plus claire aux questions sur ses méthodes. Trois jours après K3, Alibaba — l'un des investisseurs de Moonshot — a dévoilé Qwen3.8-Max-Preview, un modèle 2,4 billions largement lu comme réponse directe, poussant la course open weight vers ce que certains appellent le « club 3T ».
Runbook d'intégration en cinq étapes
FAQ
Kimi K3 est-il open source ?
Non, pas selon la définition stricte de l'OSI. C'est open weight : poids entraînés, rapport technique et certains outils infra sont publics, mais pas les données d'entraînement ni le code d'entraînement complet. Moonshot emploie toujours « open weight », jamais « open source », dans ses propres documents.
Puis-je utiliser Kimi K3 commercialement gratuitement ?
Oui, pour la grande majorité des cas. Les restrictions ne s'appliquent que si vous exploitez un business Model-as-a-Service sur K3 dépassant 20 millions de dollars de revenus sur 12 mois glissants (accord séparé avec Moonshot requis), ou si votre produit dépasse 100 millions d'utilisateurs actifs mensuels ou 20 millions de dollars de revenus mensuels (affichage de « Kimi K3 » dans l'UI requis).
Quelle VRAM ou hardware pour auto-héberger Kimi K3 ?
Moonshot recommande des supernodes avec 64 accélérateurs ou plus. Irréaliste pour le hardware grand public — la plupart des développeurs doivent utiliser l'API officielle ou un hébergeur comme OpenRouter.
Comment Kimi K3 se compare-t-il à GPT-5.6 et Claude ?
Il est derrière Claude Opus 5, GPT-5.6 Sol et Claude Fable 5 sur SWE-bench Verified indépendant (93,4 % vs 95–97 %) et 3e sur l'Artificial Analysis Intelligence Index, mais c'est le modèle open weight le plus puissant, devant GLM-5.2 et DeepSeek V4 Pro.
Quelle différence entre Kimi K3 et Kimi K2 ?
K3 a environ 3× les paramètres de K2.5, ajoute Attention Residuals et Per-Head Muon, et étend fortement le contexte et le multimodal. Sa licence ajoute aussi un seuil Model-as-a-Service absent de la famille K2, rendant les termes commerciaux plus granulaires.
Synthèse
La release open weight complète de Kimi K3 marque une nouvelle phase pour les modèles frontier chinois — de « API disponible » à « détails d'ingénierie auditable ». Il apporte une vraie innovation d'architecture (KDA, AttnRes, Per-Head Muon, Stable LatentMoE), des benchmarks compétitifs face aux modèles frontier fermés, et trois outils infra ouverts (MoonEP, FlashKDA, AgentEnv). Mais open weight n'est pas open source OSI, et les deux seuils commerciaux de la licence sur mesure méritent une revue juridique attentive.
Faire tourner un agent Kimi K3 entièrement sur un laptop personnel ou un VPS Linux générique a de vraies limites : le sleep interrompt les longues boucles, les clés API se mélangent aux codebases de production, et vous ne pouvez pas co-localiser le toolchain Apple (Xcode, Fastlane, notarytool) sur la même machine. Pour les équipes qui ont besoin d'agents 7×24 non supervisés — Kimi Code avec K3 tout en gérant CI iOS ou gateways OpenClaw — louer un nœud Mac cloud M4 chez VPSMAC (macOS natif, SSH + daemons launchd, même segment réseau que vos outils dev) est généralement plus stable et production-ready qu'un appareil personnel ou un VPS Linux pour des stratégies hybrides de modèles.
Sources : Blog officiel Moonshot · Documentation API Kimi · Vals AI SWE-bench Verified · Artificial Analysis Intelligence Index
Données au 28 juillet 2026. Les benchmarks privilégient les évaluations indépendantes Vals AI et Artificial Analysis. Capacités et tarifs peuvent évoluer — vérifier la documentation officielle avant mise en production.