Kimi K3 — open source? Обзор 2,8-триллионной модели Moonshot AI
Короткий ответ: нет, не в строгом смысле — и Moonshot AI сам так не заявляет. Вечером 27 июля 2026 года китайская AI-лаборатория опубликовала полные веса и технический отчет Kimi K3 — Mixture-of-Experts модели на 2,8 триллиона параметров с контекстом в 1 миллион токенов и нативным пониманием изображений. В этом обзоре: архитектурные инновации, сравнение бенчмарков, пороги лицензии, ограничения self-hosting, цены API и runbook интеграции из пяти шагов.
Содержание
Pain points: три вещи, которые нужно переоценить после полного релиза K3
- Путаница open source vs. open weight: китайские СМИ часто называют K3 «полностью open source», но материалы Moonshot никогда не используют «open source» — везде «open weight». Если юридическая команда проверяет по стандартам OSI, модель можно неверно классифицировать: обучающие данные и полный код обучения не опубликованы.
- Два новых коммерческих порога лицензии: K3 больше не использует Modified MIT лицензию эры K2. Это полностью кастомный документ с порогами, которых раньше не было — если вы ведете Model-as-a-Service с выручкой более 20 млн $ за 12 месяцев или продукт превышает 100 млн MAU, нужна юридическая проверка перед запуском.
- Разрыв self-hosting vs. реальность API: 2,8 триллиона параметров, около 1,56 ТБ весов и рекомендация Moonshot 64+ ускорителей означают: «веса публичны» ≠ «можно запустить локально». Для большинства команд практичный путь — API или OpenRouter.
Kimi K3 — open source или только open weight?
По определению Open Source Initiative (OSI) по-настоящему open-source модель требует публичных обучающих данных, публичного кода обучения и воспроизводимого pipeline — а не только обученных весов. Kimi K3 публикует веса, технический отчет и несколько инфраструктурных инструментов, близких к обучению, но не данные и не полный код обучения. Это open weight: любой может скачать, запустить, дообучить и коммерчески развернуть модель, но никто вне Moonshot не может воспроизвести её с нуля.
Лицензия также ужесточилась по сравнению с семейством K2. Больше не «Modified MIT» — это кастомный документ с двумя коммерческими порогами, которых раньше не было:
- Порог выручки Model-as-a-Service. Если вы или аффилированные лица ведете Model-as-a-Service на базе K3 с совокупной выручкой более 20 миллионов долларов за любые скользящие 12 месяцев, необходимо согласовать отдельное коммерческое соглашение с Moonshot AI.
- Порог атрибуции. Если продукт или сервис превышает 100 миллионов месячных активных пользователей или 20 миллионов долларов месячной выручки, нужно заметно отображать «Kimi K3» в пользовательском интерфейсе.
Для почти любого стартапа, indie-разработчика или средней компании ни один порог не является практической проблемой — коммерческие продукты на K3 можно выпускать уже сегодня. Реально важна первая оговорка — и только если бизнес-модель перепродаёт inference K3 в масштабе в прямой конкуренции с API Moonshot.
Kimi K3 кратко
| Характеристика | Значение |
|---|---|
| Всего параметров | 2,8 триллиона |
| Активных параметров | ~104 миллиарда |
| Архитектура | Mixture-of-Experts (MoE) |
| Эксперты | 896 routed experts, 16 активируются на токен, плюс shared experts |
| Механизм attention | Kimi Delta Attention (KDA) + Gated Multi-Head Latent Attention (MLA) |
| Контекстное окно | 1 000 000 токенов |
| Мультимодальность | Нативное понимание изображений (ViT-V2, 27 слоёв) |
| Формат весов | MXFP4 weights, MXFP8 activations (quantization-aware training с этапа SFT) |
| Размер загрузки | ~1,56 ТБ (Hugging Face) |
| Лицензия | Кастомная лицензия — Moonshot называет это «open weight», не «open source» |
| Первое появление | 16 июля 2026 (только API) |
| Полные веса опубликованы | 27 июля 2026 |
Вместе с весами Moonshot open-source опубликовала три инфраструктурные технологии, обеспечившие обучение K3: MoonEP, FlashKDA и AgentEnv. K3 становится крупнейшей когда-либо полностью опубликованной open-weight моделью — загрузка 1,56 ТБ заняла #1 в trending Hugging Face за тридцать минут. Moonshot последовательно называет это «open-weight» релизом, никогда «open source».
Архитектура: что реально делают KDA, Attention Residuals и Per-Head Muon
Kimi K3 не просто масштабирует существующий рецепт — Moonshot перестроила три давних стандартных компонента deep learning: attention, residual connections и optimizer.
Kimi Delta Attention (KDA): забывание по одному каналу
Стандартный Gated DeltaNet применяет одно скalar forgetting gate ко всему memory state — всё затухает с одной скоростью. KDA заменяет это channel-wise gating: каждое измерение feature получает свой независимый decay rate, модель может держать одни features бесконечно и агрессивно забывать другие. Реализовано как chunkwise Diagonal-Plus-Low-Rank (DPLR) формулировка — рекуррентность остаётся линейной по времени и hardware-efficient. K3 чередует KDA-слои с меньшим числом full global-attention (Gated MLA) слоёв — этот гибрид и даёт 1M-token контекст при компактном KV cache.
Attention Residuals (AttnRes): residual connections, которые выбирают, что сохранить
В стандартной глубокой сети residual connections накапливают выход каждого слоя равномерно — чем глубже сеть, тем сильнее размывается информация ранних слоёв. AttnRes заменяет равномерное накопление селективной, input-dependent агрегацией по всем предыдущим слоям. Overhead минимален: один RMSNorm и один pseudo-query vector на слой — пренебрежимая доля параметров. В тестах это дало примерно 25 % выше training efficiency при менее 2 % дополнительных затрат. Pseudo-query vectors инициализируются нулём, механизм стартует как uniform average без дестабилизации раннего обучения.
Per-Head Muon: независимая оптимизация attention heads
Muon — широко принятый optimizer в large-scale training. K3 расширяет его до per attention head вместо uniform обработки всей модели — каждый head получает более адаптивный convergence path. Это чисто training-time техника — невидима для API-пользователей — но часть причины, почему K3 бьёт выше active-parameter count относительно closed frontier models.
Stable LatentMoE: sparse by design
MoE-слой K3 маршрутизирует через 896 experts и активирует только 16 на токен — около 1,8 % sparsity — плюс shared experts для baseline stability. Чтобы load imbalance не душил throughput в масштабе, Moonshot применяет Quantile Balancing и доказывает математическую верхнюю границу redundant experts на compute rank — сбалансированный routing plan всегда существует.
Три инфраструктурных релиза не менее важны, чем веса
Moonshot опубликовала не только model card — open-source стек инфраструктуры, сделавший обучение K3 возможным. Это значимая часть причины положительного отклика разработчиков.
| Технология | Назначение | Ключевые цифры |
|---|---|---|
| MoonEP | Высокопроизводительная communication library для extremely large fine-grained MoE | Временно дублирует overloaded experts для равного token count на rank; доказывает upper bound redundant experts на rank, сохраняя efficiency при load imbalance |
| FlashKDA | CUTLASS-based kernel implementation Kimi Delta Attention (ранее open-sourced) | 1,72×–2,22× быстрее prefill на NVIDIA H20 vs flash-linear-attention baseline; auto-dispatch как drop-in backend через chunk_kda, без изменений кода |
| AgentEnv | Firecracker microVM sandbox system, co-developed с KVCache.ai | Для massively parallel agentic RL training; fast snapshotting, forking, restoration. Moonshot сообщает checkpoint latency от 133 ms, resume от 49 ms, до 6,5× memory overcommit (ещё не независимо воспроизведено) |
Бенчмарки: Kimi K3 vs GPT-5.6, Claude и GLM-5.2
Цифры вендоров сильно различаются по evaluation harness — ниже приоритет независимым third-party оценкам, где доступны.
SWE-bench Verified (независимая оценка, Vals AI, июль 2026)
| Модель | Score | Дата релиза |
|---|---|---|
| Claude Opus 5 | 97 % | 2026-07-24 |
| GPT-5.6 Sol | 96,2 % | 2026-07-09 |
| Claude Fable 5 | 95 % | 2026-06-09 |
| Kimi K3 | 93,4 % | 2026-07-16 |
| Qwen3.7-Max | 79,4 % | 2026-05-19 |
| DeepSeek-V4 | 76,2 % | 2026-04-23 |
Artificial Analysis Intelligence Index (нейтральный third-party composite score, max reasoning)
- Claude Fable 5 (max + fallback): 60
- GPT-5.6 Sol (max): 59
- Kimi K3 (max): ~57 — #3 overall, #1 среди open-weight моделей
- GLM-5.2 (max): 51 (прежний лидер open weight)
- DeepSeek V4 Pro (max): 44
Kimi K3 сейчас сильнейшая open-weight модель на рынке по raw capability, но не самая дешёвая. Около $0,95 за task в Intelligence Index — примерно на 60 % дешевле Claude Fable 5 (~$2,40/task), но дороже open-weight GLM-5.2 (~$0,47/task). Коротко: это capability ceiling open-weight tier, а не value pick. K3 также #1 на Arena.ai Frontend Code Arena leaderboard.
Цитируемые технические факты (EEAT)
- Масштаб: 2,8T total parameters, ~104B active, 1,8 % sparsity (16 из 896 experts на токен).
- Контекст и caching: 1M-token context window; Mooncake disaggregated serving держит cache hit rates выше 90 % на typical coding workloads.
- Независимые бенчмарки: Vals AI SWE-bench Verified 93,4 %; Artificial Analysis Intelligence Index ~57, #1 open weight, #3 overall.
Цены и self-hosting: можно ли реально запустить самому?
Через API
Moonshot предоставляет OpenAI SDK-compatible Chat Completions API на https://api.moonshot.ai/v1 с model ID kimi-k3 — большинству интеграций достаточно сменить base URL и API key.
| Тип токена | Цена за миллион токенов |
|---|---|
| Input (cache hit) | $0,30 |
| Input (cache miss) | $3,00 |
| Output (включая reasoning trace) | $15,00 |
Так как disaggregated Mooncake serving Moonshot держит cache hit rates выше 90 % на typical coding workloads, реальное потребление ближе к $0,30, чем к headline $3,00.
Self-hosting
При 2,8 триллиона параметров на 896 experts K3 недоступен для consumer или большинства prosumer hardware. Moonshot рекомендует supernode с 64 и более ускорителями. Для индивидуальных разработчиков и большинства компаний практичный путь — official API или router вроде OpenRouter, где уже семь провайдеров хостят K3, чаще всего по ценам Moonshot.
Большая картина: Kimi K3 на фоне конфликта AI США–Китай
Open-weight релиз Kimi K3 не произошёл в вакууме. Он пришёлся на World Artificial Intelligence Conference (WAIC 2026) и через несколько дней после эскалации US-China «model distillation» спора: научный советник Белого дома Michael Kratsios обвинил Moonshot в «крупномасштабной скрытой industrial distillation» против модели Fable от Anthropic для обучения K3, а министр финансов Scott Bessent упомянул санкции и Entity List designation. Министерство торговли Китая 28 июля публично ответило, обвинив Вашингтон в «AI hegemonism» и пригрозив countermeasures. На этом фоне публикация полных весов, technical report и трёх инфраструктурных технологий читается как deliberate signal — Moonshot делает ставку на то, что полная демонстрация engineering work — clearest ответ на вопросы о методах. Через три дня после K3 Alibaba — один из инвесторов Moonshot — представила Qwen3.8-Max-Preview, модель 2,4 триллиона параметров, широко воспринимаемую как direct response, толкая open-weight гонку в так называемый «3T club».
Runbook интеграции из пяти шагов
FAQ
Является ли Kimi K3 open source?
Нет, не по строгому определению OSI. Это open weight: обученные веса, технический отчет и часть инфраструктурных инструментов публичны, но обучающие данные и полный код обучения — нет. Moonshot в своих материалах использует только «open weight», никогда «open source».
Можно ли использовать Kimi K3 коммерчески бесплатно?
Да, для подавляющего большинства сценариев. Ограничения только если Model-as-a-Service на K3 превышает $20 млн выручки за 12 месяцев (нужно отдельное соглашение с Moonshot) или продукт превышает 100 млн MAU или $20 млн месячной выручки (нужно отображать «Kimi K3» в UI).
Сколько VRAM или железа нужно для self-hosting Kimi K3?
Moonshot рекомендует supernode с 64 и более ускорителями. Нереалистично для consumer или большинства prosumer hardware — большинству разработчиков стоит использовать official API или хостинг вроде OpenRouter.
Как Kimi K3 сравнивается с GPT-5.6 и Claude?
По независимым SWE-bench Verified (93,4 % vs 95–97 %) уступает Claude Opus 5, GPT-5.6 Sol и Claude Fable 5 и занимает 3-е место в Artificial Analysis Intelligence Index, но это сильнейшая доступная open-weight модель — впереди GLM-5.2 и DeepSeek V4 Pro.
Чем Kimi K3 отличается от Kimi K2?
K3 имеет примерно в 3 раза больше параметров, чем K2.5, добавляет Attention Residuals и Per-Head Muon, значительно расширяет контекст и мультимодальность. Лицензия также включает новый порог выручки Model-as-a-Service, отсутствовавший в семействе K2, делая commercial terms более granular.
Итог
Полный open-weight релиз Kimi K3 знаменует новую фазу китайских frontier models — от «API available» к «engineering details auditable». Реальные архитектурные инновации (KDA, AttnRes, Per-Head Muon, Stable LatentMoE), конкурентные бенчмарки против closed frontier models и три open infrastructure tools (MoonEP, FlashKDA, AgentEnv). Но open weight — не OSI open source, и два commercial gates кастомной лицензии заслуживают careful legal review.
Запуск Kimi K3 agent полностью на personal laptop или generic Linux VPS имеет real limits: sleep прерывает long loops, API keys смешиваются с production codebases, и нельзя co-locate Apple toolchain work (Xcode, Fastlane, notarytool) на той же машине. Для команд, которым нужны 7×24 unattended agents — Kimi Code с K3 плюс iOS CI или OpenClaw gateways — аренда M4 Mac cloud node от VPSMAC (native macOS, SSH + launchd daemons, same network segment с dev tools) обычно stable, production-ready choice vs personal device или Linux VPS для hybrid model strategies.
Источники: Официальный блог Moonshot · Документация API Kimi · Vals AI SWE-bench Verified · Artificial Analysis Intelligence Index
Данные на 28 июля 2026. Бенчмарки приоритизируют независимые оценки Vals AI и Artificial Analysis. Возможности модели и цены могут меняться — проверяйте official docs перед запуском.