Kimi K3 — open source? Обзор 2,8-триллионной модели Moonshot AI

Короткий ответ: нет, не в строгом смысле — и Moonshot AI сам так не заявляет. Вечером 27 июля 2026 года китайская AI-лаборатория опубликовала полные веса и технический отчет Kimi K3 — Mixture-of-Experts модели на 2,8 триллиона параметров с контекстом в 1 миллион токенов и нативным пониманием изображений. В этом обзоре: архитектурные инновации, сравнение бенчмарков, пороги лицензии, ограничения self-hosting, цены API и runbook интеграции из пяти шагов.

Абстрактная визуализация нейросети, представляющая Kimi K3 как крупную open-weight модель с архитектурой mixture-of-experts

Содержание

Pain points: три вещи, которые нужно переоценить после полного релиза K3

  1. Путаница open source vs. open weight: китайские СМИ часто называют K3 «полностью open source», но материалы Moonshot никогда не используют «open source» — везде «open weight». Если юридическая команда проверяет по стандартам OSI, модель можно неверно классифицировать: обучающие данные и полный код обучения не опубликованы.
  2. Два новых коммерческих порога лицензии: K3 больше не использует Modified MIT лицензию эры K2. Это полностью кастомный документ с порогами, которых раньше не было — если вы ведете Model-as-a-Service с выручкой более 20 млн $ за 12 месяцев или продукт превышает 100 млн MAU, нужна юридическая проверка перед запуском.
  3. Разрыв self-hosting vs. реальность API: 2,8 триллиона параметров, около 1,56 ТБ весов и рекомендация Moonshot 64+ ускорителей означают: «веса публичны» ≠ «можно запустить локально». Для большинства команд практичный путь — API или OpenRouter.

Kimi K3 — open source или только open weight?

По определению Open Source Initiative (OSI) по-настоящему open-source модель требует публичных обучающих данных, публичного кода обучения и воспроизводимого pipeline — а не только обученных весов. Kimi K3 публикует веса, технический отчет и несколько инфраструктурных инструментов, близких к обучению, но не данные и не полный код обучения. Это open weight: любой может скачать, запустить, дообучить и коммерчески развернуть модель, но никто вне Moonshot не может воспроизвести её с нуля.

Лицензия также ужесточилась по сравнению с семейством K2. Больше не «Modified MIT» — это кастомный документ с двумя коммерческими порогами, которых раньше не было:

  1. Порог выручки Model-as-a-Service. Если вы или аффилированные лица ведете Model-as-a-Service на базе K3 с совокупной выручкой более 20 миллионов долларов за любые скользящие 12 месяцев, необходимо согласовать отдельное коммерческое соглашение с Moonshot AI.
  2. Порог атрибуции. Если продукт или сервис превышает 100 миллионов месячных активных пользователей или 20 миллионов долларов месячной выручки, нужно заметно отображать «Kimi K3» в пользовательском интерфейсе.

Для почти любого стартапа, indie-разработчика или средней компании ни один порог не является практической проблемой — коммерческие продукты на K3 можно выпускать уже сегодня. Реально важна первая оговорка — и только если бизнес-модель перепродаёт inference K3 в масштабе в прямой конкуренции с API Moonshot.

Kimi K3 кратко

ХарактеристикаЗначение
Всего параметров2,8 триллиона
Активных параметров~104 миллиарда
АрхитектураMixture-of-Experts (MoE)
Эксперты896 routed experts, 16 активируются на токен, плюс shared experts
Механизм attentionKimi Delta Attention (KDA) + Gated Multi-Head Latent Attention (MLA)
Контекстное окно1 000 000 токенов
МультимодальностьНативное понимание изображений (ViT-V2, 27 слоёв)
Формат весовMXFP4 weights, MXFP8 activations (quantization-aware training с этапа SFT)
Размер загрузки~1,56 ТБ (Hugging Face)
ЛицензияКастомная лицензия — Moonshot называет это «open weight», не «open source»
Первое появление16 июля 2026 (только API)
Полные веса опубликованы27 июля 2026

Вместе с весами Moonshot open-source опубликовала три инфраструктурные технологии, обеспечившие обучение K3: MoonEP, FlashKDA и AgentEnv. K3 становится крупнейшей когда-либо полностью опубликованной open-weight моделью — загрузка 1,56 ТБ заняла #1 в trending Hugging Face за тридцать минут. Moonshot последовательно называет это «open-weight» релизом, никогда «open source».

Архитектура: что реально делают KDA, Attention Residuals и Per-Head Muon

Kimi K3 не просто масштабирует существующий рецепт — Moonshot перестроила три давних стандартных компонента deep learning: attention, residual connections и optimizer.

Kimi Delta Attention (KDA): забывание по одному каналу

Стандартный Gated DeltaNet применяет одно скalar forgetting gate ко всему memory state — всё затухает с одной скоростью. KDA заменяет это channel-wise gating: каждое измерение feature получает свой независимый decay rate, модель может держать одни features бесконечно и агрессивно забывать другие. Реализовано как chunkwise Diagonal-Plus-Low-Rank (DPLR) формулировка — рекуррентность остаётся линейной по времени и hardware-efficient. K3 чередует KDA-слои с меньшим числом full global-attention (Gated MLA) слоёв — этот гибрид и даёт 1M-token контекст при компактном KV cache.

Attention Residuals (AttnRes): residual connections, которые выбирают, что сохранить

В стандартной глубокой сети residual connections накапливают выход каждого слоя равномерно — чем глубже сеть, тем сильнее размывается информация ранних слоёв. AttnRes заменяет равномерное накопление селективной, input-dependent агрегацией по всем предыдущим слоям. Overhead минимален: один RMSNorm и один pseudo-query vector на слой — пренебрежимая доля параметров. В тестах это дало примерно 25 % выше training efficiency при менее 2 % дополнительных затрат. Pseudo-query vectors инициализируются нулём, механизм стартует как uniform average без дестабилизации раннего обучения.

Per-Head Muon: независимая оптимизация attention heads

Muon — широко принятый optimizer в large-scale training. K3 расширяет его до per attention head вместо uniform обработки всей модели — каждый head получает более адаптивный convergence path. Это чисто training-time техника — невидима для API-пользователей — но часть причины, почему K3 бьёт выше active-parameter count относительно closed frontier models.

Stable LatentMoE: sparse by design

MoE-слой K3 маршрутизирует через 896 experts и активирует только 16 на токен — около 1,8 % sparsity — плюс shared experts для baseline stability. Чтобы load imbalance не душил throughput в масштабе, Moonshot применяет Quantile Balancing и доказывает математическую верхнюю границу redundant experts на compute rank — сбалансированный routing plan всегда существует.

Три инфраструктурных релиза не менее важны, чем веса

Moonshot опубликовала не только model card — open-source стек инфраструктуры, сделавший обучение K3 возможным. Это значимая часть причины положительного отклика разработчиков.

ТехнологияНазначениеКлючевые цифры
MoonEPВысокопроизводительная communication library для extremely large fine-grained MoEВременно дублирует overloaded experts для равного token count на rank; доказывает upper bound redundant experts на rank, сохраняя efficiency при load imbalance
FlashKDACUTLASS-based kernel implementation Kimi Delta Attention (ранее open-sourced)1,72×–2,22× быстрее prefill на NVIDIA H20 vs flash-linear-attention baseline; auto-dispatch как drop-in backend через chunk_kda, без изменений кода
AgentEnvFirecracker microVM sandbox system, co-developed с KVCache.aiДля massively parallel agentic RL training; fast snapshotting, forking, restoration. Moonshot сообщает checkpoint latency от 133 ms, resume от 49 ms, до 6,5× memory overcommit (ещё не независимо воспроизведено)

Бенчмарки: Kimi K3 vs GPT-5.6, Claude и GLM-5.2

Цифры вендоров сильно различаются по evaluation harness — ниже приоритет независимым third-party оценкам, где доступны.

SWE-bench Verified (независимая оценка, Vals AI, июль 2026)

МодельScoreДата релиза
Claude Opus 597 %2026-07-24
GPT-5.6 Sol96,2 %2026-07-09
Claude Fable 595 %2026-06-09
Kimi K393,4 %2026-07-16
Qwen3.7-Max79,4 %2026-05-19
DeepSeek-V476,2 %2026-04-23

Artificial Analysis Intelligence Index (нейтральный third-party composite score, max reasoning)

Kimi K3 сейчас сильнейшая open-weight модель на рынке по raw capability, но не самая дешёвая. Около $0,95 за task в Intelligence Index — примерно на 60 % дешевле Claude Fable 5 (~$2,40/task), но дороже open-weight GLM-5.2 (~$0,47/task). Коротко: это capability ceiling open-weight tier, а не value pick. K3 также #1 на Arena.ai Frontend Code Arena leaderboard.

Цитируемые технические факты (EEAT)

Цены и self-hosting: можно ли реально запустить самому?

Через API

Moonshot предоставляет OpenAI SDK-compatible Chat Completions API на https://api.moonshot.ai/v1 с model ID kimi-k3 — большинству интеграций достаточно сменить base URL и API key.

Тип токенаЦена за миллион токенов
Input (cache hit)$0,30
Input (cache miss)$3,00
Output (включая reasoning trace)$15,00

Так как disaggregated Mooncake serving Moonshot держит cache hit rates выше 90 % на typical coding workloads, реальное потребление ближе к $0,30, чем к headline $3,00.

Self-hosting

При 2,8 триллиона параметров на 896 experts K3 недоступен для consumer или большинства prosumer hardware. Moonshot рекомендует supernode с 64 и более ускорителями. Для индивидуальных разработчиков и большинства компаний практичный путь — official API или router вроде OpenRouter, где уже семь провайдеров хостят K3, чаще всего по ценам Moonshot.

Большая картина: Kimi K3 на фоне конфликта AI США–Китай

Open-weight релиз Kimi K3 не произошёл в вакууме. Он пришёлся на World Artificial Intelligence Conference (WAIC 2026) и через несколько дней после эскалации US-China «model distillation» спора: научный советник Белого дома Michael Kratsios обвинил Moonshot в «крупномасштабной скрытой industrial distillation» против модели Fable от Anthropic для обучения K3, а министр финансов Scott Bessent упомянул санкции и Entity List designation. Министерство торговли Китая 28 июля публично ответило, обвинив Вашингтон в «AI hegemonism» и пригрозив countermeasures. На этом фоне публикация полных весов, technical report и трёх инфраструктурных технологий читается как deliberate signal — Moonshot делает ставку на то, что полная демонстрация engineering work — clearest ответ на вопросы о методах. Через три дня после K3 Alibaba — один из инвесторов Moonshot — представила Qwen3.8-Max-Preview, модель 2,4 триллиона параметров, широко воспринимаемую как direct response, толкая open-weight гонку в так называемый «3T club».

Runbook интеграции из пяти шагов

Шаг 1 Зарегистрироваться на kimi.com или platform.kimi.ai и создать Moonshot API key Шаг 2 Выбрать путь: web/app, official API или OpenRouter moonshotai/kimi-k3 Шаг 3 Настроить OpenAI SDK: base_url=https://api.moonshot.ai/v1, model=kimi-k3 Шаг 4 Пилот 10–20 SWE-bench-style long-code задач; записать quality, tokens и cache hits Шаг 5 Deploy hybrid routing: long code/docs на K3, repo bug fixes на Fable 5, terminal agents на GPT-5.6 Sol

FAQ

Является ли Kimi K3 open source?

Нет, не по строгому определению OSI. Это open weight: обученные веса, технический отчет и часть инфраструктурных инструментов публичны, но обучающие данные и полный код обучения — нет. Moonshot в своих материалах использует только «open weight», никогда «open source».

Можно ли использовать Kimi K3 коммерчески бесплатно?

Да, для подавляющего большинства сценариев. Ограничения только если Model-as-a-Service на K3 превышает $20 млн выручки за 12 месяцев (нужно отдельное соглашение с Moonshot) или продукт превышает 100 млн MAU или $20 млн месячной выручки (нужно отображать «Kimi K3» в UI).

Сколько VRAM или железа нужно для self-hosting Kimi K3?

Moonshot рекомендует supernode с 64 и более ускорителями. Нереалистично для consumer или большинства prosumer hardware — большинству разработчиков стоит использовать official API или хостинг вроде OpenRouter.

Как Kimi K3 сравнивается с GPT-5.6 и Claude?

По независимым SWE-bench Verified (93,4 % vs 95–97 %) уступает Claude Opus 5, GPT-5.6 Sol и Claude Fable 5 и занимает 3-е место в Artificial Analysis Intelligence Index, но это сильнейшая доступная open-weight модель — впереди GLM-5.2 и DeepSeek V4 Pro.

Чем Kimi K3 отличается от Kimi K2?

K3 имеет примерно в 3 раза больше параметров, чем K2.5, добавляет Attention Residuals и Per-Head Muon, значительно расширяет контекст и мультимодальность. Лицензия также включает новый порог выручки Model-as-a-Service, отсутствовавший в семействе K2, делая commercial terms более granular.

Итог

Полный open-weight релиз Kimi K3 знаменует новую фазу китайских frontier models — от «API available» к «engineering details auditable». Реальные архитектурные инновации (KDA, AttnRes, Per-Head Muon, Stable LatentMoE), конкурентные бенчмарки против closed frontier models и три open infrastructure tools (MoonEP, FlashKDA, AgentEnv). Но open weight — не OSI open source, и два commercial gates кастомной лицензии заслуживают careful legal review.

Запуск Kimi K3 agent полностью на personal laptop или generic Linux VPS имеет real limits: sleep прерывает long loops, API keys смешиваются с production codebases, и нельзя co-locate Apple toolchain work (Xcode, Fastlane, notarytool) на той же машине. Для команд, которым нужны 7×24 unattended agents — Kimi Code с K3 плюс iOS CI или OpenClaw gateways — аренда M4 Mac cloud node от VPSMAC (native macOS, SSH + launchd daemons, same network segment с dev tools) обычно stable, production-ready choice vs personal device или Linux VPS для hybrid model strategies.

Источники: Официальный блог Moonshot · Документация API Kimi · Vals AI SWE-bench Verified · Artificial Analysis Intelligence Index

Данные на 28 июля 2026. Бенчмарки приоритизируют независимые оценки Vals AI и Artificial Analysis. Возможности модели и цены могут меняться — проверяйте official docs перед запуском.