Kimi K3 全面开源:2.8万亿参数、百万上下文,月之暗面这次放了什么大招
7 月 27 日晚 23 点左右,月之暗面正式发布 Kimi K3 完整模型权重与技术报告,并同步开源 MoonEP、FlashKDA、AgentEnv 三项核心基础设施——这是全球首个被完整开放的 3 万亿参数级别模型。本文面向 AI 开发者与企业法务,完整解读 架构创新、基准测试、open weight 许可细节、自部署门槛与 API 定价,并附五步接入 Runbook 与 FAQ。
内容目录
痛点拆解:K3 全面开源后,选型必须重估的三件事
- 「开源」与「开放权重」语义混淆:国内媒体普遍称 K3「全面开源」,但月之暗面官方材料从未使用 open source,一直采用 open weight(开放权重)表述。企业法务若按 OSI 标准理解「开源」,可能在合规审计中踩坑——训练数据与完整训练代码并未公开。
- 许可证新增两道商业门槛:K3 不再沿用 K2 时代的 Modified MIT,而是一份完全自定义许可证。若你运营 Model-as-a-Service 业务且年收入超 2000 万美元,或产品月活超 1 亿,必须仔细阅读附加条款,否则可能面临违约风险。
- 自部署门槛与 API 现实的落差:2.8 万亿参数、约 1.56TB 权重体积、官方建议 64 卡以上超节点——对个人开发者与中小团队而言,「权重已公开」不等于「能本地跑」。更现实的路径仍是 API 或 OpenRouter 等托管平台。
时间线:从 API 首发到全面开源,只用了 11 天
- 7 月 16 日夜(WAIC 2026 前夜):Kimi K3 在 kimi.com、Kimi Work、Kimi Code 以及 Kimi API 首发,但仅限在线调用,模型权重尚未公开。官方技术博客标题为《Kimi K3: Open Frontier Intelligence》。
- 7 月 17 日:行业开始密集分析其架构,新华社报道称其为「目前全球参数最大的开源模型」。
- 7 月 22 日–23 日:中美「模型蒸馏」争端升级。美国白宫科技顾问 Michael Kratsios 指控月之暗面对 Anthropic 的 Fable 模型进行「大规模、隐蔽的工业化蒸馏」,用于训练 K3;美国财政部长 Scott Bessent 随后表示将考虑对相关中国企业实施制裁及「实体清单」限制。
- 7 月 27 日晚 23 点:月之暗面正式发布 K3 完整模型权重、技术报告,并开源 MoonEP、AgentEnv(FlashKDA 此前已开源)。权重文件在 Hugging Face 上体积约 1.56TB,上线半小时内即登顶趋势榜第一。
- 7 月 28 日:中国商务部就中美 AI 争端公开回应,指责美方搞「AI 霸权主义」并威胁采取反制措施;国内多家媒体跟进报道本次开源细节。
这次开源距离 Kimi K3 在 kimi.com 和 API 端首发,只过去了 11 天。
Kimi K3 核心参数一览
| 项目 | 参数 |
|---|---|
| 总参数量 | 2.8 万亿(2.8T) |
| 激活参数量 | 约 1040 亿 |
| 架构类型 | 混合专家模型(MoE) |
| 专家配置 | 896 个路由专家,每 token 激活 16 个(另有共享专家) |
| 注意力机制 | Kimi Delta Attention(KDA)+ 门控多头潜在注意力(Gated MLA) |
| 上下文窗口 | 100 万 token |
| 多模态能力 | 原生视觉理解(ViT-V2,27 层) |
| 权重格式 | MXFP4 权重 + MXFP8 激活(从 SFT 阶段起即采用量化感知训练) |
| 权重体积 | 约 1.56TB(Hugging Face) |
| License | 自定义许可证(官方明确称「open weight」而非「open source」) |
三大架构创新:KDA、AttnRes 和 Per-Head Muon 分别解决了什么问题
Kimi K3 在架构上重构了深度学习沿用多年的三大传统组件——注意力机制、残差连接、优化器,这也是它区别于「简单堆参数」的关键。
Kimi Delta Attention(KDA):让「遗忘」变得更精细
传统的 Gated DeltaNet 使用「标量级」的遗忘门——整个记忆用同一个衰减系数处理。KDA 把这个门控改成了「逐通道」级别:每一个特征维度都拥有自己独立的衰减率,模型因此可以让某些特征长期保留、另一些特征快速遗忘,而不是一刀切。KDA 采用 chunkwise 的 Diagonal-Plus-Low-Rank(DPLR)公式实现线性时间递归,在保证硬件效率的同时大幅降低了长序列处理的显存开销。K3 将 KDA 与少量全局注意力层(Gated MLA)交替混合使用,这也是它能支撑 100 万 token 上下文、同时把 KV Cache 开销压到极低的核心原因。
Attention Residuals(AttnRes):残差连接不再是「雨露均沾」
传统残差连接会把每一层的输出逐层均匀累加传递下去,层数越深,早期层的信息越容易被「稀释」。AttnRes 把这个过程改成了「选择性、依据输入动态聚合前面所有层的输出」——每一层只需新增一个 RMSNorm 和一个伪查询向量,参数开销几乎可以忽略不计,却能带来约 25% 的训练效率提升,代价不到 2%。伪查询向量初始化为零,保证了训练初期等价于均匀平均,避免了早期训练的不稳定。
Per-Head Muon:让每个注意力头独立学习
Muon 是近年来被广泛采用的优化器,K3 在此基础上做了「逐注意力头独立优化」的扩展,让每个注意力头拥有更自适应的收敛路径,而不是被统一的优化策略「一锅烩」。这是一项纯训练期技术,普通开发者调用 API 时无感知,但正是这类细节的堆叠,让 K3 能以相对更少的激活参数打出接近顶尖闭源模型的效果。
Stable LatentMoE:896 选 16 的稀疏艺术
K3 的 MoE 层拥有 896 个路由专家,每个 token 只激活 16 个(稀疏度约 1.8%),配合共享专家保证基础能力的稳定性。为了解决大规模 MoE 训练中常见的专家负载不均衡问题,团队采用了 Quantile Balancing 均衡策略,并配合 MoonEP,从数学上证明了每个计算节点冗余专家数的理论上界,保证了负载均衡方案的可行性。
三大开源 Infra 技术:不只是甩权重,而是整套工程能力
月之暗面这次没有只发一份权重文件,而是把支撑 K3 训练效率与稳定性的三项关键基础设施技术也一并开源,这也是本次发布在开发者社区获得较高评价的重要原因。
| 技术 | 定位 | 关键能力 |
|---|---|---|
| MoonEP | 面向超大规模细粒度 MoE 模型的高性能通信库 | 通过临时复制过载专家的方式,保证每个计算节点获得均等的 token 数,并从数学上证明了冗余专家数的理论上界,在专家负载不均衡的情况下依然维持高通信效率 |
| FlashKDA | 基于 NVIDIA CUTLASS 模板实现的 KDA 高性能算子(此前已开源) | 在 NVIDIA H20 上相比 flash-linear-attention 基线,prefill 速度提升 1.72–2.22 倍;可作为 flash-linear-attention 库中 chunk_kda 的直接替代后端,现有项目无需改代码即可获得加速 |
| AgentEnv | 与 KVCache.ai 联合开发的智能体沙箱系统,基于 Firecracker microVM | 面向大规模并行的 Agent 强化学习训练场景,支持快速快照、恢复与 fork;官方披露 checkpoint 延迟低至 133ms、恢复延迟低至 49ms、内存超分最高 6.5 倍(此数据尚未经第三方独立复现) |
跑分到底怎么样:和 GPT-5.6、Claude、GLM-4.5 比一比
不同机构、不同评测框架给出的数字差异较大,以下优先引用独立第三方复测数据,厂商自报数据会单独标注。
SWE-bench Verified(独立复测,Vals AI,截至 2026 年 7 月)
| 模型 | 分数 | 发布日期 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| Qwen3.7-Max | 79.4% | 2026-05-19 |
| DeepSeek-V4 | 76.2% | 2026-04-23 |
Artificial Analysis 智能指数(中立第三方综合评测,max 推理档)
- Claude Fable 5(max + fallback):60
- GPT-5.6 Sol(max):59
- Kimi K3(max):约 57,全球第 3,开源模型第 1
- GLM-5.2(max):51(此前的开源第一名)
- DeepSeek V4 Pro(max):44
Kimi K3 目前是开源 3T 级模型中综合能力最强的一个,但在成本上并非最优——每任务成本约 $0.95,比 Claude Fable 5(约 $2.4/任务)便宜 60% 左右,但比同为开源阵营的 GLM-5.2(约 $0.47/任务)更贵。简单来说:它是开源阵营里能力天花板最高的选项,而不是性价比最高的选项。此外,Kimi K3 目前在 Arena.ai 的 Frontend Code Arena 榜单上排名第一。
可引用技术信息(EEAT 硬核数据)
- 参数规模:总参数 2.8T,激活参数约 104B,稀疏度 1.8%(896 专家中激活 16 个)。
- 上下文与缓存:支持 100 万 token 上下文;Mooncake 分离式推理架构在典型编程工作负载上缓存命中率可达 90%+。
- 独立基准:Vals AI 独立复测 SWE-bench Verified 93.4%;Artificial Analysis 智能指数 约 57 分,开源模型第一、全球第三。
是「开源」还是「开放权重」?许可证里的两道商业门槛
这是本次发布争议最大、也最值得企业用户仔细阅读的部分。
月之暗面官方材料从未使用「open source」这个词,一直采用「open weight(开放权重)」的表述——这和国内媒体普遍使用的「开源」翻译存在语义落差。严格按照开源倡议组织(OSI)的标准,真正的开源需要同时公开训练数据、训练代码和完整可复现流程,而 K3 只公开了训练完成后的权重文件、技术报告和推理相关的 Infra 工具,训练数据和完整训练代码并未公开。
许可证本身也不再自称「Modified MIT」(这是 K2 时代的说法),而是一份完全自定义的文件,其中包含两道此前 K2 系列都没有的商业门槛:
- Model-as-a-Service 收入门槛:如果被许可方及其关联方运营「模型即服务」业务,且连续 12 个月内该业务累计收入超过 2000 万美元,必须与月之暗面另行签署商业协议才能继续使用。
- 规模展示门槛:如果产品或服务的月活用户超过 1 亿,或月收入超过 2000 万美元,必须在产品界面上显著展示「Kimi K3」字样。
对绝大多数中小团队和创业公司而言,这两道门槛几乎不会被触发,可以正常商用;但如果你的商业计划是「拿 K3 去开一个和月之暗面竞争的模型服务」,第一道门槛就是你法务团队需要重点关注的红线。
能不能自己部署?硬件门槛与 API 定价
API 方式
月之暗面提供 OpenAI SDK 兼容的 Chat Completions API(https://api.moonshot.ai/v1,模型 ID kimi-k3),大部分现有项目只需改一下 base URL 和密钥即可接入。定价为:
| Token 类型 | 价格(每百万 token) |
|---|---|
| 输入(缓存命中) | $0.30 |
| 输入(缓存未命中) | $3.00 |
| 输出(含推理过程) | $15.00 |
由于月之暗面的 Mooncake 分离式推理架构在典型编程类工作负载上缓存命中率可达 90% 以上,实际大部分调用成本会更接近 $0.30 这一档,而不是 $3 的表头价格。
自部署方式
2.8 万亿参数、896 个专家的规模决定了 K3 几乎不可能在消费级硬件上运行,官方建议部署在 64 卡及以上的超节点配置上。对于个人开发者和大部分中小团队来说,更现实的路径是通过 OpenRouter 等第三方平台调用已经托管好的 K3(目前已有 7 家服务商上线,定价大多与官方一致)。
这次开源背后:中美 AI 竞赛与 WAIC 2026 的双重背景
Kimi K3 的开源节点并非孤立事件。它恰好卡在世界人工智能大会(WAIC 2026)的窗口期,同时叠加了正在升级的中美「模型蒸馏」争端——就在权重开源前几天,美方刚刚指控月之暗面「工业化蒸馏」Anthropic 的模型来训练 K3,并威胁制裁;中国商务部则在 7 月 28 日公开回应,指责美方搞「AI 霸权主义」。在这样的背景下,月之暗面选择把权重、技术报告和三项核心 Infra 技术全部公开,某种程度上也是一种态度表达:用完整的工程细节自证技术路径的独立性。三天后,阿里巴巴(月之暗面的投资方之一)发布了 24 万亿参数的 Qwen3.8-Max-Preview,被外界普遍解读为对 K3 的直接回应,国产大模型的竞争正式进入「3T 俱乐部」阶段。
五步接入 Runbook
常见问题(FAQ)
Q: Kimi K3 真的是开源模型吗?
A: 严格来说不是。它属于「开放权重(open weight)」模型:训练完成的权重文件、技术报告和部分 Infra 工具是公开的,但训练数据和完整训练代码没有公开,不符合 OSI 标准下的「开源」定义。
Q: Kimi K3 可以免费商用吗?
A: 可以,绝大多数商业场景不受限制。但如果你运营的是「模型即服务」业务且年收入超过 2000 万美元,或产品月活超过 1 亿/月收入超过 2000 万美元,需要额外满足许可证中的特定条款。
Q: Kimi K3 需要多少显卡才能自己部署?
A: 官方建议部署在 64 卡及以上的超节点集群,个人和大部分企业用户更现实的方式是通过官方 API 或 OpenRouter 等第三方平台调用。
Q: Kimi K3 的性能到底强不强?
A: 在开源模型阵营中综合能力最强,Artificial Analysis 智能指数全球第 3,仅次于 Claude Fable 5 和 GPT-5.6 Sol;但成本高于同为开源的 GLM-5.2,属于「开源阵营天花板最高、但非性价比最优」的选择。
Q: Kimi K3 和 Kimi K2 有什么区别?
A: K3 参数规模是 K2.5 的约 3 倍,架构上新增了 Attention Residuals 和 Per-Head Muon,上下文窗口和多模态能力也大幅提升;许可证方面 K3 新增了 Model-as-a-Service 收入门槛,商业限制比 K2 系列更细化。
总结
Kimi K3 的全面开放权重发布,标志着国产大模型从「API 可用」走向「工程细节可审计」的新阶段。它在架构层面(KDA、AttnRes、Per-Head Muon、Stable LatentMoE)做了真正的工程创新,在编程长任务、文档理解等关键赛道上对标乃至逼近部分闭源旗舰,且同步开源 MoonEP、FlashKDA、AgentEnv 三项 Infra——但 open weight 不等于 OSI 开源,自定义许可证的两道商业门槛也需要法务仔细审阅。
但若你把 Kimi K3 Agent 完全跑在个人笔记本或普通 Linux VPS 上,会面临休眠中断长循环、本地密钥与生产代码库混存、以及无法在 Apple 工具链(Xcode、Fastlane、notarytool)同机编排等局限;纯 API 调用也缺少隔离的 macOS 构建与签名环境。对于需要 7×24 无人值守 Agent、在 Kimi Code 中跑 K3 同时又要做 iOS CI 或 OpenClaw 网关的团队,租赁 VPSMAC 的 M4 Mac 云节点——原生 macOS、SSH + launchd 守护、与远程开发工具同网段——通常是比个人设备或 Linux VPS 更稳定、更适合混合模型策略的生产选择。
参考资料: Moonshot 官方技术博客 · Kimi API 文档 · Vals AI SWE-bench Verified · Artificial Analysis Intelligence Index
数据截止日期:2026-07-28。 基准数据优先引用 Vals AI 与 Artificial Analysis 独立复测,模型能力与定价可能随时更新,建议发布时核实最新官方文档。