Kimi K3 开源权重 7 月 27 日发布:2.8 万亿参数、百万上下文,闭源溢价还守得住吗?
距 7 月 27 日权重发布还有 5 天。若你已在 7 月 16 日读过我们的 Kimi K3 深度评测,本文将把焦点移到开源权重发布本身:双线时间线、完整规格、基准胜负、API 真实成本、自部署硬件真相、行业意义、发布日核对清单、五步 Runbook 与 FAQ——覆盖选型与 SEO 决策所需的全部要点。
内容目录
痛点拆解:为什么 7 月 27 日必须重估模型策略?
- 开源与闭源的能力差距在前沿基本闭合:AA Intelligence Index 中 K3 以 57.1 分排名第三(3/189),距 Claude Fable 5(59.9)仅差 2.8 分。差距从「数百分」缩到「两三分」,闭源厂商很难再纯靠能力证明溢价。
- 「开源 = 笔记本能跑」是最大误区:4-bit 权重约 1.4 TB,需 64+ 加速器超节点。WAIC hype 之后,不少团队会低估 CapEx,直到发布日才意识到自部署门槛。
- 两个日期、两种产品形态容易混淆:7 月 16 日是 API/产品上线;7 月 27 日才是 Hugging Face 权重 + Modified MIT + 技术报告。搜索「Kimi K3 下载」的流量将在 27 日爆发,提前布局内容才能吃到时效红利。
一、事件时间线
| 日期 | 事件 | 意义 |
|---|---|---|
| 2026-07-16 | Kimi K3 通过 Kimi App、Kimi Work、Kimi Code 和 API 上线;Artificial Analysis 同日发布独立评测 | 开发者可立即调用 kimi-k3 |
| 2026-07-17 | 上海世界人工智能大会(WAIC)开幕,新华社将 K3 定调为「国家级里程碑」 | 中国 AI 梯队集体逼近:GLM-5.2、DeepSeek V4 Pro、MiniMax 同期发声 |
| 2026-07-27 | 完整权重公开下载(Hugging Face,Modified MIT)+ 技术报告发布 | 史上最大开源权重模型(2.8T)可下载 |
| 2026-07-27+ | vLLM KDA/prefix caching Day-0;Ollama/GGUF 社区量化跟进 | 生态可用性决定自部署可行性 |
二、API 上线 vs 权重发布:别搞混两个日期
这是当前搜索困惑的最大来源:
- 7 月 16 日:产品/API 可用——可通过 platform.kimi.ai、OpenRouter(
moonshotai/kimi-k3)或 Kimi 全家桶使用; - 7 月 27 日:完整 2.8T 权重上架 Moonshot Hugging Face 组织,Modified MIT 许可,同步技术报告(架构、训练、评估细节)。
英文社区严格区分 open weights(只放权重)与 open source(含训练代码/数据)。K3 属于前者——这本身是好内容,也是精准搜索词「kimi k3 open weights」的来源。
三、7 月 27 日开源发布:具体会发生什么
- 完整 2.8T 权重上架 Moonshot Hugging Face 组织,Modified MIT 许可证(具体条款待发布日确认);
- 同步发布技术报告(架构、训练、评估细节);
- vLLM 对 KDA / prefix caching 的支持将随权重一起落地(官方正与推理伙伴和开源维护者对齐);
- 预期后续:Ollama、GGUF 量化版本会像 K2 系列一样陆续跟进。
四、模型规格一览
| 项目 | 数据 |
|---|---|
| 总参数量 | 2.8 万亿(2.8T),史上最大开源权重模型 |
| 架构 | 稀疏 MoE:Stable LatentMoE,896 个专家中每 token 激活 16 个 |
| 注意力机制 | Kimi Delta Attention(KDA,混合线性注意力)+ Attention Residuals(AttnRes)+ Gated MLA |
| 上下文窗口 | 1,048,576 tokens(约 100 万) |
| 模态 | 原生视觉理解(文本 + 图像,产品端还支持视频),输出为文本 |
| 权重格式 | MXFP4 权重 + MXFP8 激活(原生低精度训练,4-bit 量化接近训练精度) |
| 扩展效率 | 官方称比 K2 提升约 2.5 倍 |
| 训练稳定性 | Quantile Balancing(专家路由)、Per-Head Muon 优化器、SiTU 激活函数 |
| 长上下文解码 | KDA 在百万 token 上下文中最高 6.3 倍解码加速,KV 缓存减 75% |
五、基准测试:赢在哪、输在哪
综合智能(Artificial Analysis Intelligence Index)
| 模型 | 分数 | 排名 |
|---|---|---|
| Claude Fable 5 | 59.9 | 1 |
| GPT-5.6 Sol | 58.9 | 2 |
| Kimi K3 | 57.1 | 3 / 189 |
K3 领先或打平的项目
| 基准 | K3 | Fable 5 | Sol | 解读 |
|---|---|---|---|---|
| Frontend Code Arena | 第 1 | — | — | 盲测中开发者偏好其 UI 代码 |
| Automation Bench | 第 1 | 29.1 | 29.7 | 自动化任务 |
| SpreadsheetBench 2 | 第 1 | — | — | 表格推理 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 配合 1M 上下文无压缩策略 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 超长编码会话明显领先 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 与 Sol 基本打平 |
| Program Bench | 77.8 | 76.8 | 77.6 | 微超 Sol |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 大幅超 Sol,但落后 Fable |
K3 落后的项目
- GDPval v2 Elo:1668–1687 vs Fable 5 的 1760、Sol 的 1748(长程判断力仍是 Fable 的天下);
- DeepSWE:67.5 vs Sol 的 73.0;
- 幻觉率比 K2.6 有所上升(官方承认);Reddit 有用户反馈接入自建应用后「幻觉明显多于顶级闭源模型」;
- 对话打磨度、稳定性(单次会话方差)仍逊于 Fable 5 / Sol。
六、月之暗面的诚实态度(值得引用)
月之暗面在发布时罕见地主动承认综合性能仍落后 Claude Fable 5 和 GPT-5.6 Sol,并列出已知短板:对 harness 传回推理内容敏感、意图模糊时过于主动等。K3 不是「Fable 5 杀手」,但以约 1/3 成本达到「接近前沿」的能力——这对闭源溢价叙事是直接冲击。
七、API 定价与真实成本
| 项目 | 价格(每百万 tokens) |
|---|---|
| 输入(缓存未命中) | $3.00 |
| 输入(缓存命中,自动缓存) | $0.30 |
| 输出 | $15.00 |
- 定价刻意对齐西方标准(走「质量牌」而非「低价牌」),是目前中国大模型厂商中最高的,但仍显著低于 Claude Opus 4.8 的单任务成本;
- Artificial Analysis 实测单任务成本 $0.94:比 GPT-5.6 Sol 低 9.4%,比 Claude Fable 5 低 65.8%;
- 编码类工作负载缓存命中率据称超 90%,实际成本远低于表面单价。
八、自部署现实:别被「开源」骗上笔记本
- 不是消费级硬件能跑的:4-bit 权重约 1.4 TB,官方建议 64+ 加速器的「超节点」部署,需要专家并行 + 张量并行的分布式推理;
- 参照:上一代 1T 参数的 K2.7 Code,INT4 也要约 577 GB 显存;K3 是它的 2.8 倍;
- 对绝大多数人正确答案是 API($3/$15),自部署只在三种场景成立:严格数据驻留/离线要求、需要在自有数据上微调、调用量大到自建硬件反而便宜。
7 月 27 日发布日核对清单
可引用技术信息(EEAT)
- 2.8T 总参数,896 专家激活 16 个,1M token 上下文;
- AA Intelligence Index:K3 57.1 / Sol 58.9 / Fable 5 59.9(第 3 名/189);
- 单任务成本:K3 $0.94,比 Fable 5 低 65.8%;
- 4-bit 权重约 1.4 TB;官方建议 64+ 加速器部署;
- Frontend Code Arena 第 1;SWE Marathon 42.0(长会话编码显著领先);
- 官方承认:综合能力仍落后 Fable 5 / GPT-5.6 Sol,幻觉率较 K2.6 上升。
九、API vs 自部署:三场景决策矩阵
| 场景 | 推荐路径 | 原因 |
|---|---|---|
| 初创 / PoC / 个人开发者 | API 或 OpenRouter | 零 CapEx,5 分钟接入,缓存命中后成本极低 |
| 中型团队 / 混合路由 | API + Fable 5 / Sol 并存 | 长代码 K3,FrontierSWE 级修 Bug 用 Fable,终端 Agent 用 Sol |
| 大型企业 / 数据不出域 | 64+ 卡自部署 + API 备用 | Modified MIT 允许商用微调,但 MLOps 成本极高 |
十、行业意义:闭源溢价还守得住吗?
- 开源与闭源能力差距在前沿基本闭合:差距从「数百分」缩到「两三分」,闭源厂商很难再纯靠能力证明溢价。
- 地缘背景:发布赶在 WAIC 前;一个月前美国政府曾短暂下架 Anthropic 的 Fable/Mythos 模型(7 月 1 日恢复),「监管可以关掉闭源模型,但关不掉已发布的开源权重」成为开源叙事的新论据。
- 中国厂商梯队集体逼近:Z.ai GLM-5.2(编码对标 Opus 4.8、价格 1/5)、DeepSeek V4 Pro(1.6T)、MiniMax 等,K3 是这波浪潮的最高点。
- 月之暗面的翻身仗:2025 年初被 DeepSeek R1 冲击后排名跌至国内第七,靠 K2(2025-07)→ K2.5(2026-01)→ K3 的开源路线重建地位。
十一、五步发布日 Runbook
十二、FAQ
Q: Kimi K3 权重什么时候发布?
A: 2026 年 7 月 27 日,Hugging Face 完整 2.8T 权重 + Modified MIT + 技术报告同步公开。
Q: K3 真的开源吗?
A: 准确说是 open weights:提供完整权重与 Modified MIT,不含训练代码/数据。与 fully open source 有区别。
Q: K3 多少钱?
A: API $3/$0.30 缓存/$15 per M tokens;AA 单任务约 $0.94,比 Fable 5 低 65.8%。kimi.com 免费账号可试用。
Q: 能在消费级 GPU 上跑吗?
A: 不能。4-bit 约 1.4 TB + 64+ 加速器。笔记本与普通 VPS 不现实。
Q: K3 比 Fable 5 / Sol 强吗?
A: 综合排名第三;编程长任务、Frontend Code Arena、BrowseComp 等赛道领先,但 GDPval Elo、DeepSWE、对话稳定性仍落后。
Q: 用什么许可证?
A: Modified MIT,7/27 发布日公布 LICENSE 原文,允许研究与商用(具体以 HF 仓库为准)。
总结
7 月 27 日的 Kimi K3 开源权重发布,是首个 2T+ 级、AA Index 第三、Modified MIT 商用可下载的组合——对闭源溢价叙事构成结构性冲击。Moonshot 主动承认排名第三与幻觉上升,反而增强了 E-E-A-T 可信度。对大多数团队,Q3 2026 的理性解法是 API + 混合模型路由,而非在发布日仓促自建超节点。
但若你把 K3 Agent 完全跑在个人笔记本、普通 Linux VPS 或无 macOS 的 CI 上,仍会面临长循环中断、API Key 与生产代码库混存、无法同机编排 Xcode/Fastlane/notarytool等局限。对于需要 7×24 Kimi Code + K3 长代码 Agent 同时又要做 iOS 签名或 OpenClaw 网关的团队,租赁 VPSMAC 的 M4 Mac 云节点——原生 macOS、SSH + launchd 守护——通常比个人设备或 Linux VPS 更稳定、更适合混合模型策略的生产环境。
参考资料: Moonshot 官方技术博客 · Kimi API 文档与定价 · Artificial Analysis(Intelligence Index 57.1,7 月 16 日)· VentureBeat / Northflank 自部署分析 · r/LocalLLaMA / Hacker News 社区讨论 · 关联阅读:Kimi K3 深度评测(7/16 API 上线)
数据截止日期:2026-07-22。 7 月 27 日发布日当天请更新 HF 直链、LICENSE 原文与实际文件清单;Google 对时效性内容重排很快,这一步是拿「K3 权重下载」流量的关键。