Kimi K3 全面開源:2.8 萬億參數、百萬上下文,月之暗面這次放了什麼大招
7 月 27 日晚 23 點左右,月之暗面正式發布 Kimi K3 完整模型權重與技術報告,並同步開源 MoonEP、FlashKDA、AgentEnv 三項核心基礎設施——這是全球首個被完整開放的 3 萬億參數級別模型。本文面向 AI 開發者與企業法務,完整解讀 架構創新、基準測試、open weight 授權細節、自部署門檻與 API 定價,並附五步接入 Runbook 與 FAQ。
內容目錄
痛點拆解:K3 全面開源後,選型必須重估的三件事
- 「開源」與「開放權重」語義混淆:國內媒體普遍稱 K3「全面開源」,但月之暗面官方材料從未使用 open source,一直採用 open weight(開放權重)表述。企業法務若按 OSI 標準理解「開源」,可能在合規審計中踩坑——訓練資料與完整訓練程式碼並未公開。
- 授權許可證新增兩道商業門檻:K3 不再沿用 K2 時代的 Modified MIT,而是一份完全自訂授權許可證。若你營運 Model-as-a-Service 業務且年收入超 2000 萬美元,或產品月活超 1 億,必須仔細閱讀附加條款,否則可能面臨違約風險。
- 自部署門檻與 API 現實的落差:2.8 萬億參數、約 1.56TB 權重體積、官方建議 64 卡以上超節點——對個人開發者與中小團隊而言,「權重已公開」不等於「能本地跑」。更現實的路徑仍是 API 或 OpenRouter 等託管平台。
時間線:從 API 首發到全面開源,只用了 11 天
- 7 月 16 日夜(WAIC 2026 前夜):Kimi K3 在 kimi.com、Kimi Work、Kimi Code 以及 Kimi API 首發,但僅限線上呼叫,模型權重尚未公開。官方技術博客標題為《Kimi K3: Open Frontier Intelligence》。
- 7 月 17 日:行業開始密集分析其架構,新華社報導稱其為「目前全球參數最大的開源模型」。
- 7 月 22 日–23 日:中美「模型蒸餾」爭端升級。美國白宮科技顧問 Michael Kratsios 指控月之暗面對 Anthropic 的 Fable 模型進行「大規模、隱蔽的工業化蒸餾」,用於訓練 K3;美國財政部長 Scott Bessent 隨後表示將考慮對相關中國企業實施制裁及「實體清單」限制。
- 7 月 27 日晚 23 點:月之暗面正式發布 K3 完整模型權重、技術報告,並開源 MoonEP、AgentEnv(FlashKDA 此前已開源)。權重檔案在 Hugging Face 上體積約 1.56TB,上線半小時內即登頂趨勢榜第一。
- 7 月 28 日:中國商務部就中美 AI 爭端公開回應,指責美方搞「AI 霸權主義」並威脅採取反制措施;國內多家媒體跟進報導本次開源細節。
這次開源距離 Kimi K3 在 kimi.com 和 API 端首發,只過去了 11 天。
Kimi K3 核心參數一覽
| 項目 | 參數 |
|---|---|
| 總參數量 | 2.8 萬億(2.8T) |
| 激活參數量 | 約 1040 億 |
| 架構類型 | 混合專家模型(MoE) |
| 專家配置 | 896 個路由專家,每 token 激活 16 個(另有共享專家) |
| 注意力機制 | Kimi Delta Attention(KDA)+ 門控多頭潛在注意力(Gated MLA) |
| 上下文視窗 | 100 萬 token |
| 多模態能力 | 原生視覺理解(ViT-V2,27 層) |
| 權重格式 | MXFP4 權重 + MXFP8 激活(從 SFT 階段起即採用量化感知訓練) |
| 權重體積 | 約 1.56TB(Hugging Face) |
| License | 自訂授權許可證(官方明確稱「open weight」而非「open source」) |
三大架構創新:KDA、AttnRes 和 Per-Head Muon 分別解決了什麼問題
Kimi K3 在架構上重構了深度學習沿用多年的三大傳統組件——注意力機制、殘差連接、優化器,這也是它區別於「簡單堆參數」的關鍵。
Kimi Delta Attention(KDA):讓「遺忘」變得更精細
傳統的 Gated DeltaNet 使用「標量級」的遺忘門——整個記憶用同一個衰減係數處理。KDA 把這個門控改成了「逐通道」級別:每一個特徵維度都擁有自己獨立的衰減率,模型因此可以讓某些特徵長期保留、另一些特徵快速遺忘,而不是一刀切。KDA 採用 chunkwise 的 Diagonal-Plus-Low-Rank(DPLR)公式實現線性時間遞歸,在保證硬體效率的同時大幅降低了長序列處理的顯存開銷。K3 將 KDA 與少量全局注意力層(Gated MLA)交替混合使用,這也是它能支撐 100 萬 token 上下文、同時把 KV Cache 開銷壓到極低的核心原因。
Attention Residuals(AttnRes):殘差連接不再是「雨露均沾」
傳統殘差連接會把每一層的輸出逐層均勻累加傳遞下去,層數越深,早期層的資訊越容易被「稀釋」。AttnRes 把這個過程改成了「選擇性、依據輸入動態聚合前面所有層的輸出」——每一層只需新增一個 RMSNorm 和一個偽查詢向量,參數開銷幾乎可以忽略不計,卻能帶來約 25% 的訓練效率提升,代價不到 2%。偽查詢向量初始化為零,保證了訓練初期等價於均勻平均,避免了早期訓練的不穩定。
Per-Head Muon:讓每個注意力頭獨立學習
Muon 是近年來被廣泛採用的優化器,K3 在此基礎上做了「逐注意力頭獨立優化」的擴展,讓每個注意力頭擁有更自適應的收斂路徑,而不是被統一的優化策略「一鍋燴」。這是一項純訓練期技術,普通開發者呼叫 API 時無感知,但正是這類細節的堆疊,讓 K3 能以相對更少的激活參數打出接近頂尖閉源模型的效果。
Stable LatentMoE:896 選 16 的稀疏藝術
K3 的 MoE 層擁有 896 個路由專家,每個 token 只激活 16 個(稀疏度約 1.8%),配合共享專家保證基礎能力的穩定性。為了應對大規模 MoE 訓練中常見的專家負載不均衡問題,團隊採用了 Quantile Balancing 均衡策略,並配合 MoonEP,從數學上證明了每個計算節點冗餘專家數的理論上界,保證了負載均衡方案的可行性。
三大開源 Infra 技術:不只是甩權重,而是整套工程能力
月之暗面這次沒有只發一份權重檔案,而是把支撐 K3 訓練效率與穩定性的三項關鍵基礎設施技術也一併開源,這也是本次發布在開發者社群獲得較高評價的重要原因。
| 技術 | 定位 | 關鍵能力 |
|---|---|---|
| MoonEP | 面向超大規模細粒度 MoE 模型的高性能通信庫 | 透過臨時複製過載專家的方式,保證每個計算節點獲得均等的 token 數,並從數學上證明了冗餘專家數的理論上界,在專家負載不均衡的情況下依然維持高通信效率 |
| FlashKDA | 基於 NVIDIA CUTLASS 模板實現的 KDA 高性能算子(此前已開源) | 在 NVIDIA H20 上相比 flash-linear-attention 基線,prefill 速度提升 1.72–2.22 倍;可作為 flash-linear-attention 庫中 chunk_kda 的直接替代後端,現有專案無需改程式碼即可獲得加速 |
| AgentEnv | 與 KVCache.ai 聯合開發的智能體沙箱系統,基於 Firecracker microVM | 面向大規模並行的 Agent 強化學習訓練場景,支援快速快照、恢復與 fork;官方披露 checkpoint 延遲低至 133ms、恢復延遲低至 49ms、記憶體超分最高 6.5 倍(此數據尚未經第三方獨立復現) |
跑分到底怎麼樣:和 GPT-5.6、Claude、GLM-4.5 比一比
不同機構、不同評測框架給出的數字差異較大,以下優先引用獨立第三方復測數據,廠商自報數據會單獨標註。
SWE-bench Verified(獨立復測,Vals AI,截至 2026 年 7 月)
| 模型 | 分數 | 發布日期 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| Qwen3.7-Max | 79.4% | 2026-05-19 |
| DeepSeek-V4 | 76.2% | 2026-04-23 |
Artificial Analysis 智能指數(中立第三方綜合評測,max 推理檔)
- Claude Fable 5(max + fallback):60
- GPT-5.6 Sol(max):59
- Kimi K3(max):約 57,全球第 3,開源模型第 1
- GLM-5.2(max):51(此前的開源第一名)
- DeepSeek V4 Pro(max):44
Kimi K3 目前是開源 3T 級模型中綜合能力最強的一個,但在成本上並非最優——每任務成本約 $0.95,比 Claude Fable 5(約 $2.4/任務)便宜 60% 左右,但比同為開源陣營的 GLM-5.2(約 $0.47/任務)更貴。簡單來說:它是開源陣營裡能力天花板最高的選項,而不是性價比最高的選項。此外,Kimi K3 目前在 Arena.ai 的 Frontend Code Arena 榜單上排名第一。
可引用技術資訊(EEAT 硬核數據)
- 參數規模:總參數 2.8T,激活參數約 104B,稀疏度 1.8%(896 專家中激活 16 個)。
- 上下文與快取:支援 100 萬 token 上下文;Mooncake 分離式推理架構在典型程式設計工作負載上快取命中率可達 90%+。
- 獨立基準:Vals AI 獨立復測 SWE-bench Verified 93.4%;Artificial Analysis 智能指數 約 57 分,開源模型第一、全球第三。
是「開源」還是「開放權重」?授權許可證裡的兩道商業門檻
這是本次發布爭議最大、也最值得企業用戶仔細閱讀的部分。
月之暗面官方材料從未使用「open source」這個詞,一直採用「open weight(開放權重)」的表述——這和國內媒體普遍使用的「開源」翻譯存在語義落差。嚴格按照開源倡議組織(OSI)的標準,真正的開源需要同時公開訓練資料、訓練程式碼和完整可復現流程,而 K3 只公開了訓練完成後的權重檔案、技術報告和推理相關的 Infra 工具,訓練資料和完整訓練程式碼並未公開。
授權許可證本身也不再自稱「Modified MIT」(這是 K2 時代的說法),而是一份完全自訂的文件,其中包含兩道此前 K2 系列都沒有的商業門檻:
- Model-as-a-Service 收入門檻:如果被許可方及其關聯方營運「模型即服務」業務,且連續 12 個月內該業務累計收入超過 2000 萬美元,必須與月之暗面另行簽署商業協議才能繼續使用。
- 規模展示門檻:如果產品或服務的月活用戶超過 1 億,或月收入超過 2000 萬美元,必須在產品界面上顯著展示「Kimi K3」字樣。
對絕大多數中小團隊和創業公司而言,這兩道門檻幾乎不會被觸發,可以正常商用;但如果你的商業計劃是「拿 K3 去開一個和月之暗面競爭的模型服務」,第一道門檻就是你法務團隊需要重點關注的紅線。
能不能自己部署?硬體門檻與 API 定價
API 方式
月之暗面提供 OpenAI SDK 相容的 Chat Completions API(https://api.moonshot.ai/v1,模型 ID kimi-k3),大部分現有專案只需改一下 base URL 和金鑰即可接入。定價為:
| Token 類型 | 價格(每百萬 token) |
|---|---|
| 輸入(快取命中) | $0.30 |
| 輸入(快取未命中) | $3.00 |
| 輸出(含推理過程) | $15.00 |
由於月之暗面的 Mooncake 分離式推理架構在典型程式設計類工作負載上快取命中率可達 90% 以上,實際大部分呼叫成本會更接近 $0.30 這一檔,而不是 $3 的表頭價格。
自部署方式
2.8 萬億參數、896 個專家的規模決定了 K3 幾乎不可能在消費級硬體上運行,官方建議部署在 64 卡及以上的超節點配置上。對於個人開發者和大部分中小團隊來說,更現實的路徑是透過 OpenRouter 等第三方平台呼叫已經託管好的 K3(目前已有 7 家服務商上線,定價大多與官方一致)。
這次開源背後:中美 AI 競賽與 WAIC 2026 的雙重背景
Kimi K3 的開源節點並非孤立事件。它恰好卡在世界人工智慧大會(WAIC 2026)的視窗期,同時疊加了正在升級的中美「模型蒸餾」爭端——就在權重開源前幾天,美方剛剛指控月之暗面「工業化蒸餾」Anthropic 的模型來訓練 K3,並威脅制裁;中國商務部則在 7 月 28 日公開回應,指責美方搞「AI 霸權主義」。在這樣的背景下,月之暗面選擇把權重、技術報告和三項核心 Infra 技術全部公開,某種程度上也是一種態度表達:用完整的工程細節自證技術路徑的獨立性。三天後,阿里巴巴(月之暗面的投資方之一)發布了 24 萬億參數的 Qwen3.8-Max-Preview,被外界普遍解讀為對 K3 的直接回應,國產大模型的競爭正式進入「3T 俱樂部」階段。
五步接入 Runbook
常見問題(FAQ)
Q: Kimi K3 真的是開源模型嗎?
A: 嚴格來說不是。它屬於「開放權重(open weight)」模型:訓練完成的權重檔案、技術報告和部分 Infra 工具是公開的,但訓練資料和完整訓練程式碼沒有公開,不符合 OSI 標準下的「開源」定義。
Q: Kimi K3 可以免費商用嗎?
A: 可以,絕大多數商業場景不受限制。但如果你營運的是「模型即服務」業務且年收入超過 2000 萬美元,或產品月活超過 1 億/月收入超過 2000 萬美元,需要額外滿足授權許可證中的特定條款。
Q: Kimi K3 需要多少顯卡才能自己部署?
A: 官方建議部署在 64 卡及以上的超節點叢集,個人和大部分企業用戶更現實的方式是透過官方 API 或 OpenRouter 等第三方平台呼叫。
Q: Kimi K3 的性能到底強不強?
A: 在開源模型陣營中綜合能力最強,Artificial Analysis 智能指數全球第 3,僅次於 Claude Fable 5 和 GPT-5.6 Sol;但成本高於同為開源的 GLM-5.2,屬於「開源陣營天花板最高、但非性價比最優」的選擇。
Q: Kimi K3 和 Kimi K2 有什麼區別?
A: K3 參數規模是 K2.5 的約 3 倍,架構上新增了 Attention Residuals 和 Per-Head Muon,上下文視窗和多模態能力也大幅提升;授權許可證方面 K3 新增了 Model-as-a-Service 收入門檻,商業限制比 K2 系列更細化。
總結
Kimi K3 的全面開放權重發布,標誌著國產大模型從「API 可用」走向「工程細節可審計」的新階段。它在架構層面(KDA、AttnRes、Per-Head Muon、Stable LatentMoE)做了真正的工程創新,在程式設計長任務、文件理解等關鍵賽道上對標乃至逼近部分閉源旗艦,且同步開源 MoonEP、FlashKDA、AgentEnv 三項 Infra——但 open weight 不等於 OSI 開源,自訂授權許可證的兩道商業門檻也需要法務仔細審閱。
但若你把 Kimi K3 Agent 完全跑在個人筆電或普通 Linux VPS 上,會面臨休眠中斷長循環、本地金鑰與生產程式碼庫混存、以及無法在 Apple 工具鏈(Xcode、Fastlane、notarytool)同機編排等局限;純 API 呼叫也缺少隔離的 macOS 建置與簽名環境。對於需要 7×24 無人值守 Agent、在 Kimi Code 中跑 K3 同時又要做 iOS CI 或 OpenClaw 網關的團隊,租賃 VPSMAC 的 M4 Mac 雲節點——原生 macOS、SSH + launchd 守護、與遠端開發工具同網段——通常是比個人設備或 Linux VPS 更穩定、更適合混合模型策略的生產選擇。
參考資料: Moonshot 官方技術博客 · Kimi API 文件 · Vals AI SWE-bench Verified · Artificial Analysis Intelligence Index
數據截止日期:2026-07-28。 基準數據優先引用 Vals AI 與 Artificial Analysis 獨立復測,模型能力與定價可能隨時更新,建議發布時核實最新官方文件。