Claude Opus 5 發布 × Kimi K3 蒸餾門:2026 年 7 月 25 日 AI 週報
若你本週正在為 Cursor、OpenClaw 或自研 Agent 選擇旗艦模型,卻被 Anthropic 7 月 24 日 Claude Opus 5 發布與 Kimi K3「蒸餾門」同時刷屏,本文給出明確選型結論:合規與對齊優先走 Opus 5 API;成本敏感且可承擔政策不確定性可等 7 月 27 日 K3 權重再決策。全文含 Opus 5 規格與基準拆解、白宮 Kratsios 指控與 Ryan Greenblatt 技術側證、Opus 5 vs Fable 5 vs Kimi K3 對比表、五步 Runbook、可引用技術要點與 6 題 FAQ。
目錄
1. 三個本週選型痛點
- 旗艦發布與地緣指控同週疊加,決策窗口被壓縮。 Opus 5 於 7 月 24 日上架,K3 權重 7 月 27 日開源倒數中,白宮 7 月 22–23 日又公開指控 Moonshot「蒸餾」——團隊來不及做完整 Pilot 就被迫表態路由策略。
- 基準數字好看,但帳單與合規條款不同步更新。 Frontier-Bench、CursorBench 等自報分數刷屏,卻少有人同時核算 $5/$25 定價、Fast Mode 2× 溢價,以及 Fable 5 / Mythos 5 的 30 天強制 retention 與 Opus 5「無強制保留」的差異。
- 蒸餾指控無法用單一基準驗證。 K3 GPQA 93.5%、Terminal-Bench 88.3% 等分數強勁,但 Ryan Greenblatt 的模型自稱異常與 Anthropic 340 萬次異常互動指控,讓「能不能上生產」變成政策與技術雙重風險,而非純性能問題。
2. Claude Opus 5 發布要點(2026-07-24)
Anthropic 於 2026 年 7 月 24 日正式發布 Claude Opus 5,模型 ID 為 claude-opus-5,並成為 Claude Max 訂閱預設模型。核心規格如下:
| 規格 | Claude Opus 5 |
|---|---|
| 定價 | 輸入 $5/MTok、輸出 $25/MTok |
| 上下文 | 1M tokens |
| 最大輸出 | 128K tokens |
| Thinking | 預設開啟 |
| Fast Mode | 速度 2.5×,價格 2× |
| 資料保留 | 無強制 30 天 retention(對比 Fable 5 / Mythos 5) |
這一定價與 Fable 5 同檔,但 Opus 5 在 Anthropic 產品線中定位為最強通用旗艦,且對資料生命週期給出更靈活選項——對需審計友好、不希望預設 30 天強制保留的企業 Agent 是實質加分。
3. Opus 5 基準表現與客戶引述
3.1 核心基準
- Frontier-Bench:達 Opus 4.8 的 2×
- CursorBench 3.2:僅差 Fable 5 0.5%,成本約一半
- ARC-AGI 3:為次佳模型的 3×
- Zapier AutomationBench:100%
- OSWorld 2.0:勝 Fable 5,成本僅 1/3
- 科學任務:分子結構 +10.2pp、蛋白變體 +7.7pp
- Box 企業場景:資料分析 +11%、盡職調查 +17%、綜合 +8%
3.2 客戶引述
Cursor:「Opus 5 在我們內部 Agent 基準上全面刷新紀錄,長上下文程式理解與多檔案編輯的穩定度是迄今最佳。」
Zapier:「AutomationBench 100% 意味著複雜跨應用工作流終於可以默認交給模型規劃,而非人工兜底。」
某生技客戶(Anthropic 案例):「蛋白變體預測 +7.7pp 直接縮短我們濕實驗迭代週期,Opus 5 已是研發流水線預設後端。」
Box:「企業文件盡職調查 +17% 讓我們敢把更多合規審查節點自動化,同時保留人工覆核閘門。」
4. 安全對齊與資料保留策略
Anthropic 宣稱 Opus 5 是迄今對齊度最高的 Claude 型號,同時保留產品線分工:
- Mythos 5 繼續守住 cyber / bio 能力前沿,供有明確授權的高風險研究場景。
- Opus 5 的 cyber 分類器比 Fable 5 少 85% 過度拒答——Agent 開發者會明顯感受「可討論安全話題而不被無故切斷」。
- 資料層面:Opus 5 無 Fable 5 / Mythos 5 的 30 天強制 retention,更適合合規敏感、需精細控制資料駐留的 API 整合。
5. Anthropic 2026 產品時間線
| 日期 | 事件 |
|---|---|
| 2026-06-09 | Fable 5 發布(企業 / 受控場景旗艦) |
| 2026-07-01 | Fable 5 公開 API 上線 |
| 2026-07-24 | Opus 5 發布,Claude Max 預設切換 |
三週內連續兩次旗艦更新,說明 Anthropic 正用「Fable 守前沿合規、Opus 打通用性價比」的雙軌策略搶佔 Agent 市場。
6. Kimi K3 規格回顧(Moonshot,2026-07-16)
在 Opus 5 發布前,月之暗面已於 7 月 16 日上線 Kimi K3。核心參數:
- 2.8T 參數 MoE:896 專家、16 激活
- KDA(Kimi Delta Attention) 架構
- 1M 上下文,原生視覺理解
- 完整權重計劃 2026-07-27 開源
K3 官方基準(Moonshot 自報)
| 基準 | Kimi K3 |
|---|---|
| GPQA-Diamond | 93.5% |
| Terminal-Bench | 88.3% |
| BrowseComp | 91.2% |
| HLE | 56% |
| MCP Atlas | 84.2% |
| Program Bench | 77.8% |
| SWE Marathon | 42% |
| DeepSearchQA | 95% |
7. Kimi K3「蒸餾門」爭議全時間軸
7.1 白宮公開指控(2026-07-22 ~ 07-23)
白宮科技政策辦公室主任 Michael Kratsios 在 7 月 22–23 日連續發聲,指控 Moonshot 透過蒸餾(distillation)複製美國閉源模型能力,並將議題與 GB300 晶片出口管制掛鉤。財長 Scott Bessent 則提及浮水印(watermarks)作為追溯手段。此舉把原本屬於 ML 社群的技術爭論升格為貿易與國安話語。
7.2 專家反駁(TechCrunch 等)
- Braden Hancock:兩週內從零蒸餾出 2.8T 級模型「不可能」——時間尺度與算力預算都不支持。
- Nathan Lambert:RL 後訓練已出現邊際遞減,單靠蒸餾難以解釋 K3 在多基準上的全面躍升。
- 類比:Musk 的 xAI 亦曾被指蒸餾 OpenAI——業界對「蒸餾」一詞的政治化使用已有先例。
7.3 Ryan Greenblatt 技術側證
對齊研究員 Ryan Greenblatt 公佈測試結果:K3 在部分 prompt 下自稱 Claude,並輸出 claude-opus-4-5-20250929 等 Anthropic 內部模型 ID 字串。歷史對照:K2 曾指向 Sonnet 4 時代、K3 指向 Opus 4.5 時代。Greenblatt 強調這不能在法律意義上證明蒸餾,但屬迄今最強的技術證據。
7.4 Anthropic 2026 年 2 月指控
更早於 2026 年 2 月,Anthropic 曾公開表示偵測到 340 萬次(3.4M)異常互動,懷疑有組織性提取 Claude 輸出用於訓練第三方模型——為本週白宮表態提供了前序脈絡。
8. 社群觀點:r/LocalLLaMA 三種聲音
- 「2.8T 別幻想本地跑」——完整權重需超節點級 GPU,Mac Studio 或消費級顯卡只能等量化蒸餾版或更小 checkpoint。
- 「真賣點是價格 + 少拒答」——相較 Fable 5 / Opus 5,K3 API 長上下文單價更低,且社群反映安全拒答率較低,更適合自動化腳本。
- 「等 7/27 權重再站隊」——在蒸餾指控未澄清前,生產環境應保持 Anthropic 主路由 + K3 實驗分支,避免單點政策風險。
9. Opus 5 vs Fable 5 vs Kimi K3 對比表
| 維度 | Claude Opus 5 | Claude Fable 5 | Kimi K3 |
|---|---|---|---|
| 發布日期 | 2026-07-24 | 2026-06-09(API 07-01) | 2026-07-16 |
| 模型 ID | claude-opus-5 | claude-fable-5 | kimi-k3 |
| 定價(入/出) | $5 / $25 MTok | $5 / $25 MTok | 約 $3 / $15 MTok(Moonshot API) |
| 上下文 | 1M | 1M | 1M(原生視覺) |
| 最大輸出 | 128K | 128K | 未公開同級數字 |
| Thinking | 預設開啟 | 預設開啟 | max 模式(low/high 後續) |
| 資料保留 | 無強制 30 天 | 30 天 retention | 依 Moonshot 政策 |
| 安全定位 | 最高對齊、少 85% 過度拒答 | 企業合規預設 | 社群反映拒答較少(待第三方審計) |
| 前沿 cyber/bio | 非專長 | Mythos 5 守前沿 | 未宣稱 |
| Agent 基準亮點 | AutomationBench 100%、OSWorld 2.0 1/3 成本勝 Fable | CursorBench 略高 0.5% | Terminal-Bench 88.3%、SWE Marathon 42% |
| 開源 / 自託管 | 否 | 否 | 07-27 權重開源 |
| 政策風險 | 低(Anthropic 官方) | 中(出口管制史) | 高(蒸餾指控 + 白宮表態) |
10. 本週開發者五步選型 Runbook
步驟 1 — 盤點合規與資料保留需求
若 API 合約要求零強制 retention或可證明資料刪除時間表,將 claude-opus-5 設為首選。若業務需 cyber / bio 前沿且已獲授權,保留 claude-mythos-5 或 Fable 5 作為特權路由,而非全量默認。
步驟 2 — 按任務類型對照基準
程式 Agent 優先看 CursorBench / SWE Marathon;桌面自動化看 OSWorld 2.0 / AutomationBench;科研 pipeline 看分子結構與蛋白變體增益;長 PDF / repo 全量上下文看 1M 視窗 + 有效 $/M(含 Fast Mode 是否值得 2× 溢價)。
步驟 3 — Pilot 雙軌 A/B(至少 20 次)
記錄 TTFT、任務成功率、拒答率、每任務美元成本。蒸餾門發酵期勿把 K3 設為唯一主路由。
步驟 4 — 配置 Fast Mode 與混合降級
延遲敏感子任務(如單檔補丁、格式轉換)可開 Opus 5 Fast Mode(2.5× 速、2× 價)。主路由失敗時降級至 Fable 5 或 GPT 系列,而非直接切 K3——除非已完成合規簽核。
步驟 5 — Gateway 遷至 Mac 雲 7×24 驗收
在筆電本地跑完 Pilot 後,將 Agent Gateway 遷到 VPSMAC Mac 雲:launchd 常駐、SSH 交付、API Key 僅走環境變數。7 月 27 日 K3 權重釋出後,可在 Mac 雲上掛載評估腳本,無需改開發機網路環境。
11. 可引用技術要點
- Claude Opus 5:模型 ID
claude-opus-5;定價 $5/$25 MTok;1M 上下文 / 128K 最大輸出;thinking 預設開啟;Fast Mode 2.5× 速、2× 價;無 Fable/Mythos 30 天強制 retention。 - 基準硬數據:Frontier-Bench 2× Opus 4.8;CursorBench 3.2 距 Fable 5 0.5% 且約半價;ARC-AGI 3 為次佳 3×;Zapier AutomationBench 100%;cyber 分類器比 Fable 5 少 85% 過度拒答。
- Kimi K3 與蒸餾側證:2.8T / 896 專家 / 16 激活 MoE;GPQA-Diamond 93.5%、DeepSearchQA 95%;Ryan Greenblatt 觀測 K3 輸出
claude-opus-4-5-20250929等 ID;Anthropic 2026-02 指控 3.4M 異常互動;權重開源 2026-07-27。
12. 常見問題 FAQ
Claude Opus 5 的定價與模型 ID 是什麼? 模型 ID 為 claude-opus-5,輸入 $5/MTok、輸出 $25/MTok。Fast Mode 速度 2.5×、價格 2×。Claude Max 訂閱已預設切換至 Opus 5。
Opus 5 與 Fable 5 在資料保留上有何差異? Opus 5 無 30 天強制 retention;Fable 5 與 Mythos 5 預設 30 天。合規審計場景應在選型表格中單列此項,而非只看基準分。
Kimi K3 蒸餾指控最硬的技術證據是什麼? Ryan Greenblatt 發現 K3 自稱 Claude 並洩漏 Anthropic 內部模型 ID;K2→Sonnet 4 時代、K3→Opus 4.5 時代的指紋延續。這不是法律判決,但是最強技術側證。
本週該立即切 Opus 5 還是等 K3 權重? 生產 Agent 若需穩定供應商與對齊背書,本週即可切 Opus 5。成本敏感且可接受政策不確定者,建議 7 月 27 日權重開源後再跑自託管評估,現階段僅作 API 實驗分支。
Opus 5 在哪些場景明顯贏 Fable 5? OSWorld 2.0(1/3 成本)、AutomationBench 100%、企業 Box 場景 +8~17%,以及 cyber 分類器少 85% 過度拒答——更適合通用 Agent 而非僅限受控企業沙箱。
2.8T 的 K3 能在 Mac 本地部署嗎? 不能。需 64 張以上加速卡的超節點;r/LocalLLaMA 共識是真實賣點在 API 價格與較低拒答,而非本地推理。
13. 結論與本週選型建議
2026 年 7 月第四週,AI 產業同時拋出性能里程碑(Opus 5、K3 基準)與地緣政治級指控(蒸餾門)——開發者若只盯榜單分數,極易在本週做出不可撤銷的路由決策。實務上:Opus 5 以約 Fable 5 一半成本逼近 CursorBench,且無 30 天強制 retention,是合規敏感 Agent 的預設升級對象;K3 則應視為 7 月 27 日前的「觀察倉」,而非唯一主幹。
在筆電或普通 Linux VPS 上切換模型 API 雖然只需改一行 model 字串,但 Agent 真正卡脖子的是運行時環境:本地合蓋 Gateway 休眠、Linux 缺 Apple 工具鏈、跨時區 API 調試無 launchd 守護——這些問題不會因為換成 Opus 5 就自動消失。Docker 沙箱雖能隔離依賴,卻帶來額外抽象層、排障成本與 I/O 折損;Windows 遠端桌面跑 Agent 更難承接 7×24 自動化。對需要穩定跑 OpenClaw / Cursor Agent、持 API Key 自管、並在本週完成 Opus 5 Pilot 後直接上生產的團隊,更省心的路徑是:合規敏感場景用 Opus 5 API,Gateway 部署在 VPSMAC Mac 雲;成本敏感場景等 K3 權重 7 月 27 日釋出後,在同一 Mac 節點上做自託管或混合路由評估——同一套 launchd 編排,無需因模型換代重搭環境。