Claude Opus 5 發布 × Kimi K3 蒸餾門:2026 年 7 月 25 日 AI 週報

若你本週正在為 Cursor、OpenClaw 或自研 Agent 選擇旗艦模型,卻被 Anthropic 7 月 24 日 Claude Opus 5 發布與 Kimi K3「蒸餾門」同時刷屏,本文給出明確選型結論:合規與對齊優先走 Opus 5 API;成本敏感且可承擔政策不確定性可等 7 月 27 日 K3 權重再決策。全文含 Opus 5 規格與基準拆解、白宮 Kratsios 指控與 Ryan Greenblatt 技術側證、Opus 5 vs Fable 5 vs Kimi K3 對比表五步 Runbook、可引用技術要點與 6 題 FAQ

抽象神經網路與模型路由視覺化,象徵 Claude Opus 5 與 Kimi K3 本週 AI 產業週報

目錄

1. 三個本週選型痛點

  1. 旗艦發布與地緣指控同週疊加,決策窗口被壓縮。 Opus 5 於 7 月 24 日上架,K3 權重 7 月 27 日開源倒數中,白宮 7 月 22–23 日又公開指控 Moonshot「蒸餾」——團隊來不及做完整 Pilot 就被迫表態路由策略。
  2. 基準數字好看,但帳單與合規條款不同步更新。 Frontier-Bench、CursorBench 等自報分數刷屏,卻少有人同時核算 $5/$25 定價、Fast Mode 2× 溢價,以及 Fable 5 / Mythos 5 的 30 天強制 retention 與 Opus 5「無強制保留」的差異。
  3. 蒸餾指控無法用單一基準驗證。 K3 GPQA 93.5%、Terminal-Bench 88.3% 等分數強勁,但 Ryan Greenblatt 的模型自稱異常與 Anthropic 340 萬次異常互動指控,讓「能不能上生產」變成政策與技術雙重風險,而非純性能問題。

2. Claude Opus 5 發布要點(2026-07-24)

Anthropic 於 2026 年 7 月 24 日正式發布 Claude Opus 5,模型 ID 為 claude-opus-5,並成為 Claude Max 訂閱預設模型。核心規格如下:

規格Claude Opus 5
定價輸入 $5/MTok、輸出 $25/MTok
上下文1M tokens
最大輸出128K tokens
Thinking預設開啟
Fast Mode速度 2.5×,價格
資料保留無強制 30 天 retention(對比 Fable 5 / Mythos 5)

這一定價與 Fable 5 同檔,但 Opus 5 在 Anthropic 產品線中定位為最強通用旗艦,且對資料生命週期給出更靈活選項——對需審計友好、不希望預設 30 天強制保留的企業 Agent 是實質加分。

3. Opus 5 基準表現與客戶引述

3.1 核心基準

3.2 客戶引述

Cursor:「Opus 5 在我們內部 Agent 基準上全面刷新紀錄,長上下文程式理解與多檔案編輯的穩定度是迄今最佳。」
Zapier:「AutomationBench 100% 意味著複雜跨應用工作流終於可以默認交給模型規劃,而非人工兜底。」
某生技客戶(Anthropic 案例):「蛋白變體預測 +7.7pp 直接縮短我們濕實驗迭代週期,Opus 5 已是研發流水線預設後端。」
Box:「企業文件盡職調查 +17% 讓我們敢把更多合規審查節點自動化,同時保留人工覆核閘門。」

4. 安全對齊與資料保留策略

Anthropic 宣稱 Opus 5 是迄今對齊度最高的 Claude 型號,同時保留產品線分工:

5. Anthropic 2026 產品時間線

日期事件
2026-06-09Fable 5 發布(企業 / 受控場景旗艦)
2026-07-01Fable 5 公開 API 上線
2026-07-24Opus 5 發布,Claude Max 預設切換

三週內連續兩次旗艦更新,說明 Anthropic 正用「Fable 守前沿合規、Opus 打通用性價比」的雙軌策略搶佔 Agent 市場。

6. Kimi K3 規格回顧(Moonshot,2026-07-16)

在 Opus 5 發布前,月之暗面已於 7 月 16 日上線 Kimi K3。核心參數:

K3 官方基準(Moonshot 自報)

基準Kimi K3
GPQA-Diamond93.5%
Terminal-Bench88.3%
BrowseComp91.2%
HLE56%
MCP Atlas84.2%
Program Bench77.8%
SWE Marathon42%
DeepSearchQA95%

7. Kimi K3「蒸餾門」爭議全時間軸

7.1 白宮公開指控(2026-07-22 ~ 07-23)

白宮科技政策辦公室主任 Michael Kratsios 在 7 月 22–23 日連續發聲,指控 Moonshot 透過蒸餾(distillation)複製美國閉源模型能力,並將議題與 GB300 晶片出口管制掛鉤。財長 Scott Bessent 則提及浮水印(watermarks)作為追溯手段。此舉把原本屬於 ML 社群的技術爭論升格為貿易與國安話語。

7.2 專家反駁(TechCrunch 等)

7.3 Ryan Greenblatt 技術側證

對齊研究員 Ryan Greenblatt 公佈測試結果:K3 在部分 prompt 下自稱 Claude,並輸出 claude-opus-4-5-20250929 等 Anthropic 內部模型 ID 字串。歷史對照:K2 曾指向 Sonnet 4 時代、K3 指向 Opus 4.5 時代。Greenblatt 強調這不能在法律意義上證明蒸餾,但屬迄今最強的技術證據

7.4 Anthropic 2026 年 2 月指控

更早於 2026 年 2 月,Anthropic 曾公開表示偵測到 340 萬次(3.4M)異常互動,懷疑有組織性提取 Claude 輸出用於訓練第三方模型——為本週白宮表態提供了前序脈絡。

8. 社群觀點:r/LocalLLaMA 三種聲音

  1. 「2.8T 別幻想本地跑」——完整權重需超節點級 GPU,Mac Studio 或消費級顯卡只能等量化蒸餾版或更小 checkpoint。
  2. 「真賣點是價格 + 少拒答」——相較 Fable 5 / Opus 5,K3 API 長上下文單價更低,且社群反映安全拒答率較低,更適合自動化腳本。
  3. 「等 7/27 權重再站隊」——在蒸餾指控未澄清前,生產環境應保持 Anthropic 主路由 + K3 實驗分支,避免單點政策風險。

9. Opus 5 vs Fable 5 vs Kimi K3 對比表

維度Claude Opus 5Claude Fable 5Kimi K3
發布日期2026-07-242026-06-09(API 07-01)2026-07-16
模型 IDclaude-opus-5claude-fable-5kimi-k3
定價(入/出)$5 / $25 MTok$5 / $25 MTok約 $3 / $15 MTok(Moonshot API)
上下文1M1M1M(原生視覺)
最大輸出128K128K未公開同級數字
Thinking預設開啟預設開啟max 模式(low/high 後續)
資料保留無強制 30 天30 天 retention依 Moonshot 政策
安全定位最高對齊、少 85% 過度拒答企業合規預設社群反映拒答較少(待第三方審計)
前沿 cyber/bio非專長Mythos 5 守前沿未宣稱
Agent 基準亮點AutomationBench 100%、OSWorld 2.0 1/3 成本勝 FableCursorBench 略高 0.5%Terminal-Bench 88.3%、SWE Marathon 42%
開源 / 自託管07-27 權重開源
政策風險低(Anthropic 官方)中(出口管制史)(蒸餾指控 + 白宮表態)

10. 本週開發者五步選型 Runbook

步驟 1 — 盤點合規與資料保留需求

若 API 合約要求零強制 retention或可證明資料刪除時間表,將 claude-opus-5 設為首選。若業務需 cyber / bio 前沿且已獲授權,保留 claude-mythos-5 或 Fable 5 作為特權路由,而非全量默認。

步驟 2 — 按任務類型對照基準

程式 Agent 優先看 CursorBench / SWE Marathon;桌面自動化看 OSWorld 2.0 / AutomationBench;科研 pipeline 看分子結構與蛋白變體增益;長 PDF / repo 全量上下文看 1M 視窗 + 有效 $/M(含 Fast Mode 是否值得 2× 溢價)。

步驟 3 — Pilot 雙軌 A/B(至少 20 次)

# 偽代碼:同一 Agent 任務雙路由 ROUTES = { "primary": "anthropic/claude-opus-5", "cost_exp": "moonshotai/kimi-k3", } for task in representative_tasks: log(run(task, ROUTES["primary"])) log(run(task, ROUTES["cost_exp"]))

記錄 TTFT、任務成功率、拒答率、每任務美元成本。蒸餾門發酵期勿把 K3 設為唯一主路由

步驟 4 — 配置 Fast Mode 與混合降級

延遲敏感子任務(如單檔補丁、格式轉換)可開 Opus 5 Fast Mode(2.5× 速、2× 價)。主路由失敗時降級至 Fable 5 或 GPT 系列,而非直接切 K3——除非已完成合規簽核。

步驟 5 — Gateway 遷至 Mac 雲 7×24 驗收

在筆電本地跑完 Pilot 後,將 Agent Gateway 遷到 VPSMAC Mac 雲:launchd 常駐、SSH 交付、API Key 僅走環境變數。7 月 27 日 K3 權重釋出後,可在 Mac 雲上掛載評估腳本,無需改開發機網路環境。

11. 可引用技術要點

12. 常見問題 FAQ

Claude Opus 5 的定價與模型 ID 是什麼? 模型 ID 為 claude-opus-5,輸入 $5/MTok、輸出 $25/MTok。Fast Mode 速度 2.5×、價格 2×。Claude Max 訂閱已預設切換至 Opus 5。

Opus 5 與 Fable 5 在資料保留上有何差異? Opus 5 無 30 天強制 retention;Fable 5 與 Mythos 5 預設 30 天。合規審計場景應在選型表格中單列此項,而非只看基準分。

Kimi K3 蒸餾指控最硬的技術證據是什麼? Ryan Greenblatt 發現 K3 自稱 Claude 並洩漏 Anthropic 內部模型 ID;K2→Sonnet 4 時代、K3→Opus 4.5 時代的指紋延續。這不是法律判決,但是最強技術側證。

本週該立即切 Opus 5 還是等 K3 權重? 生產 Agent 若需穩定供應商與對齊背書,本週即可切 Opus 5。成本敏感且可接受政策不確定者,建議 7 月 27 日權重開源後再跑自託管評估,現階段僅作 API 實驗分支。

Opus 5 在哪些場景明顯贏 Fable 5? OSWorld 2.0(1/3 成本)、AutomationBench 100%、企業 Box 場景 +8~17%,以及 cyber 分類器少 85% 過度拒答——更適合通用 Agent 而非僅限受控企業沙箱。

2.8T 的 K3 能在 Mac 本地部署嗎? 不能。需 64 張以上加速卡的超節點;r/LocalLLaMA 共識是真實賣點在 API 價格與較低拒答,而非本地推理。

13. 結論與本週選型建議

2026 年 7 月第四週,AI 產業同時拋出性能里程碑(Opus 5、K3 基準)與地緣政治級指控(蒸餾門)——開發者若只盯榜單分數,極易在本週做出不可撤銷的路由決策。實務上:Opus 5 以約 Fable 5 一半成本逼近 CursorBench,且無 30 天強制 retention,是合規敏感 Agent 的預設升級對象;K3 則應視為 7 月 27 日前的「觀察倉」,而非唯一主幹。

在筆電或普通 Linux VPS 上切換模型 API 雖然只需改一行 model 字串,但 Agent 真正卡脖子的是運行時環境:本地合蓋 Gateway 休眠、Linux 缺 Apple 工具鏈、跨時區 API 調試無 launchd 守護——這些問題不會因為換成 Opus 5 就自動消失。Docker 沙箱雖能隔離依賴,卻帶來額外抽象層、排障成本與 I/O 折損;Windows 遠端桌面跑 Agent 更難承接 7×24 自動化。對需要穩定跑 OpenClaw / Cursor Agent、持 API Key 自管、並在本週完成 Opus 5 Pilot 後直接上生產的團隊,更省心的路徑是:合規敏感場景用 Opus 5 API,Gateway 部署在 VPSMAC Mac 雲成本敏感場景等 K3 權重 7 月 27 日釋出後,在同一 Mac 節點上做自託管或混合路由評估——同一套 launchd 編排,無需因模型換代重搭環境。