Claude Opus 5 价格减半逼近旗舰实力,Kimi K3 却陷「自称 Claude」蒸馏门:本周 AI 圈两大瓜
如果你正在 Claude Max、OpenClaw 或自研 Agent 里纠结「要不要升 Fable 5」,或关注 Kimi K3 被白宫指控蒸馏 Anthropic 的真假——本文面向 AI 开发者与技术决策者,完整解读 2026 年 7 月 24 日 Claude Opus 5 发布与 Kimi K3「蒸馏门」全链条:含 Opus 5 定价/基准/安全/数据留存、K3 规格与 Greenblatt 技术证据、三方对比表、五步 Runbook 与六条 FAQ。
目录
1. 三大痛点:性价比与能力来源
- 旗舰太贵、日常模型不够强。 Fable 5 性能标杆但 $10/$50 每百万 token 让大量团队望而却步;Opus 4.8 虽便宜,软件工程与 Agent 任务仍明显落后旗舰。
- 开源模型「能力来源」成疑。 Kimi K3 以 2.8T 参数和接近 Fable 5 的跑分冲击市场,但白宫与 Anthropic 指控其通过「工业级蒸馏」窃取能力——开发者难以判断低价是工程优化还是合规风险。
- 新闻热度窗口短、决策信息碎片化。 Opus 5 与 K3 争议几乎同时爆发,大媒占满头部词;小站与独立开发者需要一份整合基准、时间线与技术证据的深度综述,而非两条割裂的快讯。
2. Claude Opus 5 发布:不是旗舰,但可能是最值得用的 Claude
2026 年 7 月 24 日(美国太平洋时间),Anthropic 正式发布 Claude Opus 5(模型 ID:claude-opus-5),并同步将其设为 Claude Max 默认模型,也是 Claude Pro 用户可用的最强版本。定位清晰:日常主力模型,接近旗舰 Fable 5 智能水平,价格为 Fable 5 的一半。
2.1 规格与定价
| 项目 | 内容 |
|---|---|
| 定价 | 输入 $5 / 百万 tokens,输出 $25 / 百万 tokens(与 Opus 4.8 完全相同) |
| 上下文窗口 | 100 万 tokens(默认且唯一档位) |
| 最大输出 | 128K tokens |
| 默认推理 | Thinking 默认开启,Effort 参数控制思考量 |
| 平台 | Claude API / Platform / AWS Bedrock / Google Vertex AI / Microsoft Foundry |
| Fast 模式 | 速度约为默认 2.5 倍,价格为基础价 2 倍 |
| 数据留存 | 默认访问不强制数据留存(Fable 5 / Mythos 5 需接受 30 天留存政策) |
2.2 关键基准(Anthropic 官方)
- Frontier-Bench v0.1(软件工程):超越所有模型,是 Opus 4.8 的两倍以上,单任务成本更低。
- CursorBench 3.2:max effort 下与 Fable 5 峰值相差仅 0.5%,成本为 Fable 5 一半;high/xhigh/max 档位性价比均超过市面所有模型。
- ARC-AGI 3(新颖问题):得分是次优模型的3 倍。
- Zapier AutomationBench:通过率约为次优模型 1.5 倍;最低 effort 仍超过任何其他模型;端到端账户健康工作流100% 通过(此前模型均未通过)。
- OSWorld 2.0(计算机操作):任意成本下均优于其他模型;仅用 Fable 5 成本三分之一多一点即超过 Fable 5 最佳成绩。
- 科研 / 生命科学:结构生物学、有机化学、生物信息学全面超过 Opus 4.8;光谱反推分子结构内部评测+10.2 个百分点;蛋白质序列变异功能预测+7.7 个百分点。
2.3 对齐与安全
自动化行为审计显示,Opus 5 是 Anthropic 迄今为止最对齐的模型:欺骗行为发生率最低,最不容易被诱导滥用,在避免难以逆转的鲁莽行为方面也是最安全的一代。
但在风险型双用途能力(网络安全攻击、生物安全)上,Opus 5 没有刷新前沿——仍由受限发行的 Mythos 5 占据。网络安全分类器比 Fable 5 宽松约 85%,可用于源码级漏洞发现,但仍屏蔽二进制漏洞扫描、渗透测试、漏洞利用生成。生物安全相关请求:原本在 Fable 5 上被拦截的,现在会路由给 Opus 5(而非回 Opus 4.8)。
2.4 客户反馈摘录
「Claude Opus 5 delivers near Fable 5 intelligence at Opus speed and cost. On CursorBench it's just under Fable 5 and has many of the same behaviors.」—— Cursor 团队
「Claude Opus 5 topped Zapier's AutomationBench leaderboard without spending more tokens than prior Claude models... Previous models didn't pass; Opus 5 hit 100%.」—— Zapier
「On our genomics analysis work, Claude Opus 5 behaves more like a careful scientist than any model we've run.」—— 某生物医药早期客户
Box 数据:数据分析工作流 +11%,尽职调查 +17%,整体准确率 +8%。
2.5 时间线
| 日期 | 事件 |
|---|---|
| 2026-06-09 | Claude Fable 5 / Mythos 5 正式发布 |
| 2026-07-01 | Fable 5 面向公众正式可用 |
| 2026-07-24 | Claude Opus 5 发布,成为 Claude Max 默认模型 |
3. Kimi K3「蒸馏门」:白宫下场,专家吐槽时间线,独立研究者挖出新证据
3.1 K3 本身:全球首个「3T 级」开源模型
月之暗面于 2026 年 7 月 16 日发布 Kimi K3:总参数 2.8 万亿,全球首个进入 3T 参数级的开源权重模型;稀疏 MoE,896 专家中每 token 激活 16 个(约等效 500 亿激活参数);自研 Kimi Delta Attention(KDA)+ Attention Residuals + Stable LatentMoE,训练效率较 K2 提升约 2.5 倍;100 万 token 上下文 + 原生视觉理解;完整权重承诺 7 月 27 日放出。
| 基准 | 分数 | 备注 |
|---|---|---|
| GPQA-Diamond | 93.5% | 发布时开源模型最高分 |
| Terminal-Bench 2.1 | 88.3% | 落后 GPT-5.6 Sol 0.5 分 |
| BrowseComp | 91.2% | 发布时最高分 |
| Humanity's Last Exam(带工具) | 56.0% | — |
| MCP Atlas | 84.2% | — |
| Program Bench | 77.8% | 综合最佳 |
| SWE Marathon | 42.0% | 综合最佳 |
| DeepSearchQA (F1) | 95.0% | — |
官方自评整体能力仅次于 Claude Fable 5 与 GPT-5.6 Sol,价格远低于两者。争议爆发时完整权重尚未放出,外部无法独立验证架构与跑分。
3.2 白宫突然下场
2026 年 7 月 22–23 日,白宫 OSTP 主任 Michael Kratsios 在 X 发文,指控月之暗面通过「大规模、隐蔽的产业级蒸馏」窃取 Anthropic Fable 模型能力,并提到涉嫌使用未获出口许可的 Nvidia GB300 芯片(可能经泰国服务器绕道)。财政部长 Scott Bessent 附和称「在很多中国模型上发现了美国大模型的水印」,但未说明具体指什么。Kratsios 未公开支撑证据;月之暗面对训练过程质询未予回应。
3.3 这不是第一次:Anthropic 2 月指控
2026 年 2 月,Anthropic 已公开指控月之暗面、DeepSeek、MiniMax 进行「产业级蒸馏攻击」,称识别出月之暗面超过 340 万次异常 API 交互,「明显偏离正常使用模式,反映刻意能力提取」,并称已通过请求元数据追踪到部分行为与月之暗面高层相关。月之暗面从未正面确认或否认。
3.4 独立专家几乎一边倒质疑:时间根本不够
「Fable 从 7 月 1 日才开始公开可用,你不可能在两周内蒸馏出这么多数据、训练完模型还发布出来。」—— Braden Hancock(Laude Institute / Snorkel AI 联合创始人)
「蒸馏随着中国模型逼近前沿、训练转向强化学习,边际收益越来越小……如果真这么好用,所有人早就靠蒸馏追平了 GLM 或 K3,但我们没有。」—— Nathan Lambert(Allen Institute for AI)
Elon Musk 曾在庭审中承认 xAI 训练 Grok 时蒸馏过 OpenAI 模型,并称行业普遍——问题核心是「正常技术借鉴」与「隐蔽工业级窃取」的边界。
3.5 最硬核证据:K3 会「自称是 Claude」
Redwood Research 首席科学家 Ryan Greenblatt(GitHub: rgreenblatt/which_claude_is_k3)在 7 月 24 日前后发布统计分析:Kimi K3 被问「你是谁」时异常高频自称 Claude,甚至吐出 claude-opus-4-5-20250929、claude-sonnet-4-5-20250929 等内部部署 ID——而真正的 Claude 模型自己都不会这样准确报出。
Greenblatt 判断:模型说出教师模型部署元数据比教师自己还准,很难用「模仿对话风格」解释,更可能指向训练数据混入带部署元数据标注的 Claude 数据(API 日志或打标合成数据)。K3 自称版本锁定「Claude 4.5 时代」(2025 年末),K2 则指向更早 Claude Sonnet 4——呈现「逐代追新」规律。
重要澄清:Greenblatt 强调这不能直接证明蒸馏发生,也可能来自数据污染或系统提示词泄露;但结合 Anthropic 2 月指控,这是迄今最接地气的技术证据,而不只是政治喊话。
3.6 社区反应与时间线
Reddit r/LocalLLaMA 呈现三种声音:开源与闭源差距缩短到「天」而非「月」;2.8T 参数几乎没人本地跑;K3 真正卖点是低价 + 更少拒答,而非「打败 Fable 5」。争议还牵动芯片出口管制与是否限制中国开放权重模型的产业政策讨论。
| 日期 | 事件 |
|---|---|
| 2026-02 | Anthropic 首次公开指控月之暗面/DeepSeek/MiniMax 产业级蒸馏 |
| 2026-07-01 | Claude Fable 5 面向公众开放 |
| 2026-07-16 | Kimi K3 API/产品发布 |
| 2026-07-22/23 | 白宫 Kratsios 公开指控蒸馏 + 违规芯片 |
| 2026-07-23 | TechCrunch 刊发专家质疑蒸馏说 |
| 2026-07-24 左右 | Ryan Greenblatt 发布 K3 自称 Claude 统计证据 |
| 2026-07-27(计划) | Kimi K3 完整权重开源 |
4. Claude Opus 5 vs Fable 5 vs Kimi K3 决策对比表
| 维度 | Claude Opus 5 | Claude Fable 5 | Kimi K3 |
|---|---|---|---|
| 发布日期 | 2026-07-24 | 2026-06-09(公众 7/1) | 2026-07-16 |
| 定价(输入/输出 per MTok) | $5 / $25 | 约 $10 / $50 | 大幅低于 Fable 5 / GPT-5.6 Sol |
| 相对 Fable 5 性能 | CursorBench 峰值差 0.5%,成本一半 | 旗舰基准 | 官方称仅次于 Fable 5 与 GPT-5.6 Sol |
| 数据留存 | 默认不强制 | 需接受 30 天留存 | 待权重/license 最终确认 |
| 开源/权重 | 闭源 API | 闭源 API | 7/27 承诺开放权重(2.8T) |
| 合规/争议 | Anthropic 官方,最对齐一代 | 需数据留存;Mythos 5 占双用途前沿 | 白宫蒸馏指控 + Greenblatt 身份证据(未定论) |
| 适合场景 | 合规敏感、日常 Agent/编程、免留存企业 | 极限性能、可接受留存与高价 | 极限成本、可接受溯源风险、7/27 后自部署验证 |
5. 两件事放在一起看:性价比才是主战场
Opus 5 用「半价逼近旗舰」回应市场对性价比的诉求;Kimi K3 用「开源 + 低价 + 少拒答」冲击市场;K3 争议本质上是各家在性价比战争里对「你的低价是靠技术优化还是白嫖别人模型」的一次公开摊牌。
对普通开发者:先看场景,再看立场。合规、数据留存、供应链风险敏感 → Opus 5 性价比极高;极限成本与开源可控 → 等 7 月 27 日 K3 权重放出后再实测。
6. 五步 Runbook:本周如何行动
- 冻结生产栈,48 小时内跑 Opus 5 A/B。 用现有 CursorBench 类任务对比 Opus 4.8 与 Opus 5,记录 token 成本与通过率;勿在官方稳定报告前全量切换。
- 检查数据留存与合规条款。 若此前因 Fable 5 的 30 天留存政策未升级,Opus 5 可能是更实用的「准旗舰」——尤其企业尽调、源码审计场景。
- K3 争议期保留多模型降级链。 勿将 K3 作为唯一后端;OpenClaw / LiteLLM 配置 Anthropic + OpenAI Fallback。
- 7 月 27 日后独立验证 K3。 下载权重,复现 GPQA-Diamond 等基准;运行身份自认探测(参考 Greenblatt 方法)交叉验证蒸馏间接证据。
- Gateway 迁到 Mac 云 7×24。 模型切换只改 Route;Agent Gateway 在 VPSMAC Mac 云
launchd常驻,API Key 走环境变量,避免本地断链与网络波动。
7. 可引用技术要点
- Claude Opus 5 在 CursorBench 3.2 max effort 下与 Fable 5 峰值相差 0.5%,token 成本约为 Fable 5 的 50%($5/$25 vs 约 $10/$50 per MTok)。
- Kimi K3 总参数 2.8T,MoE 激活约 50B;GPQA-Diamond 93.5% 为发布时开源最高分。
- Anthropic 2026 年 2 月指控月之暗面 340 万+ 异常 API 交互;Fable 5 公众可用(7/1)至 K3 发布(7/16)仅 15 天,专家据此质疑深度蒸馏时间线。
- Ryan Greenblatt 发现 K3 吐出
claude-opus-4-5-20250929等部署 ID,指向 Claude 4.5 时代而非当前 Fable/Mythos 系列。
8. 双语 SEO 要点(内容团队参考)
中文可继续「热点 + 观点」周报体,标题适度情绪化,冲「Kimi K3 蒸馏门」「Claude Opus 5 和 Fable 5 哪个好」等组合词。英文勿直译「蒸馏门」——应命中 Kimi K3 distillation controversy、Why does Kimi K3 say it's Claude、Claude Opus 5 vs Fable 5、Claude Opus 5 pricing 等长尾;放弃硬冲 Claude Opus 5 release 头部新闻词。英文分发重点:Hacker News、r/LocalLLaMA、r/ClaudeAI,附带 Greenblatt 技术角度一手解读。
9. 常见问题 FAQ
Claude Opus 5 比 Claude Fable 5 便宜多少? Token 单价下约为一半($5/$25 vs 约 $10/$50),CursorBench 峰值相差不到 1%。
Claude Opus 5 现在是 Claude Max 的默认模型吗? 是,7 月 24 日发布当天起生效,也是 Claude Pro 最强可用版本。
Kimi K3 真的蒸馏了 Claude 吗? 截至本文发布仍为有争议、未最终证实的指控;Greenblatt 的「自称 Claude」证据是目前最强技术间接证据。
Kimi K3 完整权重什么时候能下载? 官方承诺 2026 年 7 月 27 日。
为什么 Kimi K3 会自称是 Claude? 统计上异常高频自称并吐出内部部署 ID,可能指向带元数据标注的 Claude 训练数据,但不能直接证明蒸馏。
Claude Opus 5 需要接受数据留存政策吗? 不需要;Fable 5 / Mythos 5 则需要 30 天留存 opt-in。
10. 结论
在 Windows/Linux 普通 VPS 或本地笔记本上跑多模型 Agent,常见问题是:本地合盖断链、纯 Linux 缺 Apple 工具链、网络波动导致 Gateway 与 Anthropic API 同时超时。Opus 5 与 K3 之争解决了「选哪个模型」,但运行时环境仍决定 Agent 能否 7×24 稳定——Docker 或 WSL 方案虽灵活,却有额外抽象层、排障复杂度与性能折损。
2026 最佳实践:Opus 5(或 Fallback 链)选模型 + VPSMAC Mac 云跑 OpenClaw Gateway——合规敏感场景优先 Opus 5 的无强制留存;K3 等 7 月 27 日权重验证后再接入自部署栈。若你刚完成 Opus 5 API 验证,下一步应在 Mac 云完成 launchd 验收与多模型探针,别让 Gateway 跟着本地机器一起休眠。