DeepSeek V4 Flash正式版评测:跑分逼近Opus 4.8,价格便宜近百倍,Pro版还要等多久?(2026)
若你的 Agent 栈仍默认闭源旗舰 API,2026 年 7 月 31 日 DeepSeek 将 V4-Flash 升级为官方版将改变成本结构:同一 284B/13B 架构仅重训,Agent 跑分反超更大的 V4-Pro 预览版,价格仅为 Claude Opus 4.8 的几十分之一。本文面向 API 团队与模型采购决策者,涵盖完整时间线、定价与竞品表、CSA+HCA 架构要点、Harness 跑分争议、Artificial Analysis 对比、「斩杀线」与梁白开/梁圣社区叙事、五条可引用技术事实、五步 API 迁移 Runbook 与五条 FAQ — 数据截至 8 月 5 日。
痛点拆解:V4-Flash-0731 为何迫使 API 团队重新评估路由
- 官方版仅限 API,App 与网页端未同步。 7 月 31 日上线的 V4-Flash-0731 是API-only公测,消费者端仍走旧版本。团队若以为「全平台已切换」,会在产品体验与 API 质量之间出现割裂,且无法向非技术用户验证同一模型。
- 跑分依赖未公开的 Harness,官方自己提醒别只看数字。 Terminal Bench 2.0 82.7 分(反超 V4-Pro 预览版 67.9)全部基于尚未公开发布的 Harness 极简模式测得。在 Claude Code、Cursor 等框架独立复现前,这组数字应视为「厂商自报 + 特定框架」结果。
- V4-Pro 官方版与 Harness 仍无确切日期。 媒体援引未署名消息称 8 月 10–20 日 GA,但 DeepSeek changelog 原话仅为「尽快发布」。旗舰 Pro 与自研 Agent 框架缺席,意味着高难度推理与官方 Harness 工作流仍无法落地。
时间线:从 4 月预览到 7 月「官方版」
- 2026 年 4 月 24 日:V4 预览版发布并开源 — V4-Pro(1.6T/49B)与 V4-Flash(284B/13B),1M 上下文,MIT 协议。
- 2026 年 7 月 24 日:旧接口
deepseek-chat与deepseek-reasoner正式停用,流量切换至 V4 命名。 - 2026 年 7 月 27 日:月之暗面 Kimi K3(2.8T)开源权重上线 Hugging Face,给 DeepSeek 制造竞争压力。
- 2026 年 7 月 31 日:DeepSeek-V4-Flash-0731 正式版进入 API 公测,开源权重同步上线;changelog 首次点名自研 Agent 框架 Harness,称即将随 V4 正式版发布。仅限 API。
- 截至 2026 年 8 月 5 日:V4-Pro 官方版仍是「尽快发布」;8 月 10–20 日窗口未经官方证实。
核心数据一览:定价与规格
| 模型 | 状态 | 总参数/激活 | 上下文 | 输入价(缓存未命中/命中,每百万token) | 输出价(每百万token) | 协议 |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | 官方正式版(2026-07-31) | 284B / 13B | 1M | $0.14 / $0.0028 | $0.28 | MIT |
| DeepSeek-V4-Pro | 预览版(官方版未发布) | 1.6T / 49B | 1M | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | 权重开源(2026-07-27) | 2.8T / ~104B | ~1.05M | $3.00 / $0.30 | $15.00 | Kimi K3 License |
| GLM-5.2 | 开源(2026年6月) | ~744B / ~40B | 1M | 未在本文核实 | 未在本文核实 | MIT |
| Qwen3.8-Max | API可用(权重待放出) | 2.4T / 95B | 1M | $2.00 / ~$0.17-0.25 | $6.00 | 承诺开源 |
DeepSeek 已预告未来 API 高峰时段(北京时间 9–12 点、14–18 点)2 倍加价,截至发稿未公布生效日期。据 21 世纪经济报道,V4-Flash 相对 Claude Opus 4.8:缓存未命中输入约 36 倍便宜、缓存命中输入约 179 倍、输出约 89 倍。
深度拆解:架构不变,后训练变强
同一 284B 模型,性能来自重训
V4-Flash-0731 在参数规模与结构上与 4 月预览版完全相同,官方明确性能提升「完全来自重新进行的后训练」。284B/13B 的 Flash 在多项 Agent 基准上超过 1.6T/49B 的 V4-Pro 预览版 — 印证 2026 年下半年后训练质量正逼近甚至超过堆参数。
CSA+HCA、mHC、Muon
- 混合注意力(DSA):CSA + HCA,降低长上下文计算与显存;
- mHC:流形约束超连接,改进残差结构;
- Muon 优化器:提升训练收敛。官方称 V4-Pro 在 1M 上下文下单 token FLOPs 为 V3.2 的 27%,KV Cache 为 10%。
Harness:自研 Agent 框架首次亮相
7 月 31 日 changelog 首次出现 DeepSeek Harness — 对标 Claude Code 的 Agent 执行框架。所有 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)均用 Harness 极简模式(max 档位、top_p=0.95、temperature=1.0)测得。官方提示:「跑分对 harness 选择非常敏感。」
横向对比:Artificial Analysis 与竞品
| 模型 | 实验室 | 发布/权重 | 总参数 | Intelligence Index | 单任务成本 |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | DeepSeek | 2026-07-31 | 284B | 50 | $0.03 |
| Kimi K3 | 月之暗面 | 07-16 / 07-27 | 2.8T | 57 | $0.86 |
| GLM-5.2 | 智谱/Z.ai | 2026-06 | ~744B | 比 Flash 高约 1 分 | 未核实 |
| Qwen3.8-Max | 阿里 | 2026-08-02 GA | 2.4T | 未核实 | 未核实 |
| GPT-5.6 Sol | OpenAI | 闭源 | — | 比 Flash 高 9+ 分 | $1.86 |
| Claude Fable 5 | Anthropic | 闭源 | — | 比 Flash 高 9+ 分 | $3.15 |
在第三方指数上 V4-Flash 智能分并非最高(落后于 Kimi K3、GLM-5.2),但单任务成本约为 Kimi K3 的 1/29、GPT-5.6 Sol 的 1/62、Claude Fable 5 的 1/105。DeepSeek 打的是「够用智能 + 极致价格」— V4-Flash 预览版曾在 OpenRouter 连续七周调用量第一。
争议点:跑分好看不代表没有水分
- Harness 依赖:Agent 类跑分基于未公开框架,不宜横向套用到 Claude Code/Cursor。
- 可用性问题:海外开发者反馈输入缓存命中率偏低、安全分类器偶发超时(21 世纪经济报道援引)。
- 发布日期传言:8 月 10–20 日 GA 为未署名消息,应以官方「尽快发布」为准。
- 融资传闻:约 74 亿美元融资、487 亿美元估值等来自财经媒体「据报道」,尚无官方或监管备案确认。
背景:从「梁白开」到「梁圣」与「斩杀线」
Pro 版迟迟未兑现「7 月中旬全量上线」预期时,社区戏称创始人梁文锋为「梁白开」(白等、放空炮)。V4-Flash-0731 超预期后,昵称又变回「梁圣」。中文开发者圈流传「斩杀线」(kill line):DeepSeek「够用性能 + 极端低价」给同行设门槛 — 性能无明显超越又无法更低价,就会失去市场存在感。这也解释 GPT-5.6 Luna 一次性降价 80% 等密集调价。7 月 31 日算力芯片股(英伟达、博通、AMD)未明显波动 — 市场已习惯「DeepSeek 式效率突破」叙事。
可引用技术事实(EEAT)
- 架构恒等:V4-Flash-0731 与 4 月预览版同为 284B 总参数 / 13B 激活,提升 100% 来自后训练。
- Agent 跑分:Terminal Bench 2.0 82.7 vs V4-Pro 预览 67.9(Harness minimal mode,厂商自报)。
- 价格倍率:相对 Claude Opus 4.8,缓存未命中输入约 36×、缓存命中 179×、输出 89×(21 世纪经济报道)。
- 效率指标:1M 上下文下 V4-Pro FLOPs 为 V3.2 的 27%,KV Cache 为 10%(官方技术报告)。
- Artificial Analysis:Intelligence Index 50,单任务成本 $0.03。
五步 API 迁移 Runbook
Step 2 映射 — deepseek-chat → deepseek-v4-flash(Non-think);deepseek-reasoner → deepseek-v4-flash Think High 或 deepseek-v4-pro
Step 3 配置 — base_url https://api.deepseek.com;思考模式 temperature=1.0、top_p=1.0;确认 model 名 deepseek-v4-flash 指向 0731 构建
Step 4 试点 — 各跑 20 个代表性 Agent 任务;记录 token、缓存命中、质量与 $/任务;对比 Harness 外框架表现
Step 5 混合路由 — 批量流量走 V4-Flash-0731;硬推理保留 V4-Pro 预览或闭源兜底;监控高峰 2× 加价预告
常见问题(FAQ)
DeepSeek V4 与 V3.2 最大区别是什么?
原生 100 万 token 上下文,长上下文 FLOPs/KV 大幅降低;V4 系列专项优化 Agent 能力,适配 Claude Code、OpenCode 等工具。
日常该选 V4 Flash 还是 V4 Pro?
大规模低成本调用、Agent 流水线优先 V4-Flash-0731(Agent 跑分已反超 V4-Pro 预览)。更深世界知识或复杂推理且预算不敏感可暂用 V4-Pro 预览,待官方版再评估。
现在能用 V4 Pro 官方版吗?
截至 2026 年 8 月 5 日不能。官方版仅 V4-Flash-0731 且仅限 API。V4-Pro 与 Harness 口径为「尽快发布」,8 月 10–20 日为未经证实的传言。
公布的跑分能直接相信吗?
SWE-bench Verified 等第三方基准可信度较高;Terminal Bench 2.0 等 Agent 跑分用未公开 Harness 测得,建议等社区独立复现。
对普通开发者有什么实际影响?
使用 OpenAI/Anthropic 格式 API 无需改代码,deepseek-v4-flash 自动指向新官方版。已停用旧名需尽快切换(7 月 24 日已下线)。
数据来源:DeepSeek API 文档与 changelog · V4 技术报告 · Artificial Analysis(经旺得富理财网等转引)· 21 世纪经济报道 · Hugging Face 模型卡
纯 API 部署无法满足7×24 Agent 循环、Apple 工具链(Xcode、Fastlane、notarytool)或气隙推理所需的共置环境;在笔记本上用 antirez ds4 自托管 V4-Flash(约 160 GB 权重,128 GB+ Apple Silicon)意味着睡眠中断与密钥/仓库混用风险。对希望 Flash 自托管并同时运行 iOS CI 或 OpenClaw 网关的团队,租赁 VPSMAC M4 Mac 云节点 — 原生 macOS、SSH + launchd 无人值守、弹性 128/256/512 GB 内存 — 通常比个人硬件或 Linux VPS 更稳定。
数据截至 2026-08-05。 Benchmark 含厂商自报与 Harness 特定框架结果。定价与 V4-Pro/Harness 上线状态可能更新 — 生产决策前请查阅最新官方文档。