DeepSeek V4 Flash正式版评测:跑分逼近Opus 4.8,价格便宜近百倍,Pro版还要等多久?(2026)

若你的 Agent 栈仍默认闭源旗舰 API,2026 年 7 月 31 日 DeepSeek 将 V4-Flash 升级为官方版将改变成本结构:同一 284B/13B 架构仅重训,Agent 跑分反超更大的 V4-Pro 预览版,价格仅为 Claude Opus 4.8 的几十分之一。本文面向 API 团队与模型采购决策者,涵盖完整时间线、定价与竞品表、CSA+HCA 架构要点、Harness 跑分争议、Artificial Analysis 对比、「斩杀线」与梁白开/梁圣社区叙事、五条可引用技术事实、五步 API 迁移 Runbook 与五条 FAQ — 数据截至 8 月 5 日。

DeepSeek V4 神经网络架构示意图,展示稀疏注意力层与 MoE 路由在深色渐变背景上的可视化效果

目录

痛点拆解:V4-Flash-0731 为何迫使 API 团队重新评估路由

  1. 官方版仅限 API,App 与网页端未同步。 7 月 31 日上线的 V4-Flash-0731 是API-only公测,消费者端仍走旧版本。团队若以为「全平台已切换」,会在产品体验与 API 质量之间出现割裂,且无法向非技术用户验证同一模型。
  2. 跑分依赖未公开的 Harness,官方自己提醒别只看数字。 Terminal Bench 2.0 82.7 分(反超 V4-Pro 预览版 67.9)全部基于尚未公开发布的 Harness 极简模式测得。在 Claude Code、Cursor 等框架独立复现前,这组数字应视为「厂商自报 + 特定框架」结果。
  3. V4-Pro 官方版与 Harness 仍无确切日期。 媒体援引未署名消息称 8 月 10–20 日 GA,但 DeepSeek changelog 原话仅为「尽快发布」。旗舰 Pro 与自研 Agent 框架缺席,意味着高难度推理与官方 Harness 工作流仍无法落地。

时间线:从 4 月预览到 7 月「官方版」

核心数据一览:定价与规格

模型状态总参数/激活上下文输入价(缓存未命中/命中,每百万token)输出价(每百万token)协议
DeepSeek-V4-Flash-0731官方正式版(2026-07-31)284B / 13B1M$0.14 / $0.0028$0.28MIT
DeepSeek-V4-Pro预览版(官方版未发布)1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3权重开源(2026-07-27)2.8T / ~104B~1.05M$3.00 / $0.30$15.00Kimi K3 License
GLM-5.2开源(2026年6月)~744B / ~40B1M未在本文核实未在本文核实MIT
Qwen3.8-MaxAPI可用(权重待放出)2.4T / 95B1M$2.00 / ~$0.17-0.25$6.00承诺开源

DeepSeek 已预告未来 API 高峰时段(北京时间 9–12 点、14–18 点)2 倍加价,截至发稿未公布生效日期。据 21 世纪经济报道,V4-Flash 相对 Claude Opus 4.8:缓存未命中输入约 36 倍便宜、缓存命中输入约 179 倍、输出约 89 倍

深度拆解:架构不变,后训练变强

同一 284B 模型,性能来自重训

V4-Flash-0731 在参数规模与结构上与 4 月预览版完全相同,官方明确性能提升「完全来自重新进行的后训练」。284B/13B 的 Flash 在多项 Agent 基准上超过 1.6T/49B 的 V4-Pro 预览版 — 印证 2026 年下半年后训练质量正逼近甚至超过堆参数。

CSA+HCA、mHC、Muon

Harness:自研 Agent 框架首次亮相

7 月 31 日 changelog 首次出现 DeepSeek Harness — 对标 Claude Code 的 Agent 执行框架。所有 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)均用 Harness 极简模式(max 档位、top_p=0.95、temperature=1.0)测得。官方提示:「跑分对 harness 选择非常敏感。」

横向对比:Artificial Analysis 与竞品

模型实验室发布/权重总参数Intelligence Index单任务成本
DeepSeek-V4-Flash-0731DeepSeek2026-07-31284B50$0.03
Kimi K3月之暗面07-16 / 07-272.8T57$0.86
GLM-5.2智谱/Z.ai2026-06~744B比 Flash 高约 1 分未核实
Qwen3.8-Max阿里2026-08-02 GA2.4T未核实未核实
GPT-5.6 SolOpenAI闭源比 Flash 高 9+ 分$1.86
Claude Fable 5Anthropic闭源比 Flash 高 9+ 分$3.15

在第三方指数上 V4-Flash 智能分并非最高(落后于 Kimi K3、GLM-5.2),但单任务成本约为 Kimi K3 的 1/29、GPT-5.6 Sol 的 1/62、Claude Fable 5 的 1/105。DeepSeek 打的是「够用智能 + 极致价格」— V4-Flash 预览版曾在 OpenRouter 连续七周调用量第一。

争议点:跑分好看不代表没有水分

背景:从「梁白开」到「梁圣」与「斩杀线」

Pro 版迟迟未兑现「7 月中旬全量上线」预期时,社区戏称创始人梁文锋为「梁白开」(白等、放空炮)。V4-Flash-0731 超预期后,昵称又变回「梁圣」。中文开发者圈流传「斩杀线」(kill line):DeepSeek「够用性能 + 极端低价」给同行设门槛 — 性能无明显超越又无法更低价,就会失去市场存在感。这也解释 GPT-5.6 Luna 一次性降价 80% 等密集调价。7 月 31 日算力芯片股(英伟达、博通、AMD)未明显波动 — 市场已习惯「DeepSeek 式效率突破」叙事。

可引用技术事实(EEAT)

五步 API 迁移 Runbook

Step 1 审计 — grep 代码库中 deepseek-chat / deepseek-reasoner;列出所有服务与 Agent 网关路由
Step 2 映射 — deepseek-chat → deepseek-v4-flash(Non-think);deepseek-reasoner → deepseek-v4-flash Think High 或 deepseek-v4-pro
Step 3 配置 — base_url https://api.deepseek.com;思考模式 temperature=1.0、top_p=1.0;确认 model 名 deepseek-v4-flash 指向 0731 构建
Step 4 试点 — 各跑 20 个代表性 Agent 任务;记录 token、缓存命中、质量与 $/任务;对比 Harness 外框架表现
Step 5 混合路由 — 批量流量走 V4-Flash-0731;硬推理保留 V4-Pro 预览或闭源兜底;监控高峰 2× 加价预告

常见问题(FAQ)

DeepSeek V4 与 V3.2 最大区别是什么?

原生 100 万 token 上下文,长上下文 FLOPs/KV 大幅降低;V4 系列专项优化 Agent 能力,适配 Claude Code、OpenCode 等工具。

日常该选 V4 Flash 还是 V4 Pro?

大规模低成本调用、Agent 流水线优先 V4-Flash-0731(Agent 跑分已反超 V4-Pro 预览)。更深世界知识或复杂推理且预算不敏感可暂用 V4-Pro 预览,待官方版再评估。

现在能用 V4 Pro 官方版吗?

截至 2026 年 8 月 5 日不能。官方版仅 V4-Flash-0731 且仅限 API。V4-Pro 与 Harness 口径为「尽快发布」,8 月 10–20 日为未经证实的传言。

公布的跑分能直接相信吗?

SWE-bench Verified 等第三方基准可信度较高;Terminal Bench 2.0 等 Agent 跑分用未公开 Harness 测得,建议等社区独立复现。

对普通开发者有什么实际影响?

使用 OpenAI/Anthropic 格式 API 无需改代码,deepseek-v4-flash 自动指向新官方版。已停用旧名需尽快切换(7 月 24 日已下线)。

数据来源:DeepSeek API 文档与 changelog · V4 技术报告 · Artificial Analysis(经旺得富理财网等转引)· 21 世纪经济报道 · Hugging Face 模型卡

纯 API 部署无法满足7×24 Agent 循环、Apple 工具链(Xcode、Fastlane、notarytool)或气隙推理所需的共置环境;在笔记本上用 antirez ds4 自托管 V4-Flash(约 160 GB 权重,128 GB+ Apple Silicon)意味着睡眠中断与密钥/仓库混用风险。对希望 Flash 自托管并同时运行 iOS CI 或 OpenClaw 网关的团队,租赁 VPSMAC M4 Mac 云节点 — 原生 macOS、SSH + launchd 无人值守、弹性 128/256/512 GB 内存 — 通常比个人硬件或 Linux VPS 更稳定。

数据截至 2026-08-05。 Benchmark 含厂商自报与 Harness 特定框架结果。定价与 V4-Pro/Harness 上线状态可能更新 — 生产决策前请查阅最新官方文档。