DeepSeek V4 Flash正式版評測:跑分逼近Opus 4.8,價格便宜近百倍,Pro版還要等多久?(2026)

若你的 Agent 棧仍預設閉源旗艦 API,2026 年 7 月 31 日 DeepSeek 將 V4-Flash 升級為官方版將改變成本結構:同一 284B/13B 架構僅重訓,Agent 跑分反超更大的 V4-Pro 預覽版,價格僅為 Claude Opus 4.8 的幾十分之一。本文面向 API 團隊與模型採購決策者,涵蓋完整時間線、定價與競品表、CSA+HCA 架構要點、Harness 跑分爭議、Artificial Analysis 對比、「斬殺線」與梁白開/梁聖社區敘事、五條可引用技術事實、五步 API 遷移 Runbook 與五條 FAQ — 數據截至 8 月 5 日。

DeepSeek V4 神經網絡架構示意圖,展示稀疏注意力層與 MoE 路由在深色漸變背景上的可視化效果

目錄

痛點拆解:V4-Flash-0731 為何迫使 API 團隊重新評估路由

  1. 官方版僅限 API,App 與網頁端未同步。 7 月 31 日上線的 V4-Flash-0731 是API-only公測,消費者端仍走舊版本。團隊若以為「全平台已切換」,會在產品體驗與 API 質量之間出現割裂,且無法向非技術用戶驗證同一模型。
  2. 跑分依賴未公開的 Harness,官方自己提醒別只看數字。 Terminal Bench 2.0 82.7 分(反超 V4-Pro 預覽版 67.9)全部基於尚未公開發布的 Harness 極簡模式測得。在 Claude Code、Cursor 等框架獨立復現前,這組數字應視為「廠商自報 + 特定框架」結果。
  3. V4-Pro 官方版與 Harness 仍無確切日期。 媒體援引未署名消息稱 8 月 10–20 日 GA,但 DeepSeek changelog 原話僅為「儘快發布」。旗艦 Pro 與自研 Agent 框架缺席,意味著高難度推理與官方 Harness 工作流仍無法落地。

時間線:從 4 月預覽到 7 月「官方版」

核心數據一覽:定價與規格

模型狀態總參數/激活上下文輸入價(緩存未命中/命中,每百萬token)輸出價(每百萬token)協議
DeepSeek-V4-Flash-0731官方正式版(2026-07-31)284B / 13B1M$0.14 / $0.0028$0.28MIT
DeepSeek-V4-Pro預覽版(官方版未發布)1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3權重開源(2026-07-27)2.8T / ~104B~1.05M$3.00 / $0.30$15.00Kimi K3 License
GLM-5.2開源(2026年6月)~744B / ~40B1M未在本文核實未在本文核實MIT
Qwen3.8-MaxAPI可用(權重待放出)2.4T / 95B1M$2.00 / ~$0.17-0.25$6.00承諾開源

DeepSeek 已預告未來 API 高峰時段(北京時間 9–12 點、14–18 點)2 倍加價,截至發稿未公佈生效日期。據 21 世紀經濟報道,V4-Flash 相對 Claude Opus 4.8:緩存未命中輸入約 36 倍便宜、緩存命中輸入約 179 倍、輸出約 89 倍

深度拆解:架構不變,後訓練變強

同一 284B 模型,性能來自重訓

V4-Flash-0731 在參數規模與結構上與 4 月預覽版完全相同,官方明確性能提升「完全來自重新進行的後訓練」。284B/13B 的 Flash 在多項 Agent 基準上超過 1.6T/49B 的 V4-Pro 預覽版 — 印證 2026 年下半年後訓練質量正逼近甚至超過堆參數。

CSA+HCA、mHC、Muon

Harness:自研 Agent 框架首次亮相

7 月 31 日 changelog 首次出現 DeepSeek Harness — 對標 Claude Code 的 Agent 執行框架。所有 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)均用 Harness 極簡模式(max 檔位、top_p=0.95、temperature=1.0)測得。官方提示:「跑分對 harness 選擇非常敏感。」

橫向對比:Artificial Analysis 與競品

模型實驗室發布/權重總參數Intelligence Index單任務成本
DeepSeek-V4-Flash-0731DeepSeek2026-07-31284B50$0.03
Kimi K3月之暗面07-16 / 07-272.8T57$0.86
GLM-5.2智譜/Z.ai2026-06~744B比 Flash 高約 1 分未核實
Qwen3.8-Max阿里2026-08-02 GA2.4T未核實未核實
GPT-5.6 SolOpenAI閉源比 Flash 高 9+ 分$1.86
Claude Fable 5Anthropic閉源比 Flash 高 9+ 分$3.15

在第三方指數上 V4-Flash 智能分並非最高(落後於 Kimi K3、GLM-5.2),但單任務成本約為 Kimi K3 的 1/29、GPT-5.6 Sol 的 1/62、Claude Fable 5 的 1/105。DeepSeek 打的是「夠用智能 + 極致價格」— V4-Flash 預覽版曾在 OpenRouter 連續七週調用量第一。

爭議點:跑分好看不代表沒有水分

背景:從「梁白開」到「梁聖」與「斬殺線」

Pro 版遲遲未兌現「7 月中旬全量上線」預期時,社區戲稱創始人梁文鋒為「梁白開」(白等、放空炮)。V4-Flash-0731 超預期後,暱稱又變回「梁聖」。中文開發者圈流傳「斬殺線」(kill line):DeepSeek「夠用性能 + 極端低價」給同行設門檻 — 性能無明顯超越又無法更低價,就會失去市場存在感。這也解釋 GPT-5.6 Luna 一次性降價 80% 等密集調價。7 月 31 日算力芯片股(英偉達、博通、AMD)未明顯波動 — 市場已習慣「DeepSeek 式效率突破」敘事。

可引用技術事實(EEAT)

五步 API 遷移 Runbook

Step 1 審計 — grep 代碼庫中 deepseek-chat / deepseek-reasoner;列出所有服務與 Agent 網關路由
Step 2 映射 — deepseek-chat → deepseek-v4-flash(Non-think);deepseek-reasoner → deepseek-v4-flash Think High 或 deepseek-v4-pro
Step 3 配置 — base_url https://api.deepseek.com;思考模式 temperature=1.0、top_p=1.0;確認 model 名 deepseek-v4-flash 指向 0731 構建
Step 4 試點 — 各跑 20 個代表性 Agent 任務;記錄 token、緩存命中、質量與 $/任務;對比 Harness 外框架表現
Step 5 混合路由 — 批量流量走 V4-Flash-0731;硬推理保留 V4-Pro 預覽或閉源兜底;監控高峰 2× 加價預告

常見問題(FAQ)

DeepSeek V4 與 V3.2 最大區別是什麼?

原生 100 萬 token 上下文,長上下文 FLOPs/KV 大幅降低;V4 系列專項優化 Agent 能力,適配 Claude Code、OpenCode 等工具。

日常該選 V4 Flash 還是 V4 Pro?

大規模低成本調用、Agent 流水線優先 V4-Flash-0731(Agent 跑分已反超 V4-Pro 預覽)。更深世界知識或複雜推理且預算不敏感可暫用 V4-Pro 預覽,待官方版再評估。

現在能用 V4 Pro 官方版嗎?

截至 2026 年 8 月 5 日不能。官方版僅 V4-Flash-0731 且僅限 API。V4-Pro 與 Harness 口徑為「儘快發布」,8 月 10–20 日為未經證實的傳言。

公佈的跑分能直接相信嗎?

SWE-bench Verified 等第三方基準可信度較高;Terminal Bench 2.0 等 Agent 跑分用未公開 Harness 測得,建議等社區獨立復現。

對普通開發者有什麼實際影響?

使用 OpenAI/Anthropic 格式 API 無需改代碼,deepseek-v4-flash 自動指向新官方版。已停用舊名需盡快切換(7 月 24 日已下線)。

數據來源:DeepSeek API 文檔與 changelog · V4 技術報告 · Artificial Analysis(經旺得富理財網等轉引)· 21 世紀經濟報道 · Hugging Face 模型卡

純 API 部署無法滿足7×24 Agent 循環、Apple 工具鏈(Xcode、Fastlane、notarytool)或氣隙推理所需的共置環境;在筆記本上用 antirez ds4 自託管 V4-Flash(約 160 GB 權重,128 GB+ Apple Silicon)意味著睡眠中斷與密鑰/倉庫混用風險。對希望 Flash 自託管並同時運行 iOS CI 或 OpenClaw 網關的團隊,租賃 VPSMAC M4 Mac 雲節點 — 原生 macOS、SSH + launchd 無人值守、彈性 128/256/512 GB 內存 — 通常比個人硬件或 Linux VPS 更穩定。

數據截至 2026-08-05。 Benchmark 含廠商自報與 Harness 特定框架結果。定價與 V4-Pro/Harness 上線狀態可能更新 — 生產決策前請查閱最新官方文檔。