DeepSeek V4 Flash正式版評測:跑分逼近Opus 4.8,價格便宜近百倍,Pro版還要等多久?(2026)
若你的 Agent 棧仍預設閉源旗艦 API,2026 年 7 月 31 日 DeepSeek 將 V4-Flash 升級為官方版將改變成本結構:同一 284B/13B 架構僅重訓,Agent 跑分反超更大的 V4-Pro 預覽版,價格僅為 Claude Opus 4.8 的幾十分之一。本文面向 API 團隊與模型採購決策者,涵蓋完整時間線、定價與競品表、CSA+HCA 架構要點、Harness 跑分爭議、Artificial Analysis 對比、「斬殺線」與梁白開/梁聖社區敘事、五條可引用技術事實、五步 API 遷移 Runbook 與五條 FAQ — 數據截至 8 月 5 日。
痛點拆解:V4-Flash-0731 為何迫使 API 團隊重新評估路由
- 官方版僅限 API,App 與網頁端未同步。 7 月 31 日上線的 V4-Flash-0731 是API-only公測,消費者端仍走舊版本。團隊若以為「全平台已切換」,會在產品體驗與 API 質量之間出現割裂,且無法向非技術用戶驗證同一模型。
- 跑分依賴未公開的 Harness,官方自己提醒別只看數字。 Terminal Bench 2.0 82.7 分(反超 V4-Pro 預覽版 67.9)全部基於尚未公開發布的 Harness 極簡模式測得。在 Claude Code、Cursor 等框架獨立復現前,這組數字應視為「廠商自報 + 特定框架」結果。
- V4-Pro 官方版與 Harness 仍無確切日期。 媒體援引未署名消息稱 8 月 10–20 日 GA,但 DeepSeek changelog 原話僅為「儘快發布」。旗艦 Pro 與自研 Agent 框架缺席,意味著高難度推理與官方 Harness 工作流仍無法落地。
時間線:從 4 月預覽到 7 月「官方版」
- 2026 年 4 月 24 日:V4 預覽版發布並開源 — V4-Pro(1.6T/49B)與 V4-Flash(284B/13B),1M 上下文,MIT 協議。
- 2026 年 7 月 24 日:舊接口
deepseek-chat與deepseek-reasoner正式停用,流量切換至 V4 命名。 - 2026 年 7 月 27 日:月之暗面 Kimi K3(2.8T)開源權重上線 Hugging Face,給 DeepSeek 製造競爭壓力。
- 2026 年 7 月 31 日:DeepSeek-V4-Flash-0731 正式版進入 API 公測,開源權重同步上線;changelog 首次點名自研 Agent 框架 Harness,稱即將隨 V4 正式版發布。僅限 API。
- 截至 2026 年 8 月 5 日:V4-Pro 官方版仍是「儘快發布」;8 月 10–20 日窗口未經官方證實。
核心數據一覽:定價與規格
| 模型 | 狀態 | 總參數/激活 | 上下文 | 輸入價(緩存未命中/命中,每百萬token) | 輸出價(每百萬token) | 協議 |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | 官方正式版(2026-07-31) | 284B / 13B | 1M | $0.14 / $0.0028 | $0.28 | MIT |
| DeepSeek-V4-Pro | 預覽版(官方版未發布) | 1.6T / 49B | 1M | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | 權重開源(2026-07-27) | 2.8T / ~104B | ~1.05M | $3.00 / $0.30 | $15.00 | Kimi K3 License |
| GLM-5.2 | 開源(2026年6月) | ~744B / ~40B | 1M | 未在本文核實 | 未在本文核實 | MIT |
| Qwen3.8-Max | API可用(權重待放出) | 2.4T / 95B | 1M | $2.00 / ~$0.17-0.25 | $6.00 | 承諾開源 |
DeepSeek 已預告未來 API 高峰時段(北京時間 9–12 點、14–18 點)2 倍加價,截至發稿未公佈生效日期。據 21 世紀經濟報道,V4-Flash 相對 Claude Opus 4.8:緩存未命中輸入約 36 倍便宜、緩存命中輸入約 179 倍、輸出約 89 倍。
深度拆解:架構不變,後訓練變強
同一 284B 模型,性能來自重訓
V4-Flash-0731 在參數規模與結構上與 4 月預覽版完全相同,官方明確性能提升「完全來自重新進行的後訓練」。284B/13B 的 Flash 在多項 Agent 基準上超過 1.6T/49B 的 V4-Pro 預覽版 — 印證 2026 年下半年後訓練質量正逼近甚至超過堆參數。
CSA+HCA、mHC、Muon
- 混合注意力(DSA):CSA + HCA,降低長上下文計算與顯存;
- mHC:流形約束超連接,改進殘差結構;
- Muon 優化器:提升訓練收斂。官方稱 V4-Pro 在 1M 上下文下單 token FLOPs 為 V3.2 的 27%,KV Cache 為 10%。
Harness:自研 Agent 框架首次亮相
7 月 31 日 changelog 首次出現 DeepSeek Harness — 對標 Claude Code 的 Agent 執行框架。所有 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)均用 Harness 極簡模式(max 檔位、top_p=0.95、temperature=1.0)測得。官方提示:「跑分對 harness 選擇非常敏感。」
橫向對比:Artificial Analysis 與競品
| 模型 | 實驗室 | 發布/權重 | 總參數 | Intelligence Index | 單任務成本 |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | DeepSeek | 2026-07-31 | 284B | 50 | $0.03 |
| Kimi K3 | 月之暗面 | 07-16 / 07-27 | 2.8T | 57 | $0.86 |
| GLM-5.2 | 智譜/Z.ai | 2026-06 | ~744B | 比 Flash 高約 1 分 | 未核實 |
| Qwen3.8-Max | 阿里 | 2026-08-02 GA | 2.4T | 未核實 | 未核實 |
| GPT-5.6 Sol | OpenAI | 閉源 | — | 比 Flash 高 9+ 分 | $1.86 |
| Claude Fable 5 | Anthropic | 閉源 | — | 比 Flash 高 9+ 分 | $3.15 |
在第三方指數上 V4-Flash 智能分並非最高(落後於 Kimi K3、GLM-5.2),但單任務成本約為 Kimi K3 的 1/29、GPT-5.6 Sol 的 1/62、Claude Fable 5 的 1/105。DeepSeek 打的是「夠用智能 + 極致價格」— V4-Flash 預覽版曾在 OpenRouter 連續七週調用量第一。
爭議點:跑分好看不代表沒有水分
- Harness 依賴:Agent 類跑分基於未公開框架,不宜橫向套用到 Claude Code/Cursor。
- 可用性問題:海外開發者反饋輸入緩存命中率偏低、安全分類器偶發超時(21 世紀經濟報道援引)。
- 發布日期傳言:8 月 10–20 日 GA 為未署名消息,應以官方「儘快發布」為準。
- 融資傳聞:約 74 億美元融資、487 億美元估值等來自財經媒體「據報道」,尚無官方或監管備案確認。
背景:從「梁白開」到「梁聖」與「斬殺線」
Pro 版遲遲未兌現「7 月中旬全量上線」預期時,社區戲稱創始人梁文鋒為「梁白開」(白等、放空炮)。V4-Flash-0731 超預期後,暱稱又變回「梁聖」。中文開發者圈流傳「斬殺線」(kill line):DeepSeek「夠用性能 + 極端低價」給同行設門檻 — 性能無明顯超越又無法更低價,就會失去市場存在感。這也解釋 GPT-5.6 Luna 一次性降價 80% 等密集調價。7 月 31 日算力芯片股(英偉達、博通、AMD)未明顯波動 — 市場已習慣「DeepSeek 式效率突破」敘事。
可引用技術事實(EEAT)
- 架構恆等:V4-Flash-0731 與 4 月預覽版同為 284B 總參數 / 13B 激活,提升 100% 來自後訓練。
- Agent 跑分:Terminal Bench 2.0 82.7 vs V4-Pro 預覽 67.9(Harness minimal mode,廠商自報)。
- 價格倍率:相對 Claude Opus 4.8,緩存未命中輸入約 36×、緩存命中 179×、輸出 89×(21 世紀經濟報道)。
- 效率指標:1M 上下文下 V4-Pro FLOPs 為 V3.2 的 27%,KV Cache 為 10%(官方技術報告)。
- Artificial Analysis:Intelligence Index 50,單任務成本 $0.03。
五步 API 遷移 Runbook
Step 2 映射 — deepseek-chat → deepseek-v4-flash(Non-think);deepseek-reasoner → deepseek-v4-flash Think High 或 deepseek-v4-pro
Step 3 配置 — base_url https://api.deepseek.com;思考模式 temperature=1.0、top_p=1.0;確認 model 名 deepseek-v4-flash 指向 0731 構建
Step 4 試點 — 各跑 20 個代表性 Agent 任務;記錄 token、緩存命中、質量與 $/任務;對比 Harness 外框架表現
Step 5 混合路由 — 批量流量走 V4-Flash-0731;硬推理保留 V4-Pro 預覽或閉源兜底;監控高峰 2× 加價預告
常見問題(FAQ)
DeepSeek V4 與 V3.2 最大區別是什麼?
原生 100 萬 token 上下文,長上下文 FLOPs/KV 大幅降低;V4 系列專項優化 Agent 能力,適配 Claude Code、OpenCode 等工具。
日常該選 V4 Flash 還是 V4 Pro?
大規模低成本調用、Agent 流水線優先 V4-Flash-0731(Agent 跑分已反超 V4-Pro 預覽)。更深世界知識或複雜推理且預算不敏感可暫用 V4-Pro 預覽,待官方版再評估。
現在能用 V4 Pro 官方版嗎?
截至 2026 年 8 月 5 日不能。官方版僅 V4-Flash-0731 且僅限 API。V4-Pro 與 Harness 口徑為「儘快發布」,8 月 10–20 日為未經證實的傳言。
公佈的跑分能直接相信嗎?
SWE-bench Verified 等第三方基準可信度較高;Terminal Bench 2.0 等 Agent 跑分用未公開 Harness 測得,建議等社區獨立復現。
對普通開發者有什麼實際影響?
使用 OpenAI/Anthropic 格式 API 無需改代碼,deepseek-v4-flash 自動指向新官方版。已停用舊名需盡快切換(7 月 24 日已下線)。
數據來源:DeepSeek API 文檔與 changelog · V4 技術報告 · Artificial Analysis(經旺得富理財網等轉引)· 21 世紀經濟報道 · Hugging Face 模型卡
純 API 部署無法滿足7×24 Agent 循環、Apple 工具鏈(Xcode、Fastlane、notarytool)或氣隙推理所需的共置環境;在筆記本上用 antirez ds4 自託管 V4-Flash(約 160 GB 權重,128 GB+ Apple Silicon)意味著睡眠中斷與密鑰/倉庫混用風險。對希望 Flash 自託管並同時運行 iOS CI 或 OpenClaw 網關的團隊,租賃 VPSMAC M4 Mac 雲節點 — 原生 macOS、SSH + launchd 無人值守、彈性 128/256/512 GB 內存 — 通常比個人硬件或 Linux VPS 更穩定。
數據截至 2026-08-05。 Benchmark 含廠商自報與 Harness 特定框架結果。定價與 V4-Pro/Harness 上線狀態可能更新 — 生產決策前請查閱最新官方文檔。