DeepSeek V4-Flash-0731 正式版ベンチマークと価格解説(2026)
Agent スタックが依然として閉源フラッグシップ API をデフォルトにしているなら、2026年7月31日の DeepSeek V4-Flash 公式版アップグレードはコスト構造を変えます:284B/13B の同一アーキテクチャで後学習のみ刷新、Agent ベンチでより大きい V4-Pro プレビューを上回り、Claude Opus 4.8 の数十分の一の価格。本記事は API チームと調達担当向け — 完全タイムライン、価格・競合表、CSA+HCA アーキ要点、Harness ベンチ注意、Artificial Analysis 比較、「斬殺線」コミュニティ叙事、5 つの引用可能技術ファクト、5 ステップ API 移行 Runbook、FAQ 5 件 — データ基準 2026年8月5日。
ペインポイント:V4-Flash-0731 が API ルーティング見直しを迫る 3 理由
- 公式版は API のみ、App とウェブ未同期。 7月31日の V4-Flash-0731 はAPI-only公測。コンシューマー向けは旧ビルドのまま。「全プラットフォーム切替済み」と誤解すると UX と API 品質が乖離し、非技術ユーザーで同一モデルを検証できません。
- スコアは未公開 Harness 依存、DeepSeek 自身が数字だけ見るな警告。 Terminal Bench 2.0 の 82.7 点(V4-Pro プレビュー 67.9 超え)は未公開 Harness 極簡モードのみで測定。Claude Code、Cursor 等が独立再現するまで「ベンダー自報+特定フレームワーク」扱いが妥当です。
- V4-Pro 公式版と Harness に確定日なし。 中国メディアの 8月10–20日 GA 報道は匿名ソース。changelog 原文は「できるだけ早く公開」のみ。旗艦 Pro と自社 Agent フレームワーク不在は、高難度推論と公式 Harness ワークフローが未着地であることを意味します。
タイムライン:4月プレビューから7月「公式版」へ
- 2026年4月24日:V4 プレビュー公開・オープンソース — V4-Pro(1.6T/49B)と V4-Flash(284B/13B)、1M コンテキスト、MIT。
- 2026年7月24日:旧エイリアス
deepseek-chatとdeepseek-reasoner停止、V4 命名へ切替。 - 2026年7月27日:Moonshot AI の Kimi K3(2.8T)が Hugging Face で open weight 公開、DeepSeek に競争圧力。
- 2026年7月31日:DeepSeek-V4-Flash-0731 が公式 API 公測、ウェイト同期公開;changelog で自社 Agent フレームワーク Harness 初言及、「間もなく公開」。API のみ。
- 2026年8月5日時点:V4-Pro 公式版は「できるだけ早く」;8月10–20日はDeepSeek 未確認。
核心データ:価格と仕様
| モデル | 状態 | 総/活性パラメータ | コンテキスト | 入力(キャッシュミス/ヒット、100万token) | 出力(100万token) | ライセンス |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | 公式(2026-07-31) | 284B / 13B | 1M | $0.14 / $0.0028 | $0.28 | MIT |
| DeepSeek-V4-Pro | プレビュー(公式未公開) | 1.6T / 49B | 1M | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | open weight(2026-07-27) | 2.8T / ~104B | ~1.05M | $3.00 / $0.30 | $15.00 | Kimi K3 License |
| GLM-5.2 | オープン(2026年6月) | ~744B / ~40B | 1M | 本文未確認 | 本文未確認 | MIT |
| Qwen3.8-Max | API GA(ウェイト待ち) | 2.4T / 95B | 1M | $2.00 / ~$0.17-0.25 | $6.00 | オープンウェイト約束 |
DeepSeek は将来 API ピーク時間帯(北京 9–12時、14–18時)に2倍料金を予告、発効日未公表。21世紀経済報道によると Claude Opus 4.8 比:キャッシュミス入力約36倍安、キャッシュヒット入力179倍、出力89倍。
深掘り:アーキ不変、後学習強化
同一 284B、性能は再学習由来
V4-Flash-0731 は4月プレビューとパラメータ規模・構造が同一。DeepSeek は性能向上が「完全に再実施した後学習由来」と明言。284B/13B Flash が 1.6T/49B V4-Pro プレビューを複数 Agent ベンチで上回る — 2026年後半は後学習品質が単純スケールに迫る兆候。
CSA+HCA、mHC、Muon
- ハイブリッドアテンション(DSA):CSA + HCA、長コンテキスト計算・メモリ削減;
- mHC:多様体制約ハイパー接続、残差改善;
- Muon オプティマイザ:収束向上。1M コンテキストで V4-Pro の単 token FLOPs は V3.2 の 27%、KV Cache 10%(公式)。
Harness:自社 Agent フレームワーク初登場
7月31日 changelog で DeepSeek Harness — Claude Code 対抗の Agent 実行基盤。Agent スコア(Terminal Bench 2.0、Toolathlon 等)は Harness 極簡モード(max、top_p=0.95、temperature=1.0)で測定。公式:「スコアは harness 選択に非常に敏感」。
横断比較:Artificial Analysis と競合
| モデル | ラボ | 公開/ウェイト | 総パラメータ | Intelligence Index | タスク単価 |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | DeepSeek | 2026-07-31 | 284B | 50 | $0.03 |
| Kimi K3 | Moonshot AI | 07-16 / 07-27 | 2.8T | 57 | $0.86 |
| GLM-5.2 | 智譜/Z.ai | 2026-06 | ~744B | Flash より約1点高 | 未確認 |
| Qwen3.8-Max | Alibaba | 2026-08-02 GA | 2.4T | 未確認 | 未確認 |
| GPT-5.6 Sol | OpenAI | 閉源 | — | Flash より9点以上高 | $1.86 |
| Claude Fable 5 | Anthropic | 閉源 | — | Flash より9点以上高 | $3.15 |
Artificial Analysis では V4-Flash の Intelligence Index は Kimi K3、GLM-5.2 に劣るが、タスク単価は Kimi K3 の 1/29、GPT-5.6 Sol の 1/62、Claude Fable 5 の 1/105。DeepSeek は「十分な知能+極限価格」— プレビュー版は OpenRouter 7週連続利用量1位の報道あり。
論点:好スコア=水分なしではない
- Harness 依存:未公開フレームワーク測定、Claude Code/Cursor へ横展開不可。
- 可用性:海外開発者から入力キャッシュヒット率低下、安全分類器タイムアウト(21世紀経済報道)。
- 公開日噂:8月10–20日 GA は匿名ソース、公式「できるだけ早く」が基準。
- 資金調達噂:約74億ドル調達、487億ドル評価等は財経メディア「報道」、DeepSeek/規制未確認。
背景:「梁白開」から「梁聖」、斬殺線(kill line)
V4-Pro が7月中旬フル公開を逃すと、中国フォーラムは創業者梁文鋒を「梁白開」(空約束)と揶揄。V4-Flash-0731 が期待超え後「梁聖」に回帰。開発者間の「斬殺線」:DeepSeek の「十分性能+極端低価格」が参入障壁 — 明確に上回れず更に安くもできなければ存在感を失う。GPT-5.6 Luna 80% 値下げ等の密集価格調整を説明。7月31日 NVIDIA、Broadcom、AMD 株に大きな変動なし — 市場は DeepSeek 式効率を日常化。
引用可能な技術ファクト(EEAT)
- アーキ同一:V4-Flash-0731 は4月プレビューと 284B 総 / 13B 活性、向上100%は後学習。
- Agent スコア:Terminal Bench 2.0 82.7 vs V4-Pro プレビュー 67.9(Harness minimal、ベンダー自報)。
- 価格倍率:Claude Opus 4.8 比 — キャッシュミス入力 36×、ヒット 179×、出力 89×(21世紀経済報道)。
- 効率:1M コンテキストで V4-Pro FLOPs は V3.2 の 27%、KV 10%(公式技術報告)。
- Artificial Analysis:Intelligence Index 50、タスク単価 $0.03。
5ステップ API 移行 Runbook
Step 2 マップ — deepseek-chat → deepseek-v4-flash(Non-think);deepseek-reasoner → deepseek-v4-flash Think High または deepseek-v4-pro
Step 3 設定 — base_url https://api.deepseek.com;思考モード temperature=1.0、top_p=1.0;deepseek-v4-flash が 0731 を指すことを確認
Step 4 パイロット — 各 20 件の代表 Agent タスク;token、キャッシュヒット、品質、$/タスク;Harness 外フレームワーク比較
Step 5 ハイブリッド — 一括 V4-Flash-0731;ハード推論は V4-Pro プレビューまたは閉源;ピーク 2× 料金を監視
FAQ
DeepSeek V4 と V3.2 の最大の違いは?
ネイティブ 100 万 token コンテキスト、長コンテキスト FLOPs/KV 大幅削減;V4 系列は Agent 能力特化、Claude Code、OpenCode 等に適合。
日常利用は V4 Flash と V4 Pro どちら?
大規模低コスト・Agent パイプラインは V4-Flash-0731(Agent スコアは既に V4-Pro プレビュー超え)。深い世界知識・複雑推論で予算に余裕があれば V4-Pro プレビュー、公式版後に再評価。
V4 Pro 公式版は使える?
2026年8月5日時点では不可。公式は V4-Flash-0731 のみ、API 限定。V4-Pro と Harness は「できるだけ早く」;8月10–20日は未確認の噂。
公表ベンチマークは信頼できる?
SWE-bench Verified 等第三者ベンチは比較的可信。Terminal Bench 2.0 等 Agent スコアは未公開 Harness 測定 — コミュニティ独立再現を待つべき。
開発者への実務的影響は?
OpenAI/Anthropic 形式 API はコード変更不要 — deepseek-v4-flash が新公式版を指す。旧名は 7月24日停止済み、早急に切替。
出典:DeepSeek API ドキュメント・changelog · V4 技術報告 · Artificial Analysis(旺得富理财网等経由)· 21世紀経済報道 · Hugging Face モデルカード
API のみのデプロイでは7×24 Agent ループ、Apple ツールチェーン(Xcode、Fastlane、notarytool)、エアギャップ推論の同居環境を満たせません。ノート PC で antirez ds4 により V4-Flash を自ホスト(約160GBウェイト、128GB+ Apple Silicon)はスリープ中断と API キー/本番リポ混在リスク。Flash 自ホストと iOS CI または OpenClaw ゲートウェイを同時運用するチームには、VPSMAC M4 Mac クラウドノードのレンタル — ネイティブ macOS、SSH + launchd 無人運用、128/256/512 GB メモリ — が個人機器や Linux VPS より安定することが多いです。
データ基準日:2026-08-05。 ベンチマークにベンダー自報と Harness 特定結果を含む。価格と V4-Pro/Harness 状態は更新される可能性 — 本番前に最新公式ドキュメントを確認。