DeepSeek V4 満血版正式リリース(2026年7月):価格・ベンチマーク・GPT-5.6比較
2026年7月20日、3ヶ月のプレビューを経て DeepSeek V4 満血版(GA 正式版)が本番公開された。Agent 性能・数学推論・コード生成の全面強化に加え、DeepSeek 初の峰谷課金が導入された。本稿は AI 開発者とモデル選定担当者向けに、タイムライン、V4-Pro/Flash 仕様、CSA/HCA/mHC/Muon アーキテクチャ、ベンチマーク全表、峰谷価格、GPT-5.6/Claude Fable 5 比較、7月24日までの API 移行コード、5段 Runbookを網羅する。
目次
課題整理:GA リリースで開発者が今すぐ対応すべき3点
- 旧 API 名の強制停止が4日後:
deepseek-chatとdeepseek-reasonerは 2026年7月24日 15:59 UTC(北京 23:59)に永久停止。本番コードのmodelパラメータ未更新は即サービス中断リスク。 - 峰谷課金で請求予測が複雑化:北京時間平日 09:00–12:00・14:00–18:00 は2倍料金。24/7 Agent パイプラインはスケジューリング戦略なしでは月次コストが想定外に跳ねる。
- 「オープン vs クローズド」の再評価タイミング:V4-Pro は SWE-bench Verified 80.6%(オープンウェイト最高)を達成しつつ、出力 $0.87/M(オフピーク)——Claude Fable 5($50/M)の 1/57。コストと性能のトレードオフを再計算する好機。
一、タイムライン:プレビューから満血版へ
| 日付 | イベント |
|---|---|
| 2026-04-24 | V4 プレビュー + MIT オープンソース公開(V4-Pro 1.6T / V4-Flash 284B) |
| 2026-05 | 本番調整版 API 正式利用可能 |
| 2026-06 | V4-Pro 出力価格 75% 永久値下げ($0.87/M tokens) |
| 2026-06-29 | 全 API ユーザーへ GA リリース+峰谷課金事前通知メール |
| 2026-07-19 | GA グレー内測開始、メディアが「満血版明日公開」と報道 |
| 2026-07-20 | GA 正式版リリース(本稿公開日) |
| 2026-07-24 | deepseek-chat / deepseek-reasoner 永久停止 |
要点: アーキテクチャは4月版と同一 MoE。GA は Agent・数学・コードの性能向上と正式な商用課金体系が核心。
二、V4-Pro / V4-Flash 仕様一覧
| 仕様 | V4-Pro | V4-Flash |
|---|---|---|
| 総パラメータ | 1.6 兆(1.6T) | 2840 億(284B) |
| 1 token 活性パラメータ | 490 億(49B) | 130 億(13B) |
| Transformer 層数 | 61 層 | 43 層 |
| コンテキストウィンドウ | 1,000,000 tokens | 1,000,000 tokens |
| 最大出力 | 384K tokens | 384K tokens |
| 精度 | FP4(エキスパート)+ FP8(その他) | FP4 + FP8 混合 |
| 事前学習データ | 33T+ tokens | 32T+ tokens |
| ライセンス | MIT | MIT |
3つの推論モード
| モード | 特徴 | 適用シーン |
|---|---|---|
| Non-think | 思考チェーンなし、最速応答 | 単純 QA、ルーティング |
| Think High | 明示的推論(<redacted_thinking> タグ) | 中程度のコードデバッグ |
| Think Max | 最大推論、384K+ コンテキスト必要 | 複雑数学、長チェーン Agent |
推奨サンプリング:temperature=1.0, top_p=1.0(全モード共通・公式推奨)
三、核心アーキテクチャ:CSA + HCA + mHC + Muon
V2/V3 の MLA(Multi-head Latent Attention)を廃止し、100 万 token コンテキストを実用化する3層革新を採用。
3.1 混合注意力(CSA + HCA)
CSA(Compressed Sparse Attention/圧縮疎注意力)
- Softmax ゲート付きプーリングで KV 列を 4倍圧縮
- FP4 精度「Lightning Indexer」で top-k 疎選択(Pro: top-1024、Flash: top-512)
- 直近 128 token のスライディングウィンドウを並行保持
- 1M コンテキストで V3.2 比 27% の推論 FLOPs のみ
HCA(Heavily Compressed Attention/重度圧縮注意力)
- token を 128倍圧縮しグローバル密集注意力
- CSA が捉えにくい長距離依存を補完
- Flash は先頭2層 HCA、以降 CSA/HCA 交互;Pro も同様構造
総合効果: 1M token 時 KV Cache メモリは V3.2 の 10%(Flash は 7%)。
3.2 mHC(Manifold-Constrained Hyper-Connections)
標準残差 x = x + f(x) を 4チャネル残差ストリームに拡張。Birkhoff 多面体上の双確率行列で 61 層深ネットワークの勾配安定性を確保——より深いネットワーク、より安定した訓練。
3.3 Muon オプティマイザ
AdamW の代わりに Muon を採用。Newton-Schulz 直交化で勾配ステップを条件付けし、大規模訓練の収束速度と安定性を向上。
四、ベンチマーク:オープンウェイトの最高記録
| ベンチマーク | V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% ★ オープン最高 | 96.0% | 未単独公開 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
コスト対性能(Artificial Analysis):
- Claude Fable 5:Strategy & Ops 指数 50 点 / $3.48 per task
- DeepSeek V4-Pro:38 点 / $0.03 per task——Fable 5 の 116 倍安、スコア差約 24%
- V4-Flash:6 類指数すべて $0.04 未満 / task
⚠️ 上記は DeepSeek 自報データ。本番判断は独立 Pilot を推奨。
引用可能技術情報(EEAT)
- SWE-bench Verified 80.6%:Gemini 3.1 Pro と同点のオープンウェイト最高記録
- KV Cache 効率:1M token で V3.2 比 10%(Flash 7%)
- 推論 FLOPs:1M コンテキストで V3.2 比 27%
五、峰谷課金:価格表と節約策
DeepSeek 初の時間帯別課金(電力のピーク/オフピークに類似)。ピーク時間(北京時間):平日 09:00–12:00、14:00–18:00(2倍)。
| モデル | 項目 | オフピーク | ピーク |
|---|---|---|---|
| V4-Pro | 入力(キャッシュ命中) | ¥0.025 / $0.0035 / 1M | 2× |
| 入力(キャッシュ未命中) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 | |
| 出力 | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 | |
| V4-Flash | 入力(キャッシュ命中) | ¥0.02 / $0.0028 / 1M | 2× |
| 入力(キャッシュ未命中) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 | |
| 出力 | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 |
- バッチをオフピークへ:文書処理・コードレビューは 18:00 以降または 09:00 前
- キャッシュ命中を最大化:固定 System Prompt を先頭配置、Flash 命中 $0.0028/M は実質無料
- Flash でルーティング:意図分類は Flash、複雑推論のみ Pro へ——コスト 60–80% 削減可能
- ピークでも V4-Pro 出力 $1.74/M は Claude Opus 4.8($15/M)の 8.6 倍安
六、横断選型:V4-Pro vs GPT-5.6 Sol vs Claude Fable 5
| 次元 | V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| オープンソース | ✅ MIT | ❌ クローズド | ❌ クローズド |
| 自ホスト | ✅ 可能 | ❌ | ❌ |
| コンテキスト | 1M tokens | 未公開 | 1M tokens |
| 最高コーディング | 極強(Fable 5 に次ぐ) | 極強 | ✅ SWE-bench Pro 首位 |
| 出力(オフピーク) | $0.87/M | ~$15/M | ~$50/M |
| データプライバシー | ✅ 私有デプロイ可 | ❌ | ❌ |
- 予算重視 / 高頻度 / 私有デプロイ → V4-Pro または V4-Flash
- 極限コード能力・コスト不問 → Claude Fable 5
- ターミナル Agent / M365 統合 → GPT-5.6 Sol(Terminal-Bench 85.1%)
七、API 移行ガイド(7月24日截止)⚠️
| 旧モデル名 | 新モデル名 | 備考 |
|---|---|---|
deepseek-chat | deepseek-v4-flash(非思考) | 軽量タスク向け |
deepseek-reasoner | deepseek-v4-flash(思考)または deepseek-v4-pro | 推論強化 |
OpenAI SDK(Python)
Anthropic SDK 互換
八、5段階 API 移行 Runbook
ステップ 2 チャット → deepseek-v4-flash、推論 → deepseek-v4-pro にマッピング
ステップ 3 ステージングで temperature=1.0, top_p=1.0 の Pilot 10–20 回
ステップ 4 バッチジョブを北京時間オフピーク(18:00 以降)に cron/launchd 設定
ステップ 5 7月24日前に本番投入し OpenAI/Anthropic SDK 双方で model ID を確認
九、FAQ
Q: 満血版と4月プレビューの違いは?
A: アーキテクチャ同一。GA は性能向上・峰谷課金・本番安定性が主な変更。旧 model 名は 7/24 停止。
Q: 峰谷課金のピーク時間は?
A: 北京時間平日 09:00–12:00・14:00–18:00。2倍料金。オフピークバッチで半減可能。
Q: deepseek-chat からどう移行?
A: Flash(非思考)または Pro に置換。7/24 15:59 UTC までに完了必須。
Q: V4-Pro と GPT-5.6 Sol の選び方?
A: コスト・自ホスト・1M ctx → V4-Pro。Terminal Agent・M365 → GPT-5.6 Sol。
Q: SWE-bench 80.6% は信頼できる?
A: 自報データ。オープンウェイト最高だが Fable 5(96%)には及ばず。Pilot で判断。
Q: Flash と Pro の使い分け?
A: Flash=ルーティング・軽量($0.28/M 出力)、Pro=複雑 Agent・長コード($0.87/M)。
まとめ
DeepSeek V4 GA は Claude Fable 5 や GPT-5.6 を「全面打倒」するモデルではない——クローズド旗艦の 1/10〜1/100 のコストで、オープンウェイト最強性能を提供する点が価値だ。データ出境を避けたい企業、予算重視の独立開発者、1M token Agent エンジニアにとって V4-Pro は現時点で欠点の少ない選択肢。
峰谷課金は複雑さを増すが、オフピーク料金は依然圧倒的に競争力がある。まだ deepseek-chat を使っているなら、7月24日前に移行を完了すること。
自ホストで V4-Pro を ds4 + Mac ローカル推論と組み合わせるチームは、128/512GB 統一メモリと launchd 常駐が必須だ。API だけでは Xcode・Fastlane・notarytool と同機編成できず、個人 Mac のスリープは長ループ Agent を中断する。7×24 無人 Agent + iOS CI + OpenClaw ゲートウェイには、VPSMAC の M4 Mac クラウドノード——ネイティブ macOS、SSH + launchd、API Key と本番コードベースの分離——が Linux VPS や個人デバイスより安定した本番選択肢になる。
参考: DeepSeek 公式 API ドキュメント · arXiv:2606.19348 · HuggingFace · Artificial Analysis
データ截止日期:2026-07-20。 ベンチマークは DeepSeek 自報データ。モデル能力と価格は随時更新されるため、公開時に最新公式ドキュメントを確認してください。