DeepSeek V4 満血版正式リリース(2026年7月):価格・ベンチマーク・GPT-5.6比較

2026年7月20日、3ヶ月のプレビューを経て DeepSeek V4 満血版(GA 正式版)が本番公開された。Agent 性能・数学推論・コード生成の全面強化に加え、DeepSeek 初の峰谷課金が導入された。本稿は AI 開発者とモデル選定担当者向けに、タイムライン、V4-Pro/Flash 仕様、CSA/HCA/mHC/Muon アーキテクチャ、ベンチマーク全表、峰谷価格、GPT-5.6/Claude Fable 5 比較、7月24日までの API 移行コード、5段 Runbookを網羅する。

DeepSeek V4 満血版 GA リリースを象徴する抽象的神経ネットワーク可視化。MoE アーキテクチャと 100 万 token コンテキストを表現

目次

課題整理:GA リリースで開発者が今すぐ対応すべき3点

  1. 旧 API 名の強制停止が4日後deepseek-chatdeepseek-reasoner2026年7月24日 15:59 UTC(北京 23:59)に永久停止。本番コードの model パラメータ未更新は即サービス中断リスク。
  2. 峰谷課金で請求予測が複雑化:北京時間平日 09:00–12:00・14:00–18:00 は2倍料金。24/7 Agent パイプラインはスケジューリング戦略なしでは月次コストが想定外に跳ねる。
  3. 「オープン vs クローズド」の再評価タイミング:V4-Pro は SWE-bench Verified 80.6%(オープンウェイト最高)を達成しつつ、出力 $0.87/M(オフピーク)——Claude Fable 5($50/M)の 1/57。コストと性能のトレードオフを再計算する好機。

一、タイムライン:プレビューから満血版へ

日付イベント
2026-04-24V4 プレビュー + MIT オープンソース公開(V4-Pro 1.6T / V4-Flash 284B)
2026-05本番調整版 API 正式利用可能
2026-06V4-Pro 出力価格 75% 永久値下げ($0.87/M tokens)
2026-06-29全 API ユーザーへ GA リリース+峰谷課金事前通知メール
2026-07-19GA グレー内測開始、メディアが「満血版明日公開」と報道
2026-07-20GA 正式版リリース(本稿公開日)
2026-07-24deepseek-chat / deepseek-reasoner 永久停止
要点: アーキテクチャは4月版と同一 MoE。GA は Agent・数学・コードの性能向上と正式な商用課金体系が核心。

二、V4-Pro / V4-Flash 仕様一覧

仕様V4-ProV4-Flash
総パラメータ1.6 兆(1.6T)2840 億(284B)
1 token 活性パラメータ490 億(49B)130 億(13B)
Transformer 層数61 層43 層
コンテキストウィンドウ1,000,000 tokens1,000,000 tokens
最大出力384K tokens384K tokens
精度FP4(エキスパート)+ FP8(その他)FP4 + FP8 混合
事前学習データ33T+ tokens32T+ tokens
ライセンスMITMIT

3つの推論モード

モード特徴適用シーン
Non-think思考チェーンなし、最速応答単純 QA、ルーティング
Think High明示的推論(<redacted_thinking> タグ)中程度のコードデバッグ
Think Max最大推論、384K+ コンテキスト必要複雑数学、長チェーン Agent

推奨サンプリング:temperature=1.0, top_p=1.0(全モード共通・公式推奨)

三、核心アーキテクチャ:CSA + HCA + mHC + Muon

V2/V3 の MLA(Multi-head Latent Attention)を廃止し、100 万 token コンテキストを実用化する3層革新を採用。

3.1 混合注意力(CSA + HCA)

CSA(Compressed Sparse Attention/圧縮疎注意力)

HCA(Heavily Compressed Attention/重度圧縮注意力)

総合効果: 1M token 時 KV Cache メモリは V3.2 の 10%(Flash は 7%)。

3.2 mHC(Manifold-Constrained Hyper-Connections)

標準残差 x = x + f(x)4チャネル残差ストリームに拡張。Birkhoff 多面体上の双確率行列で 61 層深ネットワークの勾配安定性を確保——より深いネットワーク、より安定した訓練

3.3 Muon オプティマイザ

AdamW の代わりに Muon を採用。Newton-Schulz 直交化で勾配ステップを条件付けし、大規模訓練の収束速度と安定性を向上。

四、ベンチマーク:オープンウェイトの最高記録

ベンチマークV4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80.6% ★ オープン最高96.0%未単独公開~69%
SWE-bench Pro55.4%80.3%78.1%69.2%
LiveCodeBench (Pass@1)93.5%88.1%87.4%83.2%
Codeforces Elo3,206
Terminal-Bench 2.183.9%88.0%85.1%82.7%

コスト対性能(Artificial Analysis):

⚠️ 上記は DeepSeek 自報データ。本番判断は独立 Pilot を推奨。

引用可能技術情報(EEAT)

五、峰谷課金:価格表と節約策

DeepSeek 初の時間帯別課金(電力のピーク/オフピークに類似)。ピーク時間(北京時間):平日 09:00–12:00、14:00–18:00(2倍)。

モデル項目オフピークピーク
V4-Pro入力(キャッシュ命中)¥0.025 / $0.0035 / 1M
入力(キャッシュ未命中)¥3.00 / $0.435 / 1M¥6.00 / $0.87
出力¥6.00 / $0.87 / 1M¥12.00 / $1.74
V4-Flash入力(キャッシュ命中)¥0.02 / $0.0028 / 1M
入力(キャッシュ未命中)¥1.00 / $0.14 / 1M¥2.00 / $0.28
出力¥2.00 / $0.28 / 1M¥4.00 / $0.56

六、横断選型:V4-Pro vs GPT-5.6 Sol vs Claude Fable 5

次元V4-ProGPT-5.6 SolClaude Fable 5
オープンソース✅ MIT❌ クローズド❌ クローズド
自ホスト✅ 可能
コンテキスト1M tokens未公開1M tokens
最高コーディング極強(Fable 5 に次ぐ)極強✅ SWE-bench Pro 首位
出力(オフピーク)$0.87/M~$15/M~$50/M
データプライバシー✅ 私有デプロイ可

七、API 移行ガイド(7月24日截止)⚠️

旧モデル名新モデル名備考
deepseek-chatdeepseek-v4-flash(非思考)軽量タスク向け
deepseek-reasonerdeepseek-v4-flash(思考)または deepseek-v4-pro推論強化

OpenAI SDK(Python)

from openai import OpenAI client = OpenAI( api_key="your_deepseek_api_key", base_url="https://api.deepseek.com/v1" ) # ❌ 旧写法(7月24日後失効) # client.chat.completions.create(model="deepseek-chat", messages=[...]) # ✅ 新写法 response = client.chat.completions.create( model="deepseek-v4-pro", # または deepseek-v4-flash messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}], extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}} )

Anthropic SDK 互換

import anthropic client = anthropic.Anthropic( api_key="your-deepseek-api-key", base_url="https://api.deepseek.com" ) message = client.messages.create( model="deepseek-v4-pro", max_tokens=4096, messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}] )

八、5段階 API 移行 Runbook

ステップ 1 grep -r "deepseek-chat\|deepseek-reasoner" で全参照を監査
ステップ 2 チャット → deepseek-v4-flash、推論 → deepseek-v4-pro にマッピング
ステップ 3 ステージングで temperature=1.0, top_p=1.0 の Pilot 10–20 回
ステップ 4 バッチジョブを北京時間オフピーク(18:00 以降)に cron/launchd 設定
ステップ 5 7月24日前に本番投入し OpenAI/Anthropic SDK 双方で model ID を確認

九、FAQ

Q: 満血版と4月プレビューの違いは?

A: アーキテクチャ同一。GA は性能向上・峰谷課金・本番安定性が主な変更。旧 model 名は 7/24 停止。

Q: 峰谷課金のピーク時間は?

A: 北京時間平日 09:00–12:00・14:00–18:00。2倍料金。オフピークバッチで半減可能。

Q: deepseek-chat からどう移行?

A: Flash(非思考)または Pro に置換。7/24 15:59 UTC までに完了必須。

Q: V4-Pro と GPT-5.6 Sol の選び方?

A: コスト・自ホスト・1M ctx → V4-Pro。Terminal Agent・M365 → GPT-5.6 Sol。

Q: SWE-bench 80.6% は信頼できる?

A: 自報データ。オープンウェイト最高だが Fable 5(96%)には及ばず。Pilot で判断。

Q: Flash と Pro の使い分け?

A: Flash=ルーティング・軽量($0.28/M 出力)、Pro=複雑 Agent・長コード($0.87/M)。

まとめ

DeepSeek V4 GA は Claude Fable 5 や GPT-5.6 を「全面打倒」するモデルではない——クローズド旗艦の 1/10〜1/100 のコストで、オープンウェイト最強性能を提供する点が価値だ。データ出境を避けたい企業、予算重視の独立開発者、1M token Agent エンジニアにとって V4-Pro は現時点で欠点の少ない選択肢。

峰谷課金は複雑さを増すが、オフピーク料金は依然圧倒的に競争力がある。まだ deepseek-chat を使っているなら、7月24日前に移行を完了すること。

自ホストで V4-Pro を ds4 + Mac ローカル推論と組み合わせるチームは、128/512GB 統一メモリと launchd 常駐が必須だ。API だけでは Xcode・Fastlane・notarytool と同機編成できず、個人 Mac のスリープは長ループ Agent を中断する。7×24 無人 Agent + iOS CI + OpenClaw ゲートウェイには、VPSMAC の M4 Mac クラウドノード——ネイティブ macOS、SSH + launchd、API Key と本番コードベースの分離——が Linux VPS や個人デバイスより安定した本番選択肢になる。

参考: DeepSeek 公式 API ドキュメント · arXiv:2606.19348 · HuggingFace · Artificial Analysis

データ截止日期:2026-07-20。 ベンチマークは DeepSeek 自報データ。モデル能力と価格は随時更新されるため、公開時に最新公式ドキュメントを確認してください。