DeepSeek V4 полный релиз (июль 2026): цены, бенчмарки и сравнение с GPT-5.6

20 июля 2026 DeepSeek V4 вышел в General Availability (GA) — через три месяца после preview. Для AI-разработчиков и лиц, принимающих решения о моделях, это означает: улучшенные агенты, впервые пик/внепик цены API, SWE-bench Verified 80,6 % и жёсткий дедлайн миграции 24 июля. В этом руководстве — хронология, архитектура CSA/HCA/mHC, бенчмарки, таблицы цен, миграция кода и матрица выбора против GPT-5.6 и Claude Fable 5.

Абстрактная визуализация большой MoE-модели с длинным контекстом, символизирующая DeepSeek V4 GA

Содержание

Кратко: DeepSeek V4 GA улучшает агентов, математику и код, вводит пик-тарифы в будни и отключает deepseek-chat 24 июля. V4-Pro даёт 80,6 % SWE-bench Verified (рекорд open-weight), контекст 1M с 10 % KV-cache vs V3.2 — output от $0,87/M (внепик).

Болевые точки: почему GA меняет расстановку сил

  1. Legacy API отключится через дни: deepseek-chat и deepseek-reasoner прекращают работу 24 июля 2026, 15:59 UTC. Без миграции — простой production, а не только рост счёта.
  2. Пик-тарифы бьют по 24/7 pipeline: в будни 09:00–12:00 и 14:00–18:00 по Пекину тарифы ×2. Agent-циклы без планирования удваивают счёт, хотя внепик остаётся крайне дешёвым.
  3. Выбор модели без матрицы cost/performance: Claude Fable 5 лидирует SWE-bench Pro (80,3 %), но output ~$50/M; V4-Pro на Strategy & Ops — 38 vs 50 баллов за $0,03 vs $3,48 за задачу (в 116 раз дешевле). Без routing команды сжигают бюджет на closed source.

I. Хронология: от preview к полной версии

ДатаСобытие
24 апр. 2026Preview V4 + open weights (MIT): V4-Pro (1,6T) и V4-Flash (284B)
Май 2026Production-tuned V4-Flash и V4-Pro, API live
Июнь 2026Output V4-Pro −75 % навсегда ($0,87/M) — исторически дешевлее frontier
29 июн. 2026Email всем API-пользователям: GA в середине июля + пик/внепик
19 июл. 2026GA grey tests; СМИ «полная версия завтра»
20 июл. 2026Официальный GA
24 июл. 2026deepseek-chat / deepseek-reasoner offline навсегда
Одной фразой: та же MoE-архитектура, что в апреле — GA добавляет стабильность, оптимизацию агентов и дисциплинированные цены вместо «почти бесплатно».

II. Архитектура: как 1M токенов становится практичным

Семейство моделей

СпецификацияV4-ProV4-Flash
Всего параметров1,6T284B
Активно на token49B (3 %)13B (4,6 %)
Слои Transformer6143
Контекст1 000 000 tokens1 000 000 tokens
Max output384K384K
ТочностьFP4 (experts) + FP8FP4 + FP8
Pretraining33T+ tokens32T+ tokens
ЛицензияMITMIT

① CSA + HCA — гибридное внимание вместо MLA

На 1M контексте: только 27 % FLOPs vs V3.2; KV-cache 10 % (Flash: 7 %).

② mHC — Manifold-Constrained Hyper-Connections

Четыре канала residual stream с doubly stochastic mixing matrix (Birkhoff polytope) — стабильные градиенты через 61 глубокий слой.

③ Оптимизатор Muon

Обучение Muon вместо AdamW: Newton-Schulz orthogonalization → быстрее сходимость на MoE-масштабе.

Три режима reasoning

РежимОсобенностьСценарий
Non-thinkБез CoT, быстроRouting, FAQ, классификация
Think HighЯвное рассуждениеDebug кода, средняя сложность
Think MaxМаксимальная глубинаМатематика, multi-step агенты (384K+)

Рекомендуемый sampling (официально): temperature=1.0, top_p=1.0.

III. Бенчмарки: где V4-Pro побеждает — и где нет

BenchmarkDeepSeek V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80,6 % ★ рекорд open-weight96,0 %н/д~69 %
SWE-bench Pro55,4 %80,3 %78,1 %69,2 %
LiveCodeBench (Pass@1)93,5 %88,1 %87,4 %83,2 %
Codeforces Elo3 206
Terminal-Bench 2.183,9 %88,0 %85,1 %82,7 %

Реальность cost (Artificial Analysis, Strategy & Ops): Fable 5 — 50 баллов, $3,48/задача; V4-Pro — 38 баллов, $0,03/задача (в 116 раз дешевле). V4-Flash — ниже $0,04/задача по всем шести индексам.

⚠️ Часть данных — self-reported; решайте по pilot-задачам.

IV. DeepSeek V4 vs GPT-5.6 vs Claude Fable 5

ИзмерениеDeepSeek V4-ProGPT-5.6 SolClaude Fable 5
Open weights / self-host✅ MIT
Контекст 1Mне подтверждено
Лучший repo-coding (SWE-bench Pro)Второй tierВторой tier✅ Лидер
Алгоритмы / LiveCodeBench✅ ЛидерСилён
Output (внепик)$0,87/M~$15/M~$50/M
Output (пик)$1,74/M
Суверенитет данных✅ Self-host

V. Пик/внепик цены: экономия без потери качества

МодельСтатьяВнепикПик (×2)
V4-ProInput cache hit¥0,025 / $0,0035 / 1M×2
V4-ProInput cache miss¥3,00 / $0,435 / 1M¥6,00 / $0,87
V4-ProOutput¥6,00 / $0,87 / 1M¥12,00 / $1,74
V4-FlashInput cache hit¥0,02 / $0,0028 / 1M×2
V4-FlashInput cache miss¥1,00 / $0,14 / 1M¥2,00 / $0,28
V4-FlashOutput¥2,00 / $0,28 / 1M¥4,00 / $0,56

Пик (Пекин): будни 09:00–12:00 и 14:00–18:00.

Советы по экономии

  1. Batch (docs, code review) после 18:00 или до 09:00.
  2. Кэшировать system prompts — Flash cache hit $0,0028/M.
  3. Flash для routing/intent, Pro для тяжёлого reasoning (типично −60–80 % cost).
  4. DeepSeek уведомляет об изменении тарифов за 24 ч.

Даже в пик: output V4-Pro $1,74/M — в 8,6 раз дешевле Claude Opus 4.8 ($15/M) или GPT-5.6 Sol (~$15/M).

VI. Миграция API — дедлайн 24 июля ⚠️

СтароеНовоеПримечание
deepseek-chatdeepseek-v4-flash (Non-think)Drop-in для chat
deepseek-reasonerdeepseek-v4-flash (Think) или deepseek-v4-proPro для сильнее reasoning

OpenAI SDK (Python)

from openai import OpenAI client = OpenAI( api_key="your_deepseek_api_key", base_url="https://api.deepseek.com" ) # ❌ Старое — мёртво после 24.07 # client.chat.completions.create(model="deepseek-chat", messages=[...]) # ✅ Новое response = client.chat.completions.create( model="deepseek-v4-pro", messages=[{"role": "user", "content": "Проанализируй этот репозиторий..."}] ) # ✅ Think mode (замена deepseek-reasoner) response = client.chat.completions.create( model="deepseek-v4-pro", messages=[{"role": "user", "content": "Пошагово..."}], extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}} )

Anthropic SDK

import anthropic client = anthropic.Anthropic( api_key="your_deepseek_api_key", base_url="https://api.deepseek.com" ) message = client.messages.create( model="deepseek-v4-pro", max_tokens=4096, messages=[{"role": "user", "content": "Что изменилось в V4 GA?"}] )

VII. Матрица выбора

СценарийРекомендацияПричина
Бюджет / высокий API volume / self-hostV4-Pro или V4-Flash$0,87/M output, MIT, 1M контекст
Максимальный repo-codingClaude Fable 580,3 % SWE-bench Pro
Terminal/shell агентыGPT-5.6 SolTerminal-Bench 85,1 %
Массовые docs/logs дёшевоV4-FlashCache hit $0,0028/M input
Алгоритмы / соревновательное программированиеV4-ProLiveCodeBench 93,5 %, Elo 3 206
Compliance / без облакаV4-Pro self-hostMIT, private inference

EEAT — проверяемые факты

VIII. Runbook миграции в 5 шагов

Шаг 1 Сканировать код на deepseek-chat / deepseek-reasoner; изолировать staging keys Шаг 2 Mapping: chat → deepseek-v4-flash; reasoning → deepseek-v4-pro или Flash+thinking Шаг 3 SDK: base_url=https://api.deepseek.com, model=deepseek-v4-pro или deepseek-v4-flash Шаг 4 Внепик: batch после 18:00 Пекин; system prompt cache; routing Flash→Pro Шаг 5 20 pilot-задач до 24.07; логировать quality/tokens/cost; production до дедлайна

IX. Частые вопросы

В: Что нового в GA vs preview?

О: Оптимизация агентов/математики/кода, пик-тарифы, legacy имена отключены 24 июля. Архитектура та же.

В: Как экономить на пик-тарифах?

О: Внепик, cache, Flash как first-pass — раздел V.

В: Нужна ли миграция?

О: Да, до 24.07 15:59 UTC. Замените chat/reasoner на v4-flash или v4-pro.

В: V4-Pro vs GPT-5.6?

О: V4 дешевле и self-hostable; GPT-5.6 сильнее в terminal-агентах. $0,87/M vs ~$15/M.

В: Self-hosting реалистичен?

О: MIT weights доступны; MoE 1,6T требует GPU/NPU — см. гид Mac cloud inference.

В: Режимы reasoning?

О: Non-think, Think High, Think Max — temperature=1.0, top_p=1.0.

Итог

DeepSeek V4 GA — переход от «почти бесплатного preview» к production-ready open-weight платформе с дисциплинированным pricing. Ценность не в мгновенном обгоне Claude Fable 5, а в frontier-уровне за 1/10–1/100 стоимости closed source — с рабочим контекстом 1M и MIT для compliance-команд.

Agent pipeline только на laptop, Linux VPS или смешанных dev-машинах означает прерывания сна, API keys рядом с prod-репозиториями и отсутствие Apple toolchain (Xcode, Fastlane, notarytool) для параллельного iOS CI. Для DeepSeek V4 агентов 7×24 плюс OpenClaw gateway и native macOS builds VPSMAC M4 Mac cloud — SSH, launchd, изолированные keys — стабильнее DIY или API-only без auditable runtime.

Источники: DeepSeek API Docs · arXiv:2606.19348 · HuggingFace · Artificial Analysis · LLMReference

Данные на 20 июля 2026. Бенчмарки частично self-reported; проверяйте официальные docs перед production.