DeepSeek V4 полный релиз (июль 2026): цены, бенчмарки и сравнение с GPT-5.6
20 июля 2026 DeepSeek V4 вышел в General Availability (GA) — через три месяца после preview. Для AI-разработчиков и лиц, принимающих решения о моделях, это означает: улучшенные агенты, впервые пик/внепик цены API, SWE-bench Verified 80,6 % и жёсткий дедлайн миграции 24 июля. В этом руководстве — хронология, архитектура CSA/HCA/mHC, бенчмарки, таблицы цен, миграция кода и матрица выбора против GPT-5.6 и Claude Fable 5.
Содержание
deepseek-chat 24 июля. V4-Pro даёт 80,6 % SWE-bench Verified (рекорд open-weight), контекст 1M с 10 % KV-cache vs V3.2 — output от $0,87/M (внепик).Болевые точки: почему GA меняет расстановку сил
- Legacy API отключится через дни:
deepseek-chatиdeepseek-reasonerпрекращают работу 24 июля 2026, 15:59 UTC. Без миграции — простой production, а не только рост счёта. - Пик-тарифы бьют по 24/7 pipeline: в будни 09:00–12:00 и 14:00–18:00 по Пекину тарифы ×2. Agent-циклы без планирования удваивают счёт, хотя внепик остаётся крайне дешёвым.
- Выбор модели без матрицы cost/performance: Claude Fable 5 лидирует SWE-bench Pro (80,3 %), но output ~$50/M; V4-Pro на Strategy & Ops — 38 vs 50 баллов за $0,03 vs $3,48 за задачу (в 116 раз дешевле). Без routing команды сжигают бюджет на closed source.
I. Хронология: от preview к полной версии
| Дата | Событие |
|---|---|
| 24 апр. 2026 | Preview V4 + open weights (MIT): V4-Pro (1,6T) и V4-Flash (284B) |
| Май 2026 | Production-tuned V4-Flash и V4-Pro, API live |
| Июнь 2026 | Output V4-Pro −75 % навсегда ($0,87/M) — исторически дешевлее frontier |
| 29 июн. 2026 | Email всем API-пользователям: GA в середине июля + пик/внепик |
| 19 июл. 2026 | GA grey tests; СМИ «полная версия завтра» |
| 20 июл. 2026 | Официальный GA |
| 24 июл. 2026 | deepseek-chat / deepseek-reasoner offline навсегда |
Одной фразой: та же MoE-архитектура, что в апреле — GA добавляет стабильность, оптимизацию агентов и дисциплинированные цены вместо «почти бесплатно».
II. Архитектура: как 1M токенов становится практичным
Семейство моделей
| Спецификация | V4-Pro | V4-Flash |
|---|---|---|
| Всего параметров | 1,6T | 284B |
| Активно на token | 49B (3 %) | 13B (4,6 %) |
| Слои Transformer | 61 | 43 |
| Контекст | 1 000 000 tokens | 1 000 000 tokens |
| Max output | 384K | 384K |
| Точность | FP4 (experts) + FP8 | FP4 + FP8 |
| Pretraining | 33T+ tokens | 32T+ tokens |
| Лицензия | MIT | MIT |
① CSA + HCA — гибридное внимание вместо MLA
- CSA (Compressed Sparse Attention): KV сжатие 4× через Softmax-gating; FP4 «Lightning Indexer» top-1024 (Pro) / top-512 (Flash); sliding window 128 tokens.
- HCA (Heavily Compressed Attention): сжатие 128×, затем global dense attention; у Flash первые 2 слоя HCA, далее чередование CSA/HCA.
На 1M контексте: только 27 % FLOPs vs V3.2; KV-cache 10 % (Flash: 7 %).
② mHC — Manifold-Constrained Hyper-Connections
Четыре канала residual stream с doubly stochastic mixing matrix (Birkhoff polytope) — стабильные градиенты через 61 глубокий слой.
③ Оптимизатор Muon
Обучение Muon вместо AdamW: Newton-Schulz orthogonalization → быстрее сходимость на MoE-масштабе.
Три режима reasoning
| Режим | Особенность | Сценарий |
|---|---|---|
| Non-think | Без CoT, быстро | Routing, FAQ, классификация |
| Think High | Явное рассуждение | Debug кода, средняя сложность |
| Think Max | Максимальная глубина | Математика, multi-step агенты (384K+) |
Рекомендуемый sampling (официально): temperature=1.0, top_p=1.0.
III. Бенчмарки: где V4-Pro побеждает — и где нет
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % ★ рекорд open-weight | 96,0 % | н/д | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3 206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
Реальность cost (Artificial Analysis, Strategy & Ops): Fable 5 — 50 баллов, $3,48/задача; V4-Pro — 38 баллов, $0,03/задача (в 116 раз дешевле). V4-Flash — ниже $0,04/задача по всем шести индексам.
⚠️ Часть данных — self-reported; решайте по pilot-задачам.
IV. DeepSeek V4 vs GPT-5.6 vs Claude Fable 5
| Измерение | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open weights / self-host | ✅ MIT | ❌ | ❌ |
| Контекст 1M | ✅ | не подтверждено | ✅ |
| Лучший repo-coding (SWE-bench Pro) | Второй tier | Второй tier | ✅ Лидер |
| Алгоритмы / LiveCodeBench | ✅ Лидер | Силён | — |
| Output (внепик) | $0,87/M | ~$15/M | ~$50/M |
| Output (пик) | $1,74/M | — | — |
| Суверенитет данных | ✅ Self-host | ❌ | ❌ |
V. Пик/внепик цены: экономия без потери качества
| Модель | Статья | Внепик | Пик (×2) |
|---|---|---|---|
| V4-Pro | Input cache hit | ¥0,025 / $0,0035 / 1M | ×2 |
| V4-Pro | Input cache miss | ¥3,00 / $0,435 / 1M | ¥6,00 / $0,87 |
| V4-Pro | Output | ¥6,00 / $0,87 / 1M | ¥12,00 / $1,74 |
| V4-Flash | Input cache hit | ¥0,02 / $0,0028 / 1M | ×2 |
| V4-Flash | Input cache miss | ¥1,00 / $0,14 / 1M | ¥2,00 / $0,28 |
| V4-Flash | Output | ¥2,00 / $0,28 / 1M | ¥4,00 / $0,56 |
Пик (Пекин): будни 09:00–12:00 и 14:00–18:00.
Советы по экономии
- Batch (docs, code review) после 18:00 или до 09:00.
- Кэшировать system prompts — Flash cache hit $0,0028/M.
- Flash для routing/intent, Pro для тяжёлого reasoning (типично −60–80 % cost).
- DeepSeek уведомляет об изменении тарифов за 24 ч.
Даже в пик: output V4-Pro $1,74/M — в 8,6 раз дешевле Claude Opus 4.8 ($15/M) или GPT-5.6 Sol (~$15/M).
VI. Миграция API — дедлайн 24 июля ⚠️
| Старое | Новое | Примечание |
|---|---|---|
deepseek-chat | deepseek-v4-flash (Non-think) | Drop-in для chat |
deepseek-reasoner | deepseek-v4-flash (Think) или deepseek-v4-pro | Pro для сильнее reasoning |
OpenAI SDK (Python)
Anthropic SDK
VII. Матрица выбора
| Сценарий | Рекомендация | Причина |
|---|---|---|
| Бюджет / высокий API volume / self-host | V4-Pro или V4-Flash | $0,87/M output, MIT, 1M контекст |
| Максимальный repo-coding | Claude Fable 5 | 80,3 % SWE-bench Pro |
| Terminal/shell агенты | GPT-5.6 Sol | Terminal-Bench 85,1 % |
| Массовые docs/logs дёшево | V4-Flash | Cache hit $0,0028/M input |
| Алгоритмы / соревновательное программирование | V4-Pro | LiveCodeBench 93,5 %, Elo 3 206 |
| Compliance / без облака | V4-Pro self-host | MIT, private inference |
EEAT — проверяемые факты
- MoE scale: 1,6T total, 49B active — 3 % sparsity на token.
- KV efficiency: 1M контекст с 10 % KV-памяти vs V3.2 (Flash: 7 %).
- Open-weight coding: SWE-bench Verified 80,6 %, лучший open-weight вместе с Gemini 3.1 Pro.
- Cost lever: Strategy & Ops $0,03 vs $3,48 за задачу (×116).
- Peak surcharge: ×2 в будни; внепик ниже любого closed-source flagship.
VIII. Runbook миграции в 5 шагов
IX. Частые вопросы
В: Что нового в GA vs preview?
О: Оптимизация агентов/математики/кода, пик-тарифы, legacy имена отключены 24 июля. Архитектура та же.
В: Как экономить на пик-тарифах?
О: Внепик, cache, Flash как first-pass — раздел V.
В: Нужна ли миграция?
О: Да, до 24.07 15:59 UTC. Замените chat/reasoner на v4-flash или v4-pro.
В: V4-Pro vs GPT-5.6?
О: V4 дешевле и self-hostable; GPT-5.6 сильнее в terminal-агентах. $0,87/M vs ~$15/M.
В: Self-hosting реалистичен?
О: MIT weights доступны; MoE 1,6T требует GPU/NPU — см. гид Mac cloud inference.
В: Режимы reasoning?
О: Non-think, Think High, Think Max — temperature=1.0, top_p=1.0.
Итог
DeepSeek V4 GA — переход от «почти бесплатного preview» к production-ready open-weight платформе с дисциплинированным pricing. Ценность не в мгновенном обгоне Claude Fable 5, а в frontier-уровне за 1/10–1/100 стоимости closed source — с рабочим контекстом 1M и MIT для compliance-команд.
Agent pipeline только на laptop, Linux VPS или смешанных dev-машинах означает прерывания сна, API keys рядом с prod-репозиториями и отсутствие Apple toolchain (Xcode, Fastlane, notarytool) для параллельного iOS CI. Для DeepSeek V4 агентов 7×24 плюс OpenClaw gateway и native macOS builds VPSMAC M4 Mac cloud — SSH, launchd, изолированные keys — стабильнее DIY или API-only без auditable runtime.
Источники: DeepSeek API Docs · arXiv:2606.19348 · HuggingFace · Artificial Analysis · LLMReference
Данные на 20 июля 2026. Бенчмарки частично self-reported; проверяйте официальные docs перед production.