DeepSeek V4-Flash-0731: бенчмарки и цены (2026)
Если ваш Agent-стек по умолчанию использует закрытые flagship API, официальный апгрейд V4-Flash 31 июля 2026 меняет структуру затрат: та же архитектура 284B/13B с новым post-training, Agent-бенчмарки обгоняют больший preview V4-Pro, цены — доля от Claude Opus 4.8. Для API-команд и закупок — таймлайн, таблицы цен и конкурентов, CSA+HCA, оговорки Harness, Artificial Analysis, «kill line», пять технических фактов, 5-шаговый Runbook, пять FAQ — данные на 5 августа 2026.
Содержание
Болевые точки: почему V4-Flash-0731 заставляет пересмотреть API-роутинг
- Официальная версия только API; приложение и веб не обновлены. V4-Flash-0731 от 31 июля — API-only бета. Потребительские поверхности на старых сборках. Ошибочное «всё переключилось» разрывает UX и качество API.
- Оценки зависят от неопубликованного Harness; DeepSeek предупреждает. Terminal Bench 2.0 — 82,7 (выше preview V4-Pro 67,9) измерено только в ещё не публичном minimal mode Harness. До воспроизведения Claude Code, Cursor и др. — «vendor + конкретный framework».
- Нет даты официального V4-Pro и публичного Harness. Китайские СМИ цитируют GA 10–20 августа без источника; changelog: «как можно скорее». Flagship Pro и Agent-framework отсутствуют для production Harness.
Таймлайн: preview апреля → «официальная» версия июля
- 24 апреля 2026: preview V4 open-weight — V4-Pro (1,6T/49B), V4-Flash (284B/13B), контекст 1M, MIT.
- 24 июля 2026: алиасы
deepseek-chatиdeepseek-reasonerотключены; именование V4. - 27 июля 2026: Moonshot AI open weights Kimi K3 (2,8T) на Hugging Face.
- 31 июля 2026: DeepSeek-V4-Flash-0731 официальная API-бета; веса синхронизированы; changelog называет Harness. Только API.
- На 5 августа 2026: V4-Pro официально «как можно скорее»; 10–20 августа DeepSeek не подтвердил.
Ключевые данные: цены и характеристики
| Модель | Статус | Всего / активных | Контекст | Ввод (cache miss/hit, за 1M токенов) | Вывод (за 1M токенов) | Лицензия |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | Официальная (31.07.2026) | 284B / 13B | 1M | $0,14 / $0,0028 | $0,28 | MIT |
| DeepSeek-V4-Pro | Preview (официальная ожидается) | 1,6T / 49B | 1M | $0,435 / $0,003625 | $0,87 | MIT |
| Kimi K3 | Open weights (27.07.2026) | 2,8T / ~104B | ~1,05M | $3,00 / $0,30 | $15,00 | Kimi K3 License |
| GLM-5.2 | Open (июнь 2026) | ~744B / ~40B | 1M | Не проверено здесь | Не проверено здесь | MIT |
| Qwen3.8-Max | API GA (веса ожидаются) | 2,4T / 95B | 1M | $2,00 / ~$0,17-0,25 | $6,00 | Open weights обещаны |
DeepSeek анонсировал 2× наценку в часы пик (Пекин 9–12, 14–18), без даты. По 21st Century Business Herald vs Claude Opus 4.8: ввод cache miss ~36×, cache hit 179×, вывод 89× дешевле.
Та же архитектура, сильнее post-training
Та же модель 284B — прирост от переобучения
V4-Flash-0731 идентичен апрельскому preview по размеру и структуре; DeepSeek: весь скачок от post-training. Flash 284B/13B обгоняет preview V4-Pro 1,6T/49B на Agent-бенчмарках.
CSA+HCA, mHC, Muon
- Гибридное внимание (DSA): CSA + HCA;
- mHC: manifold-constrained hyper-connections;
- Оптимизатор Muon: при 1M токенов V4-Pro 27% FLOPs и 10% KV от V3.2 (официально).
Harness: первый собственный Agent-framework
Changelog 31 июля: DeepSeek Harness — ответ Claude Code. Agent-оценки (Terminal Bench 2.0, Toolathlon) в minimal mode Harness (max, top_p=0,95, temperature=1,0). «Оценки крайне чувствительны к harness.»
Сравнение: Artificial Analysis и конкуренты
| Модель | Лаб | Релиз / веса | Всего | Intelligence Index | Стоимость/задача |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | DeepSeek | 31.07.2026 | 284B | 50 | $0,03 |
| Kimi K3 | Moonshot AI | 16.07 / 27.07 | 2,8T | 57 | $0,86 |
| GLM-5.2 | Zhipu / Z.ai | 06/2026 | ~744B | ~на 1 п. выше Flash | Не проверено |
| Qwen3.8-Max | Alibaba | 02.08.2026 GA | 2,4T | Не проверено | Не проверено |
| GPT-5.6 Sol | OpenAI | Closed | — | на 9+ п. выше Flash | $1,86 |
| Claude Fable 5 | Anthropic | Closed | — | на 9+ п. выше Flash | $3,15 |
На Artificial Analysis V4-Flash не лидер по индексу, но стоимость/задача ~1/29 Kimi K3, 1/62 GPT-5.6 Sol, 1/105 Claude Fable 5. DeepSeek: «достаточный интеллект + экстремальная цена» — preview #1 OpenRouter семь недель.
Споры: хорошие цифры ≠ без оговорок
- Зависимость от Harness: неопубликованный framework.
- Usability: низкий cache hit, таймауты safety-classifier (21st Century Business Herald).
- Слухи о дате: 10–20 августа не подтверждено.
- Слухи о финансировании: ~$7,4 млрд, ~$48,7 млрд оценка — СМИ «по сообщениям», не верифицировано.
Контекст: «Liang Baikai», «Liang Sheng», kill line
Когда V4-Pro не вышел в середине июля, сообщество назвало Liang Wenfeng «Liang Baikai» (пустое обещание). После V4-Flash-0731 — снова «Liang Sheng». «Kill line» (斩杀线): достаточная производительность + дно цен — кто не обгоняет и не дешевле, теряет relevance. Объясняет GPT-5.6 Luna −80 %. 31 июля без сильного движения Nvidia, Broadcom, AMD.
Цитируемые технические факты (EEAT)
- Архитектура та же: 284B / 13B активных, 100% post-training.
- Agent-оценки: Terminal Bench 2.0 82,7 vs preview 67,9 (Harness minimal, vendor).
- Множители цены: vs Opus 4.8 miss 36×, hit 179×, вывод 89×.
- Эффективность: 1M FLOPs 27%, KV 10% от V3.2.
- Artificial Analysis: index 50, $0,03/задача.
Runbook миграции API в 5 шагов
Шаг 2 Маппинг — deepseek-chat → deepseek-v4-flash (Non-think); reasoner → v4-flash Think High или v4-pro
Шаг 3 Настройка — base_url https://api.deepseek.com; thinking temperature=1.0, top_p=1.0; deepseek-v4-flash → build 0731
Шаг 4 Пилот — по 20 Agent-задач; токены, cache, качество, $/задача; вне Harness
Шаг 5 Гибрид — массовый V4-Flash-0731; сложный reasoning Pro preview или closed-source; мониторинг 2× peak
FAQ
Главное отличие DeepSeek V4 от V3.2?
Нативный контекст 1M токенов, резко ниже FLOPs/KV; V4 оптимизирован для Agent (Claude Code, OpenCode).
V4 Flash или V4 Pro на каждый день?
Массовые вызовы и Agent-пайплайны — V4-Flash-0731 (Agent уже обгоняет preview V4-Pro). Глубокий reasoning — preview V4-Pro до официальной версии.
Можно ли использовать официальный V4 Pro?
На 5 августа 2026 — нет. Только V4-Flash-0731, API-only. V4-Pro и Harness «как можно скорее»; 10–20 августа — неподтверждённый слух.
Можно ли доверять опубликованным бенчмаркам?
SWE-bench Verified относительно надёжен. Terminal Bench 2.0 через неопубликованный Harness — ждите независимого воспроизведения.
Практическое влияние на разработчиков?
Без изменения кода OpenAI/Anthropic — deepseek-v4-flash указывает на 0731. Старые имена отключены 24 июля.
Источники: документация API DeepSeek · технический отчёт V4 · Artificial Analysis · 21st Century Business Herald · Hugging Face
Только API не покрывает Agent-циклы 7×24, Apple toolchain (Xcode, Fastlane, notarytool) и air-gapped inference в co-located среде. Self-host V4-Flash через antirez ds4 на ноутбуке (~160 GB весов, 128 GB+ Apple Silicon) — прерывания сна и смешение ключей с prod-репо. Для Flash self-host + iOS CI или OpenClaw: аренда облачных Mac VPSMAC M4 — native macOS, SSH + launchd, 128/256/512 GB — стабильнее личного железа или Linux VPS.
Данные на 05.08.2026. Бенчмарки включают vendor и Harness-результаты. Цены и статус V4-Pro/Harness могут измениться — проверьте официальную документацию перед production.