DeepSeek V4-Flash-0731: бенчмарки и цены (2026)

Если ваш Agent-стек по умолчанию использует закрытые flagship API, официальный апгрейд V4-Flash 31 июля 2026 меняет структуру затрат: та же архитектура 284B/13B с новым post-training, Agent-бенчмарки обгоняют больший preview V4-Pro, цены — доля от Claude Opus 4.8. Для API-команд и закупок — таймлайн, таблицы цен и конкурентов, CSA+HCA, оговорки Harness, Artificial Analysis, «kill line», пять технических фактов, 5-шаговый Runbook, пять FAQ — данные на 5 августа 2026.

Схема архитектуры DeepSeek V4: sparse attention и MoE-маршрутизация

Содержание

Болевые точки: почему V4-Flash-0731 заставляет пересмотреть API-роутинг

  1. Официальная версия только API; приложение и веб не обновлены. V4-Flash-0731 от 31 июля — API-only бета. Потребительские поверхности на старых сборках. Ошибочное «всё переключилось» разрывает UX и качество API.
  2. Оценки зависят от неопубликованного Harness; DeepSeek предупреждает. Terminal Bench 2.0 — 82,7 (выше preview V4-Pro 67,9) измерено только в ещё не публичном minimal mode Harness. До воспроизведения Claude Code, Cursor и др. — «vendor + конкретный framework».
  3. Нет даты официального V4-Pro и публичного Harness. Китайские СМИ цитируют GA 10–20 августа без источника; changelog: «как можно скорее». Flagship Pro и Agent-framework отсутствуют для production Harness.

Таймлайн: preview апреля → «официальная» версия июля

Ключевые данные: цены и характеристики

МодельСтатусВсего / активныхКонтекстВвод (cache miss/hit, за 1M токенов)Вывод (за 1M токенов)Лицензия
DeepSeek-V4-Flash-0731Официальная (31.07.2026)284B / 13B1M$0,14 / $0,0028$0,28MIT
DeepSeek-V4-ProPreview (официальная ожидается)1,6T / 49B1M$0,435 / $0,003625$0,87MIT
Kimi K3Open weights (27.07.2026)2,8T / ~104B~1,05M$3,00 / $0,30$15,00Kimi K3 License
GLM-5.2Open (июнь 2026)~744B / ~40B1MНе проверено здесьНе проверено здесьMIT
Qwen3.8-MaxAPI GA (веса ожидаются)2,4T / 95B1M$2,00 / ~$0,17-0,25$6,00Open weights обещаны

DeepSeek анонсировал 2× наценку в часы пик (Пекин 9–12, 14–18), без даты. По 21st Century Business Herald vs Claude Opus 4.8: ввод cache miss ~36×, cache hit 179×, вывод 89× дешевле.

Та же архитектура, сильнее post-training

Та же модель 284B — прирост от переобучения

V4-Flash-0731 идентичен апрельскому preview по размеру и структуре; DeepSeek: весь скачок от post-training. Flash 284B/13B обгоняет preview V4-Pro 1,6T/49B на Agent-бенчмарках.

CSA+HCA, mHC, Muon

Harness: первый собственный Agent-framework

Changelog 31 июля: DeepSeek Harness — ответ Claude Code. Agent-оценки (Terminal Bench 2.0, Toolathlon) в minimal mode Harness (max, top_p=0,95, temperature=1,0). «Оценки крайне чувствительны к harness.»

Сравнение: Artificial Analysis и конкуренты

МодельЛабРелиз / весаВсегоIntelligence IndexСтоимость/задача
DeepSeek-V4-Flash-0731DeepSeek31.07.2026284B50$0,03
Kimi K3Moonshot AI16.07 / 27.072,8T57$0,86
GLM-5.2Zhipu / Z.ai06/2026~744B~на 1 п. выше FlashНе проверено
Qwen3.8-MaxAlibaba02.08.2026 GA2,4TНе провереноНе проверено
GPT-5.6 SolOpenAIClosedна 9+ п. выше Flash$1,86
Claude Fable 5AnthropicClosedна 9+ п. выше Flash$3,15

На Artificial Analysis V4-Flash не лидер по индексу, но стоимость/задача ~1/29 Kimi K3, 1/62 GPT-5.6 Sol, 1/105 Claude Fable 5. DeepSeek: «достаточный интеллект + экстремальная цена» — preview #1 OpenRouter семь недель.

Споры: хорошие цифры ≠ без оговорок

Контекст: «Liang Baikai», «Liang Sheng», kill line

Когда V4-Pro не вышел в середине июля, сообщество назвало Liang Wenfeng «Liang Baikai» (пустое обещание). После V4-Flash-0731 — снова «Liang Sheng». «Kill line» (斩杀线): достаточная производительность + дно цен — кто не обгоняет и не дешевле, теряет relevance. Объясняет GPT-5.6 Luna −80 %. 31 июля без сильного движения Nvidia, Broadcom, AMD.

Цитируемые технические факты (EEAT)

Runbook миграции API в 5 шагов

Шаг 1 Аудит — grep deepseek-chat / deepseek-reasoner; все маршруты Agent
Шаг 2 Маппинг — deepseek-chat → deepseek-v4-flash (Non-think); reasoner → v4-flash Think High или v4-pro
Шаг 3 Настройка — base_url https://api.deepseek.com; thinking temperature=1.0, top_p=1.0; deepseek-v4-flash → build 0731
Шаг 4 Пилот — по 20 Agent-задач; токены, cache, качество, $/задача; вне Harness
Шаг 5 Гибрид — массовый V4-Flash-0731; сложный reasoning Pro preview или closed-source; мониторинг 2× peak

FAQ

Главное отличие DeepSeek V4 от V3.2?

Нативный контекст 1M токенов, резко ниже FLOPs/KV; V4 оптимизирован для Agent (Claude Code, OpenCode).

V4 Flash или V4 Pro на каждый день?

Массовые вызовы и Agent-пайплайны — V4-Flash-0731 (Agent уже обгоняет preview V4-Pro). Глубокий reasoning — preview V4-Pro до официальной версии.

Можно ли использовать официальный V4 Pro?

На 5 августа 2026 — нет. Только V4-Flash-0731, API-only. V4-Pro и Harness «как можно скорее»; 10–20 августа — неподтверждённый слух.

Можно ли доверять опубликованным бенчмаркам?

SWE-bench Verified относительно надёжен. Terminal Bench 2.0 через неопубликованный Harness — ждите независимого воспроизведения.

Практическое влияние на разработчиков?

Без изменения кода OpenAI/Anthropic — deepseek-v4-flash указывает на 0731. Старые имена отключены 24 июля.

Источники: документация API DeepSeek · технический отчёт V4 · Artificial Analysis · 21st Century Business Herald · Hugging Face

Только API не покрывает Agent-циклы 7×24, Apple toolchain (Xcode, Fastlane, notarytool) и air-gapped inference в co-located среде. Self-host V4-Flash через antirez ds4 на ноутбуке (~160 GB весов, 128 GB+ Apple Silicon) — прерывания сна и смешение ключей с prod-репо. Для Flash self-host + iOS CI или OpenClaw: аренда облачных Mac VPSMAC M4 — native macOS, SSH + launchd, 128/256/512 GB — стабильнее личного железа или Linux VPS.

Данные на 05.08.2026. Бенчмарки включают vendor и Harness-результаты. Цены и статус V4-Pro/Harness могут измениться — проверьте официальную документацию перед production.