DeepSeek V4-Flash-0731 공식 벤치마크·가격 해설(2026)
Agent 스택이 여전히 폐쇄형 플래그십 API를 기본으로 한다면, 2026년 7월 31일 DeepSeek V4-Flash 공식 업그레이드는 비용 구조를 바꿉니다: 동일 284B/13B 아키텍처·후학습만 갱신, Agent 벤치에서 더 큰 V4-Pro 프리뷰 초과, Claude Opus 4.8 가격의 수십분의 일. 본문은 API 팀·조달 담당자용 — 전체 타임라인, 가격·경쟁 표, CSA+HCA 아키텍처, Harness 벤치 주의, Artificial Analysis 비교, 「斬殺線」 내러티브, 인용 가능 기술 사실 5개, 5단계 API Runbook, FAQ 5개 — 데이터 기준 2026년 8월 5일.
페인 포인트: V4-Flash-0731이 API 라우팅 재평가를 강요하는 3가지
- 공식판은 API 전용, App·웹 미동기화. 7월 31일 V4-Flash-0731은 API-only 공개 베타. 소비자 앱·웹은 구버전. 「전 플랫폼 전환」으로 오해하면 UX와 API 품질이 분리되고, 비기술 사용자로 동일 모델 검증 불가.
- 점수는 미공개 Harness 의존, DeepSeek도 숫자만 믿지 말라고 경고. Terminal Bench 2.0 82.7점(V4-Pro 프리뷰 67.9 초과)은 전부 아직 공개되지 않은 Harness 미니멀 모드 측정. Claude Code, Cursor 등 독립 재현 전까지 「벤더 자보+특정 프레임워크」로 봐야 함.
- V4-Pro 공식판·Harness 확정일 없음. 중국 매체 8월 10–20일 GA 보도는 익명 출처. changelog 원문은 「가능한 한 빨리」뿐. 플래그십 Pro와 자체 Agent 프레임워크 부재는 고난도 추론·공식 Harness 워크플로 미착수를 의미.
타임라인: 4월 프리뷰에서 7월 「공식판」까지
- 2026년 4월 24일: V4 프리뷰 공개·오픈소스 — V4-Pro(1.6T/49B), V4-Flash(284B/13B), 1M 컨텍스트, MIT.
- 2026년 7월 24일: 구 별칭
deepseek-chat,deepseek-reasoner중단, V4 명명으로 전환. - 2026년 7월 27일: Moonshot AI Kimi K3(2.8T) Hugging Face open weight, DeepSeek에 경쟁 압력.
- 2026년 7월 31일: DeepSeek-V4-Flash-0731 공식 API 베타, 가중치 동기 공개; changelog에서 자체 Agent 프레임워크 Harness 최초 언급. API만.
- 2026년 8월 5일 기준: V4-Pro 공식판 여전히 「가능한 한 빨리」; 8월 10–20일 DeepSeek 미확인.
핵심 데이터: 가격과 사양
| 모델 | 상태 | 총/활성 파라미터 | 컨텍스트 | 입력(캐시 미스/히트, 100만 token) | 출력(100만 token) | 라이선스 |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | 공식(2026-07-31) | 284B / 13B | 1M | $0.14 / $0.0028 | $0.28 | MIT |
| DeepSeek-V4-Pro | 프리뷰(공식 미출시) | 1.6T / 49B | 1M | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | open weight(2026-07-27) | 2.8T / ~104B | ~1.05M | $3.00 / $0.30 | $15.00 | Kimi K3 License |
| GLM-5.2 | 오픈(2026년 6월) | ~744B / ~40B | 1M | 본문 미검증 | 본문 미검증 | MIT |
| Qwen3.8-Max | API GA(가중치 대기) | 2.4T / 95B | 1M | $2.00 / ~$0.17-0.25 | $6.00 | 오픈 가중치 약속 |
DeepSeek은 향후 API 피크 시간(베이징 9–12시, 14–18시) 2배 요금 예고, 시행일 미공표. 21세기경제보도에 따르면 Claude Opus 4.8 대비: 캐시 미스 입력 약 36배, 캐시 히트 179배, 출력 89배 저렴.
심층: 아키텍처 불변, 후학습 강화
동일 284B, 성능은 재학습에서
V4-Flash-0731은 4월 프리뷰와 파라미터 규모·구조 동일. DeepSeek은 성능 향상이 「완전히 재실행한 후학습」에서만 왔다고 명시. 284B/13B Flash가 1.6T/49B V4-Pro 프리뷰를 여러 Agent 벤치에서 초과 — 2026년 하반기 후학습 품질이 단순 스케일에 근접·초과.
CSA+HCA, mHC, Muon
- 하이브리드 어텐션(DSA): CSA + HCA, 장컨텍스트 연산·메모리 절감;
- mHC: 다양체 제약 하이퍼 연결, 잔차 개선;
- Muon 옵티마이저: 수렴 향상. 1M 컨텍스트에서 V4-Pro 단 token FLOPs는 V3.2의 27%, KV Cache 10%(공식).
Harness: 자체 Agent 프레임워크 최초 등장
7월 31일 changelog에서 DeepSeek Harness — Claude Code 대응 Agent 실행 프레임워크. Agent 점수(Terminal Bench 2.0, Toolathlon 등)는 Harness 미니멀 모드(max, top_p=0.95, temperature=1.0) 측정. 공식: 「점수는 harness 선택에 매우 민감」.
횡단 비교: Artificial Analysis와 경쟁사
| 모델 | 랩 | 출시/가중치 | 총 파라미터 | Intelligence Index | 작업당 비용 |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | DeepSeek | 2026-07-31 | 284B | 50 | $0.03 |
| Kimi K3 | Moonshot AI | 07-16 / 07-27 | 2.8T | 57 | $0.86 |
| GLM-5.2 | 智谱/Z.ai | 2026-06 | ~744B | Flash보다 약 1점 높음 | 미검증 |
| Qwen3.8-Max | Alibaba | 2026-08-02 GA | 2.4T | 미검증 | 미검증 |
| GPT-5.6 Sol | OpenAI | 폐쇄 | — | Flash보다 9점+ 높음 | $1.86 |
| Claude Fable 5 | Anthropic | 폐쇄 | — | Flash보다 9점+ 높음 | $3.15 |
Artificial Analysis에서 V4-Flash Intelligence Index는 Kimi K3, GLM-5.2에 뒤지지만 작업당 비용은 Kimi K3의 1/29, GPT-5.6 Sol 1/62, Claude Fable 5 1/105. DeepSeek은 「충분한 지능+극한 가격」— 프리뷰는 OpenRouter 7주 연속 1위 보도.
논점: 좋은 점수≠수분 없음
- Harness 의존: 미공개 프레임워크 측정, Claude Code/Cursor로 직접 이식 불가.
- 가용성: 해외 개발자 입력 캐시 히트율 낮음, 안전 분류기 타임아웃(21세기경제보도).
- 출시일 루머: 8월 10–20일 GA는 익명 출처, 공식 「가능한 한 빨리」가 기준.
- 투자 루머: 약 74억 달러, 487억 달러 밸류에이션 등 재경 매체 「보도」, DeepSeek/규제 미확인.
배경: 「梁白開」에서 「梁聖」, 斬殺線(kill line)
V4-Pro가 7월 중순 풀 출시를 놓치자 중국 포럼은 창업자 梁文锋를 「梁白開」(빈 약속)으로 조롱. V4-Flash-0731이 기대 초과 후 「梁聖」으로 회귀. 「斬殺線」: DeepSeek의 「충분한 성능+극저가」가 경쟁 문턱 — 명확히 앞서지 못하고 더 싸게도 못 하면 시장 존재감 상실. GPT-5.6 Luna 80% 인하 등 밀집 가격 조정 설명. 7월 31일 NVIDIA, Broadcom, AMD 주가 큰 변동 없음 — 시장은 DeepSeek식 효율을 일상화.
인용 가능 기술 사실(EEAT)
- 아키 동일: V4-Flash-0731은 4월 프리뷰와 284B 총 / 13B 활성, 향상 100% 후학습.
- Agent 점수: Terminal Bench 2.0 82.7 vs V4-Pro 프리뷰 67.9(Harness minimal, 벤더 자보).
- 가격 배율: Claude Opus 4.8 대비 — 캐시 미스 입력 36×, 히트 179×, 출력 89×(21세기경제보도).
- 효율: 1M 컨텍스트 V4-Pro FLOPs V3.2의 27%, KV 10%(공식 기술 보고).
- Artificial Analysis: Intelligence Index 50, 작업당 $0.03.
5단계 API 마이그레이션 Runbook
Step 2 매핑 — deepseek-chat → deepseek-v4-flash(Non-think); deepseek-reasoner → deepseek-v4-flash Think High 또는 deepseek-v4-pro
Step 3 설정 — base_url https://api.deepseek.com; 사고 모드 temperature=1.0, top_p=1.0; deepseek-v4-flash가 0731 가리키는지 확인
Step 4 파일럿 — 각 20개 대표 Agent 작업; token, 캐시 히트, 품질, $/작업; Harness 외 프레임워크 비교
Step 5 하이브리드 — 대량 V4-Flash-0731; 어려운 추론 V4-Pro 프리뷰 또는 폐쇄형; 피크 2× 요금 모니터
FAQ
DeepSeek V4와 V3.2의 최대 차이는?
네이티브 100만 token 컨텍스트, 장컨텍스트 FLOPs/KV 대폭 감소; V4 시리즈 Agent 특화, Claude Code, OpenCode 등 적합.
일상 사용은 V4 Flash vs V4 Pro?
대규모 저비용·Agent 파이프라인은 V4-Flash-0731(Agent 점수 이미 V4-Pro 프리뷰 초과). 깊은 세계 지식·복잡 추론·예산 여유는 V4-Pro 프리뷰, 공식판 후 재평가.
V4 Pro 공식판 사용 가능?
2026년 8월 5일 기준 불가. 공식은 V4-Flash-0731만, API 한정. V4-Pro·Harness 「가능한 한 빨리」; 8월 10–20일 미확인 루머.
공표 벤치마크를 믿을 수 있나?
SWE-bench Verified 등 제3자 벤치는 상대적 신뢰. Terminal Bench 2.0 등 Agent 점수는 미공개 Harness — 커뮤니티 독립 재현 대기.
개발자에게 실무적 영향은?
OpenAI/Anthropic 형식 API 코드 변경 불필요 — deepseek-v4-flash가 새 공식판 가리킴. 구명은 7월 24일 중단, 즉시 전환.
출처: DeepSeek API 문서·changelog · V4 기술 보고 · Artificial Analysis(旺得富理财网等) · 21세기경제보도 · Hugging Face 모델 카드
API 전용 배포는 7×24 Agent 루프, Apple 툴체인(Xcode, Fastlane, notarytool), 에어갭 추론의 공존 환경을 충족 못 함. 노트북에서 antirez ds4로 V4-Flash 셀프호스팅(약 160GB 가중치, 128GB+ Apple Silicon)은 절전 중단·API 키/프로덕션 저장소 혼재. Flash 셀프호스팅과 iOS CI 또는 OpenClaw 게이트웨이를 함께 운영하려면 VPSMAC M4 Mac 클라우드 노드 임대 — 네이티브 macOS, SSH + launchd 무인, 128/256/512 GB 메모리 — 가 개인 장비·Linux VPS보다 안정적.
데이터 기준: 2026-08-05. 벤치마크에 벤더 자보·Harness 특정 결과 포함. 가격·V4-Pro/Harness 상태 변경 가능 — 프로덕션 전 최신 공식 문서 확인.