DeepSeek V4 풀버전 정식 출시(2026년 7월): 가격·벤치마크·GPT-5.6 비교
2026년 7월 20일, 3개월간의 프리뷰를 거쳐 DeepSeek V4 풀버전(GA 정식판)이 프로덕션 공개되었다. Agent 성능·수학 추론·코드 생성 전면 강화에 더해 DeepSeek 최초의 피크·오프피크 요금이 도입됐다. 본문은 AI 개발자와 모델 선정 의사결정자를 위해 타임라인, V4-Pro/Flash 사양, CSA/HCA/mHC/Muon 아키텍처, 벤치마크 전체 표, 피크·오프피크 가격, GPT-5.6/Claude Fable 5 비교, 7월 24일까지 API 마이그레이션 코드, 5단 Runbook을 완전 해설한다.
목차
과제 정리: GA 출시로 개발자가 지금 대응해야 할 3가지
- 구 API명 강제 중단이 4일 후:
deepseek-chat과deepseek-reasoner는 2026년 7월 24일 15:59 UTC(베이징 23:59)에 영구 중단. 프로덕션 코드의model파라미터 미갱신은 즉시 서비스 중단 위험. - 피크·오프피크 요금으로 청구 예측 복잡화: 베이징 시간 평일 09:00–12:00·14:00–18:00은 2배 요금. 24/7 Agent 파이프라인은 스케줄링 전략 없이는 월 비용이 예상을 초과.
- 「오픈 vs 클로즈드」 재평가 시점: V4-Pro는 SWE-bench Verified 80.6%(오픈웨이트 최고)를 달성하면서 출력 $0.87/M(오프피크)——Claude Fable 5($50/M)의 1/57. 비용과 성능 트레이드오프를 재계산할 기회.
一、타임라인: 프리뷰에서 풀버전까지
| 날짜 | 이벤트 |
|---|---|
| 2026-04-24 | V4 프리뷰 + MIT 오픈소스 공개(V4-Pro 1.6T / V4-Flash 284B) |
| 2026-05 | 프로덕션 튜닝 버전 API 정식 이용 가능 |
| 2026-06 | V4-Pro 출력 가격 75% 영구 인하($0.87/M tokens) |
| 2026-06-29 | 전체 API 사용자에게 GA 출시+피크·오프피크 요금 사전 통지 메일 |
| 2026-07-19 | GA 그레이 내부 테스트 시작, 미디어 「풀버전 내일 공개」 보도 |
| 2026-07-20 | GA 정식판 출시(본문 게시일) |
| 2026-07-24 | deepseek-chat / deepseek-reasoner 영구 중단 |
핵심: 아키텍처는 4월판과 동일 MoE. GA는 Agent·수학·코드 성능 향상과 공식 상용 과금 체계가 핵심.
二、V4-Pro / V4-Flash 사양 일람
| 사양 | V4-Pro | V4-Flash |
|---|---|---|
| 총 파라미터 | 1.6조(1.6T) | 2840억(284B) |
| 1 token 활성 파라미터 | 490억(49B) | 130억(13B) |
| Transformer 층수 | 61층 | 43층 |
| 컨텍스트 윈도우 | 1,000,000 tokens | 1,000,000 tokens |
| 최대 출력 | 384K tokens | 384K tokens |
| 정밀도 | FP4(전문가) + FP8(기타) | FP4 + FP8 혼합 |
| 사전학습 데이터 | 33T+ tokens | 32T+ tokens |
| 라이선스 | MIT | MIT |
3가지 추론 모드
| 모드 | 특징 | 적용 시나리오 |
|---|---|---|
| Non-think | 사고 체인 없음, 최고속 응답 | 단순 QA, 라우팅 |
| Think High | 명시적 추론(<redacted_thinking> 태그) | 중간 복잡도 코드 디버깅 |
| Think Max | 최대 추론, 384K+ 컨텍스트 필요 | 복잡 수학, 장체인 Agent |
권장 샘플링: temperature=1.0, top_p=1.0(전 모드 공통·공식 권장)
三、핵심 아키텍처: CSA + HCA + mHC + Muon
V2/V3 MLA(Multi-head Latent Attention)를 폐기하고 100만 token 컨텍스트를 실용화하는 3층 혁신을 채택.
3.1 혼합 어텐션(CSA + HCA)
CSA(Compressed Sparse Attention/압축 희소 어텐션)
- Softmax 게이트 풀링으로 KV 시퀀스를 4배 압축
- FP4 정밀도 「Lightning Indexer」로 top-k 희소 선택(Pro: top-1024, Flash: top-512)
- 최근 128 token 슬라이딩 윈도우 병행 유지
- 1M 컨텍스트에서 V3.2 대비 27% 추론 FLOPs만 사용
HCA(Heavily Compressed Attention/고도 압축 어텐션)
- token을 128배 압축 후 글로벌 밀집 어텐션
- CSA가 포착하기 어려운 장거리 의존성 보완
- Flash는 앞 2층 HCA, 이후 CSA/HCA 교대; Pro도 유사 구조
종합 효과: 1M token 시 KV Cache 메모리는 V3.2의 10%(Flash 7%).
3.2 mHC(Manifold-Constrained Hyper-Connections)
표준 잔차 x = x + f(x)를 4채널 잔차 스트림으로 확장. Birkhoff 다면체상의 이중확률 행렬로 61층 깊은 네트워크의 그래디언트 안정성 확보——더 깊은 네트워크, 더 안정적인 훈련.
3.3 Muon 옵티마이저
AdamW 대신 Muon 채택. Newton-Schulz 직교화로 그래디언트 스텝을 조건화하여 대규모 훈련 수렴 속도와 안정성 향상.
四、벤치마크: 오픈웨이트 최고 기록
| 벤치마크 | V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% ★ 오픈 최고 | 96.0% | 미단독 공개 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
비용 대 성능(Artificial Analysis):
- Claude Fable 5: Strategy & Ops 지수 50점 / $3.48 per task
- DeepSeek V4-Pro: 38점 / $0.03 per task——Fable 5의 116배 저렴, 점수 차 약 24%
- V4-Flash: 6류 지수 모두 $0.04 미만 / task
⚠️ 상기는 DeepSeek 자체 보고 데이터. 프로덕션 판단은 독립 Pilot 권장.
인용 가능 기술 정보(EEAT)
- SWE-bench Verified 80.6%: Gemini 3.1 Pro와 동점의 오픈웨이트 최고 기록
- KV Cache 효율: 1M token에서 V3.2 대비 10%(Flash 7%)
- 추론 FLOPs: 1M 컨텍스트에서 V3.2 대비 27%
五、피크·오프피크 요금: 가격표와 절약 전략
DeepSeek 최초의 시간대별 과금(전력 피크/오프피크와 유사). 피크 시간(베이징 시간): 평일 09:00–12:00, 14:00–18:00(2배).
| 모델 | 항목 | 오프피크 | 피크 |
|---|---|---|---|
| V4-Pro | 입력(캐시 히트) | ¥0.025 / $0.0035 / 1M | 2× |
| 입력(캐시 미스) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 | |
| 출력 | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 | |
| V4-Flash | 입력(캐시 히트) | ¥0.02 / $0.0028 / 1M | 2× |
| 입력(캐시 미스) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 | |
| 출력 | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 |
- 배치를 오프피크로: 문서 처리·코드 리뷰는 18:00 이후 또는 09:00 이전
- 캐시 히트 극대화: 고정 System Prompt를 앞단 배치, Flash 히트 $0.0028/M는 사실상 무료
- Flash로 라우팅: 의도 분류는 Flash, 복잡 추론만 Pro——비용 60–80% 절감 가능
- 피크에서도 V4-Pro 출력 $1.74/M는 Claude Opus 4.8($15/M)의 8.6배 저렴
六、횡단 선택: V4-Pro vs GPT-5.6 Sol vs Claude Fable 5
| 차원 | V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| 오픈소스 | ✅ MIT | ❌ 클로즈드 | ❌ 클로즈드 |
| 셀프호스팅 | ✅ 가능 | ❌ | ❌ |
| 컨텍스트 | 1M tokens | 미공개 | 1M tokens |
| 최고 코딩 | 극강(Fable 5 다음) | 극강 | ✅ SWE-bench Pro 1위 |
| 출력(오프피크) | $0.87/M | ~$15/M | ~$50/M |
| 데이터 프라이버시 | ✅ 사설 배포 가능 | ❌ | ❌ |
- 예산 우선 / 고빈도 / 사설 배포 → V4-Pro 또는 V4-Flash
- 극한 코드 능력·비용 무관 → Claude Fable 5
- 터미널 Agent / M365 통합 → GPT-5.6 Sol(Terminal-Bench 85.1%)
七、API 마이그레이션 가이드(7월 24일 마감)⚠️
| 구 모델명 | 신 모델명 | 비고 |
|---|---|---|
deepseek-chat | deepseek-v4-flash(비추론) | 경량 태스크 |
deepseek-reasoner | deepseek-v4-flash(추론) 또는 deepseek-v4-pro | 추론 강화 |
OpenAI SDK(Python)
Anthropic SDK 호환
八、5단계 API 마이그레이션 Runbook
단계 2 채팅 → deepseek-v4-flash, 추론 → deepseek-v4-pro 매핑
단계 3 스테이징에서 temperature=1.0, top_p=1.0 Pilot 10–20회
단계 4 배치 작업을 베이징 시간 오프피크(18:00 이후)에 cron/launchd 설정
단계 5 7월 24일 전 프로덕션 배포 후 OpenAI/Anthropic SDK model ID 확인
九、FAQ
Q: 풀버전과 4월 프리뷰의 차이는?
A: 아키텍처 동일. GA는 성능 향상·피크·오프피크 요금·프로덕션 안정성이 주요 변경. 구 model명은 7/24 중단.
Q: 피크·오프피크 요금의 피크 시간은?
A: 베이징 시간 평일 09:00–12:00·14:00–18:00. 2배 요금. 오프피크 배치로 절반 가능.
Q: deepseek-chat에서 어떻게 마이그레이션?
A: Flash(비추론) 또는 Pro로 교체. 7/24 15:59 UTC까지 완료 필수.
Q: V4-Pro와 GPT-5.6 Sol 선택 기준?
A: 비용·셀프호스팅·1M ctx → V4-Pro. Terminal Agent·M365 → GPT-5.6 Sol.
Q: SWE-bench 80.6% 신뢰 가능?
A: 자체 보고. 오픈웨이트 최고이나 Fable 5(96%)에는 미달. Pilot로 판단.
Q: Flash와 Pro 사용 구분?
A: Flash=라우팅·경량($0.28/M 출력), Pro=복잡 Agent·장코드($0.87/M).
결론
DeepSeek V4 GA는 Claude Fable 5나 GPT-5.6을 「전면 격파」하는 모델이 아니다——클로즈드 플래그십의 1/10~1/100 비용으로 오픈웨이트 최강 성능을 제공하는 점이 가치다. 데이터 반출을 피하려는 기업, 예산 제약 독립 개발자, 1M token Agent 엔지니어에게 V4-Pro는 현 시점 약점이 적은 선택.
피크·오프피크 요금은 복잡도를 높이지만 오프피크 요금은 여전히 압도적 경쟁력. 아직 deepseek-chat을 쓰고 있다면 7월 24일 전 마이그레이션을 완료할 것.
셀프호스팅으로 V4-Pro를 ds4 + Mac 로컬 추론과 결합하는 팀은 128/512GB 통합 메모리와 launchd 상주가 필수. API만으로는 Xcode·Fastlane·notarytool 동기 편성 불가, 개인 Mac 절전은 장루프 Agent를 중단한다. 7×24 무인 Agent + iOS CI + OpenClaw 게이트웨이에는 VPSMAC M4 Mac 클라우드 노드——네이티브 macOS, SSH + launchd, API Key와 프로덕션 코드베이스 분리——가 Linux VPS나 개인 기기보다 안정적인 프로덕션 선택.
참고: DeepSeek 공식 API 문서 · arXiv:2606.19348 · HuggingFace · Artificial Analysis
데이터 기준일: 2026-07-20. 벤치마크는 DeepSeek 자체 보고 데이터. 모델 능력과 가격은 수시 갱신되므로 게시 시 최신 공식 문서를 확인하세요.