DeepSeek V4 풀버전 정식 출시(2026년 7월): 가격·벤치마크·GPT-5.6 비교

2026년 7월 20일, 3개월간의 프리뷰를 거쳐 DeepSeek V4 풀버전(GA 정식판)이 프로덕션 공개되었다. Agent 성능·수학 추론·코드 생성 전면 강화에 더해 DeepSeek 최초의 피크·오프피크 요금이 도입됐다. 본문은 AI 개발자와 모델 선정 의사결정자를 위해 타임라인, V4-Pro/Flash 사양, CSA/HCA/mHC/Muon 아키텍처, 벤치마크 전체 표, 피크·오프피크 가격, GPT-5.6/Claude Fable 5 비교, 7월 24일까지 API 마이그레이션 코드, 5단 Runbook을 완전 해설한다.

DeepSeek V4 풀버전 GA 출시를 상징하는 추상 신경망 시각화. MoE 아키텍처와 100만 토큰 컨텍스트를 표현

목차

과제 정리: GA 출시로 개발자가 지금 대응해야 할 3가지

  1. 구 API명 강제 중단이 4일 후: deepseek-chatdeepseek-reasoner2026년 7월 24일 15:59 UTC(베이징 23:59)에 영구 중단. 프로덕션 코드의 model 파라미터 미갱신은 즉시 서비스 중단 위험.
  2. 피크·오프피크 요금으로 청구 예측 복잡화: 베이징 시간 평일 09:00–12:00·14:00–18:00은 2배 요금. 24/7 Agent 파이프라인은 스케줄링 전략 없이는 월 비용이 예상을 초과.
  3. 「오픈 vs 클로즈드」 재평가 시점: V4-Pro는 SWE-bench Verified 80.6%(오픈웨이트 최고)를 달성하면서 출력 $0.87/M(오프피크)——Claude Fable 5($50/M)의 1/57. 비용과 성능 트레이드오프를 재계산할 기회.

一、타임라인: 프리뷰에서 풀버전까지

날짜이벤트
2026-04-24V4 프리뷰 + MIT 오픈소스 공개(V4-Pro 1.6T / V4-Flash 284B)
2026-05프로덕션 튜닝 버전 API 정식 이용 가능
2026-06V4-Pro 출력 가격 75% 영구 인하($0.87/M tokens)
2026-06-29전체 API 사용자에게 GA 출시+피크·오프피크 요금 사전 통지 메일
2026-07-19GA 그레이 내부 테스트 시작, 미디어 「풀버전 내일 공개」 보도
2026-07-20GA 정식판 출시(본문 게시일)
2026-07-24deepseek-chat / deepseek-reasoner 영구 중단
핵심: 아키텍처는 4월판과 동일 MoE. GA는 Agent·수학·코드 성능 향상과 공식 상용 과금 체계가 핵심.

二、V4-Pro / V4-Flash 사양 일람

사양V4-ProV4-Flash
총 파라미터1.6조(1.6T)2840억(284B)
1 token 활성 파라미터490억(49B)130억(13B)
Transformer 층수61층43층
컨텍스트 윈도우1,000,000 tokens1,000,000 tokens
최대 출력384K tokens384K tokens
정밀도FP4(전문가) + FP8(기타)FP4 + FP8 혼합
사전학습 데이터33T+ tokens32T+ tokens
라이선스MITMIT

3가지 추론 모드

모드특징적용 시나리오
Non-think사고 체인 없음, 최고속 응답단순 QA, 라우팅
Think High명시적 추론(<redacted_thinking> 태그)중간 복잡도 코드 디버깅
Think Max최대 추론, 384K+ 컨텍스트 필요복잡 수학, 장체인 Agent

권장 샘플링: temperature=1.0, top_p=1.0(전 모드 공통·공식 권장)

三、핵심 아키텍처: CSA + HCA + mHC + Muon

V2/V3 MLA(Multi-head Latent Attention)를 폐기하고 100만 token 컨텍스트를 실용화하는 3층 혁신을 채택.

3.1 혼합 어텐션(CSA + HCA)

CSA(Compressed Sparse Attention/압축 희소 어텐션)

HCA(Heavily Compressed Attention/고도 압축 어텐션)

종합 효과: 1M token 시 KV Cache 메모리는 V3.2의 10%(Flash 7%).

3.2 mHC(Manifold-Constrained Hyper-Connections)

표준 잔차 x = x + f(x)4채널 잔차 스트림으로 확장. Birkhoff 다면체상의 이중확률 행렬로 61층 깊은 네트워크의 그래디언트 안정성 확보——더 깊은 네트워크, 더 안정적인 훈련.

3.3 Muon 옵티마이저

AdamW 대신 Muon 채택. Newton-Schulz 직교화로 그래디언트 스텝을 조건화하여 대규모 훈련 수렴 속도와 안정성 향상.

四、벤치마크: 오픈웨이트 최고 기록

벤치마크V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80.6% ★ 오픈 최고96.0%미단독 공개~69%
SWE-bench Pro55.4%80.3%78.1%69.2%
LiveCodeBench (Pass@1)93.5%88.1%87.4%83.2%
Codeforces Elo3,206
Terminal-Bench 2.183.9%88.0%85.1%82.7%

비용 대 성능(Artificial Analysis):

⚠️ 상기는 DeepSeek 자체 보고 데이터. 프로덕션 판단은 독립 Pilot 권장.

인용 가능 기술 정보(EEAT)

五、피크·오프피크 요금: 가격표와 절약 전략

DeepSeek 최초의 시간대별 과금(전력 피크/오프피크와 유사). 피크 시간(베이징 시간): 평일 09:00–12:00, 14:00–18:00(2배).

모델항목오프피크피크
V4-Pro입력(캐시 히트)¥0.025 / $0.0035 / 1M
입력(캐시 미스)¥3.00 / $0.435 / 1M¥6.00 / $0.87
출력¥6.00 / $0.87 / 1M¥12.00 / $1.74
V4-Flash입력(캐시 히트)¥0.02 / $0.0028 / 1M
입력(캐시 미스)¥1.00 / $0.14 / 1M¥2.00 / $0.28
출력¥2.00 / $0.28 / 1M¥4.00 / $0.56

六、횡단 선택: V4-Pro vs GPT-5.6 Sol vs Claude Fable 5

차원V4-ProGPT-5.6 SolClaude Fable 5
오픈소스✅ MIT❌ 클로즈드❌ 클로즈드
셀프호스팅✅ 가능
컨텍스트1M tokens미공개1M tokens
최고 코딩극강(Fable 5 다음)극강✅ SWE-bench Pro 1위
출력(오프피크)$0.87/M~$15/M~$50/M
데이터 프라이버시✅ 사설 배포 가능

七、API 마이그레이션 가이드(7월 24일 마감)⚠️

구 모델명신 모델명비고
deepseek-chatdeepseek-v4-flash(비추론)경량 태스크
deepseek-reasonerdeepseek-v4-flash(추론) 또는 deepseek-v4-pro추론 강화

OpenAI SDK(Python)

from openai import OpenAI client = OpenAI( api_key="your_deepseek_api_key", base_url="https://api.deepseek.com/v1" ) # ❌ 구写法(7월 24일 후 만료) # client.chat.completions.create(model="deepseek-chat", messages=[...]) # ✅ 신写法 response = client.chat.completions.create( model="deepseek-v4-pro", # 또는 deepseek-v4-flash messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}], extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}} )

Anthropic SDK 호환

import anthropic client = anthropic.Anthropic( api_key="your-deepseek-api-key", base_url="https://api.deepseek.com" ) message = client.messages.create( model="deepseek-v4-pro", max_tokens=4096, messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}] )

八、5단계 API 마이그레이션 Runbook

단계 1 grep -r "deepseek-chat\|deepseek-reasoner"로 전체 참조 감사
단계 2 채팅 → deepseek-v4-flash, 추론 → deepseek-v4-pro 매핑
단계 3 스테이징에서 temperature=1.0, top_p=1.0 Pilot 10–20회
단계 4 배치 작업을 베이징 시간 오프피크(18:00 이후)에 cron/launchd 설정
단계 5 7월 24일 전 프로덕션 배포 후 OpenAI/Anthropic SDK model ID 확인

九、FAQ

Q: 풀버전과 4월 프리뷰의 차이는?

A: 아키텍처 동일. GA는 성능 향상·피크·오프피크 요금·프로덕션 안정성이 주요 변경. 구 model명은 7/24 중단.

Q: 피크·오프피크 요금의 피크 시간은?

A: 베이징 시간 평일 09:00–12:00·14:00–18:00. 2배 요금. 오프피크 배치로 절반 가능.

Q: deepseek-chat에서 어떻게 마이그레이션?

A: Flash(비추론) 또는 Pro로 교체. 7/24 15:59 UTC까지 완료 필수.

Q: V4-Pro와 GPT-5.6 Sol 선택 기준?

A: 비용·셀프호스팅·1M ctx → V4-Pro. Terminal Agent·M365 → GPT-5.6 Sol.

Q: SWE-bench 80.6% 신뢰 가능?

A: 자체 보고. 오픈웨이트 최고이나 Fable 5(96%)에는 미달. Pilot로 판단.

Q: Flash와 Pro 사용 구분?

A: Flash=라우팅·경량($0.28/M 출력), Pro=복잡 Agent·장코드($0.87/M).

결론

DeepSeek V4 GA는 Claude Fable 5나 GPT-5.6을 「전면 격파」하는 모델이 아니다——클로즈드 플래그십의 1/10~1/100 비용으로 오픈웨이트 최강 성능을 제공하는 점이 가치다. 데이터 반출을 피하려는 기업, 예산 제약 독립 개발자, 1M token Agent 엔지니어에게 V4-Pro는 현 시점 약점이 적은 선택.

피크·오프피크 요금은 복잡도를 높이지만 오프피크 요금은 여전히 압도적 경쟁력. 아직 deepseek-chat을 쓰고 있다면 7월 24일 전 마이그레이션을 완료할 것.

셀프호스팅으로 V4-Pro를 ds4 + Mac 로컬 추론과 결합하는 팀은 128/512GB 통합 메모리와 launchd 상주가 필수. API만으로는 Xcode·Fastlane·notarytool 동기 편성 불가, 개인 Mac 절전은 장루프 Agent를 중단한다. 7×24 무인 Agent + iOS CI + OpenClaw 게이트웨이에는 VPSMAC M4 Mac 클라우드 노드——네이티브 macOS, SSH + launchd, API Key와 프로덕션 코드베이스 분리——가 Linux VPS나 개인 기기보다 안정적인 프로덕션 선택.

참고: DeepSeek 공식 API 문서 · arXiv:2606.19348 · HuggingFace · Artificial Analysis

데이터 기준일: 2026-07-20. 벤치마크는 DeepSeek 자체 보고 데이터. 모델 능력과 가격은 수시 갱신되므로 게시 시 최신 공식 문서를 확인하세요.