DeepSeek V4 Pro 정식 버전 리뷰: 성능, API 가격과 비용 분석

공식 자료로 검증한 DeepSeek V4 Pro GA 리뷰로 Agent 벤치마크, 1M 컨텍스트, API 호환성, 현재 및 시간대별 가격, 비용 예시와 Modelflare 지원 현황을 다룹니다.

DeepSeek는 2026년 8월 13일 DeepSeek-V4-Pro GA를 정식 출시했습니다. 호스팅 API의 버전 표기는 이제 DeepSeek-V4-Pro-0813이며, 안정 API 모델 ID는 계속 deepseek-v4-pro입니다. 100만 토큰 컨텍스트 창, 최대 384,000개 출력 토큰, 네이티브 Responses API 지원, 출시 직후 시작되는 새로운 가격 체계가 포함됩니다.

결론부터 말하면 V4 Pro는 어려운 코딩, 저장소 규모 작업, 장시간 실행 Agent를 위해 프로덕션에서 평가할 가치가 있습니다. DeepSeek가 공개한 어려운 Agent 벤치마크에서는 V4 Flash보다 일관된 향상을 보이지만, Pro가 모든 요청에 경제적인 기본값은 아닙니다. 새 가격 체계가 시작되면 공식 입력·출력 가격은 Flash의 약 3배이고, 계정 동시 요청 한도는 5분의 1입니다.

이 리뷰는 현재 API 사실, DeepSeek가 공개한 벤치마크 결과, 당사의 분석, 현재 Modelflare 제공 현황을 구분합니다. DeepSeek의 벤치마크 점수를 독립적으로 재현하지는 않았습니다. 변동 가능한 사양과 가격은 2026년 8월 14일 확인했습니다.

DeepSeek V4 Pro 리뷰: 100만 토큰 컨텍스트와 Agent 도구 오케스트레이션

DeepSeek V4 Pro GA 한눈에 보기

항목 현재 공식 정보
GA 출시일 2026년 8월 13일
안정 API 모델 ID deepseek-v4-pro
호스팅 모델 버전 DeepSeek-V4-Pro-0813
컨텍스트 창 1,000,000토큰
최대 출력 384,000토큰
Thinking 모드 지원, 기본 활성화
Reasoning effort GA 발표: low, high, max. 아래 호환성 주의사항 참조
공식 API 형식 Chat Completions, Responses API, Anthropic Messages 호환 API
문서화된 기능 JSON 출력, Tool call, 자동 컨텍스트 캐시, prefix completion, 비Thinking 모드 FIM
공식 계정 동시성 동시 요청 500개

100만 토큰은 용량 상한이지 품질 보장이 아닙니다. 검색 정확도, 지연 시간, 캐시 재사용, 출력 길이, 클라이언트 timeout, 관련 없는 컨텍스트의 양이 긴 요청의 실제 유용성을 여전히 좌우합니다.

V4 프리뷰에서 달라진 점

4월 프리뷰에서는 V4 제품군과 오픈 웨이트 아키텍처가 소개됐습니다. 8월 GA는 호스팅 제품 업데이트로, 실무적으로 세 가지가 달라졌습니다.

  • DeepSeek는 특히 프로덕션형 코딩과 자동화 작업에서 Agent 성능이 크게 향상됐다고 설명합니다.
  • 공식 API가 OpenAI Responses 형식을 네이티브로 지원하며 Codex 지향 호환성을 포함합니다.
  • DeepSeek는 2026년 8월 16일 16:00 UTC부터 적용되는 피크·오프피크 API 가격을 발표했습니다.

안정 요청 모델은 deepseek-v4-pro로 유지되므로 기존 클라이언트가 모델 이름을 마이그레이션할 필요는 없습니다. 가격 페이지에는 현재 호스팅 버전이 DeepSeek-V4-Pro-0813으로 표시됩니다.

다운로드 가능한 프리뷰 checkpoint를 호스팅 GA 버전과 비트 단위로 같다고 자동 가정해서는 안 됩니다. DeepSeek의 공개 V4 모델 카드는 여전히 프리뷰 제품군을 설명하며 checkpoint에 0813 표기를 하지 않습니다. 따라서 자체 호스팅과 공식 API 배포는 별도로 평가해야 합니다.

벤치마크 분석: Pro가 Flash보다 나아진 영역

DeepSeek는 V4 Pro GA에 대해 다음 결과를 공개했습니다. 비교 열은 DeepSeek의 7월 31일 V4 Flash 업데이트 값을 사용하며, 차이는 절대 점수 차이입니다.

벤치마크 V4 Pro GA V4 Flash 0731 Pro 차이
Terminal Bench 2.1 87.9 82.7 +5.2
NL2Repo 61.5 54.2 +7.3
Cybergym 83.3 76.7 +6.6
DeepSWE 62.7 54.4 +8.3
Toolathlon-Verified 74.1 70.3 +3.8
Agents' Last Exam 25.7 25.2 +0.5
AutomationBench (Public) 31.8 25.1 +6.7
DSBench-FullStack 71.1 68.7 +2.4
DSBench-Hard 67.2 59.6 +7.6

DeepSeek는 V4 Pro GA의 HLE 점수도 Tool 없이 42.7, Tool 사용 시 60.0으로 보고했습니다.

하나의 대표 점수보다 전체 패턴이 중요합니다. 가장 큰 절대 향상은 저장소 작업, 어려운 소프트웨어 엔지니어링, 자동화에서 나타납니다. Agents' Last Exam의 차이는 매우 작고 폭넓은 Tool 사용에서는 중간 정도입니다. 이는 라우팅 전략을 뒷받침합니다. 원시 토큰 효율보다 완료 가능성 향상이 더 중요한 작업에 Pro를 배정하고, 대량 분류·요약·트리아지·단순 하위 Agent에는 Flash를 유지하는 방식입니다.

이는 공급자가 발표한 결과이며 Modelflare의 독립 벤치마크가 아닙니다. 하네스, Tool 권한, reasoning effort, 샘플링 설정, 시간 제한, 채점 규칙에 따라 Agent 결과는 크게 달라질 수 있습니다. 프로덕션 결정은 개인정보에 안전한 동일한 작업을 두 모델에서 재생하고, 토큰 수나 벤치마크 순위뿐 아니라 성공한 작업당 비용을 측정해야 합니다.

아키텍처와 1M 컨텍스트 주장

DeepSeek의 공개 V4 모델 카드는 Pro 제품군을 총 1.6조 개 파라미터와 490억 개 활성 파라미터를 가진 Mixture-of-Experts 모델로 설명합니다. Compressed Sparse Attention과 Heavily Compressed Attention을 결합한 하이브리드 Attention, Manifold-Constrained Hyper-Connections, Muon 옵티마이저, 32조 토큰을 넘는 사전 학습도 문서화합니다.

DeepSeek에 따르면 V4 Pro는 1M 토큰 컨텍스트에서 V3.2가 요구하는 단일 토큰 추론 FLOPs의 27%, KV 캐시의 10%를 사용합니다. 이는 모델 게시자의 아키텍처 수준 주장입니다. 100만 토큰 요청이 빠르거나 저렴하거나 모든 위치에서 같은 정확도를 보장한다는 뜻은 아닙니다.

실제 긴 컨텍스트 작업에서는 다음을 지켜야 합니다.

  • prefix 캐시가 작동하도록 안정적인 지침과 재사용 가능한 저장소 자료를 앞부분에 둡니다.
  • 캐시 hit를 가정하지 말고 prompt_cache_hit_tokensprompt_cache_miss_tokens를 추적합니다.
  • 오래된 Tool trace와 중복 파일이 컨텍스트 예산을 소비하기 전에 압축합니다.
  • 애플리케이션이 실제 사용하는 문서 깊이와 토큰 위치에서 검색을 테스트합니다.
  • 입력으로 창 전체를 채우지 말고 추론, Tool 결과, 최종 답변을 위한 공간을 남깁니다.

DeepSeek의 디스크 캐시는 자동이며 best effort 방식입니다. 재사용 가능한 prefix를 일치시키고 구축에 수초가 걸릴 수 있으며, 보통 비활성 상태가 몇 시간에서 며칠 이어지면 삭제됩니다. 반복 요청의 앞부분이 바뀌면 경제적 이점 대부분을 잃을 수 있습니다.

API 호환성: 네이티브가 동일함을 의미하지는 않는다

인터페이스 DeepSeek 공식 지원 중요한 경계
Chat Completions 지원 Thinking Tool 루프에서 reasoning_content를 보존해야 함
Responses API 지원 무상태이며 여러 OpenAI 필드가 무시되거나 미지원
Anthropic 호환 API 지원 일부 필드가 무시되며 이미지·문서 콘텐츠 미지원
FIM completion 베타 비Thinking 모드에서만 베타 endpoint 사용

공식 Responses 계층은 텍스트, function call, 서버 측 웹 검색, Codex 호환용 사용자 정의 Tool apply_patch를 지원합니다. previous_response_id, conversation, 저장된 response, background 모드, service_tier, OpenAI 관리 prompt cache key는 지원하지 않습니다. 지원하지 않는 필드가 알림 없이 무시되는 경우가 많으므로 HTTP 200만으로 의미적 동등성을 입증할 수 없습니다. Responses 클라이언트는 자체 기록을 유지하고 Chat Completions 방식의 [DONE]을 기다리는 대신 이벤트 유형을 검사해야 합니다.

Chat Completions Tool 루프에도 중요한 경계가 있습니다. Thinking 모드와 Tool을 함께 사용하면 Assistant의 reasoning_content를 후속 요청에 다시 전달해야 합니다. DeepSeek 문서는 이 필드가 누락되면 400 오류가 발생한다고 명시합니다. Gateway와 SDK adapter는 한 번의 텍스트 prompt가 아니라 완전한 다중 턴 Tool 루프로 테스트해야 합니다.

GA 발표는 low, high, max reasoning effort를 사용할 수 있다고 설명합니다. 그러나 현재의 상세 Thinking 가이드와 API 참조는 실제 유효값이 highmax이고, lowmediumhigh로, xhighmax로 매핑된다고 적고 있습니다. DeepSeek가 문서를 일치시키거나 라이브 테스트가 별도의 low 동작을 증명하기 전에는 가정한 저노력 비용 절감을 예산에 반영하지 마세요.

DeepSeek 공식 API 가격: 현재와 예정 가격

아래 가격은 모두 100만 토큰당 미국 달러입니다. 현재 고정 가격은 새 체계가 2026년 8월 16일 16:00 UTC, 베이징 시간 8월 17일 00:00에 시작될 때까지 표시됩니다.

가격 기간 캐시 hit 입력 캐시 miss 입력 출력
8월 14일 확인한 현재 가격 $0.003625 $0.435 $0.87
새 오프피크 가격 $0.022 $0.66 $1.98
새 피크 가격 $0.044 $1.32 $3.96

새 체계에서 피크 시간은 01:00–04:00 및 06:00–10:00 UTC입니다. 나머지는 모두 오프피크이며 오프피크 가격은 피크 가격의 절반입니다.

이번 전환은 현재 가격을 시간대별로 단순히 2배 나누는 것이 아닙니다. 현재 고정 요금과 비교하면 새 오프피크 가격은 캐시 입력에서 약 6.07배, 비캐시 입력에서 1.52배, 출력에서 2.28배 높습니다. 피크 가격은 이 새 오프피크 값의 두 배입니다. 캐시 재사용의 가치는 여전하지만, 출시 초기의 이례적으로 낮은 캐시 입력 가격이 가장 크게 바뀝니다.

계산한 비용 예시

토큰만의 비용 공식은 다음과 같습니다.

비용 = cache_hit_tokens × cache_hit_rate + cache_miss_tokens × cache_miss_rate + output_tokens × output_rate

아래 예시는 별도 네트워크, 구독, Tool 서비스, 결제 비용을 제외합니다. Tool을 사용하는 Agent는 여러 번 모델을 호출할 수 있으므로 첫 요청뿐 아니라 작업 전체를 계산하세요.

워크로드 DeepSeek 현재 새 오프피크 새 피크 Modelflare 8월 14일 기준
비캐시 입력 100K + 출력 10K $0.0522 $0.0858 $0.1716 $0.0540
캐시 90K + 비캐시 입력 10K + 출력 10K $0.0134 $0.0284 $0.0568 $0.0138
캐시 900K + 비캐시 입력 100K + 출력 20K $0.0642 $0.1254 $0.2508 $0.0663

두 번째와 세 번째 행은 prompt 구조가 중요한 이유를 보여줍니다. 크고 안정적인 prefix는 비용을 크게 낮출 수 있지만 실제 캐시 hit가 난 뒤에만 가능합니다. 정산의 기준은 API usage 필드입니다.

DeepSeek V4 Pro와 V4 Flash: 가격 대비 성능 선택

현재 공식 요금에서 Pro는 비캐시 입력과 출력은 Flash의 약 3.11배, 캐시 입력은 1.29배입니다. 새 가격이 시작되면 비캐시 입력과 출력은 Flash의 3배, 캐시 입력은 약 3.14배입니다. 공식 계정 동시성은 Pro 500개, Flash 2,500개입니다.

명확한 운영 규칙은 다음과 같습니다.

  • 어려운 저장소 변경, 장기 Agent, 보안 분석, 복잡한 Tool 조정, 한 번의 실패 비용이 큰 작업에는 V4 Pro를 선택합니다.
  • 단순 Agent, 병렬 worker, 전처리, 추출, 요약, 처리량 민감 트래픽에는 V4 Flash를 선택합니다.
  • Pro를 보편적인 기본값으로 삼지 말고 관측된 작업 난이도와 성공 작업당 비용으로 라우팅합니다.
  • 캐시를 사용하는 Pro 워크로드의 경제성이 크게 바뀌므로 가격 전환 뒤 재평가합니다.

Pro가 재시도나 사람의 수정을 줄인다면 토큰 가격이 3배여도 전체 비용은 더 낮을 수 있습니다. 반대로 벤치마크가 5점 높다는 이유만으로 결정적이거나 단순한 작업을 큰 모델에 보낼 수는 없습니다. 완료율, 전체 시간, 재시도 포함 총 토큰, Tool 실패, 검토자 수정 시간을 측정하세요.

Modelflare의 DeepSeek V4 Pro 가격과 제공 현황

Modelflare 라이브 가격 카탈로그를 2026년 8월 14일 확인했습니다. deepseek-stable 그룹에 deepseek-v4-pro와 고정 alias deepseek-v4-pro-0813가 다음 100만 토큰당 기본 가격으로 표시됩니다.

Modelflare 가격 스냅샷 가격
캐시 hit 입력 $0.0037
캐시 miss 입력 $0.45
출력 $0.90

이 스냅샷 요금은 DeepSeek의 현재 캐시 입력 요금보다 약 2.07%, 현재 비캐시 입력·출력 요금보다 3.45% 높습니다. 이 글은 DeepSeek의 피크·오프피크 전환 뒤에도 Modelflare 가격이 유지된다고 약속하지 않습니다. 프로덕션 결정에는 항상 라이브 가격 페이지와 요청 usage 기록을 사용하세요.

현재 공개 카탈로그 metadata는 Modelflare 경로를 OpenAI 호환 Chat Completions로 표시합니다. DeepSeek 자체 endpoint가 Responses와 Anthropic 형식을 지원하더라도 모든 Gateway 경로가 자동으로 호환되는 것은 아닙니다. 라이브 가격 페이지에 표시된 정확한 protocol을 사용하세요.

export MODELFLARE_API_KEY="your-api-key"

curl https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer ${MODELFLARE_API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {"role": "user", "content": "Review this migration plan and identify rollback risks."}
    ],
    "thinking": {"type": "enabled"},
    "reasoning_effort": "high"
  }'

일반 클라이언트 설정은 OpenAI 호환 API 가이드를 참고하세요. 정산과 캐시 토큰 해석은 AI API 비용 추적에서 확인할 수 있습니다.

프로덕션 평가 체크리스트

  1. 경로가 제공한다면 평가 중 deepseek-v4-pro-0813를 고정한 뒤 안정 alias가 변경 관리에 적합한지 결정합니다.
  2. 개인정보에 안전한 고정 작업 세트를 동일한 Tool, 권한, timeout, 중단 규칙으로 Pro와 Flash에서 재생합니다.
  3. highmax를 테스트하고, 현재 API 동작이 다름을 증명할 때까지 lowhigh와 같게 취급합니다.
  4. 다중 턴 Tool 루프를 완료하고 reasoning_content, Tool ID, 인자, 결과가 모든 adapter를 통과하는지 확인합니다.
  5. Responses 클라이언트에서는 지원하지 않는 parameter가 알림 없이 무시될 수 있으므로 필수 필드를 각각 테스트합니다.
  6. 캐시 입력, 비캐시 입력, 출력, reasoning 토큰, 지연 시간, 재시도, 성공 작업당 비용을 기록합니다.
  7. 현실적인 깊이에서 긴 prompt를 테스트하고 짧은 요청으로 100만 토큰 검색 품질을 추론하지 않습니다.
  8. 계정 동시성 한도 아래에서 부하 테스트하고 429 응답을 제한된 backoff로 처리합니다.
  9. 예산 승인 전에 현재 가격과 8월 16일/17일 피크·오프피크 체계를 모두 모델링합니다.
  10. 가용성과 비용 제어를 위해 Flash 또는 대체 모델 fallback을 유지합니다. 신뢰성 높은 AI API 라우팅도 참고하세요.

최종 평가

DeepSeek V4 Pro GA는 단순히 프리뷰 이름을 바꾼 것이 아니라 Agent에 초점을 둔 의미 있는 출시입니다. 공식 점수 패턴은 저장소 추론, 어려운 코딩, 자동화에서 가장 강하고, 새로운 Responses 인터페이스는 현대적인 코딩 Agent에 더 실용적입니다. 1M 컨텍스트와 자동 캐시는 유용하지만 애플리케이션이 안정적인 prefix를 보존하고 실제 캐시 hit를 확인할 때만 그렇습니다.

가장 큰 주의점은 경제성입니다. 출시 후 Pro는 대부분의 토큰 범주에서 Flash의 약 3배이며 동시성도 낮습니다. 모든 prompt의 기본값이 아니라 어렵고 가치가 높은 작업을 위한 상향 계층이어야 합니다. 좋은 프로덕션 구조는 보통 단순 작업을 Flash로 보내고 어렵거나 실패한 작업만 Pro로 승격합니다.

Modelflare의 8월 14일 가격 스냅샷은 DeepSeek의 현재 고정 가격과 가깝고, 현재 V4 Pro는 Chat Completions로 노출됩니다. DeepSeek의 새 가격이 시작되면 라이브 페이지를 다시 확인하세요. 오래된 글이나 캐시된 가격 화면은 청구의 기준이 될 수 없습니다.

출처와 확인일

공식 사양, 가격 체계, Modelflare 제공 현황, 라이브 가격은 2026년 8월 14일 확인했습니다.