DeepSeek V4 Flash Vision Exp 심층 리뷰: 가격, 제한과 모델 비교
공식 자료로 DeepSeek V4 Flash Vision Exp의 이미지 Token 비용, API 제한, Agent 벤치마크, Gemini 3.7 Flash·Claude Opus 4.8 비교와 Modelflare 현재 가격 및 지원 현황을 검증합니다.
DeepSeek는 2026년 8월 21일 DeepSeek V4 Flash Vision Exp를 공개했습니다. 정확한 API 모델 ID는 deepseek-v4-flash-vision-exp입니다. 텍스트와 이미지를 입력받고 텍스트를 출력하며, Token 단가는 V4 Flash와 같습니다.
핵심은 이미지 과금 방식입니다. DeepSeek는 추론 전에 이미지를 조정하고 장당 최대 384 입력 Token으로 제한합니다. 스크린샷을 반복해서 읽는 Agent에는 매우 저렴합니다. 반대급부도 분명합니다. 큰 이미지는 약 800×800 픽셀 수준의 예산으로 축소되므로, 저렴한 비용이 원본의 고해상도 세부 정보를 보존한다는 뜻은 아닙니다.
이 모델은 실험 버전이며 모든 비전 작업을 즉시 대체하는 production 모델이 아닙니다. 아래에서는 공식 사양, DeepSeek가 공개한 벤치마크, 재현 가능한 비용 계산, Modelflare의 실제 지원 상태를 구분합니다. 변동 정보는 2026년 8월 22일 확인했습니다.
DeepSeek V4 Flash Vision Exp 핵심 사양
| 항목 | 공식 값 |
|---|---|
| 출시일 | 2026년 8월 21일 |
| 상태 | 실험적 API 모델 |
| 모델 ID | deepseek-v4-flash-vision-exp |
| 입출력 | 텍스트·이미지 입력, 텍스트 출력 |
| Context Window | 1M Token |
| 최대 출력 | 384K Token |
| Thinking | thinking과 non-thinking 지원, 문서상 기본값은 thinking |
| 이미지 형식 | JPEG, PNG, GIF, WebP |
| API 형식 | Chat Completions, Responses API, Anthropic 호환 Messages |
| 이미지 상한 | 자동 축소 후 장당 최대 384 입력 Token |
| 동시성 제한 | 2,500 |
| FIM Completion | 미지원 |
DeepSeek는 전체·활성 파라미터 수, Expert 수, 학습 corpus, 아키텍처 변경을 공개하지 않았습니다. 1차 출처가 없는 정밀 수치는 추정일 뿐입니다.
V4 Flash에서 실제로 달라진 점
DeepSeek에 따르면 Vision Exp는 순수 텍스트 Agent, 추론, 세계 지식에서 정식 V4 Flash와 동급입니다. 새로 추가된 것은 native vision입니다. 스크린샷, 문서 이미지, 차트, 사진을 별도 캡션 모델 없이 같은 도구 루프에 직접 넣을 수 있습니다.
공식 출시 자료는 다음 결과를 공개했습니다.
| 평가 | DeepSeek 공개 점수 |
|---|---|
| Terminal Bench 2.1 | 83.9 |
| NL2Repo | 57.7 |
| DeepSWE | 59.3 |
| DSBench-Hard | 63.6 |
| AutomationBench 공개 세트 | 25.7 |
| ApexBench Pass@1 | 36.5 |
| Agents' Last Exam | 27.3 |
| Chartography | 64.3 |
| ZeroBench Pass@5 | 35.0 |
DeepSeek는 멀티모달 Agent 능력이 Claude Opus 4.8에 근접한다고도 설명합니다. 이는 공급자 주장이지 Modelflare의 독립 테스트가 아닙니다. 표에는 텍스트와 비전 의존 과제가 섞여 있으며, 공개 코드 Agent 테스트 조건은 DeepSeek Harness minimal, max effort, top_p=0.95, temperature=1.0입니다. 자체 replay 대상을 고르는 자료로는 유용하지만 보편 순위로 읽어서는 안 됩니다.
공식 가격과 이미지 한 장의 실제 비용
DeepSeek 가격 페이지는 백만 Token당 달러 가격을 제공합니다. 피크 시간은 UTC 01:00–04:00, 06:00–10:00이고 나머지는 오프피크입니다.
| 과금 항목 | 오프피크 | 피크 |
|---|---|---|
| 캐시 입력 | $0.007 | $0.014 |
| 비캐시 입력 | $0.22 | $0.44 |
| 출력 | $0.66 | $1.32 |
| 384 Token 이미지 한 장의 최대 입력비 | $0.00008448 | $0.00016896 |
마지막 행은 384 × 입력 단가 ÷ 1,000,000 계산이며 별도 이미지 요금제가 아닙니다. 작은 이미지는 Token이 더 적을 수 있고, 텍스트 입력과 생성 출력은 별도로 청구됩니다.
자동 크기 조정이 저렴함과 한계를 함께 설명합니다. 약 384×384보다 작은 이미지는 비율을 유지해 확대되고, 큰 이미지는 총 픽셀 수가 약 800×800에 가깝도록 축소됩니다. 따라서 2000×2000과 5000×5000이 같은 384 Token 상한에 도달할 수 있습니다. 비용은 줄지만 작은 글자, 밀집 차트 라벨, 정밀 좌표가 사라질 수 있습니다.
Gemini 3.7 Flash, Claude Opus 4.8과 가격 비교
세 모델은 서로 다른 멀티모달 문제를 풉니다. 아래는 도구, 캐시 저장, 재시도, Gateway 할인을 제외한 공급자 직접 API 표준 가격입니다.
| 모델 | 상태 | 입력 | Context / 최대 출력 | 비캐시 입력 | 출력 | 핵심 절충 |
|---|---|---|---|---|---|---|
| DeepSeek V4 Flash Vision Exp | 실험판 | 텍스트, 이미지 | 1M / 384K | 오프피크 $0.22, 피크 $0.44 | 오프피크 $0.66, 피크 $1.32 | 최저 단가와 장당 384 Token 상한, 강한 축소 |
| Gemini 3.7 Flash | GA | 텍스트, 이미지, 영상, 오디오, PDF | 1M / 64K | 2026-12-31까지 $0.75 | 2026-12-31까지 $3.75 | 더 넓은 modality와 도구, 더 높은 가격과 향후 인상 |
| Claude Opus 4.8 | GA | 텍스트, 이미지, PDF | 1M / 128K | $5.00 | $25.00 | 고해상도 vision과 성숙한 Computer Use, premium 비용 |
이미지 없이 비캐시 입력 100K Token, 출력 10K Token이라면:
- DeepSeek는 오프피크 약 $0.0286, 피크 약 $0.0572입니다.
- Gemini 3.7 Flash는 도입 가격으로 $0.1125입니다.
- Claude Opus 4.8은 $0.75입니다.
이 예에서 DeepSeek는 Gemini보다 피크 약 49%, 오프피크 약 75% 저렴합니다. Claude와는 92~96% 차이입니다. 청구액 비교일 뿐 품질 비교가 아닙니다.
이미지에서는 격차가 커지지만 해상도도 다릅니다. Anthropic 문서상 Opus 4.8의 1000×1000 이미지는 1,296 Visual Token, 약 $0.00648입니다. DeepSeek는 어떤 이미지도 피크 $0.00016896, 오프피크 $0.00008448로 제한해 입력비가 약 38~77분의 1입니다. 다만 DeepSeek는 약 800×800으로 줄이고 Opus는 더 많은 세부를 유지합니다.
1MP 이미지 100장, 텍스트 입력 100K, 출력 10K의 경우 DeepSeek 최대 비용은 오프피크 $0.0370, 피크 $0.0741입니다. Anthropic의 장당 1,296 Token을 적용한 Opus 4.8은 $1.398입니다. 같은 품질 테스트가 아니라 저비용 visual triage와 고해상도 검사가 다른 workload임을 보여주는 계산입니다.
작업별 모델 선택
DeepSeek V4 Flash Vision Exp를 통제된 방식으로 시험할 작업은 많은 스크린샷, 일반 문서, 차트, OCR형 추출, 도구 루프 안의 시각 관찰입니다. 모든 원본 픽셀보다 성공 작업당 비용이 중요할 때 적합합니다.
폭넓은 멀티모달에는 Gemini 3.7 Flash가 맞습니다. 한 흐름에서 이미지·영상·오디오·PDF를 처리하거나 Search Grounding, 코드 실행, File Search, URL Context, preview Computer Use가 필요할 때입니다. Gemini는 GA이고 DeepSeek 비전 endpoint는 실험판입니다.
고해상도 시각 Agent에는 Claude Opus 4.8이 후보입니다. 밀집 문서, 작은 UI, Computer Use, 장시간 브라우저 작업의 가치가 가격을 정당화할 때입니다. Anthropic은 긴 변 2,576px와 최대 4,784 Visual Token을 지원하므로 장당 가격만 비교하면 같은 조건이 아닙니다.
단계별 routing도 가능합니다. 저가 모델이 먼저 분류·추출하고, 모호하거나 세부가 중요한 경우만 고해상도 모델로 올립니다. 두 번째 호출, 지연, 승격률을 측정해야 하며 대부분이 승격된다면 두 모델이 자동으로 더 저렴하지 않습니다.
이미지 입력 방식과 제한
DeepSeek Vision 가이드는 다음을 지원합니다.
- 로컬 파일의 base64 inline;
- 공개 HTTP 또는 HTTPS URL;
- Files API의 재사용 가능한
file_id.
| 경계 | 제한 |
|---|---|
| Inline 요청 본문 | 48 MiB |
| base64 또는 URL 이미지 한 장 | 32 MiB |
| Files API 이미지 한 장 | 64 MiB |
| 요청당 이미지 | 600 |
file_id 없는 총량 |
64 MiB |
file_id 포함 총량 |
200 MiB |
| 최대 변 길이 | 8,192px, 15장 이상이면 4,096px |
| 외부 URL | 8,192자, 60초 안에 다운로드 |
detail: "low"는 512×512로 강제 축소해 저세부 OCR·분류에 적합합니다. high, original, 현재의 auto는 일반 규칙 전 원본을 유지합니다. Chat Completions에서는 user에만 이미지가 가능하고, Responses는 developer와 도구 출력도 허용하지만 system·assistant 이미지는 거부합니다.
Modelflare Responses API 예제
Modelflare가 정확한 모델 ID와 Responses API route를 공개했습니다. deepseek-stable 그룹에 할당된 API Key를 사용하세요.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MODELFLARE_API_KEY"],
base_url="https://modelflare.dev/v1",
)
response = client.responses.create(
model="deepseek-v4-flash-vision-exp",
input=[
{
"role": "user",
"content": [
{
"type": "input_text",
"text": "이 대시보드를 읽고 이상 세 가지와 각각의 시각적 근거를 반환하세요.",
},
{
"type": "input_image",
"image_url": "https://example.com/dashboard.png",
"detail": "low",
},
],
}
],
)
print(response.output_text)
비공개 이미지는 공개 URL 대신 base64나 Files API를 사용합니다. credential, 비공개 object URL, 개인정보를 로그에 남기지 마세요. DeepSeek Responses는 stateless라서 previous_response_id, conversation, store를 지원하지 않습니다. Function Calling과 Web Search는 지원하지만 내장 Computer Use, Code Interpreter, File Search, MCP는 무시합니다.
실험 비전 모델의 production 점검
- 정확한
deepseek-v4-flash-vision-exp를 고정하고deepseek-v4-flash를 비전 alias로 간주하지 않습니다. - 작은 글자, 밀집 표, 차트, 스크린샷, 회전 이미지, 적대적 콘텐츠를 포함한 비식별 세트를 만듭니다.
detail: "low"와 기본값을 성공률, 지연, 청구 Token으로 비교합니다.- 여러 protocol을 쓰면 Chat Completions, Responses, Messages를 각각 검증합니다.
- Structured Output, Tool Call 연결, streaming, 취소, 거부, 손상 이미지를 시험합니다.
- 반복 비공개 이미지는 Files API ID로 참조하고 보관·삭제 절차를 정합니다.
- 이미지 수·크기, 입력·캐시·출력 Token, 재시도, 지연, route, 최종 비용을 기록합니다.
- 실트래픽 기준을 넘을 때까지 세부 의존·핵심 업무에 GA fallback을 유지합니다.
HTTP 200은 요청 하나가 끝났다는 뜻일 뿐, 스크린샷을 정확히 읽었거나 도구가 승인됐거나 성공 작업당 비용이 낮아졌다는 증거가 아닙니다.
Modelflare의 DeepSeek V4 Flash Vision Exp 가격
현재 사용할 수 있습니다. 2026년 8월 22일 후속 production 점검에서 공개 모델 및 가격 카탈로그에 정확한 deepseek-v4-flash-vision-exp가 deepseek-stable 그룹으로 등록됐고, OpenAI 호환 Chat Completions와 Responses API route가 공개됐습니다.
카탈로그는 공식 피크 기준가인 입력 $0.44, 출력 $1.32, 캐시 입력 $0.014 / 백만 Token을 설정하고 deepseek-stable의 0.9x 배율을 적용합니다.
| Modelflare 그룹 | 입력 | 캐시 입력 | 출력 | 384 Token 이미지 한 장의 최대 비캐시 입력비 |
|---|---|---|---|---|
deepseek-stable |
$0.396 / 1M | $0.0126 / 1M | $1.188 / 1M | $0.000152064 |
이 가격에서 비캐시 텍스트 입력 100K Token과 출력 10K Token은 약 $0.05148입니다. 384 Token 상한 이미지 100장, 텍스트 입력 100K, 출력 10K는 최대 약 $0.06669이며 retry나 다른 요청은 제외합니다.
0.9x 그룹 가격을 DeepSeek direct 오프피크 가격으로 보지 마세요. Modelflare는 설정된 기준가에 그룹 배율을 적용하며 공급자 시간대에 따라 자동 전환하지 않습니다. 그룹, route, 가격은 바뀔 수 있으므로 live 가격 페이지와 완료 요청 기록을 기준으로 확인해야 합니다.
결론
DeepSeek V4 Flash Vision Exp는 시각 Agent의 경제성을 바꿉니다. 이미지 장당 최대 384 Token, V4 Flash 단가입니다. 스크린샷 1차 분류, 문서 추출, 차트 해석, 대량 시각 도구 루프에서 실질적인 차이가 날 수 있습니다.
같은 384 Token 상한이 경고이기도 합니다. 축소로 Computer Use와 밀집 문서에 필요한 세부가 사라질 수 있고, endpoint는 실험판이며 benchmark도 공급자 공개 자료입니다. 모든 멀티모달을 대체한다는 증거가 아니라, 저비용 시각 작업자로 평가할 모델입니다.
공식 출처와 업데이트
1차 출처:
- DeepSeek API 변경 로그
- DeepSeek Vision 가이드
- DeepSeek 모델과 가격
- DeepSeek Responses API
- Google: Gemini 3.7 Flash
- Google: Gemini API 가격
- Anthropic: Claude 모델 개요
- Anthropic: Vision Token과 이미지 제한
업데이트:
- 2026년 8월 22일: 최초 게시. 출시 상태, 사양, 이미지 처리, 제한, protocol, 시간대 가격, 경쟁 모델 가격, 비용 계산, Modelflare 카탈로그를 확인했습니다.
- 2026년 8월 22일 후속 업데이트: 정확한 ID의 Modelflare 지원을 반영해
deepseek-stable0.9x 가격, 비용 계산, 지원 route와 Modelflare Responses API 예제를 추가했습니다.