DeepSeek V4.1 Flash 심층 분석: 아키텍처, Modelflare 가격, 경쟁 모델
출처에 기댄 DeepSeek V4.1 Flash 분석입니다. 아키텍처, 1M 컨텍스트, 384K 출력, Agent 벤치마크, API 한도, OpenAI 및 Anthropic과의 비교, 현재 Modelflare 제공과 가격을 다룹니다.

DeepSeek V4.1 Flash는 긴 Agent 루프를 위해 만든 저비용 오픈 웨이트 멀티모달 모델입니다. 2026년 9월 10일에 나왔고, 100만 토큰 컨텍스트 창, 최대 384K 출력 토큰, 이례적으로 싼 공식 API, 그리고 prompt 처리와 KV 캐시 압력을 줄이는 아키텍처를 한데 묶습니다. 가장 분명한 장점은 모든 벤치마크에서 이긴다는 점이 아닙니다. 코딩, 터미널, 자동화, 도구 사용 평가에서 경쟁력을 유지하면서, 달러당 시도할 수 있는 긴 컨텍스트 Agent 작업의 양입니다.
이 결론에는 경계가 필요합니다. 아래 벤치마크 숫자는 DeepSeek가 발표한 것이고, Modelflare가 독립적으로 재현한 것이 아닙니다. DeepSeek 자신의 보고서는, 가장 어려운 추론과 경계 사례에서 이 모델이 여전히 가장 큰 폐쇄형 시스템에 뒤진다고 합니다. 올바른 제1자 API 모델 ID는 **deepseek-flash**입니다. DeepSeek V4.1 Flash는 지금 Modelflare에 버전 모델 ID **deepseek-v4.1-flash-0910**로 올라 있고, 공개 deepseek-stable 그룹에서 Chat Completions와 Responses를 모두 씁니다.
마지막 확인: 2026-09-10 UTC. 가격, 별칭, 카탈로그 상태는 바뀔 수 있습니다.
직접적인 답: DeepSeek V4.1 Flash는 무엇인가
DeepSeek 발표 공지는 DeepSeek V4.1 Flash를 이전 Flash 제품군의 프로덕션 대체로 정의합니다. 공식 엔드포인트는 deepseek-flash를 받습니다. 레거시 이름 deepseek-v4-flash와 deepseek-v4-flash-vision-exp는 DeepSeek가 일시적으로 받아들이고, Flash 요금으로 V4.1 Flash에 라우팅합니다. 2026년 9월 14일 04:00 UTC부터, DeepSeek는 deepseek-v4-pro 요청도 이후의 V4.1 Pro 발표까지 V4.1 Flash로 라우팅한다고 합니다.
이 마이그레이션 정책은 DeepSeek 자신의 API에 속합니다. Modelflare는 발표일이 찍힌 명시적 ID deepseek-v4.1-flash-0910를 쓰고, 이전 deepseek-v4-flash 항목의 이름을 조용히 바꾸지 않습니다. Modelflare 운영자가 출시를 확인했고, 모델은 2026-09-10 15:21 UTC에 공개 가격 카탈로그와 origin 가격 카탈로그 양쪽에 나타났습니다. 클라이언트는 제1자 별칭이 모든 게이트웨이에서 그대로 작동한다고 가정하지 말고, 자기 제공자가 보여 주는 정확한 ID를 써야 합니다.
이 모델의 실제 정체성은 다섯 부분입니다. 이미지와 텍스트의 멀티모달 입력, 텍스트 출력, 552B 파라미터 MoE 백본, 추가 196B 파라미터 Engram 메모리, 그리고 prompt 토큰당 8B 대 디코드된 토큰당 16B의 비대칭 활성화입니다. 마지막 점이 중심입니다. 입력이 무거운 Agent 작업은, 비슷한 규모의 대칭 디코더 전용 설계보다 반복 프리필에서 계산을 더 적게 써야 합니다.
한눈에 보는 사양
다음 값은 공식 발표, 모델 카드, 기술 보고서에서 옵니다. “백본 파라미터”와 “Engram 파라미터”는 서로 다른 저장소를 설명합니다. 어느 숫자도 토큰당 활성 계산과 같지 않습니다.
| 항목 | DeepSeek V4.1 Flash |
|---|---|
| 공식 API ID | deepseek-flash |
| Modelflare 모델 ID | deepseek-v4.1-flash-0910 |
| 모델 종류 | 멀티모달 혼합 전문가 Transformer |
| 입력 / 출력 | 텍스트와 이미지가 들어가고, 텍스트가 나옵니다 |
| Transformer 배치 | 40층: 20층 인과 인코더 + 20층 디코더 |
| 파라미터 저장 | 552B 백본 + 196B Engram 조건부 메모리 |
| 활성 파라미터 | 프리필 토큰당 8B, 디코드 토큰당 16B |
| 컨텍스트 / 최대 출력 | 1M / 384K 토큰 |
| 사전학습 | 45T 멀티모달 코퍼스 토큰, 텍스트 전용 대 멀티모달 토큰 비율 7:1 |
| 주요 어텐션/캐시 설계 | CED + CSA2 + FP4 전역 KV, FP8 로컬 SWA KV |
| 전역 KV 크기 | DeepSeek가 보고한 토큰당 890바이트 |
| 공개 추론 프리셋 | 내부 effort 눈금에서 low = 50, high = 75, max = 100 |
| 공식 API 동시성 한도 | 동시 요청 2,500개 |
| 라이선스 | MIT 체크포인트 라이선스 |
384K 출력 상한은, 이 글에서 비교하는 현재 OpenAI와 Anthropic 모델에 공개된 128K 최대의 세 배입니다. 한도이지 권장이 아닙니다. 아주 긴 출력은 지연, 비용, 그리고 흔들릴 표면을 늘립니다. 긴 Agent에서는, 도구 호출 뒤에도 요구를 유지하고 실제 인수 검사를 통과할 수 있는지가 더 쓸모 있는 질문입니다.
이 아키텍처가 긴 Agent 루프를 위해 만들어진 이유
도구를 쓰는 Agent는 관찰, 명령 결과, 수정을 기록에 거듭 더합니다. 새 턴마다 prompt 프리필, 자라는 컨텍스트 위의 어텐션, KV 저장, 새 출력이 필요할 수 있습니다. DeepSeek V4.1 Flash는 더 작은 모델 하나에 기대지 않고, 각 비용을 따로 공략합니다.
| Agent 비용 | V4.1 Flash 메커니즘 | 의도한 효과 |
|---|---|---|
| 긴 prompt를 다시 처리 | Causal Encoder-Decoder (CED) | DeepSeek 분석에서 긴 시퀀스의 점근 프리필 작업을 거의 반으로 줄입니다 |
| 전역 기록을 HBM에 유지 | CSA2 층 사이 재사용 + FP4 | 중복된 전역 KV 항목과 항목당 바이트를 줄입니다 |
| 로컬 어텐션 상태를 지속 | SWA Bounded Replay | 모든 층의 전체 로컬 캐시를 저장하는 대신, 한계가 있는 로컬 창을 재구성합니다 |
| 안정된 토큰 패턴을 회상 | Engram | 조건부 n-gram 메모리를 드물게 접근하는 표로 옮깁니다 |
| 토큰 생성 | DSpark 추측 디코딩 | 후보 위치를 여러 개 초안 내고, 확신과 시스템 부하에 따라 검증 길이를 고릅니다 |
| 이미지 처리 | DeepSeek-ViT + 프로젝터 | 시각 입력을, 사전학습부터 텍스트와 함께 처리되는 임베딩으로 바꿉니다 |
이 메커니즘은 주로 서빙 경제와 처리량을 개선합니다. 그것만으로 추론이 더 낫다는 증명은 되지 않습니다. 모델의 품질은 데이터, 사후학습, Agent 하네스, 그리고 추론 effort를 얼마나 사는지에도 달립니다.
CED: 캐시를 건드리기 전에 prompt 처리를 줄입니다
기술 보고서는 40개 Transformer 층을 20층 인과 인코더와 20층 디코더로 나눕니다. 처음 두 층은 128토큰 슬라이딩 윈도만 씁니다. 나머지 층은 로컬 슬라이딩 윈도 어텐션과 압축된 전역 컨텍스트를 결합합니다.
전역 어텐션에서 디코더는 모든 층마다 독립된 전체 KV 기록을 만들지 않습니다. 전역 키와 값은 인코더 최종 은닉 상태에서 투영됩니다. 로컬 슬라이딩 윈도 상태는 층마다 남습니다. DeepSeek는 긴 시퀀스 프리필 복잡도를, 대응하는 전층 경로의 약 절반으로 추정합니다. 지배항은 모든 토큰을 모든 L 층으로 처리하는 것에서, 전역 컨텍스트를 대략 L/2로 처리하는 것에 한계가 있는 로컬 윈도 작업을 더한 것으로 바뀝니다.
그것이 8B/16B 활성화 분할을 설명합니다. prompt 토큰은 프리필 동안 약 8B 백본 파라미터를 활성화합니다. 새로 생성된 토큰은 디코드 동안 약 16B를 활성화합니다. 거대한 문서와 짧은 답이 있는 작업이, 수십만 개의 생성 토큰이 지배하는 작업보다 더 이득을 봅니다. CED는 그 청구서의 앞쪽 절반을 줄입니다. 디코딩을 무료로 만들지는 않습니다.
CSA2, FP4, SWA Bounded Replay: 메모리 이야기
Compressed Sparse Attention 2는 캐시를 시퀀스, 층, 정밀도 차원을 따라 압축합니다. 각 CSA2 층은 세 모드 중 하나에 정적으로 배정됩니다. Full은 주 KV, indexer 키, 새로운 Top-K 위치를 계산합니다. Reindex는 주 KV와 indexer 키를 재사용하지만, 자기 쿼리로 다시 훑습니다. Reuse는 공유 KV와 이전의 희소 선택을 둘 다 재사용합니다. 모든 층은 여전히 자기 쿼리와 로컬 슬라이딩 윈도 KV를 갖습니다.
디코더의 첫 Full 층은 Top-512 항목을 고르고 후보 풀을 만듭니다. 이후 Reindex 층은 그 줄어든 풀에서 자기 Top-512 위치를 고릅니다. 주 전역 KV는 16채널마다 E4M3 스케일이 있는, 대략 4비트 E2M1 표현을 씁니다. DeepSeek는 양자화에 더 민감한 로컬 SWA 캐시에 FP8을 유지합니다.
| 캐시 층 | 정밀도 / 수명 | 보고된 결과 | 보장하지 않는 것 |
|---|---|---|---|
| 런타임 전역 KV | FP4, HBM에 상주 | 890바이트/토큰, V4 Flash의 약 1/4, V1보다 437× 작음 | 모든 경계 사례에서 완벽한 희소 선택 |
| 런타임 로컬 SWA KV | FP8 | 128토큰의 층 로컬 윈도를 보존 | 임의의 동시성에서 무시할 만한 메모리 |
| 지속 전역 KV | DeepSeek 배포 설계의 호스트 메모리 또는 SSD | 오래 재사용할 수 있는 전역 상태 | 공개 API의 고정된 보존 기간 |
| 지속 로컬 SWA 상태 | Bounded Replay로 재구성 | 같은 시퀀스 길이에서 V4 Flash 총 지속 캐시 발자국의 약 1/8 | 버려진 모든 로컬 상태의 정확한 재생 |
보고서는 자기 배포가 전역 지속 KV를 최소 72시간 유지하고, 분산된 짧은 수명의 SWA 풀을 쓴다고 합니다. 공개 컨텍스트 캐시 가이드는 캐시 생성이 자동이며 best effort라고 하고, 구축에 수 초가 걸릴 수 있으며, 항목은 일반적으로 수 시간 또는 수 일 뒤에 지워진다고 합니다. 프로덕션 클라이언트는 공개 계약을 권위로 봐야 합니다. 보장된 72시간 적중을 전제로 예산을 잡지 말고, 적중과 미스 토큰 필드를 검사합니다.
DeepSeek는 견고성 경계 두 가지를 스스로 짚습니다. CSA2는 잘못된 희소 위치를 고를 수 있고, Bounded Replay는 버려진 로컬 상태를 근사합니다. 시험에서는 평가한 설정에서 체계적인 저하를 찾지 못했지만, 극단 컨텍스트와 캐시 재개 경계는 추가 스트레스 테스트가 남은 영역입니다.
Engram, DSpark, 그리고 멀티모달 경로
Engram은 암기 일부를 밀집 모델 계산에서 분리합니다. V4.1 Flash는 196B 파라미터를, 0부터 세는 1층과 14층의 조건부 메모리 모듈 두 개에 나눕니다. 각각은 길이 2, 3, 4의 토큰 n-gram, 해시 헤드 여덟 개, 컨텍스트를 아는 게이팅, RDMA 위의 호스트 메모리 프리페치를 씁니다. 이것은 저장된 파라미터이지, 모든 토큰에 대해 활성화되는 또 다른 196B 파라미터가 아닙니다.
DSpark는 따로 훈련된 추측 디코더입니다. Transformer 블록 세 개가 128토큰 슬라이딩 윈도를 보고, 다섯 위치를 병렬로 제안합니다. 가벼운 의존 헤드가 초안 토큰을 관련시키고, 확신 헤드가 초안 중 얼마나 검증을 견딜지 추정합니다. 스케줄러는 그 확률과 측정된 엔진 처리량으로, 현재 부하에서 검증 길이를 고릅니다. 이것은 백본의 최종 검증 역할을 바꾸지 않고 시스템 토큰 처리량을 개선할 수 있습니다.
시각 경로는 2D 회전 위치 인코딩이 있는, 따로 훈련된 DeepSeek-ViT를 씁니다. 3×3 픽셀 언셔플 단계가 언어 모델로 투영하기 전에 시각 토큰 수를 9분의 1로 줄입니다. 보고된 구성에서 비전 인코더는 32층, 은닉 크기 1,024, 어텐션 헤드 16개입니다. 자기회귀 훈련 단계는, 약 47B 이미지-텍스트 쌍 위의 더 이른 대조 단계 뒤에, 544×544에서 1,344×1,344 사이로 스케일한 이미지를 씁니다.
훈련과 사후학습
DeepSeek는 멀티모달 데이터가 언어 모델 훈련에 통합된 45T 사전학습 토큰을 보고합니다. 텍스트 전용 파이프라인과 멀티모달 파이프라인은 겹침 치환과 중복 제거 뒤 7:1 토큰 비율로 합쳐집니다. 희소 어텐션은 밀집 어텐션 워밍업 없이 64K 시퀀스 길이에서 처음부터 훈련됩니다. 컨텍스트는 34T 토큰 지점에서 1M까지 늘어납니다.
| 단계 | 공개된 세부 | 왜 중요한가 |
|---|---|---|
| 비전 대조 사전학습 | 약 47B 이미지-텍스트 쌍, 저해상도 단계 | 언어 통합 전에 넓은 시각 표현을 배웁니다 |
| 비전 자기회귀 튜닝 | 캡션, 차트, OCR 및 관련 데이터가 있는 236B 토큰 | 미세한 시각 및 문서 이해를 더합니다 |
| LLM 사전학습 | 45T 토큰, 멀티모달 데이터가 처음부터 포함 | 비전을 늦은 prompt 어댑터로만 취급하는 것을 피합니다 |
| 컨텍스트 훈련 | 64K부터의 희소 어텐션, 34T 토큰에서 1M로 확장 | 훈련 뒤에만 변환하지 않고, 배포된 어텐션 패턴을 훈련합니다 |
| 사후학습 | SFT, 강화 학습, on-policy distillation | 추론, 도구, Agent 행동을 맞춥니다 |
보고서는 새로운 사후학습 알고리즘을 주장하지 않습니다. 이득을 합성 과제와 환경 만들기, 개선된 데이터 필터링, 검증 가능한 보상, 그리고 아키텍처와 데이터 규모에 돌립니다. “모델 아키텍처” 주장을 비교할 때 이것이 중요합니다. CED와 CSA2는 효율을 설명하고, 관찰된 Agent 성능은 훈련과 스캐폴드 스택 전체의 산물입니다.
추론 effort: 품질에는 보이는 토큰 청구서가 있습니다
DeepSeek는 1에서 100까지의 내부 effort 연속체를 열고, 공개 API 프리셋 low, high, max를 50, 75, 100에 대응합니다. 호환 입력은 minimal과 low를 low에, medium, high, xhigh를 high에, max 또는 ultra를 max에 대응합니다. Thinking의 기본값은 high입니다.
DeepSeek가 보고한 스윕에서, effort를 25에서 100으로 올리면 여덟 개 추론 평가의 평균 결과가 67.1%에서 76.3%로, DeepSWE가 66.0%에서 74.2%로, Terminal-Bench 2.1이 82.4%에서 90.6%로 올랐습니다. 출력 토큰은 약 2.5× 늘었습니다. 60–80 구간이 최대 토큰 예산의 절반 미만으로 품질의 대부분을 가져갔습니다. 마지막으로 100까지 가는 움직임은, 더 작은 이득을 위해 Agent 궤적을 1.6–1.8× 길게 했습니다.
이것은 이 모델에서 가장 쓸모 있는 제어 중 하나입니다. 분류, 추출, 재시도할 수 있는 탐색에는 low를 씁니다. 보통의 코딩과 조사에는 high를 씁니다. 한 번 더 시도하거나 놓친 경계 사례가 추가 토큰보다 더 비쌀 때만 max를 남겨 둡니다. 이것을 시작 가설로 두고, 인수된 과제의 비용을 잽니다.
thinking 모드에서는 temperature와 presence/frequency 페널티가 무시되고, top_p의 최솟값은 0.95입니다. 도구가 있을 때 클라이언트는 도구 결과와 함께 assistant 메시지의 완전한 reasoning_content를 돌려줘야 합니다. 빠뜨리면 400 응답이 납니다. 그 상태 규칙은, 익숙한 OpenAI 파라미터 집합을 복사하는 것보다 더 중요합니다.
OpenAI, Anthropic과의 벤치마크 비교
이 표는 DeepSeek 기술 보고서 표 3에서 고른 결과를 재현합니다. 모든 모델은 보고서의 Max 설정으로 보입니다. DeepSeek는 일부 평가에 서로 다른 필수 또는 공식 스캐폴드를 썼고, 코딩에는 1M DeepSeek Harness 컨텍스트를, 시각 Agent 과제에는 512K Claude Code 컨텍스트를 썼습니다. 숫자는 제공자가 보고한 증거이지, 독립적인 맞대결 시험도 아니고 프로덕션 SLA도 아닙니다.
| 평가 | V4 Flash | V4 Pro | V4.1 Flash | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|---|---|
| GPQA Diamond, Pass@1 | 89.9 | 92.4 | 90.9 | 94.1 | 93.4 |
| Terminal-Bench 2.1, Pass@1 | 82.7 | 87.9 | 90.6 | 88.8 | 89.1 |
| Terminal-Bench 3.0, Pass@1 | 7.6 | 11.8 | 30.0 | 34.4 | 43.3 |
| Terminal-Bench 4.0, Pass@1 | 7.0 | 12.4 | 31.2 | 39.9 | 51.8 |
| DeepSWE v1.1, 해결 | 54.4 | 62.7 | 74.2 | 73.0 | 74.0 |
| CyberGym, Pass@1 | 76.7 | 83.3 | 88.1 | 84.5 | — |
| HLE with tools, Pass@1 | 51.5 | 60.0 | 63.9 | — | 63.6 |
| AutomationBench, Pass@1 | 37.7 | 43.2 | 54.8 | 45.8 | 50.3 |
| Agents' Last Exam, Pass@1 | 25.2 | 25.7 | 31.8 | 26.7 | 28.6 |
| Chartography with tools, Pass@1 | — | — | 78.9 | 79.9 | 84.0 |
가장 강한 독해는 구체적입니다. V4.1 Flash는 Agent 과제에서 V4 Flash보다 큰 걸음을 내딛고, DeepSWE, Terminal-Bench 2.1, 자동화, 도구를 쓰는 HLE에서 GPT-5.6 Sol 및 Claude Opus 5와 경쟁합니다. GPQA, 이후 Terminal-Bench 버전, Chartography에서는 앞서지 않습니다. 보고서 자신이, 흔한 과제에서의 근접이 가장 어려운 추론과 경계 사례에서의 프런티어 대등을 뜻하지 않는다고 경고합니다.
GPT-6 Astra와 Claude Fable 5.1은 이 점수 표에서 빠졌습니다. DeepSeek 보고서가 그들에 대해 같은 행별 비교 데이터를 공개하지 않기 때문입니다. 따로인 제공자 페이지의 점수를 더하면 거짓된 공통 하네스가 생깁니다. 팀은 같은 저장소 과제, 도구, 시간 제한, 네트워크 정책, 인수 검사에서 모든 후보를 평가해야 합니다.
API 호환은 넓지만 동일하지 않습니다
공식 서비스는 OpenAI Chat Completions, OpenAI Responses, Anthropic 호환 API를 엽니다. 그 폭은 마이그레이션 일을 줄이지만, 호환은 동일한 수명 주기 의미가 아니라 요청 모양을 설명합니다.
| 표면 | DeepSeek V4.1 Flash 동작 | 마이그레이션 결과 |
|---|---|---|
| Chat Completions | 스트리밍, JSON 출력, 함수 호출. 비Thinking 모드의 prefix/FIM | 기존 OpenAI 클라이언트가 가장 단순한 출발점입니다 |
| Responses | 무상태. 함수와 이미지를 지원 | 전체 대화를 스스로 지속합니다 |
| Responses 상태 필드 | previous_response_id, conversations, store, background, context management는 미지원이거나 무시됩니다 |
200 응답이 그 기능이 효력을 냈다는 증명은 아닙니다 |
| 호스트된 도구 | Web search, file search, code interpreter, computer use, MCP 내장은 무시됩니다. 커스텀 도구 지원은 제한됩니다 | 애플리케이션에서 도구를 실행하고, 요청한 필드를 모두 시험합니다 |
| 추론 요약 | Summary와 암호화된 추론 내용은 미지원입니다 | OpenAI식 추론 전달 필드에 의존하지 않습니다 |
| Anthropic 형식 | Anthropic 메시지 모양을 받습니다 | Claude 의미를 가정하지 말고, DeepSeek의 추론 및 도구 상태 규칙을 보존합니다 |
| 비전 | 사용자 입력과 도구 출력에서 이미지를 받습니다 | 페이로드 크기, detail 모드, 이미지 수를 검증합니다 |
DeepSeek의 Responses 가이드는 metadata, prompt template, truncation, service tier, safety identifier, prompt-cache key/retention, stream options 같은 무시되는 필드도 나열합니다. 조용한 무시는 호환의 위험입니다. 스키마를 받아들인 것이 빠진 동작을 숨길 수 있습니다. 애플리케이션이 의존하는 기능마다 적합성 요청을 만듭니다. OpenAI 호환 API 가이드는 엔드포인트 모양과 능력을 왜 따로 검사해야 하는지 설명합니다.
OpenAI의 현재 모델은 더 넓은 네이티브 Responses 도구 생태계와 관리되는 상태 기능을 제공합니다. Anthropic의 네이티브 API는 자기 나름의 성숙한 thinking 블록과 도구 사용 계약이 있습니다. DeepSeek의 장점은 한 모델이 흔한 세 방언을 모두 받는다는 점입니다. 대가는, 교집합이 어느 쪽 경쟁자의 전체 네이티브 표면보다 작다는 점입니다.
비전 한도와 이미지 경제
공식 비전 가이드는 base64, 외부 URL, 또는 Files API를 통해 JPEG, PNG, GIF, WebP를 지원합니다. 이미지는 대략 1,300×1,300을 향해 자동으로 크기가 조정되고, 각각 최대 1,024 입력 토큰을 씁니다. low detail은 512×512 보기를 씁니다. high와 original은 더 많은 디테일을 유지합니다. auto는 현재 original처럼 동작합니다.
| 한도 | 공식 값 |
|---|---|
| 요청 본문 | 48 MiB |
| 인라인 또는 외부에서 가져온 이미지 | 각 32 MiB |
| 파일 ID로 참조된 이미지 | 각 64 MiB |
| 요청당 이미지 | 600 |
| 합친 이미지 바이트 | 파일 ID 없이 64 MiB, 파일 ID가 있으면 200 MiB |
| 긴 변 | 8,192 px. 이미지를 15장 이상 보낼 때는 4,096 px |
| 시각 토큰 상한 | 처리 후 이미지당 1,024토큰 |
최대 1,024 시각 토큰에서, 캐시되지 않은 이미지 하나는 함께 가는 텍스트와 출력 전에, 공개된 입력 요금으로 오프피크 약 $0.0001536 또는 피크 $0.0003072를 더합니다. 이 산술은 규모 추정에 쓸모가 있지만, 이미지 크기 조정, 캐시 동작, 실제 시각 토큰 사용은 요금을 바꿀 수 있습니다. 이미지가 더 많으면, 그렇지 않으면 텍스트나 도구 기록을 담을 컨텍스트도 소비합니다.
V4.1 Flash는 문서 스크린샷, 차트, OCR, 시각 Agent 관찰에 맞습니다. 이미지 생성 모델이 아닙니다. 생성된 이미지가 필요하면, 텍스트가 아니라 픽셀을 돌려주도록 설계된 모델과 엔드포인트를 씁니다.
공식 API 가격 비교
DeepSeek 가격 페이지는 9월 10일 04:00 UTC에 다음 요금을 도입했습니다. 평일 피크 창은 01:00–04:00과 06:00–10:00 UTC입니다. 그 밖의 평일 시간과 주말은 오프피크 요금을 씁니다. DeepSeek의 컨텍스트 캐시는 자동이므로, “캐시된 입력”은 적중을 강제하는 캐시 플래그가 아니라 보고된 캐시 적중을 뜻합니다.
OpenAI 요금은 현재 모델 비교에서, Anthropic 요금은 가격 페이지에서 옵니다. 값은 100만 토큰당 USD입니다. Anthropic은 캐시 쓰기도 과금합니다. 이 표는 새 입력, 캐시 읽기, 출력만 비교하므로 여기서는 생략합니다.
| 모델 | 컨텍스트 / 최대 출력 | 새 입력 또는 미스 | 캐시/읽기 입력 | 출력 |
|---|---|---|---|---|
| DeepSeek V4.1 Flash, 오프피크 | 1M / 384K | $0.15 | $0.003 | $0.60 |
| DeepSeek V4.1 Flash, 피크 | 1M / 384K | $0.30 | $0.006 | $1.20 |
| Modelflare의 DeepSeek V4.1 Flash | 1M / 384K 모델 한도 | $0.193548 | $0.003871 | $0.774194 |
| GPT-5.6 Luna | 1.05M / 128K | $0.20 | $0.02 | $1.20 |
| GPT-5.6 Terra | 1.05M / 128K | $2.00 | $0.20 | $12.00 |
| GPT-5.6 Sol | 1.05M / 128K | $4.00 | $0.40 | $20.00 |
| GPT-6 Astra | 1.05M / 128K | $10.00 | $1.00 | $50.00 |
| Claude Sonnet 5 | 1M / 128K | $2.00 | $0.20 | $10.00 |
| Claude Opus 5 | 1M / 128K | $5.00 | $0.50 | $25.00 |
| Claude Fable 5.1 | 1M / 128K | $10.00 | $0.25 | $50.00 |
가격 자체가 가치는 아닙니다. 서로 다른 토크나이저는 같은 텍스트에 서로 다른 토큰 수를 청구할 수 있습니다. Anthropic은 더 새로운 토큰화가 일부 작업에서 대략 30% 더 많은 토큰을 만들 수 있다고 적습니다. 모델은 서로 다른 출력 길이, 재시도, 사람의 수정도 요구할 수 있습니다. 입력 숫자가 가장 작은 행이 아니라, 인수된 과제당 비용을 비교합니다.
Modelflare의 현재 공개 카탈로그는 DeepSeek의 두 시간대 사이에 있는 요금 하나를 엽니다. 제1자 피크 요금의 약 64.5%이고, 피크 창에서는 35.5% 더 낮으며, DeepSeek 오프피크 요금보다는 약 29.0% 위입니다. 따라서 나열된 게이트웨이 요금에는 오늘 시간대 조정이 없습니다. DeepSeek의 오프피크 창을 안정적으로 쓸 수 있는 유연한 작업은, 제1자 API를 통하면 여전히 더 적게 낼 수 있습니다.
OpenAI는 입력 컨텍스트가 272K를 넘으면 더 높은 요금을 적용합니다. 요청 전체가 2× 입력 및 캐시 입력 가격과 1.5× 출력 가격을 씁니다. 이 경계는 아래의 긴 컨텍스트 시나리오에서 중요합니다. DeepSeek는 시간 창을 씁니다. Anthropic의 나열된 100만 토큰 모델은, 인용된 가격 표에서 같은 272K 경계를 쓰지 않습니다.
재현할 수 있는 비용 시나리오 둘
시나리오 A는 캐시되지 않은 입력 100K와 출력 10K가 있는 요청 하나입니다. 공식은 0.1 × input rate + 0.01 × output rate입니다. 캐시된 입력, 도구, 재시도, 세금, 제공자별 추가 항목은 없다고 가정합니다.
| 모델 | 시나리오 A 비용 |
|---|---|
| DeepSeek V4.1 Flash, 오프피크 | $0.021 |
| Modelflare의 DeepSeek V4.1 Flash | $0.0271 |
| GPT-5.6 Luna | $0.032 |
| DeepSeek V4.1 Flash, 피크 | $0.042 |
| Claude Sonnet 5 | $0.300 |
| GPT-5.6 Terra | $0.320 |
| GPT-5.6 Sol | $0.600 |
| Claude Opus 5 | $0.750 |
| GPT-6 Astra / Claude Fable 5.1 | $1.500 |
시나리오 B는 캐시된 입력 900K, 새 입력 100K, 출력 20K가 있는 웜 캐시 요청의 한계 비용입니다. 캐시를 만든 앞선 요청은 일부러 뺍니다. 공식은 0.9 × cache-read rate + 0.1 × input rate + 0.02 × output rate입니다. 입력 컨텍스트 합이 100만 토큰이므로, OpenAI의 요청 전체 긴 컨텍스트 배수가 적용됩니다.
| 모델 | 시나리오 B 한계 비용 |
|---|---|
| DeepSeek V4.1 Flash, 오프피크 | $0.0297 |
| Modelflare의 DeepSeek V4.1 Flash | $0.0383 |
| DeepSeek V4.1 Flash, 피크 | $0.0594 |
| GPT-5.6 Luna | $0.1120 |
| Claude Sonnet 5 | $0.5800 |
| GPT-5.6 Terra | $1.1200 |
| Claude Opus 5 | $1.4500 |
| GPT-5.6 Sol | $2.1200 |
| Claude Fable 5.1 | $2.2250 |
| GPT-6 Astra | $5.3000 |
비교는 토큰 수량을 같게 둡니다. 품질이 같다고 주장하지 않습니다. DeepSeek의 캐시는 best effort이고, Anthropic 캐시 생성에는 자기 쓰기 가격과 수명이 있습니다. 공정한 작업 시험은 캐시 적중/미스 토큰, 모든 시도, 과금되는 추론을 포함한 총 출력, 경과 시간, 인수율, 사람의 수정 분을 기록합니다. 비용 추적 가이드가 회계의 틀을 제공합니다.
오픈 웨이트가 자체 호스팅을 작게 만들지는 않습니다
Hugging Face 릴리스는 MIT 라이선스이고, vLLM과 SGLang 서빙 경로를 문서화합니다. 이 글을 위해 확인한 스냅샷에서, 저장소는 커밋 dba1be0a40aa45a94ad051997016db3960a90277에 safetensor 샤드 48개와 약 510.3 GB의 Git-LFS 파일을 담고 있었습니다. 그 바이트 수는 다운로드 산출물이지, 측정된 GPU RAM이 아닙니다.
시스템에는 여전히 552B 백본, 196B의 호스트가 주소 지정하는 Engram 메모리, 전문가 라우팅, FP4/FP8 캐시 경로, RDMA 프리페치, 지속 KV 저장이 있습니다. DeepSeek의 릴리스는, GPU 2,000장과 스토리지 클러스터가 있는 대규모 배포를 계획하는 팀에게 회사에 연락하라고 권합니다. 그 예는 전체 서빙 시스템의 규모를 알립니다. 모든 배포의 명시된 최소는 아닙니다. 더 작은 연구 배포는 양자화나 다른 병렬화를 쓸 수 있지만, 제공자의 API 경제에서 추론하면 안 됩니다.
오픈 웨이트는 팀에게 체크포인트 접근, 검사 가능성, 배포 정책에 대한 통제를 줍니다. DeepSeek의 커널 융합, 캐시 계층, DSpark 스케줄링, 배칭, 공개 API 지연을 자동으로 재현하지는 않습니다. 자체 호스트 계획은 측정된 처리량, 장애 복구, 유휴 용량, 스토리지 대역폭, 운영 노동과 비교합니다.
Modelflare의 DeepSeek V4.1 Flash
DeepSeek V4.1 Flash는 Modelflare에 올라 있습니다. 운영자가 확인한 출시는 공개 Modelflare 가격 카탈로그와 origin 카탈로그에서 독립적으로 보입니다. 2026-09-10 15:21 UTC에 둘 다 새 deepseek-v4.1-flash-0910 기록을 노출했습니다. 프로덕션 구성은 활성화된 deepseek-stable ability와, 같은 모델을 알리는 활성화된 경로를 보였습니다.
| Modelflare 항목 | 라이브 값 |
|---|---|
| 보낼 모델 ID | deepseek-v4.1-flash-0910 |
| 가용성 | 공개 카탈로그에 라이브이고, 라우팅 그룹이 활성화됨 |
| 공개 그룹 | deepseek-stable |
| 입력 가격 | $0.193548 / 1M 토큰 |
| 캐시 입력 가격 | $0.003871 / 1M 토큰 |
| 출력 가격 | $0.774194 / 1M 토큰 |
| 엔드포인트 유형 | /v1/chat/completions와 /v1/responses |
가격은 라이브 항목의 기본 입력 계수 $0.322580645, 공개 그룹 비율 0.6, 캐시 비율 0.02, 완성 비율 4×에서 나옵니다. 위에서 푼 두 작업에서 Modelflare 비용은 각각 약 $0.0271과 $0.0383입니다. 현재 모델 ID와 요금은 라이브 DeepSeek V4.1 Flash 가격 페이지를 씁니다.
증거 수준은 여전히 중요합니다. 공개 카탈로그와 활성화된 프로덕션 경로가 제품 가용성을 세우고, 운영자가 출시를 명시적으로 확인했습니다. 15:30 UTC까지 프로덕션 기록에는 정확한 새 모델 ID 아래 완료된 Chat Completions 호출 여섯 개가 있었고, prompt 토큰 216개와 completion 토큰 173개였습니다. 그것은 인증된 Chat Completions 디스패치와 과금되는 출력을 검증합니다. 지연이나 가용성을 재기에는 여전히 너무 작은 출시 표본이고, 이 경로를 통한 Responses나 멀티모달 동작을 독립적으로 증명하지는 않습니다. 팀은 프로덕션 작업을 옮기기 전에, 정확한 엔드포인트에서 자기 작은 인수 요청을 돌려야 합니다.
DeepSeek V4.1 Flash가 실제 우위를 갖는 곳
긴 입력, 잦은 도구 턴, 예산이 모두 중요할 때 이 모델은 일관된 우위를 갖습니다. 아키텍처는 프리필과 캐시 압력을 줄입니다. API 가격은 그 절감을 이례적으로 낮은 공개 요금으로 바꿉니다. 384K 출력 상한은 긴 패치나 보고서를 위한 여유를 남깁니다. 체크포인트는 자체 호스트 경로를 열어 둡니다.
| 작업 | V4.1 Flash가 강한 후보인 이유 | 잴 것 |
|---|---|---|
| 저장소 Agent | 낮은 토큰 요금에서 강한, 발행자가 보고한 DeepSWE와 터미널 결과 | 인수된 변경, 테스트 통과율, 재시도, 수리 시간 |
| 긴 조사 종합 | 1M 입력, 싼 캐시 적중, 384K 출력 | 인용 정확성, 요구 유지, 총 출력 |
| 시각 문서 Agent | 네이티브 이미지, OCR/차트 훈련, 흔한 Agent API | 필드 정확도, 자르기/detail 민감도, 시각 토큰 사용 |
| 대량 자동화 | 낮은 피크와 오프피크 가격, 2,500 요청 동시성 상한 | 대기 시간, 429 비율, 도구 실패, 성공당 비용 |
| 통제된 배포 | MIT 체크포인트와 문서화된 vLLM/SGLang 경로 | 하드웨어 이용률, 캐시/스토리지 대역폭, 운영 비용 |
따라서 가장 강한 프로덕션 주장은 비용 효율이 높은 긴 컨텍스트 Agent이지, “전체에서 최고의 모델”이 아닙니다. 더 싼 작은 모델이 수리가 여러 번 필요한 곳에서 이 모델이 인수된 실행 한 번으로 실제 과제를 끝내면, V4.1이 결과에서 이깁니다. 프런티어 폐쇄 모델이 값비싼 실패를 막으면, 더 높은 토큰 가격도 여전히 경제적일 수 있습니다.
OpenAI 또는 Anthropic이 더 안전한 선택으로 남는 곳
애플리케이션이 전체 Responses 생태계, 관리되는 상태, 호스트된 도구, 또는 DeepSeek가 무시하는 OpenAI 전용 계약에 의존하면 OpenAI 모델을 고릅니다. GPT-5.6 Luna는 더 짧고 캐시되지 않은 작업에서 특히 가까운 가격 경쟁자입니다. Terra, Sol, Astra는 훨씬 더 높은 표시 가격을, 다른 능력 등급과 네이티브 플랫폼 기능과 바꿉니다.
Claude의 네이티브 도구/thinking 계약, 캐시 제어, 또는 가장 어려운 Agent 작업에서의 측정된 성능이 토큰 표시 가격보다 더 중요하면 Anthropic 모델을 고릅니다. DeepSeek 자신의 표에서 Claude Opus 5는 Terminal-Bench 3/4와 Chartography를 앞섭니다. Claude Fable 5.1은 가장 부담이 큰 긴 지평 작업을 위해 자리하지만, 새 토큰과 출력 토큰당 상당히 더 비쌉니다.
안전에 중요하거나 비용이 큰 행동에서는, 브랜드나 벤치마크 평균이 아니라 평가된 실패 모드와 권한 경계에 따라 경로를 골라야 합니다. 재시도할 수 있는 일, 폴백, 부작용이 있는 행동을 가르려면 라우팅 가이드를 씁니다.
배포 점검 목록
- 제1자 API에는
deepseek-flash를 쓰고, 게이트웨이별 대응은 따로 기록합니다. - high effort에서 시작하고, 같은 인수 과제 집합에서 low와 max를 잽니다. 제공자 사이의 이름을 같은 계산으로 대응하지 않습니다.
- thinking 모드에서 도구를 쓰면, 요구된 그대로 전체
reasoning_content를 돌려줍니다. - 의존하는 Responses 필드를 모두 감사합니다. 거부된 파라미터와 조용히 무시된 파라미터는 처리가 다릅니다.
- 캐시 적중과 캐시 미스 토큰, 출력/추론 토큰, 재시도, 지연, 최종 인수를 기록합니다.
- 고정된 보존 가정이 아니라, 관찰된 적중을 중심으로 캐시 경제를 설계합니다.
- 멀티모달 요청을 보내기 전에 이미지 바이트, 수, 치수, detail 한도를 강제합니다.
- 애플리케이션 쪽 인가, 도구 멱등, 출력 검증을 모델 품질과 독립으로 둡니다.
- 출시 전에 시간 창 가격, 모델 별칭, 동시성 한도를 다시 확인합니다.
- 정확한 경로에서 실제 인증 요청을 돌립니다. 모델 카탈로그나 HTTP 200만으로는 능력의 증명이 아닙니다.
자주 묻는 질문
DeepSeek V4.1 Flash가 GPT-6 Astra나 Claude Fable 5.1보다 나은가? 보편적 주장으로는 아닙니다. V4.1 Flash는 가격과 오픈 웨이트에서 큰 우위가 있고, 제공자가 보고한 Agent 점수도 강합니다. DeepSeek 자신이, 가장 큰 폐쇄 모델이 가장 어려운 추론과 경계 사례에서 우위를 유지한다고 합니다. V4.1 보고서에는 같은 하네스의 Astra/Fable 비교가 없습니다.
DeepSeek V4.1 Flash의 파라미터는 몇 개인가? 보고서는 552B 파라미터 백본과 196B Engram 파라미터를 나열합니다. 프리필 토큰당 약 8B 백본 파라미터를, 디코드된 토큰당 16B를 활성화합니다. “총 552B”만 말하면 Engram이 빠집니다. “748B 활성”이라고 말하는 것도 틀립니다.
컨텍스트와 출력 한도는 무엇인가? 공식 한도는 컨텍스트 토큰 100만 개와 최대 384K 출력 토큰입니다. 이미지 임베딩, 텍스트, 도구 기록, 추론이 모두 해당 예산을 소비합니다.
왜 Flash라고 부르는가? 설계는 더 낮은 서빙 비용에 초점을 둡니다. 비대칭 프리필/디코드 활성화, 압축 희소 어텐션, FP4 전역 KV, 한계가 있는 지속 재생, 추측 디코딩입니다. “Flash”는 모든 prompt나 대기 조건에서 가장 낮은 지연을 약속하지 않습니다.
공개 캐시는 72시간 가는가? 그렇게 가정하면 안 됩니다. 기술 보고서는 전역 KV를 최소 72시간 유지하는 배포 설계를 설명합니다. 공개 API 가이드는 캐시를 best effort라고 부르고, 항목이 일반적으로 수 시간 또는 수 일 뒤에 지워진다고 합니다. 과금은 관찰된 적중/미스 필드를 써야 합니다.
Responses API는 OpenAI Responses의 그대로 대체인가? 익숙한 모양을 받지만, 무상태이고 여러 OpenAI 필드와 호스트된 도구를 무시합니다. 필요한 정확한 능력 계약을 시험합니다.
이미지를 생성할 수 있는가? 이미지 입력을 이해하고 텍스트를 돌려줍니다. 이미지 생성 모델이 아닙니다.
오늘 Modelflare를 통해 V4.1 Flash를 호출할 수 있는가? 예. deepseek-v4.1-flash-0910를 deepseek-stable 그룹에서 Chat Completions 또는 Responses와 함께 씁니다. 이것은 Modelflare의 발표일이 찍힌 ID입니다. 제1자 deepseek-flash 별칭은 따로인 제공자 계약입니다.
출처, 방법, 업데이트 기록
이 글은 제1자 출처를 우선하고, 문서화된 사실, DeepSeek가 보고한 평가, 계산된 예, 관찰된 Modelflare 카탈로그 상태를 나눕니다. 독립 모델 벤치마크는 돌리지 않았습니다. 비용 계산은 함께 있는 출처 산출물에 보존되고, 모든 시나리오는 토큰 벡터와 제외 항목을 말합니다. 글자 없는 표지는 기존 Modelflare 시각 스타일의 AI 생성 편집 삽화입니다.
주요 참고: DeepSeek V4.1 Flash 발표, 기술 보고서, 모델 카드, 가격, thinking, Responses, Anthropic 호환, 비전, 컨텍스트 캐싱, OpenAI 모델 비교, Anthropic 가격, 그리고 Modelflare 공개 카탈로그.
2026-09-10 업데이트: 발표 당일 첫 리뷰입니다. 제1자 모델 ID, 유효한 피크/오프피크 가격, 9월 14일 별칭 마이그레이션 공지, 현재 API 한도, 기술 보고서의 아키텍처와 벤치마크 데이터를 기록합니다. 같은 날 이후 업데이트는 deepseek-v4.1-flash-0910 아래 확인된 Modelflare 출시, 라이브 게이트웨이 가격, 풀어 본 게이트웨이 비용을 더합니다. 구현 전에 바뀔 수 있는 사실을 다시 확인합니다.