$ cat wiki/models/deepseek-v4-1-flash.md
DeepSeek V4.1-Flash
나란히 보기
- GPT-Image-2.5 Flare
- K2 Horizon
- Gemini 3.8 Flash
- Muse Spark 1.3
- Claude Fable 5.1
- Hy4 preview
- GLM-5.3-Flash
- Granite 4.2
- Grok 4.6
- Laguna S 2.1
- Kimi K3
- Inkling
- LongCat-2.0
- MiniMax M3
- GPT-Image-2.5 Sunburst
- Astra
- GLM-5.3
- Qwen 3.8 27B
- DeepSeek V4-Pro-0813
- Gemini 3.7 Flash
- Muse Glimmer
- Muse Spark 1.2
- Qwen 3.8 Max
- DeepSeek V4-Flash
- Claude Opus 5
- Gemini 3.5 Flash-Lite
- Gemini 3.6 Flash
- DeepSeek V4
- GPT-5.6 Sol
- Grok 4.5
- Claude Sonnet 5
- GLM-5.2
- Claude Fable 5
- Claude Opus 4.8
- Gemini 3.5 Flash
- Grok Build
- Claude Opus 4.7
- Muse Spark
스펙
| Attribute | Value |
|---|---|
| Developer | DeepSeek |
| Released | 2026-09-10 |
| Announced | 2026-09-10 |
| Context window | 1,000,000 |
| Pricing | 오프피크 캐시 미스 입력 $0.15/M · 캐시 적중 입력 $0.003/M · 출력 $0.60/M; 피크는 두 배 — 가격 절 참조 |
| License | MIT (오픈 웨이트) |
| Availability | DeepSeek API, Hugging Face (deepseek-ai/DeepSeek-V4.1-Flash) |
출시일
2026-09-10 (source).
2026-09-10 실행의 prefetch 후보 두 개가 출시 하루 전 이 모델을 거명했다 — DeepSeek Flash 4.1 is already being tested via API and rolling out 과 Deepseek Has Soft Retired Deepseek V4 Pro — 그리고 그 실행은 둘 다 기록하고 둘 다 채택하지 않았다. changelog 항목도, API 모델 문자열도, 모델 카드도, 기술 보고서도 뒤에 없다는 이유였다. 이제 출시로 둘 다 확인됐다 (source). 그 규칙은 이 위키에 하루를 비용으로 물렸고 루머 발행을 막았다. 여기 기록하는 이유는 맞은 루머야말로 그 규칙이 비싸게 느껴지는 경우이기 때문이다.
아키텍처 — Causal Encoder-Decoder, 그리고 비대칭 활성이 핵심이다
DeepSeek 은 이 모델을 Causal Encoder-Decoder(CED) 계열의 첫 모델이라고 기술한다 (2 패스). 보고된 구조 (source):
| 항목 | 값 |
|---|---|
| 백본 파라미터 | 552B |
| prefill 중 활성 | 8B |
| decode 중 활성 | 16B |
| 레이어 | 40 — 인코더 20 · 디코더 20 (1 패스) |
| 캐시 구성 | 디코더가 레이어마다가 아니라 인코더 출력에서 캐시를 한 번 만든다 (1 패스) |
| 입력 모달리티 | 이미지와 텍스트 네이티브 (1 패스) |
| KV 캐시 | 토큰당 890 바이트, DeepSeek-V4-Flash 의 약 4분의 1 이라고 명시 (1 패스) |
| 체크포인트 | 48 개 safetensors 샤드 ~475 GiB (1 패스) |
| 이 위키의 어떤 모델도 읽을 때와 쓸 때 다른 활성 파라미터 수를 갖지 않는다. 여기 있는 | |
| 모든 MoE 페이지 — DeepSeek V4-Flash 의 284B/13B, Hy4 preview 의 | |
| 770B/49B, GLM-5.3-Flash 의 320B-A18B — 는 두 단계를 모두 덮는 하나의 활성 | |
| 수치를 제시한다. 8B/16B 분할이 메모리 주장의 근거다: 프롬프트가 소비되는 동안 더 적은 | |
| 파라미터가 관여하고, 롱컨텍스트 에이전트 워크로드가 토큰 대부분을 쓰는 곳이 바로 거기다. |
확인되지 않은 것 은 "552B 백본" 과 구별되는 총 파라미터 수, 그리고 1M window 가 양쪽 절반에 동일한지 여부다 (source).
가격
DeepSeek 이 공개한 API 요금. 오프피크 열은 세 번의 검색 패스가 일치한 값이다 (source):
| 1M 토큰당 | 캐시 적중 입력 | 캐시 미스 입력 | 출력 |
|---|---|---|---|
| 오프피크 | $0.003 | $0.15 | $0.60 |
| 피크 | $0.006 | $0.30 | $1.20 |
| 피크 시간은 평일 UTC 01:00–04:00 과 06:00–10:00 이고, 피크 요금은 오프피크의 | |||
| 두 배 라고 명시된다. 이 출시는 Flash API 가격을 토큰 종류에 따라 약 11%~57% | |||
| 인하한다고 보고된다 (1 패스). |
오프피크 캐시 적중 입력 $0.003/M 은 은퇴하는 V4-Pro 의 $0.022/M 과 대비된다 (1 패스) — 이 모델이 겨누는 에이전트 워크로드에서는 표시 요금보다 이 칸이 더 중요하다. 오래 도는 에이전트는 매 턴 자신의 context 를 다시 읽기 때문이다.
DeepSeek V4-Flash 와의 대비 메모. 그 페이지의 스케줄은 RMB 로 적혀 있는데, 2026-08-16 변경에 대해 읽은 모든 자료가 RMB 만 제시했기 때문이고, 그 페이지는 환산을 명시적으로 거부한다. 이 페이지의 수치는 읽은 모든 자료가 USD 로 보고한다. 따라서 두 스케줄은 이 위키에서 직접 비교되지 않으며, 여기서도 환산하지 않는다.
V4-Pro 가 이 모델 안으로 은퇴한다
2026-09-14 UTC 04:00 부터 deepseek-v4-pro 로 가는 모든 요청은
V4.1-Flash 가 처리 하고 Flash 요금으로 과금 되며, 보도에 따르면 V4-Pro 의 약
4분의 1 수준이고, 라우팅은 V4.1-Pro 가 출시될 때까지 계속된다 (2 패스)
(source).
V4.1-Pro 는 읽은 자료 어디에도 날짜, 크기, 가격, 벤치마크가 없다. 페이지가 아니라 관찰 항목이다.
영향받는 페이지는 DeepSeek V4-Pro-0813 이고, 그 Availability 행에 라우팅이 기록됐다.
벤치마크
벤더 발표이며 어떤 행에도 평가 harness 가 명시되지 않았고, 읽은 자료 어디에도 어떤 종류의 독립 측정도 없다 — Artificial Analysis 지수도, 리더보드 순위도 없다 (source).
| 벤치마크 | V4.1-Flash | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|---|
| Terminal-Bench 2.1 | 90.6 | unknown | unknown |
| DeepSWE v1.1 | 74.2 | 74.0 | 73.0 |
| AutomationBench | 54.8 | 50.3 | 45.8 |
| Humanity's Last Exam | 36.8 | 56.3 | unknown |
| ProgramBench | 20.3 | 37.0 | unknown |
| **위 세 행의 격차는 0.2, 1.2, 4.5 점이고, 아래 두 행의 격차는 이 모델에 불리하게 19.5, | |||
| 16.7 점이다.** 에이전트·터미널 작업에서 앞서고 폭에서는 크게 뒤지는 모델이며, 그 둘을 모두 | |||
| 보여주는 것이 이 출시의 자체 비교군이다. Eval Harness Configuration 에 따라 | |||
| harness 를 공개하지 않은 벤더 자체 에이전트 수치는 (모델, harness) 쌍에 대한 주장이지 | |||
| 모델의 속성이 아니다. DeepSWE 에서 Opus 5 대비 0.2 점 우위는 스캐폴드 선택이 움직이는 | |||
| 범위 안에 있다. |
한 추출은 최대 추론 노력 에서 V4.1-Flash 가 "일관되게 V4-Pro 를 앞섰다" 고 진술한다 (1 패스). 그 비교의 표는 읽지 못했다.
활용 사례
- 오래 도는 에이전트·터미널 작업. 캐시 적중률과 토큰당 890 바이트 캐시 사용량이 세션 전체에 걸쳐 복리로 작용한다
- V4-Pro 를 대체하는 비용 민감 서빙 — 어차피 트래픽이 여기로 라우팅된다
- MIT 아래 자체 호스팅. 다만 ~475 GiB 체크포인트는 Muse Glimmer 와 달리 단일 소비자 GPU 로 될 일이 아니다
비교
| 모델 | 오픈? | 활성 파라미터 | Terminal-Bench 2.1 |
|---|---|---|---|
| DeepSeek V4.1-Flash | 예 (MIT) | prefill 8B / decode 16B | 90.6 (벤더) |
| DeepSeek V4-Pro-0813 | 예 (MIT) | 49B | 87.9 (벤더) |
| DeepSeek V4-Flash | 예 (MIT) | 13B | 82.7 (벤더) |
| Hy4 preview | 예 (Apache 2.0) | 49B | 85.4 (벤더) |
| GLM-5.3-Flash | 예 (MIT) | 18B | 84.3 (벤더) |
| 이 열의 모든 수치는 명시되지 않은 harness 위에서 벤더가 낸 것이므로, 이 열이 정렬하는 | |||
| 것은 모델이 아니라 주장 이다. |
상충 보고
- 오프피크 가격. 한 검색 패스는 오프피크 캐시 미스 입력을 $0.075/M, 출력을 $0.30/M 로 제시했다 — 두 칸 모두 세 패스 수치의 정확히 절반이고, 이는 오프피크 할인을 두 번 적용한 추출의 형태다. 위에는 세 패스 수치를 실었고, 한 패스 값은 여기 기록하며 채택하지 않는다 (source).
소스
- 출시 캡처 (source)
- DeepSeek — Introducing DeepSeek-V4.1-Flash (이 실행의 샌드박스에서 읽을 수 없음)
- Hugging Face — deepseek-ai/DeepSeek-V4.1-Flash (이 실행의 샌드박스에서 읽을 수 없음)
- The Next Web — DeepSeek launches V4.1-Flash and retires V4-Pro
- officechai — DeepSeek V4.1 Flash Matches GPT 5.6 Sol, Claude Opus 5 On Some Benchmarks