AI Trend Notifier
EN
← wiki

$ cat wiki/models/deepseek-v4-1-flash.md

DeepSeek V4.1-Flash

나란히 보기

스펙

AttributeValue
DeveloperDeepSeek
Released2026-09-10
Announced2026-09-10
Context window1,000,000
Pricing오프피크 캐시 미스 입력 $0.15/M · 캐시 적중 입력 $0.003/M · 출력 $0.60/M; 피크는 두 배 — 가격 절 참조
LicenseMIT (오픈 웨이트)
AvailabilityDeepSeek API, Hugging Face (deepseek-ai/DeepSeek-V4.1-Flash)

출시일

2026-09-10 (source).

2026-09-10 실행의 prefetch 후보 두 개가 출시 하루 전 이 모델을 거명했다 — DeepSeek Flash 4.1 is already being tested via API and rolling outDeepseek Has Soft Retired Deepseek V4 Pro — 그리고 그 실행은 둘 다 기록하고 둘 다 채택하지 않았다. changelog 항목도, API 모델 문자열도, 모델 카드도, 기술 보고서도 뒤에 없다는 이유였다. 이제 출시로 둘 다 확인됐다 (source). 그 규칙은 이 위키에 하루를 비용으로 물렸고 루머 발행을 막았다. 여기 기록하는 이유는 맞은 루머야말로 그 규칙이 비싸게 느껴지는 경우이기 때문이다.

아키텍처 — Causal Encoder-Decoder, 그리고 비대칭 활성이 핵심이다

DeepSeek 은 이 모델을 Causal Encoder-Decoder(CED) 계열의 첫 모델이라고 기술한다 (2 패스). 보고된 구조 (source):

항목
백본 파라미터552B
prefill 중 활성8B
decode 중 활성16B
레이어40인코더 20 · 디코더 20 (1 패스)
캐시 구성디코더가 레이어마다가 아니라 인코더 출력에서 캐시를 한 번 만든다 (1 패스)
입력 모달리티이미지와 텍스트 네이티브 (1 패스)
KV 캐시토큰당 890 바이트, DeepSeek-V4-Flash 의 약 4분의 1 이라고 명시 (1 패스)
체크포인트48 개 safetensors 샤드 ~475 GiB (1 패스)
이 위키의 어떤 모델도 읽을 때와 쓸 때 다른 활성 파라미터 수를 갖지 않는다. 여기 있는
모든 MoE 페이지 — DeepSeek V4-Flash 의 284B/13B, Hy4 preview
770B/49B, GLM-5.3-Flash 의 320B-A18B — 는 두 단계를 모두 덮는 하나의 활성
수치를 제시한다. 8B/16B 분할이 메모리 주장의 근거다: 프롬프트가 소비되는 동안 더 적은
파라미터가 관여하고, 롱컨텍스트 에이전트 워크로드가 토큰 대부분을 쓰는 곳이 바로 거기다.

확인되지 않은 것 은 "552B 백본" 과 구별되는 총 파라미터 수, 그리고 1M window 가 양쪽 절반에 동일한지 여부다 (source).

가격

DeepSeek 이 공개한 API 요금. 오프피크 열은 세 번의 검색 패스가 일치한 값이다 (source):

1M 토큰당캐시 적중 입력캐시 미스 입력출력
오프피크$0.003$0.15$0.60
피크$0.006$0.30$1.20
피크 시간은 평일 UTC 01:00–04:00 과 06:00–10:00 이고, 피크 요금은 오프피크의
두 배 라고 명시된다. 이 출시는 Flash API 가격을 토큰 종류에 따라 약 11%~57%
인하한다고 보고된다 (1 패스).

오프피크 캐시 적중 입력 $0.003/M 은 은퇴하는 V4-Pro 의 $0.022/M 과 대비된다 (1 패스) — 이 모델이 겨누는 에이전트 워크로드에서는 표시 요금보다 이 칸이 더 중요하다. 오래 도는 에이전트는 매 턴 자신의 context 를 다시 읽기 때문이다.

DeepSeek V4-Flash 와의 대비 메모. 그 페이지의 스케줄은 RMB 로 적혀 있는데, 2026-08-16 변경에 대해 읽은 모든 자료가 RMB 만 제시했기 때문이고, 그 페이지는 환산을 명시적으로 거부한다. 이 페이지의 수치는 읽은 모든 자료가 USD 로 보고한다. 따라서 두 스케줄은 이 위키에서 직접 비교되지 않으며, 여기서도 환산하지 않는다.

V4-Pro 가 이 모델 안으로 은퇴한다

2026-09-14 UTC 04:00 부터 deepseek-v4-pro 로 가는 모든 요청은 V4.1-Flash 가 처리 하고 Flash 요금으로 과금 되며, 보도에 따르면 V4-Pro 의 약 4분의 1 수준이고, 라우팅은 V4.1-Pro 가 출시될 때까지 계속된다 (2 패스) (source).

V4.1-Pro 는 읽은 자료 어디에도 날짜, 크기, 가격, 벤치마크가 없다. 페이지가 아니라 관찰 항목이다.

영향받는 페이지는 DeepSeek V4-Pro-0813 이고, 그 Availability 행에 라우팅이 기록됐다.

벤치마크

벤더 발표이며 어떤 행에도 평가 harness 가 명시되지 않았고, 읽은 자료 어디에도 어떤 종류의 독립 측정도 없다 — Artificial Analysis 지수도, 리더보드 순위도 없다 (source).

벤치마크V4.1-FlashClaude Opus 5GPT-5.6 Sol
Terminal-Bench 2.190.6unknownunknown
DeepSWE v1.174.274.073.0
AutomationBench54.850.345.8
Humanity's Last Exam36.856.3unknown
ProgramBench20.337.0unknown
**위 세 행의 격차는 0.2, 1.2, 4.5 점이고, 아래 두 행의 격차는 이 모델에 불리하게 19.5,
16.7 점이다.** 에이전트·터미널 작업에서 앞서고 폭에서는 크게 뒤지는 모델이며, 그 둘을 모두
보여주는 것이 이 출시의 자체 비교군이다. Eval Harness Configuration 에 따라
harness 를 공개하지 않은 벤더 자체 에이전트 수치는 (모델, harness) 쌍에 대한 주장이지
모델의 속성이 아니다. DeepSWE 에서 Opus 5 대비 0.2 점 우위는 스캐폴드 선택이 움직이는
범위 안에 있다.

한 추출은 최대 추론 노력 에서 V4.1-Flash 가 "일관되게 V4-Pro 를 앞섰다" 고 진술한다 (1 패스). 그 비교의 표는 읽지 못했다.

활용 사례

  • 오래 도는 에이전트·터미널 작업. 캐시 적중률과 토큰당 890 바이트 캐시 사용량이 세션 전체에 걸쳐 복리로 작용한다
  • V4-Pro 를 대체하는 비용 민감 서빙 — 어차피 트래픽이 여기로 라우팅된다
  • MIT 아래 자체 호스팅. 다만 ~475 GiB 체크포인트는 Muse Glimmer 와 달리 단일 소비자 GPU 로 될 일이 아니다

비교

모델오픈?활성 파라미터Terminal-Bench 2.1
DeepSeek V4.1-Flash예 (MIT)prefill 8B / decode 16B90.6 (벤더)
DeepSeek V4-Pro-0813예 (MIT)49B87.9 (벤더)
DeepSeek V4-Flash예 (MIT)13B82.7 (벤더)
Hy4 preview예 (Apache 2.0)49B85.4 (벤더)
GLM-5.3-Flash예 (MIT)18B84.3 (벤더)
이 열의 모든 수치는 명시되지 않은 harness 위에서 벤더가 낸 것이므로, 이 열이 정렬하는
것은 모델이 아니라 주장 이다.

상충 보고

  • 오프피크 가격. 한 검색 패스는 오프피크 캐시 미스 입력을 $0.075/M, 출력을 $0.30/M 로 제시했다 — 두 칸 모두 세 패스 수치의 정확히 절반이고, 이는 오프피크 할인을 두 번 적용한 추출의 형태다. 위에는 세 패스 수치를 실었고, 한 패스 값은 여기 기록하며 채택하지 않는다 (source).

Referenced by

Sources