$ cat wiki/models/deepseek-v4-flash.md
DeepSeek V4-Flash
나란히 보기
스펙
| 속성 | 값 |
|---|---|
| Developer | DeepSeek |
| Released | 2026-07-31 (정식 / 퍼블릭 베타, 빌드 0731; 이전 Preview) |
| Announced | 2026-07-31 |
| Context window | 1,048,576 (1M) — OpenRouter 카탈로그 deepseek/deepseek-v4-flash, 2026-08-01 읽음. DeepSeek 자체 출시 자료에는 명시되지 않았다 |
| Pricing | 2026-08-16 부터 오프피크 ¥1.50/M 입력 (캐시 미스) · ¥0.05/M 입력 (캐시 히트) · ¥4.50/M 출력. 피크는 2× — 가격 절과 상충 보고 참조 |
| License | MIT (오픈 웨이트) |
| Availability | DeepSeek API (Responses 형식, Codex 대응), Hugging Face (deepseek-ai/DeepSeek-V4-Flash-0731) |
가격 — 2026-08-16 에 정액을 떠났고, 새 수치는 RMB 로 되어 있다
2026-08-16 16:00 UTC 부로 V4-Flash 는 DeepSeek V4-Pro-0813 와 함께 정액 토큰 요금을 떠나 피크/오프피크 스케줄로 옮겨갔다 (source).
| 1M 토큰당 | 캐시 히트 입력 | 캐시 미스 입력 | 출력 |
|---|---|---|---|
| 오프피크, RMB | ¥0.05 | ¥1.50 | ¥4.50 |
| 피크, RMB | ¥0.10 | ¥3.00 | ¥9.00 |
| 피크 시간대는 01:00–04:00 및 06:00–10:00 UTC 이고 나머지 시간은 오프피크다 | |||
| (source). |
요율과 함께 통화가 바뀌었고, 이는 겉모양의 문제가 아니다. 읽은 모든 자료가 새 Flash
스케줄을 RMB 로만 제시하는데, 그것이 대체한 요금은 USD 로 표기돼 있었다 — 1M
토큰당 캐시 히트 입력 $0.0028, 캐시 미스 입력 $0.14, 출력 $0.28
(source).
따라서 위 두 행은 그것이 대체한 행과 직접 비교할 수 없으며, 이 페이지는 환산하지 않는다.
환산된 수치는 이 위키의 산술을 DeepSeek 의 가격으로 발표하는 셈이 된다. 딱 떨어지는 RMB
값들은 형제 페이지의 달러 금액이 환산이라는 가장 좋은 증거이기도 하다 —
DeepSeek V4-Pro-0813 의 ## 상충 보고 를 보라. 거기서 보고된 배수와 보고된
달러가 약 1.1% 어긋난다.
벤치마크
아래는 보도가 전한 벤더 발표 수치다. 원본 모델 카드는 이 환경에서 읽을 수 없었다. 비교 열은 DeepSeek 자신의 더 큰 모델인 V4-Pro-Preview 다 (source):
| 벤치마크 | Flash Preview | Flash 0731 | V4-Pro-Preview |
|---|---|---|---|
| Terminal Bench 2.1 | 61.8 | 82.7 | 72.1 |
| DeepSWE | 7.3 | 54.4 | unknown |
| Cybergym | 38.7 | 76.7 | unknown |
| NL2Repo | 39.4 | 54.2 | unknown |
| Toolathlon-Verified | 49.7 | 70.3 | unknown |
| 보도는 재훈련된 Flash 가 활성 파라미터가 훨씬 적은데도 에이전트 벤치마크 아홉 개에서 | |||
| V4-Pro (Preview) 를 앞섰다고 전한다 | |||
| (source). |
Eval Harness Configuration 에 따라, 이 수치들은 하네스 구성이 공개되지 않은 에이전트 벤치마크에서 벤더가 직접 돌린 값이므로 모델의 속성이 아니라 (모델, 하네스) 쌍에 대한 주장으로 기록한다.
독립 측정 — Artificial Analysis (2026-08-01)
Artificial Analysis 가 자체 지수로 이 모델을 채점했다. 수치는 열 제목과 AA 자신의 변형 표기와 함께 인용한다 (source):
| Model | Artificial Analysis Intelligence Index |
|---|---|
| GPT-5.6 Luna (max) | 51 |
| GLM-5.2 (max) | 51 |
| DeepSeek V4 Flash 0731 (max) | 50 |
| DeepSeek V4 Pro | 44 |
| DeepSeek V4 Flash (April 2026) | 40 |
| AA 는 이 점수가 4월 Flash 대비 10점 상승이고 DeepSeek V4-Pro 보다 6점 위이며, 이 | |
| 모델이 AA 의 Intelligence vs Cost per Task 파레토 프런티어에 오르고, 가중치가 공개된 | |
| 지금 리더보드에서 상위 3개 오픈 웨이트 모델 안에 든다고 밝힌다. 과제당 비용은 **GPT-5.6 | |
| Luna (max) 대비 약 60% 낮은** 수준으로 보고되며, 상당 부분이 DeepSeek 1차 API 의 **약 98% | |
| 캐시 적중 할인** 덕분이다 | |
| (source) | |
| (the-decoder). |
이는 하네스를 통제한 비교가 아니라 단일 서드파티 지수이지만, 표 안의 모든 모델에 같은 방식이 적용됐고 위의 벤더 주장에 의존하지 않으면서 그 방향과 일치한다. V4-Pro 행을 눈여겨볼 것. "공식 출시가 곧 따라온다"던 더 큰 형제가 AA 지수에서 이 모델보다 아래에 있다.
수집 단서: scripts/aa-fetch.py 는 실행되지 못했다 — 샌드박스 이그레스 프록시가
artificialanalysis.ai 에 대한 CONNECT 에 403 으로 답한다 — 따라서 이 수치들은 구조화된
리더보드 스냅샷이 아니라 AA 자체 기사와 게시물에서 왔다.
아키텍처
- MoE, 총 284B / 활성 13B — Preview 에서 변경 없음
- 자체 호스팅: 최소 H100 한 장(FP8), 전체 가중치는 약 170 GB VRAM (source)
활용 사례
- 에이전트 코딩과 터미널/도구 사용 — 움직인 벤치마크가 모두 에이전트 계열이다
- V4-Pro 가 부담스러운 비용 민감 서빙
- MIT 라이선스 하의 로컬·자체 호스팅 추론
비교
| 모델 | Terminal Bench 2.1 | 오픈? |
|---|---|---|
| DeepSeek V4-Flash 0731 | 82.7 (벤더 발표) | 예 (MIT) |
| DeepSeek V4-Pro-Preview | 72.1 (벤더 발표) | 예 (MIT) |
| DeepSeek V4 (V4-Pro-Max) | unknown | 예 (MIT) |
상충 보고
- 가격. 위의 요율(입력 캐시 미스 $0.14 / 출력 $0.28)은 digitalapplied 의 릴리스 기사에서 왔다. AlphaSignal 은 같은 모델에 대해 헤드라인에서 "100만 토큰당 $0.08" 을 제시한다. 확보한 자료 중 둘을 조정해 주는 것은 없다 — $0.08 이 혼합 요율이거나 오프피크 요율일 수 있으나, 그렇게 말하는 소스는 읽지 못했다 (source).
- Artificial Analysis 순위 — 2026-08-02 해소, 상충 아님. 2026-08-01 에 이 페이지는
"Artificial Analysis Intelligence Index 50 점, GLM-5.2 와 GPT-5.6 보다 1점 아래"라는
r/LocalLLaMA 보고를, 벤치마크로 인용할 수 없는 커뮤니티 주장으로 기록했다
(source). 그 뒤 Artificial
Analysis 가 수치를 직접 발표했고 서로 일치한다. 50 으로 GPT-5.6 Luna (max, 51) 및
GLM-5.2 (max, 51) 에 1점 뒤진다. 커뮤니티 보고가 정확했다. 수치는 이제 위의
## 벤치마크아래에 AA 를 출처로 실려 있다 (source).