$ cat wiki/models/gemini-3-8-flash.md
Gemini 3.8 Flash
나란히 보기
- Claude Fable 5.1
- Hy4 preview
- GLM-5.3-Flash
- Granite 4.2
- DeepSeek V4-Pro-0813
- Muse Glimmer
- Grok 4.6
- Laguna S 2.1
- Kimi K3
- Inkling
- GPT-5.6 Sol
- LongCat-2.0
- MiniMax M3
- GLM-5.3
- Qwen 3.8 27B
- Gemini 3.7 Flash
- Muse Spark 1.2
- Qwen 3.8 Max
- DeepSeek V4-Flash
- Claude Opus 5
- Gemini 3.5 Flash-Lite
- Gemini 3.6 Flash
- DeepSeek V4
- Grok 4.5
- Claude Sonnet 5
- GLM-5.2
- Claude Fable 5
- Claude Opus 4.8
- Grok Build
- Claude Opus 4.7
- Muse Spark
스펙
| Attribute | Value |
|---|---|
| Developer | Google DeepMind |
| Released | 2026-09-02 |
| Announced | 2026-09-02 |
| Context window | 1,048,576 토큰 (최대 출력 65,536) |
| Pricing | $0.75/M 입력 · $3.75/M 출력 (도입가, 2026-12-31 까지) · 2027-01-01 부터 $1.50/M · $7.50/M |
| License | proprietary |
| Availability | Gemini API, Google AI Studio, Antigravity, Android Studio, Gemini Enterprise · Gemini Enterprise Agent Platform |
발표와 동시에 정식 출시됐고, API 모델 id 는 gemini-3.8-flash 다 | |
| (source). |
Released 와 Announced 를 뺀 위의 모든 행이 Gemini 3.7 Flash 와
동일하다 — 같은 컨텍스트 창, 같은 출력 상한, 같은 도입가, 같은 만료일, 그 뒤의 같은
정가. 3주 간격인데 스펙 표가 기록하는 변화는 날짜뿐이다
(source).
파라미터 수·아키텍처·가중치 공개는 어느 것도 보고되지 않았고, 이 계열에서 기대되지도 않는다.
출시일
2026-09-02, Gemini 3.7 Flash (2026-08-13) 로부터 20일 뒤이고, 그 3.7 은 다시 Gemini 3.6 Flash (2026-07-21) 로부터 23일 뒤였다. 43일 사이에 Flash 세 번, 모두 같은 가격으로.
벤치마크
벤더 발표 수치, Gemini 3.7 Flash 대비 (source):
| Benchmark | Gemini 3.8 Flash | Gemini 3.7 Flash |
|---|---|---|
| Terminal-Bench 2.1 | 90.8% | 81.6% |
| DeepSWE v1.1 | 73.7% | unknown |
| SWE-bench Pro | 61.6% | 60.4% |
| 세 행의 입증 강도는 같지 않고, 이 페이지는 어느 쪽이 어느 쪽인지 밝힌다. | ||
deepmind.google 과 blog.google 은 이 실행의 샌드박스에서 모두 접근할 수 없어, 이 | ||
| 출시는 WebSearch 세 번의 패스로 포착됐다. Terminal-Bench 2.1 과 DeepSWE v1.1 은 각각 | ||
| 두 패스가 동일한 숫자로 전달했다. SWE-bench Pro 의 숫자는 한 패스만 전달했고, | ||
| 나머지 두 패스는 방향만 뒷받침했으며 — "거의 움직이지 않았다", "1점 남짓" — 어느 | ||
| 패스도 반박하지 않았다 | ||
| (source). |
흥미로운 대목은 그 행들 사이의 간격이다. 같은 모델, 같은 출시에서 Terminal-Bench 2.1 은 9.2점, SWE-bench Pro 는 1.2점 움직인다. 둘 다 코딩 벤치마크다. 갈라지는 지점은 Terminal-Bench 가 에이전트의 과제 처음부터 끝까지 — 도구를 호출하고 자기 오류에서 복구하는 것까지 — 를 채점하는 반면 SWE-bench Pro 는 패치를 채점한다는 데 있다. 하나만 움직이고 다른 하나는 움직이지 않은 출시는 모델의 코딩 지식이 아니라 모델이 운용되는 하네스에 대한 증거다. Eval Harness Configuration 를 보라 — 이 위키가 2026-07-31 부터 그 논증을 축적해 온 페이지다.
Google 의 DeepSWE v1.1 주장은 3.8 Flash 가 장기 지평 코딩에서 "대부분의 더 큰 프런티어 모델을 능가한다"는 것이다. 어느 모델들인지는 읽은 어떤 자료에도 없다 (source). 같은 벤치마크 계열에서 이 위키가 보유한 가장 가까운 수치는 Gemini 3.7 Flash 의 DeepSWE 65.3% 이고, 거기서는 벤치마크의 버전 접미사가 암묵적으로만 붙어 있었다. 그 단서를 달고 비교를 제시하는 것이지, 깔끔한 65.3 → 73.7 로 제시하는 것이 아니다.
추론 벤치마크는 더 완만한 향상을 보였다고 서술될 뿐이고, 읽은 어떤 자료에도 추론 수치는 공개되지 않았다. 이 출시 보도에는 GPQA Diamond 90.4% 라는 수치가 돌아다니는데 그것은 더 이른 Gemini 3 Flash 의 것이다. 나중에 3.8 의 수치로 오인되지 않도록 여기에 기록한다 (source).
Terminal-Bench 2.1, DeepSWE v1.1, SWE-bench Pro 중 어느 것도 이 저장소가 보유한
sources/evals/ 스냅샷에 등장하지 않으므로, 벤더 수치를 대조할 로컬 컬럼이 없다.
Gemini 3.7 Flash, Nemotron 3.5 Lightning,
Grok Imagine Image 2.0 에 이미 기록된 것과 같은 공백이다. 숫자와 그 출처는 함께
가거나 아예 가지 않는다.
비교
- Gemini 3.7 Flash — 20일 앞선 직전 모델. 날짜를 빼면 스펙 표가 동일하다
- Gemini 3.6 Flash — 그 앞 세대
- Gemini 3.8 Flash Cyber — 같은 날 출시된 제한 접근 형제 모델. Fairwind Program 을 통해서만 접근할 수 있다
- Gemini 3.5 Flash Cyber — 이전 Cyber 모델. 그런 모델이 어떻게 공개되는지가 무엇이 달라졌는지 보려면
- Qwen 3.8 Max — Alibaba 는 이 출시로부터 하루 안에 코딩 중심 사후 학습 스냅샷을, 역시 가격을 그대로 두고 내놓았다