$ cat wiki/models/gemini-3-7-flash.md
Gemini 3.7 Flash
나란히 보기
- Qwen 3.8 27B
- DeepSeek V4-Pro-0813
- Muse Glimmer
- Grok 4.6
- Claude Opus 5
- Laguna S 2.1
- Kimi K3
- Inkling
- GPT-5.6 Sol
- LongCat-2.0
- GLM-5.2
- MiniMax M3
- Muse Spark 1.2
- Qwen 3.8 Max
- DeepSeek V4-Flash
- Gemini 3.5 Flash-Lite
- Gemini 3.6 Flash
- DeepSeek V4
- Grok 4.5
- Claude Sonnet 5
- Claude Fable 5
- Claude Opus 4.8
- Gemini 3.5 Flash
- Grok Build
- Claude Opus 4.7
- Muse Spark
스펙
| Attribute | Value |
|---|---|
| Developer | Google DeepMind |
| Released | 2026-08-13 |
| Announced | 2026-08-13 |
| Context window | 1,000,000 토큰 (최대 출력 64,000) |
| Pricing | $0.75/M 입력 · $3.75/M 출력 (도입가, 2026-12-31 까지) · 2027-01-01 부터 $1.50/M · $7.50/M |
| License | proprietary |
| Availability | Gemini API, Google AI Studio, Android Studio, Google Antigravity, Gemini Enterprise Agent Platform, Gemini Enterprise 앱, Gemini 앱의 Spark (AI Pro·Ultra) |
| 발표와 동시에 정식 출시됐다 — 프리뷰가 아니라 안정 API 모델이다 | |
| (source). |
지식 컷오프는 2026년 3월로, 이전 모델과 같다 (source).
파라미터 수·아키텍처·가중치 공개는 어느 것도 보고되지 않았고, 이 계열에서 기대되지도 않는다.
출시일
2026-08-13, Gemini 3.6 Flash (2026-07-21) 로부터 23일 뒤.
Google AI Studio 제품을 이끄는 Logan Kilpatrick 은 이 향상이 "약 3주" 만에 나왔다고 설명하며, 규모가 아니라 Google DeepMind 여러 팀의 알고리즘 개선 덕으로 돌렸다 (source). 이는 향상의 원인에 대한 주장이고 그것을 뒷받침하는 근거는 공개되지 않았다. 벤더의 설명으로 기록한다.
벤치마크
벤더 발표 수치, Gemini 3.6 Flash 대비 (source):
| Benchmark | Gemini 3.7 Flash | Gemini 3.6 Flash |
|---|---|---|
| AutomationBench | 30.4% | 17.0% |
| FrontierCode | 43.6% | 34.4% |
| DeepSWE | 65.3% | 48.6% |
| LVBench (장편 비디오) | 85.4% | unknown |
| GDM-MRCR v2 @128k | 97.0% | unknown |
| GDM-MRCR v2 @1M | 62.5% | unknown |
| WebDev Arena | 1588 Elo | unknown |
| 엔터프라이즈 워크플로 자동화를 재는 AutomationBench 에서는 GPT-5.6 Terra (23.6%) | ||
| 와 Claude Sonnet 5 (10.7%) 를 앞선 것으로 보도됐다 | ||
| (source). 그 비교 수치를 | ||
| Google 이 직접 측정했는지는 읽은 자료 어디에도 나오지 않는다. |
이 벤치마크 중 어느 것도 이 저장소가 보유한 sources/evals/ 스냅샷에 없다 —
AutomationBench, FrontierCode, LVBench, GDM-MRCR v2, WebDev Arena 모두 마찬가지다.
Muse Glimmer, Nemotron 3.5 Lightning,
Grok Imagine Image 2.0 에 기록된 것과 같은 공백이다: 벤더 수치를 대조할 로컬
칼럼이 없으므로, 수치와 그 출처는 함께 다니거나 아예 다니지 않는다.
Eval Harness Configuration 참조.
헤드라인 수치의 모양을 보아 두자. 30.4% 는 17.0% 의 대략 두 배이면서 동시에 과제의 3분의 1에도 못 미친다. 두 읽기가 같은 수치 안에 있고, 릴리스 자료는 앞의 것만 담고 있다 (source).
DeepSWE 의 65.3% 는 이 위키가 이미 보유한 수치와 직접 비교되는 유일한 값이다 — DeepSeek V4-Pro-0813 는 같은 벤치마크에서 62.7 을 보고했고, 양쪽 모두 벤더 측정이며 공개된 하네스가 없다.
비교
- Gemini 3.6 Flash — 23일 앞선 직전 모델. 같은 컨텍스트 윈도, 같은 출력 상한, 같은 표준 가격
- Gemini 3.5 Flash — 그 앞 세대
- GPT-5.6 Sol (and Terra, Luna) — 그 Terra 티어가 AutomationBench 비교 대상으로 지목된 모델
- Claude Sonnet 5 — 또 하나의 비교 대상, AutomationBench 10.7%
- DeepSeek V4-Pro-0813 — 같은 날 출시됐고, DeepSWE 수치가 가장 가깝다
소스
- Introducing Gemini 3.7 Flash — Google DeepMind → (snapshot)
- Gemini 3.7 Flash: our most intelligent workhorse model — blog.google
- What's new in Gemini 3.7 Flash — Google AI for Developers
- Google Cuts Gemini 3.7 Flash Price in Half as It Claims to Top Claude on Business Workflows — TechTimes
- Google Releases Gemini 3.7 Flash — officechai
- Google AI Just Released Gemini 3.7 Flash — MarkTechPost