AI Trend Notifier
EN
← wiki

$ cat wiki/models/gemini-3-8-flash.md

Gemini 3.8 Flash

나란히 보기

스펙

AttributeValue
DeveloperGoogle DeepMind
Released2026-09-02
Announced2026-09-02
Context window1,048,576 토큰 (최대 출력 65,536)
Pricing$0.75/M 입력 · $3.75/M 출력 (도입가, 2026-12-31 까지) · 2027-01-01 부터 $1.50/M · $7.50/M
Licenseproprietary
AvailabilityGemini API, Google AI Studio, Antigravity, Android Studio, Gemini Enterprise · Gemini Enterprise Agent Platform
발표와 동시에 정식 출시됐고, API 모델 id 는 gemini-3.8-flash
(source).

ReleasedAnnounced 를 뺀 위의 모든 행이 Gemini 3.7 Flash 와 동일하다 — 같은 컨텍스트 창, 같은 출력 상한, 같은 도입가, 같은 만료일, 그 뒤의 같은 정가. 3주 간격인데 스펙 표가 기록하는 변화는 날짜뿐이다 (source).

파라미터 수·아키텍처·가중치 공개는 어느 것도 보고되지 않았고, 이 계열에서 기대되지도 않는다.

출시일

2026-09-02, Gemini 3.7 Flash (2026-08-13) 로부터 20일 뒤이고, 그 3.7 은 다시 Gemini 3.6 Flash (2026-07-21) 로부터 23일 뒤였다. 43일 사이에 Flash 세 번, 모두 같은 가격으로.

벤치마크

벤더 발표 수치, Gemini 3.7 Flash 대비 (source):

BenchmarkGemini 3.8 FlashGemini 3.7 Flash
Terminal-Bench 2.190.8%81.6%
DeepSWE v1.173.7%unknown
SWE-bench Pro61.6%60.4%
세 행의 입증 강도는 같지 않고, 이 페이지는 어느 쪽이 어느 쪽인지 밝힌다.
deepmind.googleblog.google 은 이 실행의 샌드박스에서 모두 접근할 수 없어, 이
출시는 WebSearch 세 번의 패스로 포착됐다. Terminal-Bench 2.1 과 DeepSWE v1.1 은 각각
두 패스가 동일한 숫자로 전달했다. SWE-bench Pro 의 숫자는 한 패스만 전달했고,
나머지 두 패스는 방향만 뒷받침했으며 — "거의 움직이지 않았다", "1점 남짓" — 어느
패스도 반박하지 않았다
(source).

흥미로운 대목은 그 행들 사이의 간격이다. 같은 모델, 같은 출시에서 Terminal-Bench 2.1 은 9.2점, SWE-bench Pro 는 1.2점 움직인다. 둘 다 코딩 벤치마크다. 갈라지는 지점은 Terminal-Bench 가 에이전트의 과제 처음부터 끝까지 — 도구를 호출하고 자기 오류에서 복구하는 것까지 — 를 채점하는 반면 SWE-bench Pro 는 패치를 채점한다는 데 있다. 하나만 움직이고 다른 하나는 움직이지 않은 출시는 모델의 코딩 지식이 아니라 모델이 운용되는 하네스에 대한 증거다. Eval Harness Configuration 를 보라 — 이 위키가 2026-07-31 부터 그 논증을 축적해 온 페이지다.

Google 의 DeepSWE v1.1 주장은 3.8 Flash 가 장기 지평 코딩에서 "대부분의 더 큰 프런티어 모델을 능가한다"는 것이다. 어느 모델들인지는 읽은 어떤 자료에도 없다 (source). 같은 벤치마크 계열에서 이 위키가 보유한 가장 가까운 수치는 Gemini 3.7 FlashDeepSWE 65.3% 이고, 거기서는 벤치마크의 버전 접미사가 암묵적으로만 붙어 있었다. 그 단서를 달고 비교를 제시하는 것이지, 깔끔한 65.3 → 73.7 로 제시하는 것이 아니다.

추론 벤치마크는 더 완만한 향상을 보였다고 서술될 뿐이고, 읽은 어떤 자료에도 추론 수치는 공개되지 않았다. 이 출시 보도에는 GPQA Diamond 90.4% 라는 수치가 돌아다니는데 그것은 더 이른 Gemini 3 Flash 의 것이다. 나중에 3.8 의 수치로 오인되지 않도록 여기에 기록한다 (source).

Terminal-Bench 2.1, DeepSWE v1.1, SWE-bench Pro 중 어느 것도 이 저장소가 보유한 sources/evals/ 스냅샷에 등장하지 않으므로, 벤더 수치를 대조할 로컬 컬럼이 없다. Gemini 3.7 Flash, Nemotron 3.5 Lightning, Grok Imagine Image 2.0 에 이미 기록된 것과 같은 공백이다. 숫자와 그 출처는 함께 가거나 아예 가지 않는다.

활용 사례

워크호스로 자리매김했고, Google 이 3.7 Flash 에 썼던 것과 같은 단어다. 향상은 소프트웨어 엔지니어링, 에이전트형 과제, 특화 영역의 다단계 추론에서 주장된다 (source).

텍스트·이미지·오디오·비디오를 입력으로 받고 텍스트를 출력한다 (source).

비교

  • Gemini 3.7 Flash — 20일 앞선 직전 모델. 날짜를 빼면 스펙 표가 동일하다
  • Gemini 3.6 Flash — 그 앞 세대
  • Gemini 3.8 Flash Cyber — 같은 날 출시된 제한 접근 형제 모델. Fairwind Program 을 통해서만 접근할 수 있다
  • Gemini 3.5 Flash Cyber — 이전 Cyber 모델. 그런 모델이 어떻게 공개되는지가 무엇이 달라졌는지 보려면
  • Qwen 3.8 Max — Alibaba 는 이 출시로부터 하루 안에 코딩 중심 사후 학습 스냅샷을, 역시 가격을 그대로 두고 내놓았다

Referenced by

Sources