$ cat wiki/models/gemini-3-8-live-extended-thinking.md
Gemini 3.8 Live Extended Thinking
스펙
| Attribute | Value |
|---|---|
| Developer | Google DeepMind |
| Released | 2026-09-15 |
| Announced | 2026-09-15 |
| Context window | unknown |
| Pricing | 입력 오디오 시간당 $3.50 |
| License | proprietary |
| Availability | Gemini API, Google AI Studio, Search Live · 기업용은 Gemini Enterprise 경유 |
| Gemini 3.8 Live 와 함께 *"Introducing Gemini 3.8 Live and 3.8 Live | |
| Extended Thinking"* 한 편으로 발표됐고, "동일한 개발자·기업 공급" 을 받는다고 | |
| 서술됐다 | |
| (source). |
Pricing 칸은 오디오 시간당 요율이지 토큰당 가격이 아니며, 둘은 서로 대체되지
않는다. 두 모델을 통틀어 발행된 유일한 비용 수치이고, 한 번의 검색 패스 에
근거하며, 토큰당 요율·context window·API 모델 id 는 읽은 자료 어디에도 없다.
unknown 대신 행에 적은 이유는 실재하는 과금 단위에 대한 실재하는 발행 가격이기
때문이다. 이 저장소의 스펙 표가 보통 나르는 토큰당 가격은 읽은 자료에 존재하지
않는다 (source).
이 페이지를 넘어서는 문제이기도 하다. scripts/spec-check.py 는 Pricing 을
토큰당 카탈로그에 되짚어 읽으므로, 오디오 시간 요율은 그 검사가 확인할 수 없는
칸이다. Gemini Omni 1.1 Flash 가 초당 영상 가격으로 안고 있는 것과
같은 구멍이다.
출시일
2026-09-15. DeepMind 자체 RSS 항목
(Tue, 15 Sep 2026 17:05:57 +0000) 으로 확정했고 그것은 state/prefetch.json 에
담겨 있다. 발표 페이지는 이 실행의 샌드박스에서 닿을 수 없다
(source).
벤치마크
Artificial Analysis Speech to Speech Quality Index — 두 패스, 동일한 자릿수, 같은 세 행이며, 발행된 열 제목과 함께 인용한다 (source):
| Model | Speech to Speech Quality Index |
|---|---|
| Gemini 3.8 Live Extended Thinking | 82.6% |
| GPT-Live-1 "GPT-Live-1 Astra (Medium)" | 81.5% |
| Grok Voice Think Fast 2.0 "(High)" | 81.3% |
| 해당 지수에서 "선두" 를 차지한 것으로 보고됐다. |
차이는 2 위 행 대비 1.1 포인트, 3 위 행 대비 1.3 포인트이며 신뢰구간은 발행되지 않았다. 세 행 중 둘은 괄호 안에 추론 강도 수식어 — "Medium", "High" — 를 달고 있고 1 위 행에는 없다. 즉 세 항목이 같은 강도에서 돌았다고 명시되지 않았다. Eval Harness Configuration 이 존재하는 이유가 되는 구분이고, 여기서는 해소되지 않는다.
이 수치는 sources/evals/artificial-analysis-* 스냅샷에서 온 것이 아니다.
Artificial Analysis 의 열을 인용한 벤더·보도 수치다. 이 저장소가 가진 가장 최근
AA 스냅샷은 2026-09-13 이고 speech-to-speech 열을 담고 있지 않아 대조할 로컬
열이 없다 — Gemini 3.8 Flash 와 Gemini 3.7 Flash 에 이미
기록된 것과 같은 구멍이다. AA 스냅샷은 일요일에만 포착되므로, 로컬 읽기가 이를
뒷받침할 수 있는 가장 이른 시점은 2026-09-20 이다.
같은 두 경쟁 모델 대비 비용 (1 패스)
| Model | Cost per hour of input audio |
|---|---|
| Gemini 3.8 Live Extended Thinking | $3.50 |
| Grok Voice Think Fast 2.0 | $4.80 |
| GPT-Live-1 | $5.83 |
| 품질에서 앞서면서 둘 다보다 싸다는 구도로 제시됐고 — 가까운 쪽보다 27% 낮다. | |
| 품질 표와 비용 표가 같은 세 모델을 같은 순서로 부르고 있고, 그것은 벤더가 고른 | |
| 프레임이며 그렇게 기록한다. |
활용 사례
대화의 흐름을 끊지 않으면서 더 많은 추론이 필요한 고복잡도 과제 를 겨냥한다 (2 패스). 규모와 비용 효율로 자리매김된 형제 모델과 대비된다 (source).
짝에 명시된 역량을 공유한다: 대화 도중 97 개 언어 사이 탐지·전환, 말을 이어가면서 백그라운드로 tool call 과 API 요청 실행, 시각 입력의 준실시간 처리 (1 패스) (source).
라이브 오디오에서의 "extended thinking" 은 텍스트 환경에는 없는 지연 제약 아래 놓인 Test-Time Compute (Inference-Time Compute Scaling) 다. 추론 예산이 대화 한 턴 안에 들어가야 한다. 읽은 자료 어디에도 thinking 예산도, 턴 지연도, 예산을 어떻게 제어하는지도 없으므로 여기서 그 이름이 무엇을 가리키는지는 확립되지 않았다.
비교
- Gemini 3.8 Live — 같은 날, 같은 공급 경로로 발표된 짝의 저비용 쪽이자 수치가 하나도 없는 쪽
- GPT-Live-1 — 벤더가 비교 대상으로 삼은 OpenAI 계열. 이 표들에서 81.5% 와 시간당 $5.83
- Grok Voice Think Fast 2.0 — xAI 계열. 81.3% 와 시간당 $4.80
- Gemini 3.5 Transcribe — 같은 랩의 음성 계열이되 대화가 아니라 인식 쪽
- Gemini 3.8 Flash — 같은 세대의 텍스트 주력. 그쪽은 가격과 context window 가 발행돼 있다