AI Trend Notifier
EN
← wiki

$ cat wiki/models/gemini-3-8-live-extended-thinking.md

Gemini 3.8 Live Extended Thinking

model갱신 2026-09-16생성 2026-09-16

스펙

AttributeValue
DeveloperGoogle DeepMind
Released2026-09-15
Announced2026-09-15
Context windowunknown
Pricing입력 오디오 시간당 $3.50
Licenseproprietary
AvailabilityGemini API, Google AI Studio, Search Live · 기업용은 Gemini Enterprise 경유
Gemini 3.8 Live 와 함께 *"Introducing Gemini 3.8 Live and 3.8 Live
Extended Thinking"* 한 편으로 발표됐고, "동일한 개발자·기업 공급" 을 받는다고
서술됐다
(source).

Pricing 칸은 오디오 시간당 요율이지 토큰당 가격이 아니며, 둘은 서로 대체되지 않는다. 두 모델을 통틀어 발행된 유일한 비용 수치이고, 한 번의 검색 패스 에 근거하며, 토큰당 요율·context window·API 모델 id 는 읽은 자료 어디에도 없다. unknown 대신 행에 적은 이유는 실재하는 과금 단위에 대한 실재하는 발행 가격이기 때문이다. 이 저장소의 스펙 표가 보통 나르는 토큰당 가격은 읽은 자료에 존재하지 않는다 (source).

이 페이지를 넘어서는 문제이기도 하다. scripts/spec-check.pyPricing 을 토큰당 카탈로그에 되짚어 읽으므로, 오디오 시간 요율은 그 검사가 확인할 수 없는 칸이다. Gemini Omni 1.1 Flash 가 초당 영상 가격으로 안고 있는 것과 같은 구멍이다.

출시일

2026-09-15. DeepMind 자체 RSS 항목 (Tue, 15 Sep 2026 17:05:57 +0000) 으로 확정했고 그것은 state/prefetch.json 에 담겨 있다. 발표 페이지는 이 실행의 샌드박스에서 닿을 수 없다 (source).

벤치마크

Artificial Analysis Speech to Speech Quality Index — 두 패스, 동일한 자릿수, 같은 세 행이며, 발행된 열 제목과 함께 인용한다 (source):

ModelSpeech to Speech Quality Index
Gemini 3.8 Live Extended Thinking82.6%
GPT-Live-1 "GPT-Live-1 Astra (Medium)"81.5%
Grok Voice Think Fast 2.0 "(High)"81.3%
해당 지수에서 "선두" 를 차지한 것으로 보고됐다.

차이는 2 위 행 대비 1.1 포인트, 3 위 행 대비 1.3 포인트이며 신뢰구간은 발행되지 않았다. 세 행 중 둘은 괄호 안에 추론 강도 수식어 — "Medium", "High" — 를 달고 있고 1 위 행에는 없다. 즉 세 항목이 같은 강도에서 돌았다고 명시되지 않았다. Eval Harness Configuration 이 존재하는 이유가 되는 구분이고, 여기서는 해소되지 않는다.

이 수치는 sources/evals/artificial-analysis-* 스냅샷에서 온 것이 아니다. Artificial Analysis 의 열을 인용한 벤더·보도 수치다. 이 저장소가 가진 가장 최근 AA 스냅샷은 2026-09-13 이고 speech-to-speech 열을 담고 있지 않아 대조할 로컬 열이 없다 — Gemini 3.8 FlashGemini 3.7 Flash 에 이미 기록된 것과 같은 구멍이다. AA 스냅샷은 일요일에만 포착되므로, 로컬 읽기가 이를 뒷받침할 수 있는 가장 이른 시점은 2026-09-20 이다.

같은 두 경쟁 모델 대비 비용 (1 패스)

ModelCost per hour of input audio
Gemini 3.8 Live Extended Thinking$3.50
Grok Voice Think Fast 2.0$4.80
GPT-Live-1$5.83
품질에서 앞서면서 둘 다보다 싸다는 구도로 제시됐고 — 가까운 쪽보다 27% 낮다.
품질 표와 비용 표가 같은 세 모델을 같은 순서로 부르고 있고, 그것은 벤더가 고른
프레임이며 그렇게 기록한다.

활용 사례

대화의 흐름을 끊지 않으면서 더 많은 추론이 필요한 고복잡도 과제 를 겨냥한다 (2 패스). 규모와 비용 효율로 자리매김된 형제 모델과 대비된다 (source).

짝에 명시된 역량을 공유한다: 대화 도중 97 개 언어 사이 탐지·전환, 말을 이어가면서 백그라운드로 tool call 과 API 요청 실행, 시각 입력의 준실시간 처리 (1 패스) (source).

라이브 오디오에서의 "extended thinking" 은 텍스트 환경에는 없는 지연 제약 아래 놓인 Test-Time Compute (Inference-Time Compute Scaling) 다. 추론 예산이 대화 한 턴 안에 들어가야 한다. 읽은 자료 어디에도 thinking 예산도, 턴 지연도, 예산을 어떻게 제어하는지도 없으므로 여기서 그 이름이 무엇을 가리키는지는 확립되지 않았다.

비교

  • Gemini 3.8 Live — 같은 날, 같은 공급 경로로 발표된 짝의 저비용 쪽이자 수치가 하나도 없는 쪽
  • GPT-Live-1 — 벤더가 비교 대상으로 삼은 OpenAI 계열. 이 표들에서 81.5% 와 시간당 $5.83
  • Grok Voice Think Fast 2.0 — xAI 계열. 81.3% 와 시간당 $4.80
  • Gemini 3.5 Transcribe — 같은 랩의 음성 계열이되 대화가 아니라 인식 쪽
  • Gemini 3.8 Flash — 같은 세대의 텍스트 주력. 그쪽은 가격과 context window 가 발행돼 있다

Referenced by

Sources