$ cat wiki/models/gemini-3-8-flash-tts.md
Gemini 3.8 Flash TTS
Google DeepMind 의 표현력 있는 텍스트 음성 변환 모델로, 2026-09-23 에 Gemini 3.8 Flash-Lite TTS 와 함께 발표돼 같은 날 Gemini API 와 Google AI Studio 에서 롤아웃됐다. 게임, 몰입형 오디오북, 팟캐스트, 인터랙티브 미디어 전반의 깊은 창작 연출과 캐릭터 디자인에 자리매김한다 (source).
1 차 출처로 읽지 못했다. deepmind.google 는 이 런의 샌드박스에서
EGRESS_BLOCKED 를 반환한다. 제목, URL, 날짜는 state/prefetch.json 을 통해
Google DeepMind 자체 RSS 피드에서 왔고 본문은 두 개의 검색 패스에서 왔다.
스펙
| Attribute | Value |
|---|---|
| Developer | Google DeepMind |
| Released | 2026-09-23 |
| Announced | 2026-09-23 |
| Context window | 텍스트 입력 8,192 토큰 |
| Pricing | unknown |
| License | unknown |
| Availability | Gemini API, Google AI Studio |
| 두 행은 읽는 방식을 밝혀 둘 필요가 있다 | |
| (source): |
Context window는 대화 컨텍스트가 아니라 텍스트 입력 예산이다. 8,192 토큰이 들어가고 오디오가 나온다. 스키마가 속성 이름을 고정하고 있고 이것이 공개된 유일한 입력 길이 수치이므로, 이 행은 문서화된 숫자를 싣는다.Pricing은unknown이며 의도적으로 그렇다. 한 패스가 오디오 1 분당 약 $0.037 을 제시하지만 이는 이전 Flash TTS 모델에 대한 것이고, 같은 패스가 주는 토큰당 요율은 Gemini 3.8 Flash 텍스트 모델의 것으로 전혀 다른 모델이다. 어느 것도 이 모델의 가격이 아니며 채택하지 않는다. 가격이 생기면spec-check가 카탈로그에 대조해 읽을 행이 바로 이것이다.
출시일
2026-09-23 (2 개 패스), 발표와 롤아웃이 같은 날이다.
벤치마크
없다. 읽은 범위에 어떤 종류의 벤치마크, MOS 점수, 청취 선호도 결과, 비교 수치도 없다. 품질 주장 전체가 Google 자신의 표현 — "지금까지 가장 표현력 있는 오디오 생성 모델" — 이며 거기에 붙은 측정치는 없다 (source).
이것은 빈 섹션으로 남기기보다 명시할 가치가 있다. 음성 합성에는 확립된 공개 평가들이 있고, 그중 아무것도 공개하지 않는 출시는 이 위키가 오늘 확인할 수 없고 나중에도 확인할 수 없는 주장을 하는 것이다 — 비교할 기준이 아무것도 고정되지 않았기 때문이다.
활용 사례
Google 이 명시한 것 (2 개 패스) (source):
- 게임 — 캐릭터 디자인과 보이스 연출
- 몰입형 오디오북
- 팟캐스트
- 인터랙티브 미디어
역량 규정은 "어조, 속도, 표현적 뉘앙스에 대한 세밀한 제어"를 갖춘 프롬프트로 지시하는 감정 음성 (1 개 패스) 이고, 여기에 보이스 디자인과 보이스 복제 (1 개 패스) 가 더해진다. 130 개 언어가 지원되며 목록은 읽은 범위에 공개돼 있지 않다.
생성된 모든 클립에 SynthID 워터마크가 붙고, 감지되지 않으며 오디오 출력에 직접 삽입돼 AI 생성 음성을 탐지 가능하게 유지한다고 서술된다 (2 개 패스). 그것이 명시된 유일한 안전장치다 — 그리고 그것은 보이스 복제 옆에 명시돼 있으며, 동의·초상·오용 통제는 읽은 범위에 전혀 나타나지 않는다.
비교
- Gemini 3.8 Flash-Lite TTS — 같은 게시물, 같은 날, 같은 API 로 발표됐다. 갈림은 창작 연출 대 대량 처리다: 이 모델은 캐릭터 작업에, Flash-Lite 는 더빙, 대량 오디오, 음성 에이전트에. 읽은 범위에서 둘을 가르는 수치가 하나도 없다 — 가격도, 지연 시간도, 품질도 — 그래서 현재 그 구분은 포지셔닝일 뿐 그 이상이 아니다.
- Gemini 3.5 Transcribe — 오디오 라인의 반대편, 음성 출력이 아니라 음성 입력이며 이 위키가 보유한 가장 가까운 비교 대상이다.
- Gemini 3.8 Flash — 버전 번호를 공유할 뿐 그 밖에는 아무것도 공유하지 않는다. 그것은 텍스트 모델이고 그 가격 행은 여기 적용되지 않는다.