$ cat wiki/models/gemini-3-8-flash-lite-tts.md
Gemini 3.8 Flash-Lite TTS
Google DeepMind 의 대량 처리용 텍스트 음성 변환 모델로, 2026-09-23 에 Gemini 3.8 Flash TTS 와 함께 발표돼 같은 날 Gemini API 와 Google AI Studio 에서 롤아웃됐다. 대량·비용 효율 용도 — 더빙, 오디오 콘텐츠 제작, 음성 에이전트 — 에 자리매김한다 (source).
1 차 출처로 읽지 못했다. deepmind.google 는 이 런의 샌드박스에서
EGRESS_BLOCKED 를 반환한다. 제목, URL, 날짜는 state/prefetch.json 을 통해
Google DeepMind 자체 RSS 피드에서 왔고 본문은 두 개의 검색 패스에서 왔다.
스펙
| Attribute | Value |
|---|---|
| Developer | Google DeepMind |
| Released | 2026-09-23 |
| Announced | 2026-09-23 |
| Context window | 텍스트 입력 8,192 토큰 |
| Pricing | unknown |
| License | unknown |
| Availability | Gemini API, Google AI Studio |
Pricing 은 unknown 이고, 이 모델에서는 그 행이 가장 중요하다. 이 모델이 | |
| Gemini 3.8 Flash TTS 와 별도로 존재할 명시된 이유 전체가 대량에서 더 | |
| 싸다는 것인데, 읽은 범위에 두 모델 어느 쪽의 가격도 없다 — 그래서 둘을 가르는 | |
| 유일한 주장이 아래에 아무 숫자도 갖지 않은 주장이 된다. 한 패스가 이전 Flash | |
| TTS 모델을 오디오 1 분당 약 $0.037 로 기록하지만, 그것은 다른 모델이고 여기서 | |
| 채택하지 않는다 | |
| (source). |
그 밖에 문서화된 사양은 공개된 모든 항목에서 Flash TTS 모델과 동일하다: 같은 텍스트 입력 8,192 토큰, 같은 오디오 출력, 같은 130 개 지원 언어, 같은 보이스 디자인·복제 기능, 같은 SynthID 워터마킹 (문서화 집합에 1 개 패스).
출시일
2026-09-23 (2 개 패스), 발표와 롤아웃이 같은 날이다.
벤치마크
없다. 읽은 범위에 어떤 벤치마크, MOS 점수, 청취 선호도 결과, 지연 시간 수치, 처리량 수치도 나타나지 않는다 (source).
명시된 목적이 비용 효율적인 대량 처리인 모델에서 그 주장을 확립할 수치는 지연 시간과 처리량이며, 둘 다 공개되지 않았다. 그 공백은 채워지는 대신 기록된다.
활용 사례
Google 이 명시한 것 (2 개 패스) (source):
- 더빙
- 대량의 오디오 콘텐츠 제작
- 음성 에이전트
음성 에이전트가 이 모델을 위키의 나머지와 잇는 항목이다. 이 위키에서 Google 음성 모델이 미디어 제작이 아니라 에이전트 스택에 자리매김된 첫 사례이며, 오디오 라인 옆뿐 아니라 Agents (LLM Agents) 옆에 놓이게 한다.
생성된 모든 클립에 SynthID 워터마크가 붙는다 (2 개 패스) — Flash 모델과 동일한 유일한 명시 안전장치이고, 명시된 보이스 복제 역량 옆에서 동의와 초상 통제에 대해 동일하게 침묵한다.
비교
- Gemini 3.8 Flash TTS — 함께 발표됐고, 같은 날, 같은 API, 같은 공개 사양이다. 갈림은 그 뒤에 수치가 없는 명시된 포지셔닝이다: 저쪽은 창작 연출과 캐릭터 디자인, 이쪽은 대량과 비용. 어느 쪽이든 가격이나 지연 시간 수치가 생기기 전까지, 이 위키는 Google 이 무엇을 위한 것이라고 말하는지에서만 다른 두 개의 모델 페이지를 보유한다.
- Gemini 3.5 Transcribe — 음성 출력이 아니라 음성 입력이며, 여기서 보유한 가장 가까운 오디오 비교 대상이다.