$ cat wiki/models/gemini-3-5-transcribe.md
Gemini 3.5 Transcribe
스펙
| 속성 | 값 |
|---|---|
| Developer | Google DeepMind |
| Released | 2026-08-26 |
| Announced | 2026-08-26 |
| Context window | unknown |
| Pricing | unknown |
| License | proprietary |
| Availability | Google Antigravity; Gboard Rambler; 개발자 API. Search Live, Gemini Live, Docs, Keep, Gmail, Chrome 에 적용 예정 |
Context window 가 unknown 인 것은 읽은 자료 어디에도 오디오 길이나 토큰 한도가 | |
없기 때문이고, Pricing 이 unknown 인 것은 요금이 공개되지 않았기 때문이다. | |
| API model id 도 확인되지 않았다 | |
| (source). |
출시일
2026-08-26. 85개 이상 언어를 자동 감지하는 전사 모델 (source).
흥미로운 주장은 정확도가 아니라, 출력이 전사가 아니라는 점이다. 이 모델은 정형화되지 않은 발화를 서식 있는 텍스트로 바꾸고, 필러 워드를 제거한다 — 인식만이 아니라 편집을 하고 있다. 그래서 이 모델의 WER 은 두 가지 일 중 하나에 대한 측정이며, 나머지 하나는 어디에서도 측정되지 않는다: 서식화나 필러 워드 제거가 올바른지에 대한 수치가 없고, 의미를 담고 있던 비유창성이 사라질 때 사용자가 무엇을 잃는지에 대한 서술도 없다.
벤치마크
Google 자체 수치, FLEURS 에서 "상위 언어·로케일 집합 기준":
| 모드 | WER |
|---|---|
| 스트리밍 | 5.50% |
| 비스트리밍 | 5.04% |
| Google 자사 Chirp 3 (2025) 대비: word error rate 개선과 "현저히 나은 지연" — | |
| 최종 전사까지 걸리는 시간 70% 단축 | |
| (source). |
그 수치들에는 단서가 둘 따라붙는다. 비교 기준이 Google 의 이전 모델 하나뿐이고 제3자 ASR 시스템은 등장하지 않는다. 그리고 "상위 언어·로케일 집합 기준"이라는 표현이 85개 이상 언어 감지를 말하는 주장에서 실제로 하중을 진다: FLEURS 는 102개 언어를 포괄하는데 채점된 부분집합은 명시되지 않았고, 자원이 가장 풍부한 언어들 위에서 평균낸 WER 은 저자원 언어 사용자가 얻는 수치가 아니다.
활용 사례
받아쓰기와 메모 캡처가 실제 배포처다: Gboard Rambler 가 이 모델 위에서 돌고, Search Live, Gemini Live, Docs, Keep, Gmail, Chrome 이 적용 예정으로 지목되었다. 개발자에게는 API 로 제공되며, 오늘 기준 Google Antigravity 에서 쓸 수 있다 (source).
비교
- SL2T — 2026-08 의 또 다른 DeepMind 인식 모델로, 수어를 텍스트로 옮기며 Gboard 와 Live Transcribe 를 통해 Pixel 에 탑재되었다. 같은 달, 같은 표면, 그리고 역량은 공개하고 정확도는 공개하지 않는 같은 패턴 — 다만 SL2T 는 수치를 전혀 내지 않았고, Transcribe 는 적어도 자사 전작 대비 WER 을 낸다.
- GPT-Realtime-2 (OpenAI) 와 Grok Voice Think Fast 2.0 — 음성 대 음성 등급. 과제가 다르다: 그 모델들은 답하고, 이 모델은 받아 적는다. 이 위키에는 그들 사이에 공유되는 벤치마크가 없다.