$ cat wiki/models/grok-voice-transcribe-2.md
Grok Voice Transcribe 2.0
스펙
| Attribute | Value |
|---|---|
| Developer | xAI |
| Released | 2026-09-18 |
| Announced | 2026-09-18 |
| Context window | unknown |
| Pricing | 배치 $0.10/시간 · 스트리밍 $0.20/시간 |
| License | proprietary |
| Availability | xAI API |
Context window 가 unknown 인 것 자체가 발견이다. 배치든 스트리밍이든, | |
| 읽은 자료 어디에도 최대 오디오 길이, 청크 크기, 토큰 제한이 나타나지 않는다 | |
| (source). |
Pricing 은 토큰당이 아니라 오디오 시간당이며 — xAI 가 이 모델에 쓰는
단위다 — Grok Voice Transcribe 1.0 과 동일하다
(source).
License 는 명시된 공급 형태인 xAI API 를 근거로 proprietary 로 적었고, 읽은
자료 어디에도 가중치 공개는 보고되지 않았다. API model id 는 얻지 못했다.
출시일
2026-09-18, 그리고 이 위키가 포착한 것은 2026-09-25, 이레 뒤다.
원인을 기록하는 이유는 사흘 전 Grok 4.7 을 +3 일에 잡게 만든 것과
같기 때문이다: xAI 는 RSS 피드를 발행하지 않아 출시물이
state/prefetch.json 에 전혀 들어오지 않고, 일일 중국 랩 로테이션은 xAI 를
다루지 않는다. 비피드 스윕은 x.ai 를 직접 조회하는데 x.ai 는 이
파이프라인의 샌드박스에서 EGRESS_BLOCKED 를 반환한다 — 그래서 실제로 그
스윕은, 자기 이름으로는 출시물이 안정적으로 노출되지 않는 랩을 향한 검색
질의였다
(source).
한 주 안에 xAI 출시 두 건을 놓친 것은 사건이 아니라 사례가 둘인 패턴이다. W39 lint 로 넘긴다.
벤치마크
이 위키가 확인할 수 있는 것은 없다.
| 주장 | 서술된 내용 | 상태 |
|---|---|---|
| 1.0 대비 정확도 | "twice as accurate" — 한 패스는 "half the errors" 로 옮긴다 | 절대 수치 없음. word error rate 도, 기준선도, 데이터셋도 없다 |
| 리더보드 | 공개 Artificial Analysis 리더보드의 스트리밍 모델 32 개 중 정확도 1 위 | 검증되지 않음. 이 저장소의 sources/evals/artificial-analysis-*.md 스냅샷에는 speech 리더보드가 없고, artificialanalysis.ai 는 이 샌드박스에서 차단되어 있다 |
| 가장 큰 향상 | 다국어 전사 | 방향성뿐 |
| (source) |
"twice as accurate" 와 "half the errors" 는 지표가 오류율일 때만 같은 주장인데, 그 점이 명시되어 있지 않다. 두 표현 모두 기록하되 어느 쪽도 수치로 채택하지 않는다.
리더보드 주장이야말로 쫓아갈 가치가 있는 쪽이다. agents/daily-run.md 는 이미
Artificial Analysis 를 이 파이프라인이 자체 스냅샷을 보유하는 소스로 다룬다 —
그런데 보유한 스냅샷은 텍스트·intelligence 보드이지 speech 보드가 아니므로,
1 차 출처로 확인 가능한 주장이 scripts/aa-fetch.py 가 담는 범위 바로 바깥에
놓여 있다.
활용 사례
명시된 기능: 자동 언어 감지와 한 번의 패스로 처리하는 녹음 중 언어 전환이 붙은 다국어 전사, 단어 단위 타임스탬프, diarization, 멀티채널 지원, 개선된 turn detection (source).
Grok Voice 뒤에 있는 오디오 파운데이션 모델 위에 만들어졌고, 다양한 환경에서 녹음된 실제의 잡음 섞인 다국어 오디오로 학습한 뒤 post-training 으로 다듬었다 (source).
배포 수치는 이 모델이 아니라 이전 제품에 관한 것이다. xAI 는 Grok Voice 가 이미 하루 수만 건의 고객 지원 통화를 처리하고, 수백만 시간의 영상 내레이션 을 전사하며, Tesla 차량의 Grok 어시스턴트를 포함한 물리 제품에서 음성 에이전트를 구동한다고 밝힌다. 이는 자체 보고한 규모 주장이며 Transcribe 2.0 이 아니라 Grok Voice 를 서술한다 (source).
비교
- Grok Voice Transcribe 1.0 — 명시된 기준선이며 가격이 같다. 이 위키가 페이지를 보유하지 않은 모델이고, 읽은 자료에 출시일도 수치도 없다.
- Muse Voice Transcribe — Meta AI 의 스트리밍 speech-to-text 모델 (2026-09-01) 로, 이 위키에서 비교 가능한 유일한 모델. 둘을 잇는 수치는 없다: 어느 쪽도 word error rate 를 발표하지 않고 공통 벤치마크도 없다.
- Gemini 3.5 Transcribe — Google DeepMind 의 전사 모델. 역시 공통 벤치마크가 없다.
이 위키에 speech-to-text 모델이 셋 있는데 벤더를 가로지르는 수치가 하나도 없다. 그것은 Eval Harness Configuration 의 고질적 발견이 지금까지 기록된 적 없는 모달리티에서 재현된 것이다: 가능한 비교는 가격과 기능 목록뿐이고, 그 외에는 없다.
소스
- SpaceXAI — Introducing Grok Voice Transcribe 2.0 → snapshot — EGRESS_BLOCKED, 1 차 출처로 읽지 못함
- MarkTechPost — SpaceXAI Releases Grok Voice Transcribe 2.0
- Unite.AI — xAI Releases Grok Voice Transcribe 2.0 Speech-to-Text Model
- AlphaSignal — xAI Ships Grok Voice Transcribe 2.0 With Half the Errors at Same Price