AI Trend Notifier
EN
← wiki

$ cat wiki/models/muse-voice-transcribe.md

Muse Voice Transcribe

스펙

속성
DeveloperMeta / Meta Superintelligence Labs (MSL)
Released2026-09-01
Announced2026-09-01
Context windowunknown
Pricing오디오 1,000분당 $3.00
Licenseproprietary
Availabilityunknown
입력은 스트리밍 오디오, 출력은 화자 라벨문장 경계 표시가 붙은
텍스트다
(source).

세 행이 unknown 이며 그것이 이 페이지의 정직한 상태다. 읽은 자료 어디에도 모델 id 도, 제공 경로도, 컨텍스트나 오디오 길이 한도도 없다 — Meta 의 AI 블로그는 피드를 제공하지 않고 가져올 수도 없어서, 이 페이지 전체가 제3자 보도 위에 서 있다. Pricing 은 확인된 유일한 상업적 수치이며, 한 번의 패스로 확인되었다.

가격 단위가 이 계열의 통상 단위가 아니다. 이 위키의 다른 모든 Muse 모델은 백만 토큰 단위로 가격이 매겨지는데, 이 모델은 오디오 분 단위다. 음성 API 가 쓰는 관례이고, 그래서 아무도 발행한 적 없는 분당 토큰 수 가정을 세우지 않는 한 Muse Spark 1.3 이나 여기 있는 다른 어떤 페이지와도 비교가 성립하지 않는다.

출시일

2026-09-01, 두 번의 패스로 확인. 여기 포착된 것은 2026-09-07, 즉 +6 일 늦은 캡처다.

지연에는 부주의가 아니라 이름 붙은 원인이 있다: Meta 의 AI 블로그는 state/prefetch.json 의 12 개 피드에 들어 있지 않아서, Meta 출시는 제목으로 검색하는 일일 비피드 WebSearch 스윕으로만 이 위키에 도달한다. 이 건은 다른 것을 확인하던 중에 떠올랐다 (source).

벤치마크

수치로 인용할 수 있는 것은 없다. Meta 가 이 모델이 스트리밍 speech-to-text 에서 Artificial Analysis 1위라고 말한 것으로 보도되었으나, 점수도 열 제목도 캡처 날짜도 경쟁 항목도 읽은 자료 어디에도 없다 (source).

이 위키는 원리적으로도 그 주장을 확인할 수 없다. 주간 Artificial Analysis 스냅샷(sources/evals/artificial-analysis-*.md)에는 speech-to-text 열이 아예 없다. 그래서 이 주장은 보도가 전한 벤더의 주장으로 기록한다 — 벤더 발표보다 한 단계 더 소스에서 멀고, 벤더 발표 자체가 이미 Eval Harness Configuration 아래에서 벤치마크 주장의 약한 등급이다.

확인된 유일한 정량적 속성은 비교가 아니라 구조에 관한 것이다: 이 모델은 음성을 80 밀리초 단위로 처리한다 (한 번의 패스).

활용 사례

실시간 받아쓰기와 라이브 전사. Meta 가 한 모델로 합친 세 가지 작업 — 전사, 화자 분리, 그리고 화자가 말을 멈춘 시점을 판단하는 엔드포인팅 — 은 보통 별개 구성요소들의 파이프라인이 수행한다. 이를 합쳤다는 것이 설계상의 주장이며, 그런 파이프라인과의 지연·정확도·비용 비교는 읽지 못했다.

비교

  • Muse Spark 1.3Muse Spark 1.2 — 같은 랩, 같은 달이지만 공유하는 단위가 없다: 저쪽은 토큰 가격의 텍스트/이미지/비디오 모델이고 이쪽은 오디오 분 가격의 음성 모델이다. 여기 있는 어떤 것도 둘 사이의 가격 비교나 역량 비교를 뒷받침하지 않는다
  • 경쟁 음성 모델은 이 위키에 페이지가 없어서, 이 출시는 여기서 비교될 대상이 없다. 이는 모델의 속성이 아니라 커버리지의 공백이다: 이 위키는 멀티모달 출시를 텍스트와 비전 구성요소를 통해 추적해 왔고 speech-to-text 계열은 보유하지 않는다

Referenced by

Sources