$ cat wiki/models/sl2t.md
SL2T
스펙
| 속성 | 값 |
|---|---|
| Developer | Google DeepMind |
| Released | 2026-08-12 |
| Announced | 2026-08-12 |
| Context window | unknown |
| Pricing | unknown |
| License | unknown |
| Availability | Pixel 11 — Gboard 및 Live Transcribe (수어-텍스트 받아쓰기) |
앞의 세 행을 뺀 모두가 unknown 이고, 그 이유는 읽기가 아니라 발표 쪽에 있다. 읽은 자료 | |
| 어디에도 파라미터 수, 아키텍처, 컨텍스트 윈도, 라이선스, 가중치 공개, API 에 관한 진술이 | |
없다 (source). Pricing 이 | |
"무료"가 아니라 unknown 인 것은, 이 모델이 휴대폰 기능 안에 실려 나가고 그 상업적 조건에 | |
| 관한 진술은 읽지 못했기 때문이다. |
Availability 는 유통 경로가 아니라 제품 표면이다. 이 모델을 Pixel 11 바깥에서 얻을 수
있다는 표시는 어디에도 없다.
방법
기기 경계를 사이에 두고 나뉜 두 모델 (source):
- 온디바이스 모델이 카메라 영상을 "기하 좌표로 이루어진 일종의 와이어프레임"으로 변환한다
- 영상이 아니라 그 좌표가 Google 서버로 전송되고, 거기서 SL2T 가 번역을 수행한다
Google 은 이 분리가 프라이버시 설계라고 밝힌다. 정확히 읽을 값어치가 있다. 원본 영상은 기기를 떠나지 않는다고 명시되어 있고, 그로부터 뽑아낸 포즈 데이터는 떠난다. 이것은 하이브리드 시스템이지 온디바이스 모델이 아니며, 이 페이지는 "온디바이스 수어 번역"이 아니라 그렇게 기록한다 — 발표의 모양새는 앞쪽으로 읽히기를 부르지만.
학습 데이터: "10만 시간 이상"의 다국어 수어 데이터, 그중 "약 사분의 일"이 American Sign Language (source).
벤치마크
공개된 것 없음. 읽은 자료 어디에도 정확도, 단어 오류율, 비교 수치가 등장하지 않는다 (source).
가치 주장 전체가 전사 품질에 달린 접근성 제품이 품질 수치 하나 없이 발표된 것이다. 그 부재는
채워 넣지 않고 기록한다. 이 저장소가 보유한 어떤 sources/evals/ 스냅샷에도 이 모델은 없고,
애초에 그중 어디에도 수어 벤치마크 자체가 없다.
활용 사례
명시된 것: Gboard 와 Live Transcribe 에서의 수어-텍스트 받아쓰기. 청각장애인과 난청 사용자가 "평소 타이핑했을 자리 어디에서나 휴대폰에 수어로 말할 수 있게" 한다 (source).
명시된 대상: "전 세계에서 청각장애 또는 난청인 것으로 추정되는 7천만 명" (source).
학습 데이터와 출시된 기능 사이의 간극이 지켜볼 지점이다. 모델은 다국어 수어 데이터로 학습됐고, 제품이 번역하는 것은 ASL → 영어 텍스트 하나뿐이다. 두 번째 언어 쌍에 대한 일정은 읽은 자료 어디에도 없고, 수어들은 서로 통하지 않는다 — 다국어 학습 데이터가 ASL-영어 기능을 BSL 이나 KSL 사용자에게 쓸모 있게 만들어 주지는 않는다.
비교
- SignGemma — Google 은 이전에 같은 이름의 수어 번역 모델에 대해 공개 피드백을 요청한 적이 있다 (source). SL2T 가 그 후속인지, 이름을 바꾼 것인지, 무관한 계열인지는 읽은 자료 어디에도 명시되어 있지 않으며, 여기서 추론하지 않는다
- Gemini Omni — DeepMind 의 범용 멀티모달 모델. SL2T 는 대신 단일 목적 번역기로 시스템 키보드 안에 들어갔다
- Gemma 3n — 온디바이스 계열. SL2T 는 포즈 추출 쪽 절반이 온디바이스이고 번역 쪽 절반은 아니다