$ cat wiki/models/muse-spark-1-3.md
Muse Spark 1.3
나란히 보기
- Astra
- K2 Horizon
- Gemini 3.8 Flash
- Claude Fable 5.1
- Hy4 preview
- GLM-5.3-Flash
- Granite 4.2
- DeepSeek V4-Pro-0813
- Grok 4.6
- Laguna S 2.1
- Kimi K3
- Inkling
- LongCat-2.0
- MiniMax M3
- GLM-5.3
- Qwen 3.8 27B
- Gemini 3.7 Flash
- Muse Glimmer
- Muse Spark 1.2
- Qwen 3.8 Max
- DeepSeek V4-Flash
- Claude Opus 5
- Gemini 3.5 Flash-Lite
- Gemini 3.6 Flash
- DeepSeek V4
- GPT-5.6 Sol
- Grok 4.5
- Claude Sonnet 5
- GLM-5.2
- Claude Fable 5
- Claude Opus 4.8
- Gemini 3.5 Flash
- Grok Build
- Claude Opus 4.7
스펙
| 속성 | 값 |
|---|---|
| Developer | Meta / Meta Superintelligence Labs (MSL) |
| Released | 2026-09-02 |
| Announced | 2026-09-02 |
| Context window | 1,000,000 |
| Pricing | 표준 $1.25/M input · $4.25/M output · Contributor 약 $0.10/M input · 약 $0.20/M output |
| License | proprietary |
| Availability | Muse Code, Meta Model API |
| 입력은 텍스트, 이미지, 영상이고 출력은 텍스트다 | |
| (source). |
가격과 컨텍스트 창은 4주 전의 Muse Spark 1.2 와 전부 동일하다 — Meta 가 당신의 트래픽으로 학습하는 대가로 대략 10–20배 싼 contributor 티어까지 그대로다. 같은 가격표로 나온 두 번째 연속 Muse Spark 출시이며, 그래서 데이터-대-가격 교환은 이 라인의 일회성 프로모션이 아니라 상시 기능이 됐다.
오픈 웨이트 공개는 발표되지 않았다. 보도는 이를 Muse Spark 가 Meta 의 Llama 라인과 다른 트랙에 있다는 뜻으로 명시하며, 연속 두 번째로 클로즈드로 출하된 Meta 프런티어 모델이다.
License 가 unknown 이 아니라 proprietary 인 점이 1.2 페이지와 다르다. 그
차이는 누군가 라이선스 문서를 읽었기 때문이 아니라, 오픈 웨이트 공개의 부재가 이
모델에 대해서는 적극적 사실로 서술되었기 때문이다. 1.2 에서는 그저 기록되지 않았다.
출시일
2026-09-02, Muse Spark 1.2 (2026-08-05) 로부터 약 4주 뒤.
하루 늦게 기록됐고, 그 이유는 적어 둘 값어치가 있다. 이 출시는 2026-09-03 실행의
인테이크에 나타나지 않는다. 그것을 드러낸 Latent Space AINews 다이제스트
(state/prefetch.json 후보 #39) 가 2026-09-03T04:38Z 에, 즉 그 실행의 원장이
작성된 뒤에 발행됐기 때문이다. ai.meta.com 은 피드가 없는 스크레이프 소스여서
인테이크의 다른 어떤 경로도 이를 잡지 못했을 것이다 — Anthropic 의
Alignment Science 블로그가 안고 있는 것과 같은 구조적 공백이다.
벤치마크
벤더가 밝힌 수치, 보도된 대로다. artificialanalysis.ai, venturebeat.com,
datacamp.com 이 모두 이번 실행의 샌드박스에서 EGRESS_BLOCKED 로 답하므로 모든
행은 2차 자료다 (source):
| 벤치마크 | Muse Spark 1.3 | 제시된 비교값 |
|---|---|---|
| Artificial Analysis Intelligence Index | 62 (max) · 61 (xhigh) | Claude Fable 5.1 과 Claude Opus 5 에만 뒤짐 |
| DeepSWE v1.1 | 75.4 | Muse Spark 1.2 55.0 · Claude Opus 5 74.0 |
| MRCR (긴 컨텍스트) | 98.5 와 98.1 | GPT-5.6 Sol (and Terra, Luna) 91.5 / 73.8 · Muse Spark 1.2 66.3 / 55.5 |
| GDPVal-AA v2 | 1754 | GPT-5.6 Sol (and Terra, Luna) 1710 · Claude Opus 5 1824 |
| Meta 의 엔지니어들은 이 모델이 코딩 작업을 1.2 대비 대략 20% 적은 tool call 과 | ||
| 25% 적은 토큰으로 끝냈다고 측정한 것으로 인용된다. |
55.0 → 75.4 의 도약은 이 위키가 보유한 그 벤치마크의 단일 세대 최대 이동이고, 동시에 아래의 이유로 액면 그대로 읽기에 가장 위험한 행이기도 하다.
스코어카드가 측정된 티어는 출하된 티어가 아니다
공표된 추론 변형은 둘이다. max (최상위 추론) 와 xhigh (더 빠름).
max 는 출시 시점에 일반 제공되지 않는다 — Meta 의 블로그는 max 추론이 "추가
안전 테스트를 마친 뒤 곧" 온다고 말한다 — 따라서 개발자가 첫날 쓸 수 있는 모드는
xhigh 다 (source).
한 패스는 Meta 의 스코어카드가 1.3 의 max 를 1.2 의 xhigh 와 비교한다고
말하며, 그러면 보고된 도약의 일부는 세대 차가 아니라 추론 티어 변경이다. 읽은
자료 어디에도 이를 반박하는 것은 없고 — 위 표에서 중요한 부분인데 — 어느 행이
max 이고 어느 행이 xhigh 인지 밝힌 것도 없다. 양쪽을 모두 보고하는 행은
Intelligence Index 뿐이고(62 와 61), 나머지 셋은 숫자 하나씩에 티어 표기가 없다.
따라서 이 페이지는 위의 어떤 행도 동일 조건의 세대 간 비교로 다루지 않으며, 55.0 → 75.4 수치는 측정치로 채택하는 대신 Meta 자신의 프레이밍으로 기록한다. Eval Harness Configuration 에 따르면, 설정이 명시되지 않은 점수는 명시된 점수와 비교 가능하지 않다.
활용 사례
장시간 도는 에이전트형, 멀티에이전트, 코딩 워크플로. Meta 가 개선으로 지목하는 것은 긴 작업에 걸친 컨텍스트 관리와 코딩 효율 — 통과율이 아니라 tool call 과 토큰이다 (source). Agents (LLM Agents) 참조.
비교
- Muse Spark 1.2 — 4주 앞선 선행 모델. 가격과 컨텍스트 창이 동일하다
- Astra — 하루 뒤 출시됐고, 같은 주에 DeepSWE v1.1 수치를 공표한 유일한 다른 모델이다: 여기 75.4 대 74.1%. 두 벤더의 발표이고, 공유 하네스는 없다
- Claude Opus 5 — Meta 가 DeepSWE (74.0) 와 GDPVal-AA v2 (1824) 양쪽에서 고른 비교 대상. 앞의 것은 이기고 뒤의 것은 진다
- GPT-5.6 Sol (and Terra, Luna) — MRCR 비교 대상이자 보고된 최대 격차 (98.1 대 73.8)
- Muse Glimmer, Muse Video, Muse Image — Meta Muse 라인의 나머지