$ cat wiki/models/muse-spark-1-2.md
Muse Spark 1.2
model갱신 2026-08-10생성 2026-08-07
나란히 보기
스펙
| 속성 | 값 |
|---|---|
| Developer | Meta / Meta Superintelligence Labs (MSL) |
| Released | 2026-08-05 |
| Announced | 2026-08-05 |
| Context window | 1,000,000 |
| Pricing | 표준 입력 $1.25/M · 출력 $4.25/M · 캐시 $0.15/M · contributor 입력 $0.10/M · 출력 $0.20/M · 캐시 $0.002/M |
| License | unknown |
| Availability | Muse Code (베타, macOS + Linux), Meta Model API |
| 가격 티어는 둘이고, 싼 쪽은 학습 데이터로 값을 치른다. 최초 포착은 표준 티어만 기록했다. 2026-08-10 에 읽은 4개 매체는 Mtok 당 $0.10/$0.20 의 contributor 티어에 일치한다 — 입력 약 12배, 출력 약 21배 저렴 — 그리고 이는 당신의 프롬프트와 완성 결과를 Meta 의 향후 모델 학습에 사용해도 좋다는 명시적 허가를 대가로 하며, 팀당 분당 60 요청으로 제한된다(표준 티어는 3,000) | |
| (source). | |
| 이는 물량 할인이 아니라 데이터-대-가격 거래이고, 요청 제한 때문에 동시성이 낮은 작업에만 쓸 수 있다. |
License 는 proprietary 가 아니라 unknown 으로 남긴다. 3자 보도는 가중치를 닫힌 것으로, 조건을 Meta Model API 프리뷰 약관으로 서술하며 contributor 티어가 그 위에 학습 데이터 허가를 더한다고 말한다
(source) — 그러나 읽은 어느 소스도 라이선스 원문을 인용하거나 링크하지 않았고, 서술은 라이선스가 아니다. 가중치는 공개되지 않았다
(source).
출시일
2026-08-05, 이 모델이 구동하는 터미널 코딩 에이전트 Muse Code 와 동시에 (source).
벤치마크
Muse Spark 1.1 대비 Meta 자체 보고 수치:
| 벤치마크 | Muse Spark 1.1 | Muse Spark 1.2 | 상승 |
|---|---|---|---|
| Terminal-Bench 2.1 | 76.2% | 82.9% | +6.7 |
| DeepSWE v1.1 | 53.0% | 59.3% | +6.3 |
| Meta 는 방법론을 공개하며, 단서도 Meta 자신의 것이다: 모델을 **Meta 자체 벤더 에이전트 | |||
| 제품 안에서**(Muse Code) 돌렸고, 격리된 Daytona 클라우드 샌드박스에서, **내부 Meta 평가 | |||
| 프레임워크**로, Terminal-Bench 2.1 공식 릴리스의 89개 과제에 대해 **5회 시도 평균 | |||
| pass@1** 로 채점했다. Meta 는 자사 에이전트 도구와 시스템 프롬프트가 **"독점 서드파티 모델에 | |||
| 특별히 맞춰져 있지 않을 수 있다"**, 즉 경쟁 모델이 최선의 상태로 측정되지 않을 수 있다고 | |||
| 밝힌다 (source). |
Meta 자체 비교 차트에서는 Claude 가 세 항목 모두 1위이고, Muse Spark 1.2 는 Meta 가 강조한 벤치마크들에서 2위다 (source).
독립 측정은 Artificial Analysis 가 했고, Intelligence Index 에서 3점 상승을 보고하며 상승분은 에이전틱 평가에 집중된다:
| 지표 | Muse Spark 1.1 | Muse Spark 1.2 |
|---|---|---|
| GDPval-AA v2 | 1371 Elo | 1631 Elo |
| Terminal-Bench v2.1 | 78% | 80% |
| τ³-Banking | 25% | 27% |
| 이 저장소는 해당 컬럼을 담은 Artificial Analysis 스냅샷을 로컬에 보유하고 있지 않으므로, | ||
| 수치는 보고된 대로 인용되며 대조할 로컬 근거가 없다 | ||
| (source). |
활용 사례
- Muse Code — 터미널 코딩 에이전트, macOS 와 Linux 에서 베타. 코드를 생성하고 검증하며, 세션 내내 백그라운드 서브에이전트 여러 개를 지속적으로 관리한다 (source).
- 코드 생성, 복잡한 디버깅, 코드베이스 이해, 엔드투엔드 개발 워크플로 — Meta 가 1.1 대비 개선했다고 밝힌 영역 (source).
- Meta Model API 를 통한 직접 API 사용. 표준 티어 가격과 컨텍스트는 1.1 과 같다 (source). contributor 티어가 1.1 에도 있었는지는 읽은 어느 소스도 밝히지 않는다 (source).
지속되는 백그라운드 서브에이전트는 모델에 대한 주장과 분리해 봐야 할 제품 주장이다. 세션 내내 서브에이전트를 살려 두는 에이전트는 하니스 설계이고, 위 벤치마크 수치는 그 하니스가 루프 안에 있는 상태에서 나왔다. Meta 의 방법론이 그렇게 말한다.
비교
| 모델 | 가격 (Mtok 당 입력/출력) | 컨텍스트 | Terminal-Bench 2.1 |
|---|---|---|---|
| Muse Spark 1.2 | $1.25/$4.25 · contributor $0.10/$0.20 | 1M | 82.9% (Meta) · 80% (AA) |
| Muse Spark 1.1 (Muse Spark (1.0 / 1.1)) | $1.25/$4.25 | 1M | 76.2% (Meta) · 78% (AA) |
| Meta 는 업그레이드를 거치며 표준 티어 가격과 컨텍스트 윈도우를 그대로 두었고, 그만큼은 출시를 상업 | |||
| 조건이 아니라 모델과 하니스에 걸었다는 뜻이다 | |||
| (source). 다만 | |||
| contributor 티어는 분명한 상업적 수이고, 날카로운 수다: $0.10/$0.20 은 이 위키에 있는 모든 프런티어 | |||
| 코딩 모델보다 싸며, 그렇게 매겨진 이유는 나머지를 구매자가 자기 코드에 대한 학습 권리로 치르기 때문이다 | |||
| (source). |
상충 보고
Terminal-Bench 및 DeepSWE 수치는 세 가지로 보고되며, 페이지 본문은 Meta 자신의 것을 따른다.
| 출처 | Terminal-Bench 2.1 | DeepSWE 1.1 | SWE-Bench Pro |
|---|---|---|---|
| Meta (자체 보고) | 82.9% | 59.3% | 보고 없음 |
| Artificial Analysis (독립) | 80% | 보고 없음 | 보고 없음 |
| kingy.ai, Meta 보고서를 출처로 제시 | 80.0 | 53.3 | 61.5 |
| 세 번째 행은 같은 출처를 주장하면서 첫 행과 공통 벤치마크 둘 다에서 어긋나고, 다른 어떤 | |||
| 소스에도 없는 SWE-Bench Pro 수치를 싣는다. 두 번째 행은 모순이 아니라 다른 측정이다 — | |||
| 다른 하니스는 다른 수치를 내는 것이 당연하며, Meta 자신이 그렇게 말한다. 조정하지 않고 | |||
| 기록한다 (source). |
열린 질문
- 1.2 는 Muse Spark 1.1 의 백본을 공유하는가, 별도 학습 실행인가? Watermelon 과의 관계는 밝혀지지 않았다.
- 파라미터 수, 아키텍처, 학습 컴퓨트 — 어느 것도 공개되지 않았다.
- Muse Code 는 미국 밖에서 쓸 수 있는가? Meta Model API 퍼블릭 프리뷰는 1.1 시점에 미국 개발자 전용이었다.
- 1.2 를 규율하는 라이선스는 무엇이며, 1.1 의 것과 다른가?
소스
- Meta AI Research — Introducing Muse Code and Muse Spark 1.2 (source)
- Meta — Muse Spark 1.2 & Muse Code Evaluation Methodology
- Artificial Analysis — Muse Spark 1.2
- VentureBeat
- 9to5Mac
- Developers Digest — 12배 저렴한 contributor 티어 (source)
- Wavect — Muse Code 가격과 contributor 티어 가이드
- AiCybr — 전체 가이드, 검증된 벤치마크와 가격