AI Trend Notifier
EN
← wiki

$ cat wiki/models/muse-spark-1-2.md

Muse Spark 1.2

나란히 보기

스펙

속성
DeveloperMeta / Meta Superintelligence Labs (MSL)
Released2026-08-05
Announced2026-08-05
Context window1,000,000
Pricing표준 입력 $1.25/M · 출력 $4.25/M · 캐시 $0.15/M · contributor 입력 $0.10/M · 출력 $0.20/M · 캐시 $0.002/M
Licenseunknown
AvailabilityMuse Code (베타, macOS + Linux), Meta Model API
가격 티어는 둘이고, 싼 쪽은 학습 데이터로 값을 치른다. 최초 포착은 표준 티어만 기록했다. 2026-08-10 에 읽은 4개 매체는 Mtok 당 $0.10/$0.20 의 contributor 티어에 일치한다 — 입력 약 12배, 출력 약 21배 저렴 — 그리고 이는 당신의 프롬프트와 완성 결과를 Meta 의 향후 모델 학습에 사용해도 좋다는 명시적 허가를 대가로 하며, 팀당 분당 60 요청으로 제한된다(표준 티어는 3,000)
(source).
이는 물량 할인이 아니라 데이터-대-가격 거래이고, 요청 제한 때문에 동시성이 낮은 작업에만 쓸 수 있다.

Licenseproprietary 가 아니라 unknown 으로 남긴다. 3자 보도는 가중치를 닫힌 것으로, 조건을 Meta Model API 프리뷰 약관으로 서술하며 contributor 티어가 그 위에 학습 데이터 허가를 더한다고 말한다 (source) — 그러나 읽은 어느 소스도 라이선스 원문을 인용하거나 링크하지 않았고, 서술은 라이선스가 아니다. 가중치는 공개되지 않았다 (source).

출시일

2026-08-05, 이 모델이 구동하는 터미널 코딩 에이전트 Muse Code 와 동시에 (source).

벤치마크

Muse Spark 1.1 대비 Meta 자체 보고 수치:

벤치마크Muse Spark 1.1Muse Spark 1.2상승
Terminal-Bench 2.176.2%82.9%+6.7
DeepSWE v1.153.0%59.3%+6.3
Meta 는 방법론을 공개하며, 단서도 Meta 자신의 것이다: 모델을 **Meta 자체 벤더 에이전트
제품 안에서**(Muse Code) 돌렸고, 격리된 Daytona 클라우드 샌드박스에서, **내부 Meta 평가
프레임워크**로, Terminal-Bench 2.1 공식 릴리스의 89개 과제에 대해 **5회 시도 평균
pass@1** 로 채점했다. Meta 는 자사 에이전트 도구와 시스템 프롬프트가 **"독점 서드파티 모델에
특별히 맞춰져 있지 않을 수 있다"**, 즉 경쟁 모델이 최선의 상태로 측정되지 않을 수 있다고
밝힌다 (source).

Meta 자체 비교 차트에서는 Claude 가 세 항목 모두 1위이고, Muse Spark 1.2 는 Meta 가 강조한 벤치마크들에서 2위다 (source).

독립 측정은 Artificial Analysis 가 했고, Intelligence Index 에서 3점 상승을 보고하며 상승분은 에이전틱 평가에 집중된다:

지표Muse Spark 1.1Muse Spark 1.2
GDPval-AA v21371 Elo1631 Elo
Terminal-Bench v2.178%80%
τ³-Banking25%27%
이 저장소는 해당 컬럼을 담은 Artificial Analysis 스냅샷을 로컬에 보유하고 있지 않으므로,
수치는 보고된 대로 인용되며 대조할 로컬 근거가 없다
(source).

활용 사례

  • Muse Code — 터미널 코딩 에이전트, macOS 와 Linux 에서 베타. 코드를 생성하고 검증하며, 세션 내내 백그라운드 서브에이전트 여러 개를 지속적으로 관리한다 (source).
  • 코드 생성, 복잡한 디버깅, 코드베이스 이해, 엔드투엔드 개발 워크플로 — Meta 가 1.1 대비 개선했다고 밝힌 영역 (source).
  • Meta Model API 를 통한 직접 API 사용. 표준 티어 가격과 컨텍스트는 1.1 과 같다 (source). contributor 티어가 1.1 에도 있었는지는 읽은 어느 소스도 밝히지 않는다 (source).

지속되는 백그라운드 서브에이전트는 모델에 대한 주장과 분리해 봐야 할 제품 주장이다. 세션 내내 서브에이전트를 살려 두는 에이전트는 하니스 설계이고, 위 벤치마크 수치는 그 하니스가 루프 안에 있는 상태에서 나왔다. Meta 의 방법론이 그렇게 말한다.

비교

모델가격 (Mtok 당 입력/출력)컨텍스트Terminal-Bench 2.1
Muse Spark 1.2$1.25/$4.25 · contributor $0.10/$0.201M82.9% (Meta) · 80% (AA)
Muse Spark 1.1 (Muse Spark (1.0 / 1.1))$1.25/$4.251M76.2% (Meta) · 78% (AA)
Meta 는 업그레이드를 거치며 표준 티어 가격과 컨텍스트 윈도우를 그대로 두었고, 그만큼은 출시를 상업
조건이 아니라 모델과 하니스에 걸었다는 뜻이다
(source). 다만
contributor 티어는 분명한 상업적 수이고, 날카로운 수다: $0.10/$0.20 은 이 위키에 있는 모든 프런티어
코딩 모델보다 싸며, 그렇게 매겨진 이유는 나머지를 구매자가 자기 코드에 대한 학습 권리로 치르기 때문이다
(source).

상충 보고

Terminal-Bench 및 DeepSWE 수치는 세 가지로 보고되며, 페이지 본문은 Meta 자신의 것을 따른다.

출처Terminal-Bench 2.1DeepSWE 1.1SWE-Bench Pro
Meta (자체 보고)82.9%59.3%보고 없음
Artificial Analysis (독립)80%보고 없음보고 없음
kingy.ai, Meta 보고서를 출처로 제시80.053.361.5
세 번째 행은 같은 출처를 주장하면서 첫 행과 공통 벤치마크 둘 다에서 어긋나고, 다른 어떤
소스에도 없는 SWE-Bench Pro 수치를 싣는다. 두 번째 행은 모순이 아니라 다른 측정이다 —
다른 하니스는 다른 수치를 내는 것이 당연하며, Meta 자신이 그렇게 말한다. 조정하지 않고
기록한다 (source).

열린 질문

  • 1.2 는 Muse Spark 1.1 의 백본을 공유하는가, 별도 학습 실행인가? Watermelon 과의 관계는 밝혀지지 않았다.
  • 파라미터 수, 아키텍처, 학습 컴퓨트 — 어느 것도 공개되지 않았다.
  • Muse Code 는 미국 밖에서 쓸 수 있는가? Meta Model API 퍼블릭 프리뷰는 1.1 시점에 미국 개발자 전용이었다.
  • 1.2 를 규율하는 라이선스는 무엇이며, 1.1 의 것과 다른가?

Referenced by

Sources