AI Trend Notifier
EN한
← wiki

$ cat wiki/models/grok-4-6.md

Grok 4.6

model갱신 2026-08-23생성 2026-07-21

나란히 보기

스펙

속성값
DeveloperxAI
Released2026-08-07 (보도 기준) — ## 상충 보고 참고. 두 번째 보도 날짜는 2026-08-12
Announced2026-07-18
Context window500,000 토큰
Pricing$2/M input · $6/M output. 200K 토큰에 도달한 요청은 전체가 $4.00/M input · $1.00/M cached input · $12.00/M output 으로 다시 매겨진다
Licenseproprietary
AvailabilityAPI
**세 행이 2026-08-16 에 unknown 을 벗어났고, 그중 어느 것도 1차 소스 페이지에서 온 것이
아니다.** Context window, Pricing, Availability 는 출시 아흐레 뒤에도 unknown 이었고,
당시 이는 조사 부족이 아니라 발견으로 기록됐다. 달라진 것은 같은 사양이 이제 여러 독립
문서 사이트에 일관되게 나타난다는 점이다. 2026-08-07 에는 어디에도 없었다
(source). **이 환경에서 xAI 의
모델 카드·가격 페이지·출시 글을 읽은 적은 여전히 없으므로**, 위의 모든 값은 서드파티이고
그 밑에 깔린 관찰은 그대로 유효하다.

Availability 는 소스가 뒷받침하는 가장 좁은 것으로 API 라고 적는다 — 공개된 토큰 단가는 API 를 함의한다. 읽은 소스 중 어느 것도 서피스(앱, Cursor, X 통합)를 열거하지 않으므로 아무것도 나열하지 않는다.

200K 경계는 계층이 아니라 절벽이다: 요청이 그 선을 넘으면 전체가 다시 매겨지므로, 200,001 번째 토큰의 한계 비용은 그 앞의 모든 토큰에 적용된 차액이다 (source).

출시일

  • 출시: 2026-08-07, 보도 기준 — Musk 가 7월 25일에 제시한 8월 8일경 목표보다 하루 이르고, 8월 4일의 "다음 주쯤" 과도 맞는다. 이 환경에서는 xAI 의 1차 소스 페이지를 읽지 못했으므로 날짜는 서드파티 보도에 실려 있다 (source). 상충: 2026-08-16 에 읽은 네 건의 문서는 대신 2026-08-12 을 적는다 — ## 상충 보고 참고
  • 발표: 2026년 7월 18일 (Elon Musk on X)
  • 사전학습: 2026년 7월 20일 주 완료 예정 (Musk on X); 7월 23일 기준 xAI가 공개 완료를 확인하지 않았지만, 일정상 사전학습이 완료되었거나 거의 완료된 것으로 추정
  • 현재 단계 (2026-07-23 기준): 사후 학습 중으로 추정 — RL 파인튜닝, RLHF, 안전성 평가; xAI에서 공개 업데이트 없음
  • 출시: ~2026년 8월 8일; Musk가 X (7월 25일)에서 4.6이 "약 2주" 후라고 언급 → ~8월 8일. 동시에 Grok 4.7(~4주, ~8월 22일) 확인 — 4.7의 별도 모델로서 최초 공개 확인. (소스)

벤치마크

벤더 벤치마크 표는 읽지 못했다. 출시 보도에 두 수치가 돌고 있는데, 둘 다 xAI 페이지에서 가져온 것이 아니라 매체가 xAI 에 귀속시킨 것이다 (source):

측정보도값보도된 비교 대상
SWE Marathon29.0%Claude Opus 4.8 26.0%
처리량초당 80 트랜잭션—
Eval Harness Configuration 에 따라, 하니스 설명도 없고 뒤를 받치는 벤더
페이지도 없는 단일 매체 수치는 기록만 하고 이 위키의 다른 벤치마크 표와 비교하지 않는다. 두 수치
모두 2026-08-16 에 읽은 자료에는 다시 나타나지 않았다
(source).

첫 독립 측정 — 2026-08-16

Grok 4.6 은 2026-08-09 Artificial Analysis 스냅숏에는 없고 2026-08-16 것에는 있으므로, 이 저장소가 보유한 이 모델의 첫 독립 산출 수치다 (source):

SettingArtificial Analysis Intelligence IndexContext WindowCost per Task USDCreator
Grok 4.6 · high61500k$0.84SpaceXAI
Artificial Analysis Intelligence Index 는 그 발행자가 자기 벤치마크 묶음으로 만든 복합
점수이지 정확도가 아니며, Cost per Task USD 는 그들이 측정한 작업 하나의 비용이지 토큰
단가가 아니다. Creator 가 SpaceXAI 인 것은 그들의 표에 그렇게 적혀 있기 때문이고, 이
위키는 이 모델을 xAI 아래에 둔다.

같은 스냅숏 안에서 읽으면 61 은 GPT-5.6 Sol (max) 및 Claude Opus 5 (high) 와 같은 자리이고, 62 의 Claude Fable 5 (with fallback) 보다 하나 아래, 63 의 Claude Opus 5 (max/xhigh) 보다 둘 아래다 — 그것도 Opus 5 (max) 의 $2.34, Fable 5 의 $3.14 에 대해 $0.84 로 (source). 전작 Grok 4.5 는 $0.36 에 56 이다.

이것은 측정 하나이지 벤치마크 표가 아니다. 평가를 파는 한 업체의 복합 점수이고, 어떤 과제가 움직였는지는 아무것도 말해 주지 않으며, xAI 가 내지 않은 모델 카드를 대신하지 않는다.

2026-08-23 — 추론 설정 셋이 더 붙었고, 격차는 9점이다

일요일 캡처는 위의 high 행 옆에 xhigh, medium, low 행을 더한다 (source):

SettingIntelligence IndexContext WindowCost per Task USDMedian Tokens/s
Grok 4.6 · high61500k$0.8469
Grok 4.6 · xhigh60500k$1.0462
Grok 4.6 · medium59500k$0.6773
Grok 4.6 · low52500k$0.2270
high 가 xhigh 보다 5분의 4 비용으로 더 높은 점수를 받는다. 캡처된 그대로의 발행자 표이며
읽은 대로 기록한다 — 이 위키가 교정할 수 있는 오타가 아니라 역전이고, 1점은 이 종합값이 주 단위로
움직이는 범위 안이다(high 자체는 2026-08-16 의 61 에서 변하지 않았다). 이 설정들이 xAI 의 API
에 어떻게 대응되는지는 읽은 자료에 서술되어 있지 않고, xAI 는 여전히 모델 카드를 내지 않았다.

high → low 격차는 3.8배 비용 차이에 9점이며, 이는 같은 캡처의 Qwen 3.8 27B 43 → 52 와 같은 모양이다: 이 리더보드에서 추론 설정은 모델 세대만큼의 값어치를 하며, 설정 없이 인용된 행은 아무것도 가리키지 않는다.

위 두 표 모두 행 라벨에 설정을 적었고, 이는 의도적이다. scripts/claim-check.py 는 괄호 안의 내용을 지워 행 라벨을 정규화하므로, 그 검사에게 Grok 4.6 (high) 와 Grok 4.6 (low) 는 같은 라벨이다 — 하나가 다른 하나를 조용히 덮어쓰고, 살아남은 값이 인용된 스냅숏에서 마지막에 오는 Grok 4.6 … 행과 대조된다. 2026-08-23 에 이 페이지에서 그렇게 보고된 상충 세 건(61 대 52, $0.22 대 $0.84, 70 대 69)은 양쪽의 모든 수치가 옳았고 짝짓기만 틀린 것이었다. 설정을 괄호 밖에 적으면 각 라벨이 구별되므로, 검사는 이 행들을 잘못 대조하는 대신 대조하지 않는다. 그 대가로 검사가 이 표를 더는 검증하지 않으며 — 스냅숏 자신의 라벨도 여전히 grok 4.6 으로 합쳐진다 — 그것이 정직한 상태다: 행 라벨 대조는 추론 설정을 볼 수 없다.

활용 사례

2026-08-16 에 읽은 문서는 이 모델을 장시간 실행되는 에이전트, 에이전틱 코딩, 대화형·시각 작업을 위해 만들어진 것으로 서술하며, 텍스트와 이미지를 입력받아 텍스트를 출력하고 low / medium / high / xhigh 추론 노력 수준을 갖는다고 적는다 (source).

이는 서드파티가 옮긴 포지셔닝 진술이지 역량 측정이 아니다 — 그 뒤를 받치는 과제 단위 평가는 아무것도 읽지 못했고, 노력 수준은 Claude Sonnet 5 와 Claude Opus 5 가 이미 출시한 방식과 같은 패턴이다.

비교

모델개발사파라미터상태
Grok 4.5xAI1.5T2026-07-08 출시
Grok 4.6xAI발표 2T / 보도 1.5T2026-08-07 출시 (보도 기준)
Kimi K3Moonshot2.8T MoE2026-07-16 출시
MiniMax M3 ProMiniMax2.7T (미확인)Q3 2026 (미확인)

상충 보고

파라미터 수. 2026-07-18 Musk 는 이 모델을 Grok 4.5 의 1.5T 보다 "33% 큰" 2조 파라미터로 발표했고, 이 페이지는 그 수치를 기록했다 (소스). 2026-08-07 출시 보도는 대신 Grok 4.5 와 동일한 "V9" 기반 위의 1.5T 로 서술하며, 이득이 규모가 아니라 개선된 지도 파인튜닝과 강화학습에서 나온다고 한다 (source).

여기서 읽은 어느 소스도 둘을 조정하지 않으며, 둘은 이 릴리스가 무엇인지 — 더 큰 모델인지, 같은 모델을 더 세게 사후 학습한 것인지 — 에 대한 서로 다른 주장이다. 소스 우선순위 규칙상 벤더의 발표가 서드파티 보도보다 우선하므로, 비교 표는 Musk 의 수치를 매체의 것으로 대체하지 않고 둘 다 유지한다. xAI 가 모델 카드를 내는 순간 해소된다. 2026-08-16 에 읽은 자료는 파라미터 수를 아예 언급하지 않으므로, 이 상충은 그 수집으로 달라지지 않는다 (source).

출시일. 이 페이지는 2026-08-08 이후 그날의 출시 보도에서 온 2026-08-07 을 실어 왔다 (source). 2026-08-16 에 읽은 네 건의 문서는 출시를 2026-08-12 로 적는다 (source).

양쪽 모두 서드파티라서 소스 우선순위 규칙이 둘을 가르지 못하고, 이 환경에서 도달 가능한 xAI 1차 페이지도 없다. Released 행은 2026-08-07 을 유지한다 — 더 이른 주장이고, 이 페이지가 여드레 동안 게시해 온 것이며, 같은 지위의 나중 주장으로 날짜 있는 주장을 갈아 끼우는 것은 Qwen 3.8 27B 가 경고로 존재하는 바로 그 조용한 정정이 된다. 08-12 날짜는 대신 여기에 기록한다. 2026-08-09 Artificial Analysis 스냅숏에 이 모델이 없다는 것은 두 날짜 어느 쪽과도 어긋나지 않으므로 아무것도 결정하지 않는다.

소스

주요 사실 (발표 기준)

  • 파라미터 수: 2조 (Grok 4.5의 1.5T 대비 33% 증가)
  • 성능 주장: "모든 면에서 [Grok 4.5]보다 낫다" (Musk, 미검증)
  • 속도 목표: Grok 4.5와 "속도 및 토큰 효율성을 비슷하게 유지"
  • 동기: Musk가 Moonshot AI의 Kimi K3 (2.8T MoE, 2026년 7월 16일 발표)에 대한 직접 대응으로 언급
  • 월간 주기: 2026년 남은 기간 매달 출시하겠다는 xAI 의 6월 28일 발표와 일치

⚠️ 벤치마크, 가격, 컨텍스트 창, 공식 출시일이 아직 공개되지 않았습니다. 서드파티 평가로 검증될 때까지 성능 주장은 사전 출시 홍보 문구로 처리하세요.

발표 시점에 쓰였다. 2026-08-16 에 일부가 뒤집혔다: 가격표와 500K 컨텍스트 윈도가 이제 여러 서드파티에 문서화돼 있고, Artificial Analysis 가 독립 지수 수치 하나를 준다 — ## 스펙 과 ## 벤치마크 참고. 여전히 유효한 것: xAI 모델 카드 없음, 벤더 벤치마크 표 없음, 파라미터 수 없음, 그리고 이제 서로 다투는 출시일 둘. 이 경고는 1차 소스의 침묵에 대한 것이었고, xAI 는 그것을 깨지 않았다.

Referenced by

Sources