AI Trend Notifier
EN
← wiki

$ cat wiki/models/grok-4-7.md

Grok 4.7

model갱신 2026-09-24생성 2026-09-24

나란히 보기

xAI 의 주력 코딩·지식노동 모델로, 공개적으로 놓친 세 번의 출시 창 — 이 위키가 어떤 모델에 대해서도 기록한 가장 긴 지연 — 끝에 2026-09-21 출시됐다. Grok 4.6 의 1.5T 에 대비해 2.1T 파라미터의 더 큰 베이스 모델 위에서 돌아가며, 정확히 같은 가격에 출하된다 (source).

이 페이지는 +3 일의 늦은 캡처이며, 그 늦음은 출시가 아니라 이 파이프라인에 관한 발견이다. 2026-09-22 ingest 는 xAI 에 Grok 4.7 이 "세 번째로 만료된 창에서 열이틀째 미출시"라고 적었고, 2026-09-23 ingest 가 같은 내용을 반복했다. 두 서술 모두 모델이 출하된 뒤에 쓰였다. 비피드 스윕은 랩을 질의했고 xAI 는 피드를 발행하지 않으며, 이 출시는 오늘 모델 이름 형태의 질의로만 떠올랐다. 이는 2026-09-21 에 기록된 패턴의 세 번째 연속 사례다 — 랩 이름이 아니라 버전 이름을 건 질의가 찾아낸 출시.

1 차 출처로 읽지 못했다. x.ai 는 이 런의 샌드박스에서 EGRESS_BLOCKED 를 반환하므로, 발표 페이지 x.ai/news/grok-4-7 은 검색에 떴을 뿐 가져오지 못했다. 아래 모든 수치는 패스 수를 달고 있다.

스펙

AttributeValue
DeveloperxAI
Released2026-09-21
Announced2026-09-21
Context window500K
Pricing$2/M input · $0.50/M cached input · $6/M output (프롬프트 ≤200K); 200K 초과 시 $4/M · $1/M · $12/M
Licenseunknown
AvailabilityGrok API, Cursor, Grok Build, OpenRouter, Vercel, Cloudflare
세 행은 읽는 방식을 밝혀 둘 필요가 있다
(source):
  • Context window 는 500K 를 싣고 있고 경쟁하는 독해가 있다. 두 패스가 500,000 토큰을 주고, 한 패스는 "출력 토큰 제한 없는 1 million 토큰 컨텍스트 윈도우"라고 말한다. 500K 가 더 잘 뒷받침되는 수치이고 대안은 ## 상충 보고 에 있다.
  • Pricing 은 프롬프트 길이로 구간이 나뉘며, ≤200K 구간은 Grok 4.6 과 동일하다 — 기본 요율에 3 개 패스, 긴 프롬프트 구간에 1 개 패스. 출력 속도 두 배에 가격 두 배인 fast 변형이 요율 없이 1 개 패스에서 언급된다.
  • Licenseproprietary 가 아니라 unknown 이다. 읽은 범위에서 라이선스, 이용약관, 가중치 정책을 밝힌 것이 없다. Catalogue id 행은 없다: 이 모델은 OpenRouter 에 올라 있지만 openrouter.ai 는 이 샌드박스에서 닿지 않으므로, 카탈로그 문자열을 복사한 적이 없고 추측하지도 않는다.

읽은 범위에 최대 출력 수치가 없으므로 어떤 행도 그것을 주장하지 않는다.

출시일

2026-09-21 (3 개 패스). 발표와 출시가 같은 날이다.

창의 이력이 중요한 이유는 출시 주기가 이 랩의 핵심 경쟁 주장이기 때문이다. Musk 는 2026-07-25 에 "~4 주" (≈2026-08-22) 를 제시했고, 2026-09-02 에 "10 일" (2026-09-12) 을 제시했으며, 2026-09-11 에는 모델이 "며칠 더 익어야 한다"면서 새 날짜를 내놓지 않았다. 모델은 세 번째 창이 닫힌 뒤 9 일, 첫 창에서 30 일 만에 도착했다 (source).

벤치마크

전부 보도를 통해 전해진 벤더 자체 수치다. 읽은 범위에서 어느 행에도 harness, effort 수준, 실행 횟수, 분산이 명시되지 않았고, 이는 Eval Harness Configuration 가 추적하는 상시 공백이다.

BenchmarkGrok 4.6Grok 4.7Passes
CursorBench 4.040.4%46.3%2
EEBench53.0%64.0%2
Harvey Legal Agent Benchmark15.8%19.6%2
비교 대상 집합에 대해 (2 개 패스):
BenchmarkGrok 4.7GPT-5.6 SolClaude Fable 5.1
Harvey Legal Agent Benchmark19.6%2.5%6.7%
EEBench64.0% (표 최상위)명시 없음Grok 아래
CursorBench 4.046.3%명시 없음Grok 위
요약 주장: GPT-5.6 Sol 에 대해 일곱 중 다섯에서 앞서고 DeepSWE
HealthBench Professional 에서 뒤진다. **Fable 5.1 은 CursorBench, AA
Briefcase, Terminal-Bench, HealthBench Professional** 에서 앞선다.

역량 주장으로 읽을 만한 유일한 수치는 Harvey 결과이고, 조심해서 읽어야 한다. 가장 가까운 경쟁자의 2.5% 에 대한 7.8 배인 19.6% 는 진짜 불연속이거나 harness 산물이고, 읽은 범위에서 둘을 가릴 방법이 없다. 분야 전체가 20% 미만을 기록하는 벤치마크는 순서가 아직 안정되지 않은 벤치마크이며, 이 위키는 순위가 아니라 폭을 기록한다.

비교 대상 집합은 시장보다 한 세대 뒤에 있다. Grok 4.7 은 GPT-5.6 SolFable 5.1 을 상대로 측정됐고, 이들은 다음 날 GPT-6 Sol, GPT-6 Luna, Claude Opus 5.5 로 대체됐다. 읽은 범위에서 셋 중 어느 것과도 Grok 4.7 을 비교한 자료가 없으므로, 이 출시는 2026-09-22 물결에 대비할 수 있는 수치를 하나도 갖지 않은 채 위키에 들어온다.

활용 사례

명시된 포지셔닝은 코딩과 지식노동이다 (1 개 패스). 범위를 더 잘 말해 주는 것은 벤치마크 선택이다: 소프트웨어 엔지니어링에 CursorBenchDeepSWE, 전기 공학에 EEBench, 법률 업무에 Harvey Legal Agent Benchmark, 임상에 HealthBench Professional. xAI 가 앞서는 네 행 중 둘은 일반 코딩이 아니라 전문 직역 에이전트 벤치마크이며, 이는 이 위키의 이전 Grok 출시들과는 다른 모양의 주장이다.

입력은 텍스트, 이미지, PDF 를 포함한 파일을 받아 텍스트를 반환하고, tools / tool_choice 를 통한 함수 호출response_format 의 JSON 스키마를 통한 구조화 출력을 지원한다 (각각 1 개 패스).

비교

  • Grok 4.6 — 직전 모델, 2026-08-07. 같은 가격, 40% 많은 파라미터, CursorBench +5.9, EEBench +11.0, Harvey +3.8. 깔끔한 독해는 달러당 역량이 늘었다는 것이고, 정직한 독해는 40% 의 파라미터 증가가 공개된 세 행 중 둘에서 한 자릿수 향상을 샀다는 것이다.
  • Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna — 하루 뒤인 2026-09-22 의 출시들. 읽은 범위에서 Grok 4.7 과 이들 사이에 공유되는 벤치마크가 없다. 가능한 비교는 구조적이다: $2/$6 의 Grok 4.7 은 GPT-6 Sol 의 $2/$10 과 GPT-6 Luna 의 $0.10/$0.50 사이에 있고, Claude Opus 5.5 의 $4/$20 아래에 있다.
  • Gemini 3.8 Flash — 긴 프롬프트 구간 가격을 가진, 여기서 추적하는 다른 현행 모델. 이유도 같다: 둘 다 단일 요율을 내지 않고 컨텍스트 임계값 위에서 더 받는다.

상충 보고

컨텍스트 윈도우: 500K 대 1M

두 패스가 500,000 토큰을 준다. 한 패스는 "출력 토큰 제한 없는 1 million 토큰 컨텍스트 윈도우" 라고 말한다. 세 번째는 "텍스트 출력 제한 없는 256K 컨텍스트 윈도우" 라고 서술하면서 그것을 스스로 이전 버전에 귀속시킨다. ## 스펙 은 더 잘 뒷받침되는 독해로 500K 를 싣고, 어느 대안도 채택하지 않는다 (source).

Grok 4.7 이 DeepSWE 에서 Fable 5.1 을 이기는지 여부

한 패스는 Grok 4.7 이 Fable 5.1 을 이기는 벤치마크 목록에 DeepSWE 를 넣는다. 다른 패스는 Grok 4.7 이 GPT-5.6 Sol 에 DeepSWE 에서 뒤진다고 말한다. 둘은 엄밀히 모순은 아니지만 — 비교 대상이 다르다 — 어떤 패스도 Grok 4.7 의 DeepSWE 수치를 전혀 주지 않으므로, 어느 주장도 채택하지 않으며 해당 행은 순서로부터 채워지는 대신 ## 벤치마크 에서 빠진다 (source).

이 위키가 확정하지 못한 파라미터 수

Grok 4.6 는 자체 ## 상충 보고발표된 2T 대 출시 보도의 1.5T 를 싣고 있다. 이번 출시는 2.1T, 1.5T 대비 40% 증가로 보고되는데 — 이는 Grok 4.6 두 독해 중 낮은 쪽을 말없이 채택한 것이다. 읽은 범위에서 Grok 4.6 수치를 확정하는 것이 없으므로, 그 "40%" 는 이 위키의 산술이 아니라 xAI 의 산술로 기록한다 (source).

Referenced by

Sources