AI Trend Notifier
EN한
← wiki

$ cat wiki/models/glm-5-3.md

GLM-5.3

나란히 보기

스펙

AttributeValue
DeveloperZ.ai (Z.ai / Zhipu AI)
Released2026-08-14 (GLM Coding Plan); 오픈 웨이트 2026-08-28
Announced2026-08-14
Context window1M (max_position_embeddings: 1048576, 벤더 config.json, 2026-08-28)
PricingGLM Coding Plan 월 $18부터. 토큰 단가는 공개되지 않았다 — 모델 카드에도 가격이 없고, Z.ai의 API 가격표에는 아직 GLM-5.2만 있고 GLM-5.3 항목이 없다
Licenseglm-5.3 — MIT 형태의 허락에 매출 연동 보안 심사 조항이 붙은 것; MIT 가 아니다
AvailabilityGLM Coding Plan 구독자; Hugging Face 오픈 웨이트 (zai-org/GLM-5.3 FP8, zai-org/GLM-5.3-BF16)
Context window 는 두 번 움직였고, 두 번째 움직임이 이를 확정한다. 2026-08-23까지는
unknown 이었고, 그 뒤 제3자 등재에서 채워졌다 — Artificial Analysis 의 1M
(source) — Z.ai 가 수치를 공개한 적이
없고, GLM-5.2의 공유 베이스에서 유추하는 것은 이 스키마의 unknown 이 막으려는
바로 그 오류이기 때문이다. 2026-08-28 에 벤더가 그 수치를 직접 공개했다: 가중치 저장소의
config.json 이 max_position_embeddings: 1048576 을 기록한다
(source). 이제 이 칸은 등재가
아니라 1 차 산출물을 인용하며, 둘은 일치한다.

그 파일에서 가져오지 않은 것: 파라미터 수. config.json 은 78 개 층, hidden size 6144, 256 개의 라우팅 전문가, 토큰당 활성 8 개를 주지만 총합은 주지 않는다. 그것들을 더하는 것은 Z.ai 의 수치가 아니라 이 위키의 산술이므로 하지 않으며, 따라서 ## 상충 보고 의 743B/744B 불일치는 해소되지 않은 채로 남는다.

같은 행에서 가져오지 않은 것: 가격. Artificial Analysis 의 Cost per Task USD 는 그 발행처가 측정한 과제 1건의 비용이지 토큰 단가가 아니며, 이는 해당 스냅숏 자신의 머리말에 적혀 있다. Pricing 은 공개된 그대로 둔다.

출시일

2026-08-14, GLM Coding Plan을 통해 (source).

오픈 웨이트: 2026-08-28. zai-org/GLM-5.3 은 2026-08-28T15:22:14Z 에 마지막으로 수정되어 141 개의 FP8 .safetensors 샤드를 담고 있고, zai-org/GLM-5.3-BF16 은 13:46:13Z 에 282 개를 담고 있다. 저장소 자체는 2026-08-25T06:42:50Z 에 만들어져 사흘 동안 가중치 없이 서 있었다. 제3자 양자화인 unsloth/GLM-5.3-GGUF 는 2026-08-28T04:05:14Z 에 생성되었다 (source).

창구는 예고된 날짜에 닫혔다. Z.ai 는 2026-08-14 에 오픈 웨이트가 "안전성 평가를 거친 뒤 단계적으로, 약 2주" 뒤에 나온다고 밝혔고 (source), Hugging Face 자리표시자는 2026-08-28 을 지목했으며, 가중치는 2026-08-28 UTC 에 도착했다. 이 위키는 2026-08-28 09:00 KST 시점에 이 창구를 열려 있고 닫히지 않은 것으로 기록했는데 그때로서는 옳았고, 그래서 닫힘을 날짜가 아니라 타임스탬프와 함께 여기 기록한다.

이는 여전히 지연이 아니라 방식의 변화다. GLM-5.2는 구독자 접근(2026-06-13)과 오픈 웨이트·독립 API(2026-06-16) 사이가 사흘이었다. 이번 출시는 그 둘을 열나흘 떼어 놓고, 뒤쪽에 안전성 평가라는 조건을 붙였다. Open-Weights Policy Fight 참조.

안전성 평가가 무엇에 관한 것이었는지, 마침내 밝혀졌다. 모델 카드는 2026-08-14 자료가 말하지 않은 이유를 자진해서 밝힌다: "사후 학습을 확장하면서 사이버 역량이 예상보다 빠르게 발달했다. GLM-5.3 은 취약점 발견에서 CyberGym 최고 수준이며, 그 이득은 익스플로잇 체인 위쪽으로 갈수록 가장 크고, 거기서 익스플로잇 벤치마크에서 GLM-5.2 의 두 배를 넘는다" (source). 이는 이 페이지가 2026-08-27 에 열린 것으로 기록한 질문 — 왜 게이트가 GLM-5.3 에는 걸리고 GLM-5.3-Flash에는 걸리지 않았는가 — 에 답한다. 다만 카드는 그 평가가 무엇으로 이루어졌는지, 누가 수행했는지, 무엇을 결론 내렸는지는 말하지 않는다.

라이선스는 glm-5.3 이며 MIT 가 아니다. 모델 카드의 front matter 는 license: other, license_name: glm-5.3 을 기록하고, 저장소에는 영어와 중국어로 된 라이선스 파일이 있다 (source).

허락 자체는 MIT 형태다 — 사용, 복제, 수정, 병합, 공개, 배포, 재실시, 판매, 실행, 배치, 파인튜닝, 파생물 작성이 무상으로 허용된다. 조항 하나가 더해진다. "Model as a Service" 사업을 운영하는 피허락자로서 그 계열사를 포함한 총 매출이 연속 12 개월 동안 $10 billion 을 초과하는 경우, 상업적 사용 전에 Z.AI 의 보안 심사를 통과해야 하며 "보안 심사의 범위와 방식은 Z.AI 가 합리적으로 정한다". Model as a Service 는 "입력, 파라미터 또는 학습 데이터에 대해 제3자가 실질적 통제를 행사할 수 있게 하는 방식"의 추론·파인튜닝 접근 제공으로 정의되며, 모델 능력이 특정 기능이나 하네스에만 임베드된 최종 사용자 제품과, 타인이 호스팅하는 모델로의 단순 요청 중계는 명시적으로 제외된다.

여기서 세 가지가 따라 나오며, 이 페이지는 그것들을 조항 자체와 구분해 적는다.

  • 이 문턱은 하이퍼스케일러와 최대 모델 벤더를 고르고 그 밖의 누구도 고르지 않는다. 연구소, 스타트업, 자가 호스팅 사용자는 문면상 조항 2 의 영향을 받지 않는다.
  • GLM-5.3-Flash는 MIT 로 출하되었다 — GLM-5.3 발표 여드레 뒤, 그 가중치보다 이틀 앞서. 두 형제는 같은 조건을 받지 않았고, 그 차이를 설명하는 자료는 읽은 것 중에 없다.
  • 이는 같은 릴리스에 붙은 두 번째 조건이다. 첫 번째는 시점(안전성 평가)이었고, 두 번째는 누가 상업적으로 서빙할 수 있는가다. Open-Weights Policy Fight 참조 — 거기서 "오픈 웨이트"는 계속해서 하나의 입장이 아니라 입장들의 범위를 가리킨다.

벤치마크

벤더 발표 수치다. 이 수치 어느 것에도 공개된 하네스가 없고, 다섯 벤치마크 모두 이 저장소의 sources/evals/ 스냅샷에 없다 (source):

BenchmarkGLM-5.2GLM-5.3
Terminal-Bench 3.04.628.3
DeepSWE v1.146.266.9
AutomationBench26.248.2
Agents' Last Exam (CLI)unknown28.5
CyberGymunknown84.5%
DeepSWE 기준선과 AutomationBench 행은 2026-08-21 에 추가됐다. Z.ai 수치에 대한 두 번째 독립
보도에서 온 것이다 (source). 그
보도는 Terminal-Bench 3.0 4.6 → 28.3 과 DeepSWE 66.9 를 2026-08-14 포착과 동일하게 주며,
그래서 그것이 더하는 두 수치를 경합하는 서술로 분류하는 대신 받아들인다. 이 표의 나머지와
마찬가지로 하네스가 공개되지 않은 벤더 서술 로 남는다.

Z.ai의 내부 평가는 GLM-5.2 대비 코딩 역량 약 50% 향상을 보고했고, 보도는 GLM-5.3을 Terminal-Bench 3.0과 Agents' Last Exam에서 오픈소스 모델 중 1위로 놓는다 (source).

두 번 읽어 볼 만한 수치가 둘 있다.

  • Terminal-Bench 3.0: 4.6 → 28.3. 여섯 배 이동이면서 동시에 과제의 29%에도 못 미친다. 릴리스 자료는 앞의 읽기만 담고 있다. 벤치마크 버전에 주의할 것 — Qwen 3.8 27B와 DeepSeek V4-Pro-0813은 Terminal-Bench 2.1을 보고하며, 다른 스위트이므로 버전 경계를 넘어 비교할 수 없다. Eval Harness Configuration 참조.
  • Agents' Last Exam CLI: 28.5 대 GPT-5.6 Sol의 28.6. 0.1점 차이이고, 그 차이가 작을수록 이득을 보는 쪽이 직접 측정했으며, 양쪽 모두 공개된 하네스가 없다. 측정된 동률이어서가 아니라 Z.ai가 그렇게 발표했기 때문에 기록한다.

CyberGym에서 GLM-5.3의 **84.5%**는 Mythos 5와 GPT-5.6 Sol (and Terra, Luna)을 근소하게 앞선 것으로 보고됐고, ExploitBench 같은 심층 익스플로잇 과제에서는 폐쇄형 프런티어 모델과의 격차가 남아 있다 (source). 이 위키가 이미 보유한 가장 가까운 수치는 DeepSeek V4-Pro-0813의 같은 벤치마크 벤더 발표 83.3이며, 그 역시 하네스가 없는 자사 측정이다.

2026-08-23 — 첫 독립 측정이며, 벤더가 주장한 방향으로 움직인다. Artificial Analysis 의 주간 리더보드는 GLM-5.3 (max) 를 Artificial Analysis Intelligence Index 60, Cost per Task USD $0.68, Median Tokens/s 102, Latency First Chunk 4.35 s, Total Response 28.84 s, 컨텍스트 1M 으로 싣는다. 2026-08-16 캡처에는 없었고 이번 주에 새로 등장했다 (source; 전주는 여기).

같은 표의 GLM-5.2 (max) 53 — 이번 주 $0.44, 지난주 $0.32 — 과 견주면, Z.ai 가 베이스가 바뀌지 않았다고 서술한 두 모델 사이에서 지표가 53 → 60 으로 움직인다. 이는 Post-Training Scaling 의 핵심 주장을 팔 것이 없는 쪽에서 뒷받침한 이 위키 최초의 수치이며, 위 벤더 벤치마크 다섯 개 중 어느 것도 아닌 제3자 하네스의 종합값이다.

그것이 어디까지인지에 대한 세 가지 한계. 이 지표는 Artificial Analysis 자신의 스위트 종합값 이지 정확도가 아니며 벤더 표와 비교할 수 없다; (max) 는 하나의 추론 설정이므로 이는 GLM-5.3 의 최상위 구성을 GLM-5.2 의 그것과 비교하는 것이다; 그리고 종합값에서의 7점 이동은 Z.ai 내부 평가가 보고하는 "~50% 코딩 역량 개선"이 아니다 — 더 작고, 더 넓으며, 독립적으로 측정된 주장이다. 같은 표에서 GLM-5.3 은 Kimi K3 (max) 60 및 Grok 4.6 (xhigh) 60 과 같은 자리에 있고, GPT-5.6 Sol (and Terra, Luna) (max) 61 과 Claude Opus 5 (high) 61 보다 1점 아래, Claude Opus 5 (max/xhigh) 63 보다 3점 아래다.

2026-08-28 — 완전한 벤더 표, 그리고 이 페이지가 없다고 적었던 하네스. 모델 카드는 비교 모델 7 개에 대한 16 개 벤치마크 행을 싣는다. 전체는 캡처에 옮겨 두었고, 아래는 이 페이지가 이미 보유한 내용을 바꾸는 행들이다 (source):

BenchmarkGLM-5.3GLM-5.2Kimi K3DeepSeek-V4 Pro-0813Qwen3.8-MaxOpus 4.8Fable 5 (w/ fallback)GPT-5.6 Sol
Terminal Bench 2.188.281.088.387.986.685.088.088.8
Terminal Bench 3.028.34.617.4––21.133.734.6
DeepSWE (v1.1)66.946.267.562.756.658.069.772.7
CyberGym84.577.280.083.378.578.183.883.6
ExploitGym (2h / 6h)105 / 13029 / 3936 / 70–14 / 2680 / 120181 / 247216 / 293
ExploitBench54.424.432.2–28.840.078.076.5
AutomationBench (v1.0.6)48.226.246.743.239.841.046.245.8
Agents' Last Exam (ALE-CLI)28.523.827.625.727.025.723.828.6
GDPval-AA v217691508168215901739158817431730
이 페이지가 2026-08-14 부터 실어 온 네 수치는 변경 없이 확인되었다 — Terminal-Bench 3.0
4.6 → 28.3, DeepSWE 66.9, AutomationBench 48.2, ALE-CLI 28.5 — 이번에는 보도가 아니라
벤더 자신의 모델 카드에서다. CyberGym 은 84.5 로 공개되어 있으며, 위 표는 카드의 값을
그대로 옮긴 것이고 이 페이지의 앞 절은 이를 백분율로 적고 있다.

이제 모든 행이 자신의 하네스를 명시하며, 그것이 달라진 점이다. 이 페이지는 2026-08-14 에 "이 수치들 중 어느 것에 대해서도 하네스가 공개된 것으로 보고되지 않았다"고 적었다. 카드의 각주는 거의 모든 행에 대해 하네스를 공개하며, 그 상세함은 Eval Harness Configuration이 한 달 동안 요구해 온 바로 그것이다: Terminal-Bench 2.1 과 3.0, CyberGym, ExploitGym, ExploitBench, PostTrainBench, SWE-Marathon, Agents' Last Exam 에 Claude Code 2.1.207; DeepSWE 에 mini-swe-agent; HLE 의 판정 모델로 GPT-5.6-luna (medium); FrontierSWE 에 Proximal; GDPval-AA v2 에 Artificial Analysis — 행마다 샘플링 파라미터, 컨텍스트 길이, 타임아웃, 턴 상한, 롤아웃 횟수, 컨테이너 정책이 함께 명시된다.

그 각주들 중 셋은 요약하기보다 읽을 가치가 있다:

  • Terminal-Bench 3.0 은 avg@3, reasoning effort max, 컨텍스트 400K, 600 에이전트 턴, 10 시간 타임아웃, Tool Search 비활성, 공식 별도 검증기, 각 롤아웃은 과제의 공식 이미지로 만든 컨테이너에서 수행된다. 이 다섯 중 어느 하나만 바뀌어도 수치가 움직인다.
  • ExploitGym 의 2h / 6h 예산은 실제 경과 시간이 아니다. 그것은 API 추론 시간을 "모델별 초당 토큰 수로 재척도한" 것이며, TPS 는 Artificial Analysis 에서 가져왔다 — GLM-5.3 은 115, Kimi K3 는 40, Qwen3.8 Max 는 47. 더 빠르다고 측정된 모델이 같은 명목 예산 안에서 더 많은 일을 하도록 허용된다는 뜻이며, 이런 방식으로 비교된 세 모델은 Z.ai 가 직접 돌린 유일한 셋이다.
  • 두 벤치마크는 부정행위 방지 검사를 제거하고 교체한 상태로 채점되었다. PostTrainBench 에서는 패턴 매칭 검사가 "로컬 vLLM 엔드포인트에 OpenAI SDK 를 통해 접근할 때 오탐을 냈고", SWE-Marathon 의 strip-clone 에서는 import 탐지가 "유효한 구현을 거부할 수 있었다". 둘 다 LLM 기반 검사로 교체되었다. Z.ai 가 이를 공개한 것은 옳은 행동이고, 동시에 두 행이 수정된 프로토콜 아래 채점되었다는 뜻이기도 하다.

GLM-5.3 이 앞서는 곳과 그렇지 않은 곳. 표에서 CyberGym (84.5), AutomationBench (48.2), GDPval-AA v2 (1769) 에서 1 위이고, Terminal Bench 3.0 에서는 오픈 웨이트 항목 중 1 위다. Terminal Bench 2.1, Terminal Bench 3.0, DeepSWE, HLE, ALE-CLI 에서는 GPT-5.6 Sol 에 뒤지고, 익스플로잇 행에서는 Fable 5 에 큰 폭으로 뒤진다 — ExploitBench 54.4 대 78.0, ExploitGym 105 / 130 대 181 / 247. "CyberGym 최고 수준"이라는 주장은 취약점 발견에 관한 것이고 카드도 그렇게 명시하고 있으며, 같은 표의 익스플로잇 행들은 반대 방향으로 간다. 이 구분은 AI-Enabled Cyberattacks까지 이어지므로 뭉뚱그려서는 안 된다.

2026-09-29 — 최초의 독립 사이버 측정이며, 위의 독법을 뒤집는다. Anthropic 의 Frontier Red Team 이 GLM-5.3 and the Spread of Advanced Cyber Capabilities 를 발표했다 — 이번 실행에서 1차 출처로 확인 (source). 저자: Andrew Fasano, Marius Fleischer, Cole McFaul, Robert Xiao, Tripp Gallagher.

ExploitBench, 모델당 410회 시도:

모델종단 익스플로잇비율
Claude Mythos Preview56 / 41014%
GLM-5.350 / 41012%
Claude Opus 4.6거의 0약 0%
GLM-5.2거의 0약 0%
Kimi K3거의 0약 0%
DeepSeek V4.1-Flash거의 0약 0%
그리고 바이너리 익스플로잇 — 완전한 제어 흐름 탈취 — 에서 GLM-5.3 4% 대 Claude Mythos
Preview 의 6%, 시험된 다른 모든 모델은 0%.

이 페이지는 2026-08-28 부터 GLM-5.3 이 "trails Fable 5 by a wide margin on the exploitation rows — ExploitBench 54.4 against 78.0" 라고 적어 왔다. 독립 측정은 그것이 Anthropic 의 가장 사이버 역량 높은 모델과 두 점 안쪽이라고 말한다. 둘이 같은 양에 대한 서술일 수는 없으며, 그 불일치는 새 수치를 선호해 해소하는 대신 ## 상충 보고 아래에 공개한다.

도움 없는 발견 결과가 벤더 쪽에 대응물이 없는 부분이다. 원문:

Over the course of a day (and with limited human attention), GLM-5.3 found several previously unknown vulnerabilities in the browser's JavaScript engine, and chained them together into a working exploit: a webpage that, when visited, reads arbitrary files from the visitor's computer.

그것은 벤치마크 점수가 아니다. Z.ai 의 16개 벤치마크 표의 어떤 행도 실제 표적을 상대로 한 새로운 취약점 발견을 측정하지 않으며, AI-Enabled Cyberattacks 가 그 귀결을 담는다.

안전장치, 이 페이지에 아예 수치가 없던 항목. 시뮬레이션 환경에서 악의적 사이버 공격 지시에 대한 응답률:

조건GLM-5.3Claude
맨 지시0%0%
허위 명분64%0%
사전 채운 추론92%0%
abliteration100%해당 없음
abliteration 은 한 번도 시도해 본 적 없는 팀에게 약 2,200 GPU 시간, 대략 $4,400 이
들었고, 거부율을 90% 이상에서 JailbreakBench 3% · HarmBench 2% · StrongREJECT 12% 로
떨어뜨렸다. Anthropic 은 그 비대칭을 그대로 진술한다: "Claude models are released with cyber safeguards, and versions with reduced safeguards are limited to vetted users. Anyone can download and use GLM-5.3." Open-Weights Policy Fight 참조.

두 번째 독립 평가가 글 안에 인용되어 있고 그 글이 측정한 것은 아니다. NIST 의 Center for AI Standards and Innovation(CAISI) 은 GLM-5.3 을 "the most cyber-capable open-weight model released to date", 사이버 벤치마크 종합에서 미국 프런티어보다 약 4개월 뒤로 보았다. 그것은 평가 대상 모델의 경쟁사가 전달한 제3자 수치이며 이번 실행에서 독립적으로 읽지 않았다.

활용 사례

코딩과 롱호라이즌 에이전트 작업. 토큰 API가 아니라 구독형 코딩 제품을 통해 제공되며, GLM-5.2가 출시된 것과 같은 경로다 (source). 2026-08-28 부터는 자가 호스팅도 가능하다: 카드는 SGLang, vLLM, TokenSpeed, Transformers, KTransformers, Unsloth 를, 그리고 Ascend NPU 용으로 vLLM-Ascend, xLLM, SGLang 을 나열한다 (source). Ascend 경로는 Z.ai가 추론 서빙에 100,000 대가 넘는 국산 칩을 쓴다고 공개한 것과 나란히 둘 만하다.

재현이 무엇을 뜻하는지 바꾸는 추론 기본값 하나. reasoning_effort 는 low, high, max 를 받으며, 전달되지 않거나 그 밖의 값으로 설정되면 max 로 기본 설정된다. 카드는 "벤치마크와 리더보드 재현을 위해서는 기본값 max 를 유지하라"고 지시한다. 따라서 위 표의 모든 수치는 max 노력 수치이며, 이는 이 페이지가 Artificial Analysis 의 (max) 등재에 이미 적용하고 있는 것과 같은 단서다.

사이버보안 프레이밍은 Z.ai 자신의 것이고 이 릴리스에서 가장 뚜렷한 포지셔닝이다. 일반 코딩 벤치마크가 아니라 CyberGym을 앞세운다. AI-Enabled Cyberattacks 참조.

2026-08-18 — 그 프레이밍에 붙은 접근 모델. GLM-5.3 은 Z.ai 의 "Shield of Open Source" 프로그램과 함께 출하된다: 무료 보안 감사, ZCode 플랫폼을 통한 자동 코드 감사 도구, 오픈소스 커뮤니티를 위한 무료 모델 사용 쿼터, 그리고 모델의 가장 민감한 공격적 역량을 검증된 사용자에게만 남겨 두는 제한 계층 "Cybersecurity Trusted Access" (source).

읽은 자료 어디에도 그 계층과 오픈 웨이트를 조화시키는 설명이 없고, 이제 가중치는 나왔다. 이 페이지는 가중치가 예정 상태일 때 이 긴장을 기록했는데, 공개는 게이트를 가장 무력하게 만드는 방향으로 그것을 해소한다. "모델의 가장 민감한 공격적 역량"에 대한 검증 접근 통제는 그것이 게이팅하는 가중치의 공개를 견디지 못한다 — 이제 누구든 Z.ai 를 전혀 거치지 않고 이 모델을 돌릴 수 있다. 모델 카드와 라이선스와 저장소는 Shield of Open Source 프로그램이나 Cybersecurity Trusted Access 를 전혀 언급하지 않으므로 (source), 두 계획이 같은 계획인지, 게이트가 호스팅 API 에만 적용되는지, 검증이 무엇으로 이루어지는지 — 어느 자료도 말하지 않는다. 이 질문은 처음 기록되었을 때보다 날카로워졌고, 덜 열려 있지 않다.

비교

  • GLM-5.2 — 같은 베이스 모델, 변경 없음. 두 페이지의 모든 차이는 사후 학습이다
  • GPT-5.6 Sol (and Terra, Luna) — Agents' Last Exam CLI와 CyberGym에서 지목된 비교 대상
  • Claude Fable 5 — 보도는 GLM-5.3의 코딩·에이전트 역량이 여기에 "근접"한다고 서술하지만, 공통된 벤치마크 수치는 공개되지 않았다
  • DeepSeek V4-Pro-0813 — 같은 주의 또 다른 중국 랩 에이전트 릴리스이자, 이 위키가 보유한 유일한 다른 CyberGym 수치
  • Qwen 3.8 27B — 같은 날 출시됐고 정반대의 거래다: 가중치가 먼저이고 구독은 없다

상충 보고

  • "ExploitBench" 는 약 5배 차이 나는 두 측정을 이름 하나로 담고 있으며, 이 페이지는 이제 둘 다 싣는다. Z.ai 의 모델 카드는 GLM-5.3 54.4, GLM-5.2 24.4, Kimi K3 32.2, Opus 4.8 40.0, Fable 5 78.0, GPT-5.6 Sol 76.5 로 보고한다 (source). Anthropic 의 Frontier Red Team 은 GLM-5.3 12% (50/410), Claude Mythos Preview 14% (56/410), 그리고 GLM-5.2, Kimi K3, Opus 4.6, DeepSeek V4.1-Flash 는 거의 0% 로 보고한다 (source).

    순위는 보존되고 크기는 보존되지 않는다. 둘 다 Anthropic 프런티어 모델을 GLM-5.3 보다 근소하게 위에 둔다. 그러나 Z.ai 의 카드는 GLM-5.2 를 24.4 로 두는데 Anthropic 은 거의 0% 로 두고, Opus 4.8 을 40.0 으로 두는데 Opus 4.6 은 거의 0% 다 — 어떤 반올림으로도 설명되지 않는 차이다.

    확립된 것: 두 실행은 서로 다른 harness 를 썼다. Z.ai 의 각주는 자기 ExploitBench 행에 Claude Code 2.1.207 을 명시한다; Anthropic 은 분모 410회 시도를 보고하고 harness 는 명시하지 않는다. 확립되지 않은 것: 과제 집합이 애초에 같은 벤치마크인지, 54.4 가 퍼센트인지(이 페이지는 그것을 양쪽 방식으로 적어 왔다), 그리고 어느 쪽이 그 역량의 더 나은 추정인지.

    어느 수치도 철회하지 않고 어느 쪽도 선호하지 않는다. CLAUDE.md 는 벤더 자신의 모델에 대해서는 벤더 발표에 우선권을 주며, Anthropic 은 GLM-5.3 에 대해 보고하는 경쟁사다 — 그러나 Anthropic 은 동시에 여기서 자기가 팔지 않는 모델을 측정한 유일한 당사자이기도 하다. Eval Harness Configuration 참조: harness 없는 벤치마크 이름은 측정이 아니며, 이것은 하나의 이름이 둘을 담고 있는 이 위키가 보유한 가장 날카로운 사례다.

  • 게시된 컨텍스트 창이 카탈로그와 어긋나며, 이 페이지의 수치를 유지한다. spec-check 실행 90 (2026-09-12) 이 보고한 값은 컨텍스트 1,000,000 대 카탈로그 1,310,720 이다 (source).

    스펙 행은 바꾸지 않았다: 위 셀은 이 페이지가 인용한 벤더 자료에 충실하고, CLAUDE.md 는 카탈로그보다 벤더 발표를 앞세운다. 1,310,720 은 1.25 × 1,048,576 이므로 카탈로그의 단위로는 임의의 수가 아니라 떨어지는 수다 — 관찰로 기록할 뿐 설명으로 채택하지 않는다.

    확인되지 않은 것: 어느 수치가 옳은지, 그리고 카탈로그가 같은 배포를 가리키는지 여부다. openrouter.ai 는 데일리 런의 샌드박스에서 차단돼 있어 여기서는 판정할 수 없다.

    2026-08-29 이후 모든 실행에서 빨간 Action 이 보고해 왔고 — 25회 연속 — 2026-09-13 까지 이 페이지에 기록되지 않았다.

  • 베이스 파라미터 수. 이번 릴리스 보도는 공유 베이스를 743B로 서술한다 (source). 이 위키는 6월 자체 취재에서 GLM-5.2에 744B 총 파라미터를 기록해 두었다 (source). 양쪽 모두 제3자 출처이고 두 수치는 서로 어긋나는데, Z.ai는 베이스가 그대로라고 밝혔으므로 두 반올림 중 많아야 하나만 맞다. 어느 쪽도 다른 쪽을 근거로 수정하지 않았다.

Referenced by

Sources