AI Trend Notifier
EN
← wiki

$ cat wiki/models/glm-5-3.md

GLM-5.3

스펙

AttributeValue
DeveloperZ.ai (Z.ai / Zhipu AI)
Released2026-08-14 (GLM Coding Plan 한정)
Announced2026-08-14
Context windowunknown
PricingGLM Coding Plan 월 $18부터. 토큰 단가는 공개되지 않았다 — Z.ai의 API 가격표에는 아직 GLM-5.2만 있고 GLM-5.3 항목이 없다
Licenseunknown — 오픈 웨이트는 안전성 평가 후 "약 2주" 뒤로 예고됐고, 라이선스 이름은 공개되지 않았다
AvailabilityGLM Coding Plan 구독자
Context windowunknown인 것은 의도적이다. Z.ai는 GLM-5.3이 GLM-5.2
베이스를 그대로 재사용한다고 밝혔고 그 모델은 1,000,000 토큰 윈도를 갖지만, 베이스를
공유한다는 사실이 공개된 사양은 아니다. 형제 모델에서 행을 유추하는 것이야말로 이 스키마의
unknown이 막으려는 오류다
(source).

출시일

2026-08-14, GLM Coding Plan을 통해 (source).

가중치는 나오지 않았다. Z.ai는 API 접근과 오픈 웨이트가 안전성 평가를 거친 뒤 단계적으로, 약 2주 뒤에 나온다고 밝혔다 (source).

이는 지연이 아니라 방식의 변화다. GLM-5.2는 구독자 접근(2026-06-13)과 오픈 웨이트·독립 API(2026-06-16) 사이가 사흘이었다. 이번 출시는 그 둘을 명시적으로 2주 떼어 놓고, 뒤쪽에 안전성 평가라는 조건을 붙였다. Open-Weights Policy Fight 참조.

벤치마크

벤더 발표 수치다. 이 수치 어느 것에도 공개된 하네스가 없고, 다섯 벤치마크 모두 이 저장소의 sources/evals/ 스냅샷에 없다 (source):

BenchmarkGLM-5.2GLM-5.3
Terminal-Bench 3.04.628.3
DeepSWE v1.146.266.9
AutomationBench26.248.2
Agents' Last Exam (CLI)unknown28.5
CyberGymunknown84.5%
DeepSWE 기준선과 AutomationBench 행은 2026-08-21 에 추가됐다. Z.ai 수치에 대한 두 번째 독립
보도에서 온 것이다 (source). 그
보도는 Terminal-Bench 3.0 4.6 → 28.3DeepSWE 66.9 를 2026-08-14 포착과 동일하게 주며,
그래서 그것이 더하는 두 수치를 경합하는 서술로 분류하는 대신 받아들인다. 이 표의 나머지와
마찬가지로 하네스가 공개되지 않은 벤더 서술 로 남는다.

Z.ai의 내부 평가는 GLM-5.2 대비 코딩 역량 약 50% 향상을 보고했고, 보도는 GLM-5.3을 Terminal-Bench 3.0과 Agents' Last Exam에서 오픈소스 모델 중 1위로 놓는다 (source).

두 번 읽어 볼 만한 수치가 둘 있다.

  • Terminal-Bench 3.0: 4.6 → 28.3. 여섯 배 이동이면서 동시에 과제의 29%에도 못 미친다. 릴리스 자료는 앞의 읽기만 담고 있다. 벤치마크 버전에 주의할 것 — Qwen 3.8 27BDeepSeek V4-Pro-0813Terminal-Bench 2.1을 보고하며, 다른 스위트이므로 버전 경계를 넘어 비교할 수 없다. Eval Harness Configuration 참조.
  • Agents' Last Exam CLI: 28.5 대 GPT-5.6 Sol의 28.6. 0.1점 차이이고, 그 차이가 작을수록 이득을 보는 쪽이 직접 측정했으며, 양쪽 모두 공개된 하네스가 없다. 측정된 동률이어서가 아니라 Z.ai가 그렇게 발표했기 때문에 기록한다.

CyberGym에서 GLM-5.3의 **84.5%**는 Mythos 5와 GPT-5.6 Sol (and Terra, Luna)을 근소하게 앞선 것으로 보고됐고, ExploitBench 같은 심층 익스플로잇 과제에서는 폐쇄형 프런티어 모델과의 격차가 남아 있다 (source). 이 위키가 이미 보유한 가장 가까운 수치는 DeepSeek V4-Pro-0813의 같은 벤치마크 벤더 발표 83.3이며, 그 역시 하네스가 없는 자사 측정이다.

활용 사례

코딩과 롱호라이즌 에이전트 작업. 토큰 API가 아니라 구독형 코딩 제품을 통해 제공되며, GLM-5.2가 출시된 것과 같은 경로다 (source).

사이버보안 프레이밍은 Z.ai 자신의 것이고 이 릴리스에서 가장 뚜렷한 포지셔닝이다. 일반 코딩 벤치마크가 아니라 CyberGym을 앞세운다. AI-Enabled Cyberattacks 참조.

2026-08-18 — 그 프레이밍에 붙은 접근 모델. GLM-5.3 은 Z.ai 의 "Shield of Open Source" 프로그램과 함께 출하된다: 무료 보안 감사, ZCode 플랫폼을 통한 자동 코드 감사 도구, 오픈소스 커뮤니티를 위한 무료 모델 사용 쿼터, 그리고 모델의 가장 민감한 공격적 역량을 검증된 사용자에게만 남겨 두는 제한 계층 "Cybersecurity Trusted Access" (source).

읽은 자료 어디에도 그 계층과 예정된 오픈 웨이트를 조화시키는 설명이 없다. 이 페이지는 안전성 평가를 거쳐 2026-08-28 무렵으로 예정된 가중치 공개를 기록하고 있다. 공격적 역량에 대한 검증 접근 게이트는 그것이 게이팅하는 가중치가 공개된 뒤에도 살아남는 통제로 보기 어렵다. 두 계획이 같은 계획인지, 게이트가 API 에만 적용되는지, 검증이 무엇으로 이루어지는지 — 어느 소스도 말하지 않는다.

비교

  • GLM-5.2같은 베이스 모델, 변경 없음. 두 페이지의 모든 차이는 사후 학습이다
  • GPT-5.6 Sol (and Terra, Luna) — Agents' Last Exam CLI와 CyberGym에서 지목된 비교 대상
  • Claude Fable 5 — 보도는 GLM-5.3의 코딩·에이전트 역량이 여기에 "근접"한다고 서술하지만, 공통된 벤치마크 수치는 공개되지 않았다
  • DeepSeek V4-Pro-0813 — 같은 주의 또 다른 중국 랩 에이전트 릴리스이자, 이 위키가 보유한 유일한 다른 CyberGym 수치
  • Qwen 3.8 27B — 같은 날 출시됐고 정반대의 거래다: 가중치가 먼저이고 구독은 없다

상충 보고

  • 베이스 파라미터 수. 이번 릴리스 보도는 공유 베이스를 743B로 서술한다 (source). 이 위키는 6월 자체 취재에서 GLM-5.2744B 총 파라미터를 기록해 두었다 (source). 양쪽 모두 제3자 출처이고 두 수치는 서로 어긋나는데, Z.ai는 베이스가 그대로라고 밝혔으므로 두 반올림 중 많아야 하나만 맞다. 어느 쪽도 다른 쪽을 근거로 수정하지 않았다.

Referenced by

Sources