AI Trend Notifier
EN
← wiki

$ cat wiki/models/glm-5-3-flash.md

GLM-5.3-Flash

나란히 보기

스펙

속성
DeveloperZ.ai
Released2026-08-26
Announced2026-08-26
Context window1,048,576 (1M)
Pricing$0.15/M input · $0.03/M cached input · $0.50/M output
LicenseMIT
AvailabilityHugging Face (오픈 가중치), Z.ai API
총 320B / 활성 18B MoE (320B-A18B), 네이티브 멀티모달 — 이미지와 비디오
입력 — 이며, Z.ai 가 정밀한 롱컨텍스트 능력을 유지하면서 롱컨텍스트 서빙 비용을
크게 낮춘다고 설명하는 희소 + 선형 어텐션 하이브리드 아키텍처를 쓴다
(source).

50% 런치 할인이 위 요금을 한시적으로 절반으로 낮춘다. 스펙 표에는 프로모션가가 아니라 표준가를 적었다 (source).

출시일

2026-08-26, 발표와 공개가 같은 날 — 다만 서비스가 시작된 날은 아니다. Z.ai 의 발표문은 이 모델이 "이전에 Ox Alpha 로 미리 공개되었다"고 말한다. OpenCode 에서 돌던 그 스텔스 모델이며, 2차 보도는 그 기간을 공개 전의 단계적 공개 부하 테스트로 설명한다. r/LocalLLaMA 는 같은 날 아침 06:28 에 정체를 특정했고, 공개 스레드는 14:06 에 올라왔다 (source).

발표문에서 모델에 관한 것이 아닌 한 줄: "running entirely on Chinese AI chips." Z.ai 가 런치 포스트 자체에서, 묻지도 않았고 실리콘 이름도 밝히지 않은 채 그렇게 적는다. 이 위키는 이미 NVIDIA 없이 학습된 중국 프런티어 모델 하나 — LongCat-2.0, Huawei Ascend 910 — 를 보유하고 있으므로 주장 자체가 전례 없는 것은 아니다. 새로운 것은 랩이 그것을 각주가 아니라 프런티어 공개의 헤드라인 항목으로 자진해서 내세운다는 점이다. 읽은 어떤 자료도 부품명, 벤더, 또는 "entirely" 가 학습을 가리키는지 서빙을 가리키는지 둘 다인지를 말하지 않는다 (source).

벤치마크

벤더 자체 수치 (Z.ai 의 모델 카드, 2차 보도가 인용 — 하네스는 공개되지 않음):

BenchmarkGLM-5.3-FlashGLM-5.2
DeepSWE v1.163.446.2
Terminal-Bench 2.184.3명시 없음
AutomationBench48.8명시 없음
독립 수치: Artificial Analysis Intelligence Index v4.1.1 — 57, 태스크당
$0.045
(source).

붙들어 둘 값은 그 독립 수치 57 이다. 벤더가 아닌 쪽이 측정한 유일한 값이기 때문이다. 이 위키가 이미 추적하는 모델과의 규모 감각을 위해: 같은 지수에서 DeepSeek V4-Pro-081353, Nemotron 3.5 Lightning24 다.

Z.ai 자신의 프레이밍 — GLM-5.2 대비 "1/10 가격"에 "코딩과 에이전트 벤치마크에서 Claude Opus 4.8 에 근접" — 은 읽은 어떤 자료에도 나란한 표가 없는 벤더 주장이다. 이 위키는 DeepSWE v1.1, Terminal-Bench 2.1, AutomationBench 에 대한 Opus 4.8 수치를 보유하고 있지 않으므로 그 비교는 여기서 검증할 수 없고, 결과가 아니라 주장으로 기록한다.

활용 사례

공개된 모든 수치가 놓인 자리가 코딩과 에이전트 작업이다(DeepSWE, Terminal-Bench, AutomationBench). 네이티브 멀티모달 입력(이미지, 비디오)과 1M 컨텍스트 창은 명시된 역량이지만 어느 쪽에도 붙은 벤치마크가 없다 (source).

비교

  • GLM-5.3 — 열이틀 앞선 2026-08-14 공개이며, 여기서 가장 중요한 한 가지 점에서 정반대다: GLM-5.3 의 가중치는 "가장 강력한 오픈 웨이트 코딩 모델"로 마케팅되는 동안 안전성 평가를 이유로 약 2주 보류되었다. GLM-5.3-Flash 는 첫날 MIT 가중치를 냈다. 읽은 어떤 자료도 왜 작은 형제 쪽에는 그런 게이트가 필요 없었는지, 또는 GLM-5.3 의 창(2026-08-28 경 예정)이 아직 열려 있는지를 설명하지 않는다.
  • GLM-5.2 — 5.x 계열 전체가 파생된 744B/40B MIT 베이스이며, GLM-5.3-Flash 가 짝지은 수치를 공개한 유일한 모델.
  • Qwen3.8-Flash-Next같은 날 공개되었고, 마찬가지로 오픈 웨이트에 멀티모달 MoE 이며 비용 효율을 내세우고, 총 176B 로 규모는 대략 절반이다. 중국의 두 랩이 몇 시간 간격으로 비용 최적화된 오픈 멀티모달 MoE 를 내놓은 것이 이 날의 모양이며, 우연도 아니고 두 랩 어느 쪽도 언급하지 않는다.
  • DeepSeek V4-Flash — 또 하나의 중국 오픈 웨이트 "Flash" 등급, MIT, $0.14/$0.28 per M. GLM-5.3-Flash 는 입력이 조금 더 비싸고 출력은 약 1.8배이며, 대신 활성 파라미터가 약 1.4배이고 네이티브 멀티모달이다.

Referenced by

Sources