$ cat wiki/models/glm-5-3-flash.md
GLM-5.3-Flash
나란히 보기
- Granite 4.2
- DeepSeek V4-Pro-0813
- Gemini 3.7 Flash
- Muse Glimmer
- Grok 4.6
- Claude Opus 5
- Laguna S 2.1
- Kimi K3
- Inkling
- GPT-5.6 Sol
- LongCat-2.0
- MiniMax M3
- Qwen 3.8 27B
- Muse Spark 1.2
- Qwen 3.8 Max
- DeepSeek V4-Flash
- Gemini 3.5 Flash-Lite
- Gemini 3.6 Flash
- DeepSeek V4
- Grok 4.5
- Claude Sonnet 5
- GLM-5.2
- Claude Fable 5
- Claude Opus 4.8
- Gemini 3.5 Flash
- Grok Build
- Claude Opus 4.7
- Muse Spark
스펙
| 속성 | 값 |
|---|---|
| Developer | Z.ai |
| Released | 2026-08-26 |
| Announced | 2026-08-26 |
| Context window | 1,048,576 (1M) |
| Pricing | $0.15/M input · $0.03/M cached input · $0.50/M output |
| License | MIT |
| Availability | Hugging Face (오픈 가중치), Z.ai API |
| 총 320B / 활성 18B MoE (320B-A18B), 네이티브 멀티모달 — 이미지와 비디오 | |
| 입력 — 이며, Z.ai 가 정밀한 롱컨텍스트 능력을 유지하면서 롱컨텍스트 서빙 비용을 | |
| 크게 낮춘다고 설명하는 희소 + 선형 어텐션 하이브리드 아키텍처를 쓴다 | |
| (source). |
50% 런치 할인이 위 요금을 한시적으로 절반으로 낮춘다. 스펙 표에는 프로모션가가 아니라 표준가를 적었다 (source).
출시일
2026-08-26, 발표와 공개가 같은 날 — 다만 서비스가 시작된 날은 아니다. Z.ai 의 발표문은 이 모델이 "이전에 Ox Alpha 로 미리 공개되었다"고 말한다. OpenCode 에서 돌던 그 스텔스 모델이며, 2차 보도는 그 기간을 공개 전의 단계적 공개 부하 테스트로 설명한다. r/LocalLLaMA 는 같은 날 아침 06:28 에 정체를 특정했고, 공개 스레드는 14:06 에 올라왔다 (source).
발표문에서 모델에 관한 것이 아닌 한 줄: "running entirely on Chinese AI chips." Z.ai 가 런치 포스트 자체에서, 묻지도 않았고 실리콘 이름도 밝히지 않은 채 그렇게 적는다. 이 위키는 이미 NVIDIA 없이 학습된 중국 프런티어 모델 하나 — LongCat-2.0, Huawei Ascend 910 — 를 보유하고 있으므로 주장 자체가 전례 없는 것은 아니다. 새로운 것은 랩이 그것을 각주가 아니라 프런티어 공개의 헤드라인 항목으로 자진해서 내세운다는 점이다. 읽은 어떤 자료도 부품명, 벤더, 또는 "entirely" 가 학습을 가리키는지 서빙을 가리키는지 둘 다인지를 말하지 않는다 (source).
벤치마크
벤더 자체 수치 (Z.ai 의 모델 카드, 2차 보도가 인용 — 하네스는 공개되지 않음):
| Benchmark | GLM-5.3-Flash | GLM-5.2 |
|---|---|---|
| DeepSWE v1.1 | 63.4 | 46.2 |
| Terminal-Bench 2.1 | 84.3 | 명시 없음 |
| AutomationBench | 48.8 | 명시 없음 |
| 독립 수치: Artificial Analysis Intelligence Index v4.1.1 — 57, 태스크당 | ||
| $0.045 | ||
| (source). |
붙들어 둘 값은 그 독립 수치 57 이다. 벤더가 아닌 쪽이 측정한 유일한 값이기 때문이다. 이 위키가 이미 추적하는 모델과의 규모 감각을 위해: 같은 지수에서 DeepSeek V4-Pro-0813 이 53, Nemotron 3.5 Lightning 이 24 다.
Z.ai 자신의 프레이밍 — GLM-5.2 대비 "1/10 가격"에 "코딩과 에이전트 벤치마크에서 Claude Opus 4.8 에 근접" — 은 읽은 어떤 자료에도 나란한 표가 없는 벤더 주장이다. 이 위키는 DeepSWE v1.1, Terminal-Bench 2.1, AutomationBench 에 대한 Opus 4.8 수치를 보유하고 있지 않으므로 그 비교는 여기서 검증할 수 없고, 결과가 아니라 주장으로 기록한다.
활용 사례
공개된 모든 수치가 놓인 자리가 코딩과 에이전트 작업이다(DeepSWE, Terminal-Bench, AutomationBench). 네이티브 멀티모달 입력(이미지, 비디오)과 1M 컨텍스트 창은 명시된 역량이지만 어느 쪽에도 붙은 벤치마크가 없다 (source).
비교
- GLM-5.3 — 열이틀 앞선 2026-08-14 공개이며, 여기서 가장 중요한 한 가지 점에서 정반대다: GLM-5.3 의 가중치는 "가장 강력한 오픈 웨이트 코딩 모델"로 마케팅되는 동안 안전성 평가를 이유로 약 2주 보류되었다. GLM-5.3-Flash 는 첫날 MIT 가중치를 냈다. 읽은 어떤 자료도 왜 작은 형제 쪽에는 그런 게이트가 필요 없었는지, 또는 GLM-5.3 의 창(2026-08-28 경 예정)이 아직 열려 있는지를 설명하지 않는다.
- GLM-5.2 — 5.x 계열 전체가 파생된 744B/40B MIT 베이스이며, GLM-5.3-Flash 가 짝지은 수치를 공개한 유일한 모델.
- Qwen3.8-Flash-Next — 같은 날 공개되었고, 마찬가지로 오픈 웨이트에 멀티모달 MoE 이며 비용 효율을 내세우고, 총 176B 로 규모는 대략 절반이다. 중국의 두 랩이 몇 시간 간격으로 비용 최적화된 오픈 멀티모달 MoE 를 내놓은 것이 이 날의 모양이며, 우연도 아니고 두 랩 어느 쪽도 언급하지 않는다.
- DeepSeek V4-Flash — 또 하나의 중국 오픈 웨이트 "Flash" 등급, MIT, $0.14/$0.28 per M. GLM-5.3-Flash 는 입력이 조금 더 비싸고 출력은 약 1.8배이며, 대신 활성 파라미터가 약 1.4배이고 네이티브 멀티모달이다.