$ cat wiki/models/glm-5-3-flash.md
GLM-5.3-Flash
나란히 보기
- EmbeddingGemma 2
- Mistral Large 4
- Kolibri-1
- GPT-6.1 Sol
- MiMo-V2.6-Pro
- Grok 4.7
- Ternary Bonsai 2 27B
- Fugu Max
- Kimi K2.8 Preview
- DeepSeek V4.1-Flash
- K2 Horizon
- Muse Spark 1.3
- Hy4 preview
- Granite 4.2
- Ling-3.0-tiny
- Laguna S 2.1
- Inkling
- LongCat-2.0
- MiniMax M3
- Gemini 4 Argon
- Claude Sonnet 5.5
- Claude Opus 5.5
- GPT-6 Luna
- GPT-6 Sol
- Gemini 3.8 Live
- Fugu Ultra v2
- GPT-Image-2.5 Flare
- GPT-Image-2.5 Sunburst
- Astra
- Gemini 3.8 Flash
- Claude Fable 5.1
- GLM-5.3
- Qwen 3.8 27B
- DeepSeek V4-Pro-0813
- Gemini 3.7 Flash
- Muse Glimmer
- Grok 4.6
- Muse Spark 1.2
- Qwen 3.8 Max
- DeepSeek V4-Flash
- Claude Opus 5
- Gemini 3.5 Flash-Lite
- Gemini 3.6 Flash
- DeepSeek V4
- Kimi K3
- GPT-5.6 Sol
- Grok 4.5
- Claude Sonnet 5
- GLM-5.2
- Claude Fable 5
- Claude Opus 4.8
- Gemini 3.5 Flash
- Grok Build
- Claude Opus 4.7
- Muse Spark
스펙
| 속성 | 값 |
|---|---|
| Developer | Z.ai |
| Released | 2026-08-26 |
| Announced | 2026-08-26 |
| Context window | 1,048,576 (1M) |
| Pricing | $0.15/M input · $0.03/M cached input · $0.50/M output |
| License | MIT |
| Availability | Hugging Face (오픈 가중치), Z.ai API |
| 총 320B / 활성 18B MoE (320B-A18B), 네이티브 멀티모달 — 이미지와 비디오 | |
| 입력 — 이며, Z.ai 가 정밀한 롱컨텍스트 능력을 유지하면서 롱컨텍스트 서빙 비용을 | |
| 크게 낮춘다고 설명하는 희소 + 선형 어텐션 하이브리드 아키텍처를 쓴다 | |
| (source). |
50% 런치 할인이 위 요금을 한시적으로 절반으로 낮춘다. 스펙 표에는 프로모션가가 아니라 표준가를 적었다 (source).
출시일
2026-08-26, 발표와 공개가 같은 날 — 다만 서비스가 시작된 날은 아니다. Z.ai 의 발표문은 이 모델이 "이전에 Ox Alpha 로 미리 공개되었다"고 말한다. OpenCode 에서 돌던 그 스텔스 모델이며, 2차 보도는 그 기간을 공개 전의 단계적 공개 부하 테스트로 설명한다. r/LocalLLaMA 는 같은 날 아침 06:28 에 정체를 특정했고, 공개 스레드는 14:06 에 올라왔다 (source).
발표문에서 모델에 관한 것이 아닌 한 줄: "running entirely on Chinese AI chips." Z.ai 가 런치 포스트 자체에서, 묻지도 않았고 실리콘 이름도 밝히지 않은 채 그렇게 적는다. 이 위키는 이미 NVIDIA 없이 학습된 중국 프런티어 모델 하나 — LongCat-2.0, Huawei Ascend 910 — 를 보유하고 있으므로 주장 자체가 전례 없는 것은 아니다. 새로운 것은 랩이 그것을 각주가 아니라 프런티어 공개의 헤드라인 항목으로 자진해서 내세운다는 점이다. 읽은 어떤 자료도 부품명, 벤더, 또는 "entirely" 가 학습을 가리키는지 서빙을 가리키는지 둘 다인지를 말하지 않는다 (source).
셋 중 하나가 이제 답을 얻었고, 그것이 주장의 크기를 바꾼다. 이후 공개된 내용에 따르면 모든 트래픽이 전적으로 국산 칩으로 처리되었고, 추론 서비스에 10만 개 이상의 국산 칩이 투입되었으며, "하드웨어 효율과 토큰당 비용이 주류 NVIDIA GPU 에 준하는 수준에 도달했다"고 한다. 즉 "entirely" 는 서빙에 대해서는 확인된다. GLM-5.3-Flash 가 무엇으로 학습되었는지는 읽은 어떤 자료도 말하지 않으며, 이 모델에 대한 부품명과 벤더는 여전히 밝혀지지 않았다. 다른 곳에서 보도된 벤더 목록 — Moore Threads, Cambricon, Kunlun Chip, MetaX, Enflame, Hygon — 과 10만 장 규모의 Huawei Ascend 910B 학습 클러스터는 GLM-5 계열에 대한 서술이지 GLM-5.3-Flash 에 대한 것이 아니며, 잘못된 실리콘이 잘못된 모델에 귀속되지 않도록 여기가 아니라 캡처 쪽에 기록했다 (source).
그 규모의 서빙 주장은 학습 주장과는 다른 종류의 주장이고, 둘 중 약한 쪽이다. 국산 부품 위의 추론은 프런티어 모델을 NVIDIA 없이 학습할 수 있음을 입증하지 않는다. 또한 외부에서 검증하기 가장 어려운 주장이기도 하다. 공개된 어떤 자료로도 칩 수량을 확인할 수 없고, "주류 NVIDIA GPU 에 준하는" 은 기준도, 워크로드도, 측정 방법도 지목하지 않는다 (source).
벤치마크
벤더 자체 수치 (Z.ai 의 모델 카드, 2차 보도가 인용 — 하네스는 공개되지 않음):
| Benchmark | GLM-5.3-Flash | GLM-5.2 |
|---|---|---|
| DeepSWE v1.1 | 63.4 | 46.2 |
| Terminal-Bench 2.1 | 84.3 | 명시 없음 |
| AutomationBench | 48.8 | 명시 없음 |
| 독립 수치: Artificial Analysis Intelligence Index v4.1.1 — 57, 태스크당 | ||
| $0.045 | ||
| (source). |
붙들어 둘 값은 그 독립 수치 57 이다. 벤더가 아닌 쪽이 측정한 유일한 값이기 때문이다. 이 위키가 이미 추적하는 모델과의 규모 감각을 위해: 같은 지수에서 DeepSeek V4-Pro-0813 이 53, Nemotron 3.5 Lightning 이 24 다.
Z.ai 자신의 프레이밍 — GLM-5.2 대비 "1/10 가격"에 "코딩과 에이전트 벤치마크에서 Claude Opus 4.8 에 근접" — 은 읽은 어떤 자료에도 나란한 표가 없는 벤더 주장이다. 이 위키는 DeepSWE v1.1, Terminal-Bench 2.1, AutomationBench 에 대한 Opus 4.8 수치를 보유하고 있지 않으므로 그 비교는 여기서 검증할 수 없고, 결과가 아니라 주장으로 기록한다.
활용 사례
공개된 모든 수치가 놓인 자리가 코딩과 에이전트 작업이다(DeepSWE, Terminal-Bench, AutomationBench). 네이티브 멀티모달 입력(이미지, 비디오)과 1M 컨텍스트 창은 명시된 역량이지만 어느 쪽에도 붙은 벤치마크가 없다 (source).
이 모델이 어떻게 출시됐는지, 랩 자신의 설명 (2026-09-28)
Z.ai가 글을 하나 냈고 Import AI 474 가 이를 보도했다. 자사 모델을 자사 인프라 구축에 쓴 사례로 이번 출시 를 제시한다: 엔지니어 가 목표와 시스템 경계를 정하고, Infra Agent 가 분석과 가설 수립과 코드 변경을 수행하고, 실험 환경 이 "layered, timely, and verifiable" 피드백을 돌려준다 (source).
설명에 수치는 따라붙지 않는다 — 속도 향상도, 반복 횟수도, 에이전트가 작성한 변경의 비중도 없다 — 그리고 읽은 자료 어디에도 독립적인 검증이 없으므로, 측정된 결과가 아니라 서술된 관행으로 보유한다. 여기에 기록하는 이유는 그 주장이 이 페이지의 대상 에 관한 것이기 때문이다: 이 모델의 출시를 GLM-5.3 의 출시와 비교하는 독자는 이제 둘이 같은 방식으로 만들어지지 않았다는 랩 자신의 진술을 갖게 된다. 다룸은 R&D Automation Index 에 있다.
비교
- GLM-5.3 — 열이틀 앞선 2026-08-14 공개이며, 여기서 가장 중요한 한 가지 점에서 정반대다: GLM-5.3 의 가중치는 "가장 강력한 오픈 웨이트 코딩 모델"로 마케팅되는 동안 안전성 평가를 이유로 약 2주 보류되었다. GLM-5.3-Flash 는 첫날 MIT 가중치를 냈다. 읽은 어떤 자료도 왜 작은 형제 쪽에는 그런 게이트가 필요 없었는지, 또는 GLM-5.3 의 창(2026-08-28 경 예정)이 아직 열려 있는지를 설명하지 않는다.
- GLM-5.2 — 5.x 계열 전체가 파생된 744B/40B MIT 베이스이며, GLM-5.3-Flash 가 짝지은 수치를 공개한 유일한 모델.
- Qwen3.8-Flash-Next — 같은 날 공개되었고, 마찬가지로 오픈 웨이트에 멀티모달 MoE 이며 비용 효율을 내세우고, 총 176B 로 규모는 대략 절반이다. 중국의 두 랩이 몇 시간 간격으로 비용 최적화된 오픈 멀티모달 MoE 를 내놓은 것이 이 날의 모양이며, 우연도 아니고 두 랩 어느 쪽도 언급하지 않는다.
- DeepSeek V4-Flash — 또 하나의 중국 오픈 웨이트 "Flash" 등급, MIT, $0.14/$0.28 per M. GLM-5.3-Flash 는 입력이 조금 더 비싸고 출력은 약 1.8배이며, 대신 활성 파라미터가 약 1.4배이고 네이티브 멀티모달이다.
상충 보고
-
게시된 컨텍스트 창이 카탈로그와 어긋나며, 이 페이지의 수치를 유지한다.
spec-check실행 90 (2026-09-12) 이 보고한 값은 컨텍스트 1,048,576 대 카탈로그 1,310,720 이다 (source).스펙 행은 바꾸지 않았다: 위 셀은 이 페이지가 인용한 벤더 자료에 충실하고,
CLAUDE.md는 카탈로그보다 벤더 발표를 앞세운다. 1,310,720 은 1.25 × 1,048,576 이므로 카탈로그의 단위로는 임의의 수가 아니라 떨어지는 수다 — 관찰로 기록할 뿐 설명으로 채택하지 않는다.확인되지 않은 것: 어느 수치가 옳은지, 그리고 카탈로그가 같은 배포를 가리키는지 여부다.
openrouter.ai는 데일리 런의 샌드박스에서 차단돼 있어 여기서는 판정할 수 없다.2026-08-29 이후 모든 실행에서 빨간 Action 이 보고해 왔고 — 25회 연속 — 2026-09-13 까지 이 페이지에 기록되지 않았다.