$ cat wiki/models/hy4-preview.md
Hy4 preview
나란히 보기
- GLM-5.3-Flash
- Granite 4.2
- DeepSeek V4-Pro-0813
- Gemini 3.7 Flash
- Muse Glimmer
- Grok 4.6
- Claude Opus 5
- Laguna S 2.1
- Kimi K3
- Inkling
- GPT-5.6 Sol
- LongCat-2.0
- MiniMax M3
- GLM-5.3
- Qwen 3.8 27B
- Muse Spark 1.2
- Qwen 3.8 Max
- DeepSeek V4-Flash
- Gemini 3.5 Flash-Lite
- Gemini 3.6 Flash
- DeepSeek V4
- Grok 4.5
- Claude Sonnet 5
- GLM-5.2
- Claude Fable 5
- Claude Opus 4.8
- Gemini 3.5 Flash
- Grok Build
- Claude Opus 4.7
- Muse Spark
스펙
| 속성 | 값 |
|---|---|
| Developer | Tencent |
| Released | 2026-08-28 |
| Announced | 2026-08-28 |
| Context window | over 1,000,000 |
| Pricing | $0.834/M input · $2.501/M output |
| License | Apache-2.0 |
| Availability | Hugging Face (BF16 + FP8), ModelScope, GitCode, CNB, Tencent Cloud TokenHub, OpenRouter, WorkBuddy, CodeBuddy, Yuanbao, ima |
Context window 는 보도가 적은 그대로 기록한다 — "1M 토큰 초과", 그리고 "1M | |
토큰 컨텍스트"라고 단정적으로 적힌 곳도 있다. config.json 값을 읽지 못했으므로 이 | |
| 행에는 설정 파일이 제공했을 정확한 정수를 넣지 않는다; GLM-5.3 의 같은 | |
| 수치도 그 설정을 읽고 나서야 고정되었다 | |
| (source). |
Pricing 은 API 요율이고 가중치는 무료다. Apache 2.0 이 BF16 체크포인트와 FP8
양자화를 모두 덮으므로, 토큰당 수치는 모델이 아니라 Tencent 의 호스팅에 매겨진
가격이다.
출시일
2026-08-28 공개, 같은 날 오픈소스화 — 발표와 가중치가 함께였고 유예 기간이 없었다. 이는 가장 가까운 두 비교 대상과 정반대다: GLM-5.3 은 2026-08-14 발표 후 안전 평가를 이유로 약 2주간 가중치를 보류했고, Qwen3.8-Flash-Next 는 공개 카운트다운 타이머를 돌렸다 (source).
벤치마크
아래 모든 수치는 Tencent 자체 수치이며, 어느 행에도 하네스가 명시되어 있지 않다. 제3자가 이 모델을 측정한 적은 없다: 같은 날 아침 캡처된 Artificial Analysis 리더보드에 등장하지 않으며, 그 리더보드는 Tencent 를 이전 모델 Hy3 의 Intelligence Index 42 로만 등재하고 있다 (source).
| Benchmark | Hy4 preview | 보도된 비교 대상 |
|---|---|---|
| Terminal Bench 2.1 | 85.4 | DeepSeek V4 Pro 를 앞섰다고 보도됨 |
| DeepSWE | 28.0 → 64.3 | 28.0 기준선의 모델은 지목되지 않음 |
| 내부 블라인드 평가 (엔지니어링 과제 203건, 전문가 163명) | 2.99 / 4 | Kimi K3 2.94, GLM-5.3 2.92 |
| GLM-5.3 대상 맞대결, 같은 평가 | 46.8% 승 · 12.8% 무 · 40.4% 패 | — |
| BenchAlign 리더보드 | 228개 중 #7, 79.16/100 | 제3자 리더보드이며, BenchAlign 이 아니라 BenchLM 을 통해 읽음 |
| 블라인드 평가는 측정 대상 당사자가 설계하고 실행하고 채점했다. Tencent 자체 | ||
| 전문가 163명이 Tencent 자체 과제 203건을 채점한 것은 유용한 내부 신호이며, 다른 | ||
| 누구도 재현할 수 없는 비교다. 그것이 보고하는 격차 — 2.99 대 2.94 및 2.92 — 는 | ||
| 4점 척도에서 0.05 와 0.07 이고, 읽은 자료 중 어느 것도 분산이나 신뢰구간이나 | ||
| 채점자 간 일치도를 제시하지 않으므로 그 순서가 분리 가능한지는 확립되지 않았다. |
벤치마크 12개에 걸쳐 "어떤 단일 시험에서도 최하위가 아니었다" 는 것이 Tencent 가 앞세우는 주장이다. 읽은 자료에서 인용된 것은 위의 행들뿐이고 나머지 벤치마크는 지목되지 않았으므로, 그 주장은 여기서 검증할 수 없다.
활용 사례
에이전트 코딩과 터미널 작업이, 무엇을 벤치마크했는지가 말해 주는 바다: Terminal Bench, DeepSWE, 그리고 엔지니어링 과제로 서술된 내부 과제 집합. 처음 탑재된 일차 제품들 — CodeBuddy 와 WorkBuddy — 도 같은 방향을 가리킨다 (source).
희소성이 배포 논거다. 770B 중 활성 49B 는 순전파당 모델의 약 6% 이며, 770B 모델을 $0.834/M input 으로 부를 수 있게 하는 것이 그것이다. 읽은 자료 중 어느 것도 처리량, 지연, 메모리 사용량을 측정하지 않으며, 이 모델이 여기에 r/LocalLLaMA 를 통해 올라왔음에도 로컬 추론 수치는 존재하지 않는다.
비교
- GLM-5.3 — Tencent 가 직접 고른 비교 대상이며, 점수보다 라이선스가 더
크게 갈린다. GLM-5.3 은 그룹 매출 100억 달러를 넘는 Model-as-a-Service
사업자에게 Z.AI 의 보안 심사를 요구하는 전용
glm-5.3라이선스로 나왔고, Hy4 preview 는 그런 조항 없이 Apache 2.0 으로 나왔다. Tencent 자체 블라인드 평가에서 격차는 2.99 대 2.92 다. - DeepSeek V4-Pro-0813 — 1.6T/49B MoE, MIT, 대략 두 배 큰 총 규모에 동일한 활성 49B 파라미터. Terminal Bench 2.1 수치가 맞아떨어지지 않는 건은
## 상충 보고를 볼 것. - Kimi K3 — 2.8T MoE, Tencent 블라인드 평가의 세 번째 모델로 2.94.
- Qwen3.8-Flash-Next — 이번 2주의 또 다른 중국 오픈 웨이트 릴리스이자
정반대의 설계 지점: 770B/49B 에 대해 총 176B / 활성 6B, Apache 2.0 에 대해
qwen-community-1.0. - 아키텍처상으로는 DeepSeek 의 작업에 가장 가깝고, 그것은 Tencent 자신의 명명에 따른 것이다: 어텐션 모듈이 Gated DeepSeek Sparse Attention (Gated DSA) 이다. 지목된 경쟁사의 어텐션 메커니즘 위에 프런티어 모델을 세워 공개하는 것은 오픈 웨이트가 낳으리라 기대되는 바로 그것이며, 일반론이 아니라 사례로 기록해 둘 가치가 있다.
상충 보고
Terminal Bench 2.1 — Hy4 preview 의 85.4 는 DeepSeek V4-Pro 를 앞섰다고 보도되는데, 이 위키는 그 모델에 대해 87.9 를 보유하고 있다. DeepSeek V4-Pro-0813 은 2026-08-14 에 여기 기록된 대로 하네스가 공개되지 않은 상태의 벤더 자체 Terminal Bench 2.1 87.9 를 달고 있다. Tencent 의 주장이 성립하려면 85.4 아래의 V4-Pro 수치가 필요한데, Tencent 가 V4-Pro 에 대해 사용한 수치는 읽지 못했다.
이것은 해소되지 않았고, 해소해서도 안 된다. 두 벤더가 같은 벤치마크를 각자
자체 보고하면서 어느 쪽도 하네스를 명시하지 않은 것은 Eval Harness Configuration
이 존재하는 이유 그 자체다: 두 수치가 서로 다른 구성에 대한 정확한 측정일 수 있고,
공개된 어떤 것도 그것을 가려낼 수 없다. CLAUDE.md 에 따라 페이지 본문은 어느
쪽도 확정으로 싣지 않으며 둘 다 출처와 함께 여기에 놓인다
(source).
GLM-5.3 과 공유하는 파라미터 형태. 여기 보고된 백본 — 78 레이어, 라우티드
익스퍼트 256 개, top-8 활성 — 은 2026-08-28 에 GLM-5.3 의 config.json 에서 읽은
레이어/익스퍼트/라우팅 형태와 같다. 관찰로만 기록한다: 읽은 자료 중 어느 것도 둘을
연결하지 않으며, MoE 모델 둘이 같은 구성에 도달한 것 자체는 아무것도 입증하지 않는다.