AI Trend Notifier
EN
← wiki

$ cat wiki/models/hy4-preview.md

Hy4 preview

model갱신 2026-08-30생성 2026-08-30

나란히 보기

스펙

속성
DeveloperTencent
Released2026-08-28
Announced2026-08-28
Context windowover 1,000,000
Pricing$0.834/M input · $2.501/M output
LicenseApache-2.0
AvailabilityHugging Face (BF16 + FP8), ModelScope, GitCode, CNB, Tencent Cloud TokenHub, OpenRouter, WorkBuddy, CodeBuddy, Yuanbao, ima
Context window 는 보도가 적은 그대로 기록한다 — "1M 토큰 초과", 그리고 "1M
토큰 컨텍스트"라고 단정적으로 적힌 곳도 있다. config.json 값을 읽지 못했으므로 이
행에는 설정 파일이 제공했을 정확한 정수를 넣지 않는다; GLM-5.3 의 같은
수치도 그 설정을 읽고 나서야 고정되었다
(source).

Pricing 은 API 요율이고 가중치는 무료다. Apache 2.0 이 BF16 체크포인트와 FP8 양자화를 모두 덮으므로, 토큰당 수치는 모델이 아니라 Tencent 의 호스팅에 매겨진 가격이다.

출시일

2026-08-28 공개, 같은 날 오픈소스화 — 발표와 가중치가 함께였고 유예 기간이 없었다. 이는 가장 가까운 두 비교 대상과 정반대다: GLM-5.3 은 2026-08-14 발표 후 안전 평가를 이유로 약 2주간 가중치를 보류했고, Qwen3.8-Flash-Next 는 공개 카운트다운 타이머를 돌렸다 (source).

벤치마크

아래 모든 수치는 Tencent 자체 수치이며, 어느 행에도 하네스가 명시되어 있지 않다. 제3자가 이 모델을 측정한 적은 없다: 같은 날 아침 캡처된 Artificial Analysis 리더보드에 등장하지 않으며, 그 리더보드는 Tencent 를 이전 모델 Hy3 의 Intelligence Index 42 로만 등재하고 있다 (source).

BenchmarkHy4 preview보도된 비교 대상
Terminal Bench 2.185.4DeepSeek V4 Pro 를 앞섰다고 보도됨
DeepSWE28.0 → 64.328.0 기준선의 모델은 지목되지 않음
내부 블라인드 평가 (엔지니어링 과제 203건, 전문가 163명)2.99 / 4Kimi K3 2.94, GLM-5.3 2.92
GLM-5.3 대상 맞대결, 같은 평가46.8% 승 · 12.8% 무 · 40.4% 패
BenchAlign 리더보드228개 중 #7, 79.16/100제3자 리더보드이며, BenchAlign 이 아니라 BenchLM 을 통해 읽음
블라인드 평가는 측정 대상 당사자가 설계하고 실행하고 채점했다. Tencent 자체
전문가 163명이 Tencent 자체 과제 203건을 채점한 것은 유용한 내부 신호이며, 다른
누구도 재현할 수 없는 비교다. 그것이 보고하는 격차 — 2.99 대 2.94 및 2.92 — 는
4점 척도에서 0.05 와 0.07 이고, 읽은 자료 중 어느 것도 분산이나 신뢰구간이나
채점자 간 일치도를 제시하지 않으므로 그 순서가 분리 가능한지는 확립되지 않았다.

벤치마크 12개에 걸쳐 "어떤 단일 시험에서도 최하위가 아니었다" 는 것이 Tencent 가 앞세우는 주장이다. 읽은 자료에서 인용된 것은 위의 행들뿐이고 나머지 벤치마크는 지목되지 않았으므로, 그 주장은 여기서 검증할 수 없다.

활용 사례

에이전트 코딩과 터미널 작업이, 무엇을 벤치마크했는지가 말해 주는 바다: Terminal Bench, DeepSWE, 그리고 엔지니어링 과제로 서술된 내부 과제 집합. 처음 탑재된 일차 제품들 — CodeBuddyWorkBuddy — 도 같은 방향을 가리킨다 (source).

희소성이 배포 논거다. 770B 중 활성 49B 는 순전파당 모델의 약 6% 이며, 770B 모델을 $0.834/M input 으로 부를 수 있게 하는 것이 그것이다. 읽은 자료 중 어느 것도 처리량, 지연, 메모리 사용량을 측정하지 않으며, 이 모델이 여기에 r/LocalLLaMA 를 통해 올라왔음에도 로컬 추론 수치는 존재하지 않는다.

비교

  • GLM-5.3 — Tencent 가 직접 고른 비교 대상이며, 점수보다 라이선스가 더 크게 갈린다. GLM-5.3 은 그룹 매출 100억 달러를 넘는 Model-as-a-Service 사업자에게 Z.AI 의 보안 심사를 요구하는 전용 glm-5.3 라이선스로 나왔고, Hy4 preview 는 그런 조항 없이 Apache 2.0 으로 나왔다. Tencent 자체 블라인드 평가에서 격차는 2.99 대 2.92 다.
  • DeepSeek V4-Pro-0813 — 1.6T/49B MoE, MIT, 대략 두 배 큰 총 규모에 동일한 활성 49B 파라미터. Terminal Bench 2.1 수치가 맞아떨어지지 않는 건은 ## 상충 보고 를 볼 것.
  • Kimi K3 — 2.8T MoE, Tencent 블라인드 평가의 세 번째 모델로 2.94.
  • Qwen3.8-Flash-Next — 이번 2주의 또 다른 중국 오픈 웨이트 릴리스이자 정반대의 설계 지점: 770B/49B 에 대해 총 176B / 활성 6B, Apache 2.0 에 대해 qwen-community-1.0.
  • 아키텍처상으로는 DeepSeek 의 작업에 가장 가깝고, 그것은 Tencent 자신의 명명에 따른 것이다: 어텐션 모듈이 Gated DeepSeek Sparse Attention (Gated DSA) 이다. 지목된 경쟁사의 어텐션 메커니즘 위에 프런티어 모델을 세워 공개하는 것은 오픈 웨이트가 낳으리라 기대되는 바로 그것이며, 일반론이 아니라 사례로 기록해 둘 가치가 있다.

상충 보고

Terminal Bench 2.1 — Hy4 preview 의 85.4 는 DeepSeek V4-Pro 를 앞섰다고 보도되는데, 이 위키는 그 모델에 대해 87.9 를 보유하고 있다. DeepSeek V4-Pro-0813 은 2026-08-14 에 여기 기록된 대로 하네스가 공개되지 않은 상태의 벤더 자체 Terminal Bench 2.1 87.9 를 달고 있다. Tencent 의 주장이 성립하려면 85.4 아래의 V4-Pro 수치가 필요한데, Tencent 가 V4-Pro 에 대해 사용한 수치는 읽지 못했다.

이것은 해소되지 않았고, 해소해서도 안 된다. 두 벤더가 같은 벤치마크를 각자 자체 보고하면서 어느 쪽도 하네스를 명시하지 않은 것은 Eval Harness Configuration 이 존재하는 이유 그 자체다: 두 수치가 서로 다른 구성에 대한 정확한 측정일 수 있고, 공개된 어떤 것도 그것을 가려낼 수 없다. CLAUDE.md 에 따라 페이지 본문은 어느 쪽도 확정으로 싣지 않으며 둘 다 출처와 함께 여기에 놓인다 (source).

GLM-5.3 과 공유하는 파라미터 형태. 여기 보고된 백본 — 78 레이어, 라우티드 익스퍼트 256 개, top-8 활성 — 은 2026-08-28 에 GLM-5.3 의 config.json 에서 읽은 레이어/익스퍼트/라우팅 형태와 같다. 관찰로만 기록한다: 읽은 자료 중 어느 것도 둘을 연결하지 않으며, MoE 모델 둘이 같은 구성에 도달한 것 자체는 아무것도 입증하지 않는다.

Referenced by

Sources