$ cat wiki/models/k2-horizon.md
K2 Horizon
나란히 보기
- Astra
- Gemini 3.8 Flash
- Muse Spark 1.3
- Claude Fable 5.1
- Hy4 preview
- GLM-5.3-Flash
- Granite 4.2
- DeepSeek V4-Pro-0813
- Grok 4.6
- Laguna S 2.1
- Kimi K3
- Inkling
- LongCat-2.0
- MiniMax M3
- GLM-5.3
- Qwen 3.8 27B
- Gemini 3.7 Flash
- Muse Glimmer
- Muse Spark 1.2
- Qwen 3.8 Max
- DeepSeek V4-Flash
- Claude Opus 5
- Gemini 3.5 Flash-Lite
- Gemini 3.6 Flash
- DeepSeek V4
- GPT-5.6 Sol
- Grok 4.5
- Claude Sonnet 5
- GLM-5.2
- Claude Fable 5
- Claude Opus 4.8
- Gemini 3.5 Flash
- Grok Build
- Claude Opus 4.7
- Muse Spark
Institute of Foundation Models 가 내놓은 모델 여섯 개의 계열. 2026-09-03 Apache 2.0 으로, 가중치·코드·학습 데이터·방법론을 함께 공개했다 (source).
이것은 Moonshot 의 모델이 아니다. Moonshot AI 의 Kimi 라인도 "K2" 를 쓰고, 이 릴리스는 Kimi 출시가 일상적인 r/LocalLLaMA 를 통해 드러났다. K2 Horizon 은 MBZUAI 의 IFM 에서 나왔다. 두 라인은 세 글자를 공유할 뿐 그 밖에는 아무 관계가 없다. 이 구분을 여기와 Institute of Foundation Models (IFM) 양쪽에 적는 이유는, 틀리면 아부다비 연구소의 성과를 베이징 연구소에 돌리게 되기 때문이다.
스펙
| 속성 | 값 |
|---|---|
| Developer | Institute of Foundation Models (IFM) |
| Released | 2026-09-03 |
| Announced | 2026-09-03 |
| Context window | 524,288 (플래그십 375B-A23B, midtraining 이후 네이티브) |
| Pricing | unknown |
| License | Apache 2.0 (가중치와 코드) |
| Availability | Hugging Face (가중치, 코드, 체크포인트, 재배포 가능한 범위의 학습 데이터) |
Pricing 이 "무료" 가 아니라 unknown 인 이유가 있다. 가중치는 비용 없이 내려받을 | |
| 수 있지만 읽은 자료 어디에도 1자 호스팅 엔드포인트나 가격이 서술되어 있지 않고, | |
추론 비용은 그것을 서빙하는 쪽의 몫이다. 이 구분이야말로 unknown 이 지키려고 | |
| 존재하는 것이다. |
모델 여섯에 페이지 하나. CLAUDE.md 의 규칙은 시리즈가 아니라 모델당 한 페이지이고,
이 릴리스는 그 규칙의 경계다. 한 게시물에서 체크포인트 여섯이 발표되었고, 라이선스와
레시피와 학습 코퍼스를 공유하며, 그중 어느 것에 대해서도 개별 수치가 공표되지
않았다. 여섯 페이지로 쪼개면 파라미터 수만 다른 스펙 표 여섯 개와, 모두 "공표된
점수 없음" 이라고 적힌 ## 벤치마크 여섯 개가 나온다. 출처가 이들을 구분해 줄 때까지
함께 둔다.
출시일
2026-09-03. 크기: 0.9B, 3.7B, 7B, 32B, 36B-A4B, 375B-A23B.
각 모델은 약 20조 토큰으로 사전학습되었다고 명시된다. 플래그십 375B-A23B 는 Mixture of Experts 이고 총 375B 파라미터 중 추론 시 23B 활성이다 (source).
IFM 은 크기별 용도를 밝힌다. 0.9B 로컬 개발, 3.7B 단일 노드 서빙, 7B 비용 민감 배포, 32B 상시 고부하 사용. 나머지 두 크기의 용도는 어느 패스도 실어 나르지 않았다.
벤치마크
없다. 이는 캡처의 공백이 아니라 발견이다.
IFM 은 비교 주장 셋을 공표하고 그중 어느 것에도 벤치마크 이름과 점수를 붙이지 않는다 (source):
| 주장 | 공표된 대로 |
|---|---|
| 추론, 수학, 코딩, 에이전트형 작업 전반 | "모든 크기 등급에서 최상급 성능" |
| 0.9B, 3.7B, 7B | 각자의 규모에서 새로운 state of the art 라고 명시 |
| 에이전트형 tool use, 터미널, 장기 워크플로 | 자기 크기의 2.6배까지의 오픈 웨이트 MoE 모델과 대등하거나 그 이상, "클로즈드 프런티어 모델과 경쟁력 있음" |
ifm.ai, huggingface.co, artificialanalysis.ai 가 모두 이번 실행의 샌드박스에서 | |
| 닿지 않으므로, 발표에 두 번의 검색 패스가 드러내지 못한 스코어카드가 있을 가능성을 | |
| 배제할 수는 없다. 말할 수 있는 것은 이 위키에 도달한 수치가 하나도 없다는 것이며, | |
| 학습 데이터는 공개하면서 평가 수치는 공개하지 않는 모델 카드는 이례적인 형태다. |
2.6배 주장은 숫자가 붙었다면 확인 가능했을 바로 그 주장이다. 플래그십 총 파라미터의 2.6배인 오픈 웨이트 MoE 는 대략 975B 급 모델인데, 이 비교는 그런 모델도, 벤치마크도, 하네스도 명명하지 않는다. Eval Harness Configuration 에 따르면 그것은 포지셔닝 주장이다.
활용 사례
이 릴리스의 논지는 역량이 아니라 재현성이다. 가중치, 코드, 재배포 라이선스가 허용하는 범위의 학습 데이터, 중간 체크포인트, 학습 설정, 세밀한 로그, 평가 결과. 제한된 데이터셋에 대해서는 데이터 대신 출처 설명, 구축 방법, 혼합 레시피를 공개한다 (source).
Open-Weights Policy Fight 참조 — 이것은 8월 내내 이 위키가 반대편 끝을 기록해 온 스펙트럼의 먼 쪽 끝에 있다.
비교
- GLM-5.3 — Open-Weights Policy Fight 가 여부 → 시점 → 조건 으로 추적한 8월의 릴리스. GLM-5.3 은 매출 기준 조건이 붙은 자체 라이선스로 가중치를 냈고, K2 Horizon 은 조건 없이 Apache 2.0 으로 가중치·코드·데이터를 낸다. 그리고 GLM-5.3 이 스코어카드를 낸 자리에서 K2 Horizon 은 아무 점수도 내지 않는다
- Qwen 3.8 27B, Gemma 4 12B, Nemotron 3.5 Lightning — 겹치는 크기대의 오픈 웨이트 릴리스이고, 모두 가중치만 낸다
- Kimi K3 — Moonshot AI 의 현 플래그십이자, 이 페이지 첫머리의 구분이 존재하는 이유