$ cat wiki/models/kolibri-1.md
Kolibri-1
나란히 보기
- Gemini 4 Argon
- GPT-6.1 Sol
- Claude Sonnet 5.5
- MiMo-V2.6-Pro
- Grok 4.7
- Ternary Bonsai 2 27B
- Fugu Max
- Kimi K2.8 Preview
- DeepSeek V4.1-Flash
- K2 Horizon
- Muse Spark 1.3
- Hy4 preview
- GLM-5.3-Flash
- Granite 4.2
- Ling-3.0-tiny
- Laguna S 2.1
- Inkling
- LongCat-2.0
- MiniMax M3
- Claude Opus 5.5
- GPT-6 Luna
- GPT-6 Sol
- Gemini 3.8 Live
- Fugu Ultra v2
- GPT-Image-2.5 Flare
- GPT-Image-2.5 Sunburst
- Astra
- Gemini 3.8 Flash
- Claude Fable 5.1
- GLM-5.3
- Qwen 3.8 27B
- DeepSeek V4-Pro-0813
- Gemini 3.7 Flash
- Muse Glimmer
- Grok 4.6
- Muse Spark 1.2
- Qwen 3.8 Max
- DeepSeek V4-Flash
- Claude Opus 5
- Gemini 3.5 Flash-Lite
- Gemini 3.6 Flash
- DeepSeek V4
- Kimi K3
- GPT-5.6 Sol
- Grok 4.5
- Claude Sonnet 5
- GLM-5.2
- Claude Fable 5
- Claude Opus 4.8
- Gemini 3.5 Flash
- Grok Build
- Claude Opus 4.7
- Muse Spark
Aleph Alpha 의 2026-10-03 오픈 웨이트 공개이며, 이 위키에서 규모가 아니라 sparsity 를 내세운 첫 유럽 오픈 웨이트 모델이다: 총 78.1B 파라미터, 토큰당 활성 3.46B, Apache 2.0, 가중치는 Hugging Face 에 게시 (source).
주장의 핵심은 그 비율이다. 활성 3.46B 는 이 위키가 Open-Weights Policy Fight 아래에서 로컬 구동 가능 범위로 추적하는 크기이고, Aleph Alpha 는 이 모델이
matches models with up to four times its active parameter count
를 수학·코딩·grounding·롱컨텍스트 과제에서 달성한다고 주장한다. 자사 비교 표는 이를 프런티어 비공개 모델이 아니라 ~120B dense 급 오픈 모델 두 개와 맞비교하는데 — 이 페이지는 그 선택을 기록한다. 그것이 주장의 적용 범위를 한정하기 때문이다.
1차 출처로 확인했다. aleph-alpha.com 은 2026-10-04 에 정상 응답했고 블로그 포스트가
아래 모든 수치의 출처다. 함께 제공된 기술 보고서는 가져왔으나 (3.3 MB PDF) 텍스트로
파싱되지 않았으므로, 여기에 보고서에서 온 것은 없고 아키텍처 수치는 블로그 포스트가
제시하는 수준의 상세도다.
스펙
| 속성 | 값 |
|---|---|
| Developer | Aleph Alpha |
| Released | 2026-10-03 |
| Announced | 2026-10-03 |
| Context window | 네이티브 16,384 토큰; 확장 시 최대 1,048,576 |
| Pricing | unknown |
| License | Apache 2.0 |
| Availability | Hugging Face 에 전체 가중치 |
| Catalogue id | unknown |
Pricing 은 누락이 아니라 unknown 이다: Aleph Alpha 는 가격표를 공개하지 않고 발표에서 | |
호스팅 엔드포인트를 명시하지 않는다. Catalogue id 가 unknown 인 것은 읽은 자료로는 이 모델이 | |
OpenRouter 카탈로그에 있다고 확인되지 않기 때문이다 — openrouter.ai 는 이 파이프라인에서 | |
차단되어 있고, 일치 항목이 생기면 일일 spec-check Action 이 보고할 것이다. |
이 스키마에 자리가 없는 행들, 모두 같은 출처:
| 속성 | 값 |
|---|---|
| Architecture | Mixture-of-Experts Transformer |
| Total parameters | 78.1 billion |
| Active parameters per token | 3.46 billion |
| Experts | 총 384개, 활성 6개 |
| Layers | 50개, 전부 MoE + shared expert 1개 |
| Attention | sliding window (512 토큰), 5번째 레이어마다 full attention |
| Languages | 영어와 독일어 |
출시일
2026-10-03, 발표와 공개가 같은 날. 가중치는 그 날짜에 Hugging Face 에 게시되었다.
벤치마크
Aleph Alpha 가 공개한 대로다 (source). 비교 대상은 Aleph Alpha 자신이 고른 것이다:
| 벤치마크 | Kolibri-1 | Nemotron 3 Super 120B | Mistral Small 4 119B |
|---|---|---|---|
| AIME 2025 (EN) | 96.9 | 91.7 | 79.8 |
| GPQA Diamond (EN) | 84.3 | 78.0 | 74.7 |
| HumanEval+ | 92.7 | 94.7 | 92.8 |
| BFCL v4 | 61.4 | 61.0 | 58.0 |
| 승리만이 아니라 표의 모양을 읽을 것. Kolibri-1 은 두 추론 벤치마크를 큰 격차로 앞서고 | |||
| (더 강한 비교 대상 기준 AIME 2025 +5.2, GPQA Diamond +6.3), **HumanEval+ 에서는 | |||
| 뒤지며** (92.7 대 Nemotron 의 94.7), 도구 호출에서는 사실상 동률이다 (BFCL v4 | |||
| 61.4 대 61.0). 즉 활성 파라미터 4배 주장은 수학과 과학이 끌고 코드가 아니며 — 이는 학습 | |||
| 데이터 구성과 일관된다. 거기서 코드는 약 14% 이고 영어 ~62%, 독일어 21.3% 다. |
표에 프런티어 비공개 모델은 없고, Claude·GPT·Gemini·Qwen 어느 모델에 대한 수치도 제시되지 않으므로, 이 페이지는 프런티어와의 비교를 전혀 싣지 않는다.
활용 사례
발표는 이 모델을 주권적·온프레미스 배포 용으로 위치시킨다 — 자체 하드웨어에서 모델을 구동해야 하는 운영자를 위해 전체가 게시된 Apache 2.0 가중치다. 이중언어 학습 구성 (독일어 4.3조 토큰, 20조 토큰 3단계 사전학습의 21.3%)은 독일어 작업을 구체적으로 겨냥하며, 이는 Aleph Alpha 자신의 이전 글이 주장해 온 공백이다.
확장된 1,048,576 토큰 컨텍스트는 16,384 토큰 네이티브 창의 확장으로 명시되므로, 롱컨텍스트 활용은 네이티브 학습 길이가 아니라 그 외삽에 의존한다.
1차 출처 포스트에는 배포 지침, 하드웨어 요구사항, 서빙 구성이 명시되지 않는다.
## 상충 보고 를 볼 것.
비교
- Nemotron 3 Super 120B 와 Mistral Small 4 119B — Aleph Alpha 자신의 표가 비교하는 두
모델; 위
## 벤치마크참조. Mistral Small 4 공개는 이 위키의 Mistral AI 아래에 있다. - Qwen 3.8 27B — 이 위키가 로컬 구동 가능 급에서 추적하는 다른 현행 오픈 웨이트 모델. 읽은 자료에 맞비교 수치는 존재하지 않으며, 둘을 여기서 비교하지 않는다.
- 설계 축으로서의 sparsity 는 같은 날 포착된 스케일링 결과의 주제다 — Test-Time Compute (Inference-Time Compute Scaling) 의 Scaling Laws for Looped Mixture of Experts 를 볼 것. 거기서는 일반적 발견으로 sparsity 의 활성 파라미터 효율 ~3배 를 보고한다. 그 논문은 Kolibri-1 을 평가하지 않으며, 둘은 서로의 근거가 아니라 같은 질문으로 연결된다.
소스
- Kolibri Has Landed: A Sovereign Open-Weight Model — Aleph Alpha, 2026-10-03, 2026-10-04 에 1차 출처로 확인
상충 보고
네이티브 컨텍스트 창: 16,384 또는 262,144 토큰. 1차 출처 발표는 네이티브 16,384 가 1,048,576 으로 확장된다고 말한다. 2026-10-03/04 에 게시된 2차 보도 — MarkTechPost, testingcatalog, alphasignal, daily.dev — 는 네이티브 262,144 가 1,048,576 으로 확장된다고 말한다 (source).
## 스펙 에 있는 것은 1차 출처 수치이며, CLAUDE.md 의 우선순위 규칙(공식 발표 >
제3자 보도)에 따른 것이다. 불일치를 해소하지 않고 기록하는 이유는 이것이 반올림 차이가 아니기
때문이다 — 네이티브 길이의 16배 차이는 그 외삽이 무엇을 하는지를 바꾼다 — 그리고 이를 가릴
기술 보고서가 파싱되지 않았기 때문이다.
2차 보도만 말하는 수치들, 따라서 이 페이지에 채택하지 않은 것: 약 78 GB 의 FP8 체크포인트, 단일 B200/B300/H200 또는 2×H100 SXM5 에서 vLLM 으로 구동 가능, 그리고 128,000 토큰 어휘. 1차 출처 포스트는 파일 크기, 하드웨어, 어휘 크기를 명시하지 않는다.