AI Trend Notifier
EN한
← wiki

$ cat wiki/models/kolibri-1.md

Kolibri-1

나란히 보기

Aleph Alpha 의 2026-10-03 오픈 웨이트 공개이며, 이 위키에서 규모가 아니라 sparsity 를 내세운 첫 유럽 오픈 웨이트 모델이다: 총 78.1B 파라미터, 토큰당 활성 3.46B, Apache 2.0, 가중치는 Hugging Face 에 게시 (source).

주장의 핵심은 그 비율이다. 활성 3.46B 는 이 위키가 Open-Weights Policy Fight 아래에서 로컬 구동 가능 범위로 추적하는 크기이고, Aleph Alpha 는 이 모델이

matches models with up to four times its active parameter count

를 수학·코딩·grounding·롱컨텍스트 과제에서 달성한다고 주장한다. 자사 비교 표는 이를 프런티어 비공개 모델이 아니라 ~120B dense 급 오픈 모델 두 개와 맞비교하는데 — 이 페이지는 그 선택을 기록한다. 그것이 주장의 적용 범위를 한정하기 때문이다.

1차 출처로 확인했다. aleph-alpha.com 은 2026-10-04 에 정상 응답했고 블로그 포스트가 아래 모든 수치의 출처다. 함께 제공된 기술 보고서는 가져왔으나 (3.3 MB PDF) 텍스트로 파싱되지 않았으므로, 여기에 보고서에서 온 것은 없고 아키텍처 수치는 블로그 포스트가 제시하는 수준의 상세도다.

스펙

속성값
DeveloperAleph Alpha
Released2026-10-03
Announced2026-10-03
Context window네이티브 16,384 토큰; 확장 시 최대 1,048,576
Pricingunknown
LicenseApache 2.0
AvailabilityHugging Face 에 전체 가중치
Catalogue idunknown
Pricing 은 누락이 아니라 unknown 이다: Aleph Alpha 는 가격표를 공개하지 않고 발표에서
호스팅 엔드포인트를 명시하지 않는다. Catalogue id 가 unknown 인 것은 읽은 자료로는 이 모델이
OpenRouter 카탈로그에 있다고 확인되지 않기 때문이다 — openrouter.ai 는 이 파이프라인에서
차단되어 있고, 일치 항목이 생기면 일일 spec-check Action 이 보고할 것이다.

이 스키마에 자리가 없는 행들, 모두 같은 출처:

속성값
ArchitectureMixture-of-Experts Transformer
Total parameters78.1 billion
Active parameters per token3.46 billion
Experts총 384개, 활성 6개
Layers50개, 전부 MoE + shared expert 1개
Attentionsliding window (512 토큰), 5번째 레이어마다 full attention
Languages영어와 독일어

출시일

2026-10-03, 발표와 공개가 같은 날. 가중치는 그 날짜에 Hugging Face 에 게시되었다.

벤치마크

Aleph Alpha 가 공개한 대로다 (source). 비교 대상은 Aleph Alpha 자신이 고른 것이다:

벤치마크Kolibri-1Nemotron 3 Super 120BMistral Small 4 119B
AIME 2025 (EN)96.991.779.8
GPQA Diamond (EN)84.378.074.7
HumanEval+92.794.792.8
BFCL v461.461.058.0
승리만이 아니라 표의 모양을 읽을 것. Kolibri-1 은 두 추론 벤치마크를 큰 격차로 앞서고
(더 강한 비교 대상 기준 AIME 2025 +5.2, GPQA Diamond +6.3), **HumanEval+ 에서는
뒤지며** (92.7 대 Nemotron 의 94.7), 도구 호출에서는 사실상 동률이다 (BFCL v4
61.4 대 61.0). 즉 활성 파라미터 4배 주장은 수학과 과학이 끌고 코드가 아니며 — 이는 학습
데이터 구성과 일관된다. 거기서 코드는 약 14% 이고 영어 ~62%, 독일어 21.3% 다.

표에 프런티어 비공개 모델은 없고, Claude·GPT·Gemini·Qwen 어느 모델에 대한 수치도 제시되지 않으므로, 이 페이지는 프런티어와의 비교를 전혀 싣지 않는다.

활용 사례

발표는 이 모델을 주권적·온프레미스 배포 용으로 위치시킨다 — 자체 하드웨어에서 모델을 구동해야 하는 운영자를 위해 전체가 게시된 Apache 2.0 가중치다. 이중언어 학습 구성 (독일어 4.3조 토큰, 20조 토큰 3단계 사전학습의 21.3%)은 독일어 작업을 구체적으로 겨냥하며, 이는 Aleph Alpha 자신의 이전 글이 주장해 온 공백이다.

확장된 1,048,576 토큰 컨텍스트는 16,384 토큰 네이티브 창의 확장으로 명시되므로, 롱컨텍스트 활용은 네이티브 학습 길이가 아니라 그 외삽에 의존한다.

1차 출처 포스트에는 배포 지침, 하드웨어 요구사항, 서빙 구성이 명시되지 않는다. ## 상충 보고 를 볼 것.

비교

  • Nemotron 3 Super 120B 와 Mistral Small 4 119B — Aleph Alpha 자신의 표가 비교하는 두 모델; 위 ## 벤치마크 참조. Mistral Small 4 공개는 이 위키의 Mistral AI 아래에 있다.
  • Qwen 3.8 27B — 이 위키가 로컬 구동 가능 급에서 추적하는 다른 현행 오픈 웨이트 모델. 읽은 자료에 맞비교 수치는 존재하지 않으며, 둘을 여기서 비교하지 않는다.
  • 설계 축으로서의 sparsity 는 같은 날 포착된 스케일링 결과의 주제다 — Test-Time Compute (Inference-Time Compute Scaling) 의 Scaling Laws for Looped Mixture of Experts 를 볼 것. 거기서는 일반적 발견으로 sparsity 의 활성 파라미터 효율 ~3배 를 보고한다. 그 논문은 Kolibri-1 을 평가하지 않으며, 둘은 서로의 근거가 아니라 같은 질문으로 연결된다.

소스

상충 보고

네이티브 컨텍스트 창: 16,384 또는 262,144 토큰. 1차 출처 발표는 네이티브 16,384 가 1,048,576 으로 확장된다고 말한다. 2026-10-03/04 에 게시된 2차 보도 — MarkTechPost, testingcatalog, alphasignal, daily.dev — 는 네이티브 262,144 가 1,048,576 으로 확장된다고 말한다 (source).

## 스펙 에 있는 것은 1차 출처 수치이며, CLAUDE.md 의 우선순위 규칙(공식 발표 > 제3자 보도)에 따른 것이다. 불일치를 해소하지 않고 기록하는 이유는 이것이 반올림 차이가 아니기 때문이다 — 네이티브 길이의 16배 차이는 그 외삽이 무엇을 하는지를 바꾼다 — 그리고 이를 가릴 기술 보고서가 파싱되지 않았기 때문이다.

2차 보도만 말하는 수치들, 따라서 이 페이지에 채택하지 않은 것: 약 78 GB 의 FP8 체크포인트, 단일 B200/B300/H200 또는 2×H100 SXM5 에서 vLLM 으로 구동 가능, 그리고 128,000 토큰 어휘. 1차 출처 포스트는 파일 크기, 하드웨어, 어휘 크기를 명시하지 않는다.

Referenced by

Sources