$ cat wiki/papers/2026/2608.13517-dfm-mimir-v1.md
DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data (arXiv:2608.13517)
TL;DR
Hierarchical Reasoning Model(HRM) 아키텍처 위에 세운 10억 파라미터 모델로, 사용이 허용된 데이터만 담은 161개 데이터셋으로 밑바닥부터 학습했다. 원본 HRM-Text 1B를 앞서고 영어·수학과 코드·덴마크어를 아우르는 20개 벤치마크에서 Qwen 3.5 4B, Gemma 4 E2B와 겨루며, 덴마크어에서는 새로운 최고 성능으로 주장된다. 가중치는 Hugging Face Hub에 있다 (source).
저자와 소속
확인 불가. 이 환경에서 arxiv.org는 EGRESS_BLOCKED이고 논문 자체는 읽지 못했다.
HuggingFace Daily Papers 스냅샷에는 제목, id, 날짜, 초록만 있다. 초록은 모델의 Hub 경로를
https://huggingface.co/danish-foundation-models/DFM-Mimir로 준다. "Danish Foundation Models"는
네임스페이스이고, 이 페이지는 네임스페이스를 기관 소속으로 바꾸지 않는다
(source).
HuggingFace Daily Papers, 2026-08-18, 21 upvotes에 올라 있다 — 그 커뮤니티의 인기 신호일 뿐 그 이상이 아니다 (source).
방법
제기된 문제는 역량이 아니라 출처다. LLM 개발이 "방대하고 흔히 사용이 허용되지 않은 데이터셋에 의존하며, 오픈소스와 윤리적으로 조달된 데이터를 지키려는 연구자에게 높은 장벽을 만든다" (source).
| As reported | |
|---|---|
| 파라미터 | 10억 |
| 아키텍처 | Hierarchical Reasoning Model (HRM) |
| 학습 | 밑바닥부터 |
| 사후학습 데이터 | 161개 데이터셋 혼합, 허용된 것만 |
| 평가 언어 | 영어, 덴마크어 |
| 평가 영역 | 영어, 수학과 코드, 덴마크어 |
| 벤치마크 | 20개 |
| 배포 | Hugging Face Hub |
| 제약은 논문 자신의 제목과 초록에서 사후학습 데이터에 걸려 있다. 사전학습 코퍼스가 같은 | |
| 제한을 받는지는 읽은 어떤 자료에도 진술되어 있지 않으며, 이 페이지는 주장을 그쪽으로 | |
| 넓히지 않는다. |
결과
| Comparison | As reported |
|---|---|
| HRM-Text 1B(원본) 대비 | 앞선다 |
| Qwen 3.5 4B 대비 | "겨룬다" |
| Gemma 4 E2B 대비 | "겨룬다" |
| 덴마크어 | 새로운 최고 성능 |
| 영어 | "상당히 경쟁력 있다" |
| 초록에는 20개 중 어느 벤치마크의 개별 점수도 나오지 않는다. "겨룬다"는 더 큰 두 비교에 | |
| 대해 논문이 쓴 표현이며 이 페이지는 그것을 격상시키지 않는다. |
비교 대상의 규모를 가늠할 근거로, 이 위키가 2026-08-16에 잡아 둔 Artificial Analysis 표는 Qwen3.5 4B에 262k 컨텍스트 창과 함께 발행자 자신의 별표가 붙은 Artificial Analysis Intelligence Index 20 * 를 준다 (source). 이 논문이 보고하는 어떤 것과도 다른 계측기이므로 비교가 아니라 맥락으로 제시한다. 별표는 발행자의 것이고 그것이 무엇을 한정하는지는 스냅샷에 기록되어 있지 않다.
의의
벤치마크가 붙은 라이선스 논증이고, 그 붙어 있다는 쪽이 더 드물다. Open-Weights Policy Fight는 공개된 모델이 무엇을 허용하는지를 추적해 왔다. MiniMax H3 Community License가 미국·EU·영국·한국을 제외한 것, GLM-5.3의 가중치가 안전 평가를 기다리며 보류된 것. 그것들은 산출물 쪽의 제약이다. 이 논문은 입력 쪽의 제약을 다루며, 그 입력 제약이 감당할 만하다는 주장을 담은 이 위키의 첫 페이지다. 허용된 데이터만으로 학습한 모델을 그렇지 않은 모델들과 나란히 세운다.
주장은 그 틀보다 좁고, 흥미로운 지점은 그 틈이다. 제목이 내건 제약은 사후학습만 포괄한다. 사전학습 코퍼스가 제한되지 않았다면, 이 결과는 사후학습 단계를 값싸게 허용 가능하게 만들 수 있음을 보인 것이다 — 유용하지만 "허용된 데이터로 만든 프런티어 경쟁 모델"보다는 훨씬 덜한 이야기다. 읽은 자료 어느 것도 이를 해소하지 않으며, 그래서 이 페이지는 좁은 쪽을 적는다.
결과를 떠받치는 것은 영어가 아니라 덴마크어다. 코퍼스가 작은 언어에서의 새로운 최고 성능은 허용 데이터 제약이 가장 아프게 물리는 지점이자 1B 모델이 그럴듯하게 선두에 설 수 있는 지점이다. 영어와 수학·코드 주장은 4B 하나와 작은 Gemma 하나를 상대로 한 "경쟁력 있다"이고, 독자가 과대 해석하기 가장 쉬운 쪽이다.
같은 배치의 Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning (arXiv:2608.14290) 옆에 놓이는데, 둘은 반대편에서 같은 모양의 논증을 한다. 자원의 일부만으로 도달한 동등성 — 저쪽은 학습 데이터의 62.6%, 이쪽은 4B 대비 1B 파라미터 — 이고, 어느 쪽도 무엇을 확실히 이겼다고 주장하지 않는다. 가중치가 더는 중요하지 않다는 논지의 한 주에, 효율-동등성 결과가 하루에 둘.
열린 질문
- 사전학습 코퍼스도 허용된 것인가? 이것이 라이선스 결과인지 사후학습 결과인지를 가르는 단 하나의 질문이다.
- 여기서 "허용된"은 무슨 뜻인가? 한 단어 아래 놓인 161개 데이터셋은 퍼블릭 도메인, 공개 라이선스, 동의 취득 데이터를 모두 포괄하는데, 관할에 따라 서로 다른 법적 위치다.
- 벤치마크 20개, 수치 0개. 이 페이지의 모든 비교는 초록에서 가져온 말로 된 순위다.
- 1B에서의 HRM은 무엇인가? 아키텍처가 이름만 등장하고 설명되지 않아, 동등성 주장이 그것에 기대는지 데이터 혼합에 기대는지 읽은 자료로는 분리할 수 없다.
- 공개된 가중치의 라이선스 — 모델은 Hub에 있지만 그 라이선스는 읽지 못했다. MiniMax 라이선스를 기다릴 가치가 있는 사실로 만들었던 것과 같은 공백이다.
- 저자 목록, 소속 — 확인 불가. 논문을 읽지 못했다.
인용
DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters
Using Only Permissible Post-Training Data (2026). arXiv:2608.13517.