$ cat wiki/papers/2026/2609.10712-nemotron-imo-gold.md
An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics
TL;DR
IMO 2026 에서 42 점 만점에 30 점 — 금메달 기준 — 을 기록한 오픈 모델 파이프라인이며, 전 과정을 자연어로 처리하고 형식 증명기도, 외부 도구도, 인터넷 접근도 쓰지 않는다. Nemotron 3 Ultra 에서 출발해 지도 미세조정과 강화학습으로 전문가 체크포인트 둘을 학습시키고, 그 셋(일반 공개 모델과 두 전문가)이 후보 증명을 생성·검증·정제하는 반복 탐색을 구동하며, 별도의 고연산 단계가 각 제출을 선택한다. 후학습 체크포인트 둘, 학습 데이터, 학습·추론 코드, 제출한 풀이, 그리고 새 벤치마크 (Nemotron-IMO-Bench, 올림피아드 수준 새 문제 200 개) 가 모두 공개된다 (source).
저자와 소속
읽은 자료 어디에도 공개돼 있지 않다. 스냅샷에 저자 목록도 소속도 없다 (source). 베이스 모델은 Nemotron 3 Ultra 로 NVIDIA 계열이며 — NVIDIA 와 Nemotron 3.5 Lightning 참조 — 여기서 읽은 어떤 pass 도 논문의 소속을 밝히지 않으므로 단정하지 않는다.
방법
| 요소 | 내용 |
|---|---|
| 베이스 모델 | Nemotron 3 Ultra |
| 후학습 | 지도 미세조정과 강화학습으로 전문가 체크포인트 둘 생성 |
| 추론 시스템 | 후보 증명을 생성·검증·정제하는 반복 탐색, 체크포인트 셋이 구동 — 일반 공개 모델과 두 전문가 |
| 최종 선택 | 별도의 고연산 단계가 각 제출을 선택 |
| 동작 방식 | 전 과정 자연어 — "no formal prover, external tools, or internet access" |
| 연구한 변수 | 체크포인트 선택, 검증, 정제 |
| (source) |
"형식 증명기 없음" 이라는 줄이 짚어 둘 설계 결정이다. 이 위키가 보유한 다른 모든 수학 결과는 생성에 기계적 검증을 짝지운다 — Lean 4 가 논증을 한 줄씩 다시 검사하는 것으로, AI for Mathematics 가 이 분야를 가르는 이음매로 기록한 바로 그것이다. 이 시스템에는 그 절반이 없다. 여기서 검증은 같은 탐색 루프 안에서 모델이 모델을 검사하는 것이고, 이는 다른 종류의 더 약한 보증이다 — 그리고 논문은 그 점을 감추지 않고 명시한다.
의의
닫힌 모델 뒤에서만 시연돼 온 역량에 대한 오픈 웨이트 쪽의 답이다. AI for Mathematics 는 프런티어 랩이 발표한 수학 결과의 연속을 기록해 왔다 — Erdős 단위 거리 작업, More than two thirds of the zeros of the Riemann zeta function lie on the critical line, 2026-09-08 의 Navier–Stokes blowup 주장 — 그리고 그 하나하나가 내부용이거나, 미공개이거나, 둘 다인 모델에서 나왔고 수백만 달러 단위의 연산 값이 매겨졌다. 이 파이프라인은 금메달 점수에 도달하면서 체크포인트와 데이터와 코드를 내놓는다. 다른 무엇이 논쟁적이든, 독자가 직접 돌려볼 수 있는 그 페이지의 첫 항목이다.
그것이 봉사하는 분야가 바로 이 장르에 공개적으로 반대한 이틀 뒤에 도착했다. 2026-09-11 에 필즈상 수상자 25 명이 A Severe Misalignment of AI in Mathematics 에 서명했고, 그 불만은 수학 문제 풀이를 벤치마크로 쓰면 결과가 "announced in a rush, leaving no time for a proper writeup" 하게 된다는 것이다 (source). IMO 점수는 반대의 대상이 된 것의 가장 순수한 형태 — 새로운 수학이 전혀 들어 있지 않은, 대회 위의 숫자 — 다. 두 문서는 서로 모순되지 않으며, 데이터와 코드와 풀이의 공개는 오히려 선언이 요구하는 writeup 규율에 가깝다고 볼 수 있다. 같은 주가 둘 다를 냈기에 AI for Mathematics 에 나란히 기록한다.
test-time-compute 의 모양이 여기서는 모델이 아니라 메커니즘이다. 생성 → 검증 → 정제 → 선택에 별도의 고연산 선택 단계가 붙은 것은 Test-Time Compute (Inference-Time Compute Scaling) 를 증명에 적용한 것이고, 논문은 "checkpoint choice, verification, and refinement" 를 변수로 연구했다고 말하는데 이는 가중치가 아니라 스캐폴드에 대한 ablation 이다. Eval Harness Configuration 에 따르면 그래서 30/42 는 (모델, 파이프라인) 쌍의 속성이며, 공개된 쪽은 그 파이프라인이다.
열린 질문
- 30/42 에 연산이 얼마나 들었는지. 반복 탐색에도, "별도의 고연산 단계" 에도 어떤 수치도 없다 — GPU 시간도, 샘플 수도, 실제 소요 시간도.
- 탐색 없이는 점수가 얼마인지. 읽은 자료 어디에도 단일 체크포인트 베이스라인이 보고되지 않아, 후학습과 test-time compute 사이의 몫이 측정되지 않는다.
- 수학자가 말하는 의미에서 증명이 옳은지. IMO 채점은 루브릭에 따른 사람의 채점이고, 그 자연어 증명을 독립적으로 다시 읽었다는 보고는 없으며, 검사할 형식 인증서도 없다.
- 체크포인트가 어떤 라이선스를 다는지. "we release" 가 진술의 전부이고 라이선스는 거명되지 않으므로, 이 페이지의 오픈 웨이트 주장은 공개 주장이지 라이선스 주장이 아니다 — Open-Weights Policy Fight 참조.
- Nemotron-IMO-Bench 의 문제 200 개가 오염되지 않았는지. "novel" 이라고만 기술되고, 구성 절차도 오염 제거 절차도 보고되지 않는다.
인용
arXiv 2609.10712, An Open Recipe for IMO Gold: Training Nemotron for Olympiad
Mathematics. source 로 읽음 —
arxiv.org 는 이 실행의 샌드박스에서 차단돼 있어, 그 스냅샷의 초록이 이 페이지가 딛고
있는 텍스트의 전부다.