$ cat wiki/papers/2026/2605.13301-olympiad-reasoning.md
Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling
arxiv: 2605.13301 Authors: 28명, 제1저자 Yafu Li Submitted: 2026-05-13 · HF Daily 2026-05-16 에서 포착 (#1, 134 upvotes)
TL;DR
이미 post-training 을 마친 reasoning 백본을, 커리큘럼 학습·강화학습 단계·test-time scaling 을 결합해 올림피아드 풀이 모델로 바꾸는 레시피. 30B 모델로 수학·물리 올림피아드 금메달 수준 성능을 주장합니다 (source). 기여는 새로움이 아니라 단순하고 통일된 방식으로 제시됩니다 — abstract 자체가 이미 여러 시스템이 이 수준에 도달했다고 적고 있어, 주장의 핵심은 그 결과를 얼마나 저렴하게 재현하는가입니다.
방법
abstract 가 하나의 레시피로 함께 묶어 제시하는 세 요소 (source):
| 요소 | 서술된 내용 |
|---|---|
| 백본 | 30B 파라미터, reasoning 용 post-training 완료 상태 |
| 지도학습 단계 | 학습 trajectory 약 340,000개 |
| RL 단계 | 강화학습 200 스텝 |
| 추론 | test-time scaling, 100K 토큰을 넘는 trajectory 에서도 안정 |
| 결과 모델의 이름은 SU-01 입니다. abstract 어디에도 새로운 아키텍처나 목적함수는 | |
| 없습니다 — 주장은 조합과 그 순서에 걸려 있습니다. |
결과
IMO 2025 / USAMO 2026 및 IPhO 2024 / 2025 에서 금메달 수준 성능을 주장하며, 대회 범위를 넘어 과학 추론으로 일반화된다고 보고합니다 (source).
abstract 페이지에는 수치 점수도 메달 수도 없습니다. 결과 표는 77쪽 보고서 본문에 있고, 이 페이지를 위해 그 본문은 읽지 않았습니다. 이 논문에 귀속되는 어떤 수치든 이 페이지가 아니라 그 보고서를 인용해야 합니다 — 정성적 주장을 숫자로 바꿔 적는 것이 바로 이 위키의 검사들이 잡으려는 실패입니다.
의의
- 2026-05-16 HF Daily #1, 134 upvotes — 그날 그 커뮤니티의 인기 신호이지 품질 판정이 아닙니다
- 단순하고 통일된 이라는 프레이밍은 재현 비용에 대한 주장이고, 이는 Test-Time Compute (Inference-Time Compute Scaling) 스케일링 논쟁에 직접 닿습니다: 30B 백본에 RL 200 스텝으로 이 수준에 도달한다면 흥미로운 변수는 파라미터 수가 아니라 레시피입니다
- 77쪽 기술 보고서에 저자 28명은 대형 협업을 시사합니다
열린 질문
- abstract 는 점수 없이 금메달 수준을 단언합니다. 보고서의 결과 표는 실제로 무엇을, 어떤 기준 풀이에 대해 보여주는가?
- compute 는 RL 단계와 test-time scaling 사이에 어떻게 나뉘는가? 추론 예산이 결과를 떠받치고 있다면 "단순"이라는 말이 너무 많은 일을 하는 셈입니다.
- 정답을 검증할 수 있는 올림피아드형 문제가 아닌 도메인으로도 옮겨가는가?
인용
@article{olympiad_unified_scaling_2026,
title={Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling},
year={2026},
eprint={2605.13301},
archivePrefix={arXiv}
}