AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2605.13301-olympiad-reasoning.md

Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling

paper갱신 2026-08-14생성 2026-05-16

arxiv: 2605.13301 Authors: 28명, 제1저자 Yafu Li Submitted: 2026-05-13 · HF Daily 2026-05-16 에서 포착 (#1, 134 upvotes)

TL;DR

이미 post-training 을 마친 reasoning 백본을, 커리큘럼 학습·강화학습 단계·test-time scaling 을 결합해 올림피아드 풀이 모델로 바꾸는 레시피. 30B 모델로 수학·물리 올림피아드 금메달 수준 성능을 주장합니다 (source). 기여는 새로움이 아니라 단순하고 통일된 방식으로 제시됩니다 — abstract 자체가 이미 여러 시스템이 이 수준에 도달했다고 적고 있어, 주장의 핵심은 그 결과를 얼마나 저렴하게 재현하는가입니다.

방법

abstract 가 하나의 레시피로 함께 묶어 제시하는 세 요소 (source):

요소서술된 내용
백본30B 파라미터, reasoning 용 post-training 완료 상태
지도학습 단계학습 trajectory 약 340,000개
RL 단계강화학습 200 스텝
추론test-time scaling, 100K 토큰을 넘는 trajectory 에서도 안정
결과 모델의 이름은 SU-01 입니다. abstract 어디에도 새로운 아키텍처나 목적함수는
없습니다 — 주장은 조합과 그 순서에 걸려 있습니다.

결과

IMO 2025 / USAMO 2026IPhO 2024 / 2025 에서 금메달 수준 성능을 주장하며, 대회 범위를 넘어 과학 추론으로 일반화된다고 보고합니다 (source).

abstract 페이지에는 수치 점수도 메달 수도 없습니다. 결과 표는 77쪽 보고서 본문에 있고, 이 페이지를 위해 그 본문은 읽지 않았습니다. 이 논문에 귀속되는 어떤 수치든 이 페이지가 아니라 그 보고서를 인용해야 합니다 — 정성적 주장을 숫자로 바꿔 적는 것이 바로 이 위키의 검사들이 잡으려는 실패입니다.

의의

  • 2026-05-16 HF Daily #1, 134 upvotes — 그날 그 커뮤니티의 인기 신호이지 품질 판정이 아닙니다
  • 단순하고 통일된 이라는 프레이밍은 재현 비용에 대한 주장이고, 이는 Test-Time Compute (Inference-Time Compute Scaling) 스케일링 논쟁에 직접 닿습니다: 30B 백본에 RL 200 스텝으로 이 수준에 도달한다면 흥미로운 변수는 파라미터 수가 아니라 레시피입니다
  • 77쪽 기술 보고서에 저자 28명은 대형 협업을 시사합니다

열린 질문

  • abstract 는 점수 없이 금메달 수준을 단언합니다. 보고서의 결과 표는 실제로 무엇을, 어떤 기준 풀이에 대해 보여주는가?
  • compute 는 RL 단계와 test-time scaling 사이에 어떻게 나뉘는가? 추론 예산이 결과를 떠받치고 있다면 "단순"이라는 말이 너무 많은 일을 하는 셈입니다.
  • 정답을 검증할 수 있는 올림피아드형 문제가 아닌 도메인으로도 옮겨가는가?

인용

@article{olympiad_unified_scaling_2026,
  title={Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling},
  year={2026},
  eprint={2605.13301},
  archivePrefix={arXiv}
}

Referenced by

Sources