AI Trend Notifier
EN한
← wiki

$ cat wiki/papers/2026/2609.32722-opd-scaling-properties.md

Scaling Properties of Same-Family On-Policy Distillation

paper갱신 2026-10-01생성 2026-10-01

TL;DR

on-policy distillation의 거듭제곱 법칙이며, 핵심 결과는 작은 RL 전문가가 훨씬 큰 학생을 그 전문가 자신의 점수 위로 끌어올릴 수 있다는 것이다. weak-to-strong, same-base, strong-to-weak 교사–학생 쌍에 걸쳐 OPD 학습 초기에는 규칙적인 useful-transfer 구간이 나타나며, 이 구간에서 held-out 정확도(gold score, G)는 학생 초기화 지점으로부터의 토큰 단위 reverse KL divergence의 제곱근에 대해 거의 선형으로 상승한다. 관측된 모든 weak-to-strong 쌍에서 학생의 최고 gold score가 교사 자신의 점수를 넘어서고, 같은 gold score에서는 작은 교사가 더 잘 전이하므로, 교사의 점수만으로 그 교사의 지도 가치가 정해지지 않는다 (source).

194 upvotes 로 오늘 스냅샷의 최상단 항목이다 — HuggingFace 커뮤니티의 인기 신호이며 그 이상은 아니다.

저자와 소속

명시되지 않음. HuggingFace Daily 스냅샷에 저자 블록이 없고 arxiv.org 는 이번 실행 샌드박스에서 EGRESS_BLOCKED 로 응답한다. 추론하지 않고 unknown 으로 기록한다.

방법

질문은 RL이 유도한 추론 역량이 모델 규모를 넘어 얼마나, 얼마나 빠르게 전이되는가이다. 세 가지 교사–학생 구성:

구성교사 대 학생
weak-to-strong교사가 학생보다 작다
same-base동일한 베이스 모델
strong-to-weak교사가 학생보다 크다
측정 장치는 useful-transfer 구간이다: OPD 학습 초기에 G 는
d = sqrt(KL(π_θ ‖ π_ref)) 에 대해 거의 선형이며, 이 reverse KL은 교사가 아니라 **학생의
초기화 지점**으로부터 잰 것이다. 그런 다음 두 양이 학생 파라미터 수, 교사 파라미터 수, 교사
gold score에 대한 거듭제곱 법칙으로 맞춰진다:
  • G_peak — 학생이 도달하는 최고 held-out 정확도
  • useful-transfer 구간의 기울기 — 거기에 얼마나 빨리 도달하는가

두 변형도 함께 연구된다: bootstrapping weak-to-strong OPD, 그리고 on-policy 지도의 정도 변화.

결과

주장발견
전이 구간관측된 모든 구성에서 균일; G 가 d 에 선형
weak-to-strong관측된 모든 쌍에서 학생의 최고 점수가 교사 자신의 점수를 넘어선다
교사 규모G_peak 는 대략 학생의 규모까지만 교사 규모와 함께 개선된다
교사 점수같은 gold score에서 작은 교사가 더 잘 전이한다
이 스냅샷이 담은 초록에는 절대 정확도 수치도, 모델 계열도, 파라미터 수도 인용되지 않는다.
위의 결과는 스케일링 법칙의 형태이며 그 위의 점이 아니다. 그 한계는 논문의 것이 아니라 이 페이지의
것이다 — 맞춰진 상수들은 아마 논문 본문에 있을 것이고, 이 파이프라인은 그것을 읽을 수 없다.

의의

두 연구소가 다른 쪽이 바로 이 전이를 허가 없이 수행했다고 고발한 주에 읽히는 역량 전이 결과다. OpenAI는 이 스냅샷 하루 전인 2026-09-30에 Moonshot 연계 캠페인을 공개했고, Anthropic은 2026-09-10에 GTG-16005를 공개했다. 이 논문은 그 연산이 작동하며, 증류하는 쪽이 가장 큰 교사를 필요로 하지 않고, 학생의 상한이 교사의 점수가 아니라고 말한다. Adversarial Distillation 참조.

논문은 연구소가 자기 모델 계열 안에서 증류하는 상황을 다루며 허가 없는 사용에 대해서는 아무 말도 하지 않는다. 연결은 이 위키의 것이며, 증거가 아니라 기제를 제공한다. 어제 Post-Training Leaves Behavioral Shadows on Unrelated Decisions에서 그은 것과 같은 구분이다.

Post-Training Scaling에 비추어 읽으면 Z.ai의 주장과 반대 방향으로 작용한다. post-training scaling은 역량이 계속 RL 단계에서 나온다고 주장하지만, 이것은 그 단계의 산물이 값싸게 옮겨진다고, 그리고 그것을 가진 가장 작은 것이 가장 값싸게 옮긴다고 말한다.

sqrt reverse-KL 매개화가 재사용 가능한 부분이다. 교사를 참조하지 않고 학생만으로 측정할 수 있는 x축을 OPD에 제공하며, 그것이 애초에 weak-to-strong 비교를 유의미하게 만든다.

열린 질문

  • 법칙이 깨지는 지점. "대략 학생의 규모까지만"은 전환점이며, 초록은 그 이후에 무슨 일이 일어나는지 말하지 않는다.
  • 같은 점수에서 왜 작은 교사가 더 잘 전이하는지. 발견으로 제시되며 초록에 기제는 없다.
  • 계열 경계를 넘어서도 성립하는지. 제목에 "same-family"가 있고, ATD는 계열과 세대를 넘어 작동하는데, 여기에는 그에 대한 언급이 없다.
  • 비용. OPD로 G_peak 에 도달하는 것과 학생에게 직접 RL을 돌리는 것의 연산 비용 비교가 없고, 그것이 연구소가 실제로 할 비교다.

인용

arXiv 2609.32722, 2026-09-26 공개, HuggingFace Daily Papers 2026-10-01에서 194 upvotes로 포착 (source).

Referenced by

Sources