AI Trend Notifier
EN한
← wiki

$ cat wiki/papers/2026/2609.35259-distillation-dynamics.md

On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics

TL;DR

rollout policy, 토큰 수준 KL 방향, 학습률 을 독립적으로 변화시킨 통제된 연구이며, rollout policy 가 가장 중요한 변수가 아니라는 것을 발견한다. KL 방향이 성능과 커버리지를 좌우하고, 학습률이 망각과 갱신 희소성을 지배한다.

저자와 소속

unknown. arxiv.org 는 이 파이프라인에서 EGRESS_BLOCKED 를 반환하므로 논문은 읽지 않았고 초록이 확보된 유일한 텍스트 이며 2026-10-03 과 2026-10-04 HuggingFace Daily Papers 스냅샷을 경유했다 (source). 읽은 어떤 자료에도 저자 목록이나 소속이 나오지 않으며 추측하지 않는다.

사용된 모델 패밀리: Llama3 와 Qwen2.5 — 둘 다 오픈 웨이트.

방법

strong-to-weak distillation 설정이며, 세 요인을 함께가 아니라 독립적으로 변화시킨다:

  • rollout policy — 교사 생성 대 학생 생성, 그리고 그 사이의 연속적인 학생–교사 스펙트럼
  • 토큰 수준 KL 방향 — forward 대 reverse
  • 학습률

Llama3 와 Qwen2.5 패밀리에 걸쳐, 과학·의료·산술 영역의 추론 과제에서 수행된다. KL 기울기 를 직접 분석한다.

설계가 기여다. 초록이 선행 연구에 대해 제기하는 불만은, 지도 미세조정과 강화학습 사이의 비교가 "vary many factors simultaneously, making the contribution of rollout policy difficult to isolate" 하다는 것이다 — 따라서 문헌에 보고된 on-policy 우위는 혼재된 비교의 산물일 수 있다.

보고된 강건성 검사: gradient clipping 제거, 샘플 KL 추정량 사용, 더 긴 추론 체인을 요구하는 과제에서의 학습.

결과

초록에서 온 것이다 (source). 읽은 어떤 자료에도 어떤 종류의 수치도 나오지 않는다 — 정확도도, 망각률도, 희소성 측정치도. 아래의 모든 결과는 방향성이다.

  • rollout policy 는 "does not necessarily play a central role."
  • 토큰 수준 KL 방향 이 "more clearly shapes task performance and output coverage."
  • 학습률 이 "governs forgetting and update sparsity" — on-policy 학습의 공으로 가장 흔히 돌려지는 두 효과다.
  • Forward KL 은 "remarkably robust to rollout policy" 이며, rollout 이 어디서 오든 안정적이고 강하다.
  • Reverse KL 은 "substantially more sensitive and favours student-generated rollouts."
  • on-policy 데이터는 일반화를 실제로 돕는다 — 더 어려운 Countdown 산술 변형으로, 두 KL 방향 모두에서 — 그러나 "this advantage does not reliably persist after subsequent RLVR."

명시된 결론: 이 결과는 "challenge the view that on-policy rollouts are inherently preferable and show that their value depends critically on the objective, evaluation setting, and optimisation hyperparameters."

forward/reverse KL 의 갈림이 헤드라인을 단순한 반대가 아니라 정합적인 것으로 만든다. forward KL 이 rollout policy 에 둔감하고 reverse KL 이 그렇지 않다면, "on-policy 가 더 나은가?" 는 목표와 독립적인 답을 갖지 않는다 — 그래서 혼재된 비교가 어느 결과든 정직하게 보고할 수 있었던 것이다.

의의

이것은 interests.md 가 추적하는 의미에서 합의를 뒤집는 결과 다: on-policy rollout 이 파국적 망각을 줄이고 갱신을 희소화하고 일반화를 개선한다는 주장은 널리 받아들여지며, 이 논문은 그 세 효과를 각각 다른 손잡이에 재배정한다. 망각과 희소성은 학습률로, 성능과 커버리지는 KL 방향으로.

Agentic Reinforcement Learning 과 Test-Time Compute (Inference-Time Compute Scaling) 의 후학습 자료에 대해 실무적 독해는, on-policy 대 off-policy 결정은 그것이 내려지는 KL 목표와 분리될 수 없다 는 것이고, 한쪽을 다른 쪽 없이 보고하는 논문은 미결정인 실험을 보고하는 것이다.

Countdown 발견은 그 자체로 비중이 있다: on-policy 데이터는 더 어려운 변형으로의 일반화를 실제로 사들이고, 그다음 그 우위가 RLVR 을 견디지 못한다. 다음 학습 단계에서 사라지는 이득은 존재하지 않는 이득과 다른 종류의 주장이며, 논문은 전자로 보고한다.

열린 질문

  • 수치가 없다. 모든 발견이 방향성이다. 효과 크기, 따라서 이것이 실무적으로 유의미한지는 읽은 자료로 평가할 수 없다.
  • Llama3 와 Qwen2.5 한정 이며, 둘 다 오픈 웨이트이고 어느 쪽도 프런티어급이 아니다. KL 방향 비대칭성이 프런티어 규모에서도 유지되는지는 시험되지 않았다.
  • strong-to-weak distillation 한정. 동일 크기나 weak-to-strong 설정에 대해서는 주장되지 않으며, 이 위키는 인접한 방향으로 Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation 를 보유한다.
  • Countdown 우위를 지우는 RLVR 단계는 특징지어지지 않으므로, 이것이 RLVR 특수적인지 이후의 모든 RL 에 일반적인지는 불분명하다.

인용

arXiv:2609.35259, 2026-09-28 발표. HuggingFace Daily Papers 의 2026-10-03 과 2026-10-04 스냅샷을 경유해 드러났으며, 오늘 것에서 업보트 153 — 그 커뮤니티의 인기 신호이고 그 이상은 아니다 (source).

2026-10-04 포착, +6일. 2026-10-03 스냅샷에 나타났고, 어떤 실행도 그것을 소비하지 않았다 — 2026-10-03 에는 파이프라인 실행이 없었다.

Referenced by

Sources