$ cat wiki/papers/2026/2608.16647-on-policy-distillation-generalization.md
Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models (arXiv:2608.16647)
TL;DR
일반화 요인을 한 번에 하나씩 바꾸는 통제된 연구는, on-policy distillation 이 전이하는 것이 특정 문제에 대한 교사의 답이 아니라 교사의 추론 행동임을 발견한다: 학습 난이도는 거의 문제가 되지 않고, 교사가 한 번도 풀지 못한 문제도 여전히 쓸모가 있다. 얼마나 멀리 닿는지는 origin 관계에 달려 있다 — same-origin 교사/학생 쌍은 언어, 추론 지평, 심지어 다른 도메인까지 전이되고, cross-origin 쌍은 대체로 학습된 분포에만 들어맞는다. 그 도달 범위는 양방향으로 같은 속성이다: 교사의 영향력은 프롬프트를 도메인 전문가에게 라우팅해도 가둘 수 없기 때문에, 교사를 결합하면 그 역량들 사이에 혼합 비율에 좌우되는 시소가 생긴다 (source).
저자와 소속
확인 불가. arxiv.org 는 이 실행의 샌드박스에서 EGRESS_BLOCKED 이며, 논문 자체는
읽지 못했다. HuggingFace Daily Papers, 2026-08-25, 14 upvotes 에 등재
(source).
방법
논문이 지목하는 간극. On-policy distillation(OPD) 은 학생 자신의 정책에서 샘플링한 궤적을 지도하지만, 그 일반화 행동은 "대부분의 연구가 OPD 를 단일 도메인에서, 학습 데이터에 가까운 벤치마크로 평가하기 때문에 잘 이해되지 않은 채"다.
설계 자체가 기여다: 도메인 내 분포 이동 → 도메인 간 전이 → 다중 교사 설정에 걸쳐, 한 번에 하나의 요인만 바꾼다. 방법 논문이 아니라 통제된 연구이며, 그래서 발견들이 어떤 시스템의 점수가 아니라 OPD 의 속성으로 진술된다.
결과
발견으로 보고된다. 초록에는 수치가 전혀 없다.
- 전이되는 것은 답이 아니라 행동이다. 학습 난이도는 거의 문제가 되지 않고, 교사가 한 번도 풀지 못한 문제도 쓸모가 있다 — 복제되는 신호가 교사가 무엇을 결론짓는지가 아니라 어떻게 추론하는지일 때에만 말이 되는 결과다.
- Origin 관계가 지배한다. same-origin 교사/학생 쌍은 학생을 "언어, 추론 지평, 심지어 다른 도메인에 걸쳐" 교사 가까이 데려간다. cross-origin 쌍은 "대체로 학습된 분포에만 들어맞는다".
- 도달 범위는 양날이다. 프롬프트를 도메인 전문가에게 라우팅해도 각 교사의 영향력을 가둘 수 없으므로, 교사를 결합하면 역량들 사이에 혼합 비율에 좌우되는 시소가 생긴다 — 하나를 얻는 것이 다른 하나를 잃는 것이고, 어느 쪽인지는 혼합에 달려 있다.
의의
"same-origin 은 전이되고 cross-origin 은 아니다"는 상업적 함의가 있는 주장이며, 이 위키는 그것이 놓이는 분쟁을 이미 담고 있다. Alibaba / Qwen AI Lab 는 Claude 를 상대로 한 2.5만 계정, 2,880만 상호작용 규모의 distillation 캠페인 혐의를 싣고 있다. 이 논문은 그 사건에 대해 말하지 않으며 그에 관한 증거로 읽혀서는 안 된다 — 다만 일반적인 형태에 대해서는 말한다: 이 연구의 발견대로라면 cross-origin 교사로부터의 distillation 은 대체로 학습된 분포를 사는 것이고, 사람들이 우려하는 광범위한 역량 전이는 same-origin 사례다.
다중 교사 시소가 실무적으로 결정적인 결과다. 강한 학생을 만드는 뻔한 방법은 여러 강한 교사에게서 증류하고 도메인으로 라우팅하는 것이다. 이 논문은 라우팅이 영향력을 분할하지 못한다고 말한다 — 그러므로 다중 교사 OPD 는 가산적이지 않으며, 결과는 교사 각각의 강함이 아니라 혼합에 달려 있다.
같은 레버에 대한 제약으로서 Post-Training Scaling 옆에 놓인다. 그 페이지는 사후 학습을 현재 역량이 도착하고 있는 축으로 기록한다 — 기반이 그대로인 GLM-5.2 → GLM-5.3 을 제3자가 53 → 60 으로 측정했다. Distillation 은 그 축에서 가장 값싼 도구 중 하나이고, 이것은 그 수익이 교사 품질이나 데이터 양이 아니라 관계(교사/학생 origin)에 의해 정해진다고 말하는 이 위키의 첫 결과다.
열린 질문
- "origin" 이란 무엇인가? 같은 사전학습 코퍼스인지, 같은 계열인지, 같은 tokenizer 인지, 같은 연구소인지 — 초록은 정의하지 않는데, 결과 전체가 그 위에 서 있다.
- 어디에도 수치가 없다. 모든 발견이 방향성이며 효과 크기는 알 수 없다.
- 어떤 모델, 어떤 도메인, 어떤 언어인가? 하나도 지목되지 않는다.
- 시소를 피할 수 있는가? 논문은 그것을 진단하고 "다중 교사 OPD 를 진단하는 유용한 관점"을 제시할 뿐, 해법을 내놓지 않는다.
- off-policy distillation 에서도 성립하는가? 통제된 비교는 OPD 내부에서 이루어지며, 실무자에게 중요할 대조는 교사 출력에 대한 평범한 SFT 와의 비교다.
인용
Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy
Distillation of Large Language Models (2026). arXiv:2608.16647.