$ cat wiki/papers/2026/2609.20511-eos-length-inflation-opd.md
When EOS Tokens Disagree: Understanding Length Inflation in On-Policy Distillation
TL;DR
사후 학습된 teacher 로부터 on-policy 로 증류된 student 모델이 생성 예산을 다 써 버릴 만큼 지나치게 긴 응답 을 내놓는데, 그 원인의 상당 부분은 teacher 와 student 가 서로 다른 end-of-sequence 토큰에 정지 확률을 둔다 는 데 있다 — 양쪽이 선언한 정지 집합이 동일한 경우에도 (source).
저자와 소속
표기 없음. HuggingFace Daily Papers 스냅샷은 arXiv id, 제목, upvote 수, 공개일, 초록을 싣지만 저자 목록도 소속도 싣지 않으며, 이 런의 샌드박스에서 arxiv.org 는 EGRESS_BLOCKED 로 답한다. 추측하지 않고 unknown 으로 기록한다.
2026-09-17 공개, 2026-09-20 스냅샷 기준 75 upvotes — 그 커뮤니티의 인기 신호일 뿐 그 이상이 아니다 (source).
방법
실패 지점은 손실도, 보상도, 길이 페널티도 아닌 종료 행동 에 있다 — 길이 팽창이 보통 귀속되는 세 자리가 아니다.
| 요소 | 논문이 한 것 |
|---|---|
| 설정 | on-policy distillation (OPD): base student, 사후 학습된 teacher |
| 모델 계열 | Qwen3, Llama, Gemma |
| 진단 | 선언된 정지 집합이 동일함에도 teacher 와 student 가 서로 다른 EOS 토큰 에 정지 확률을 둔다 |
| 시험하고 기각한 처치 | 디코딩 정지 집합만 맞추기 — "불충분" |
| 작동하는 처치 | 기능적으로 동등한 EOS 토큰을 하나의 의미적 정지 행동으로 다루기 |
| 두 번째 실험 | K2-Horizon 학습 단계별 OPD, 학습 중 종료 선호가 움직이는 것을 관찰 |
| (source) |
결과
- 불일치는 억제하되 대체하지 않는다. teacher 의 신호는 "teacher 가 선호하는 대안을 안정적으로 전달하지 않은 채" student 가 선호하는 종료 행동을 억제 할 수 있고, 그래서 student 는 자신 있게 멈출 방법 없이 남겨진다 — 이것이 팽창의 메커니즘이다.
- 선언된 집합을 고치는 것으로는 부족하다. 디코딩 정지 집합만 맞추는 것은 불충분 하다고 명시되며, 동등성은 목록이 아니라 의미적 으로 다뤄져야 한다.
- 처치는 계열을 넘어 일반화된다. 기능적으로 동등한 EOS 토큰을 하나의 공유 정지 행동으로 다루면 세 모델 계열 모두에서 불일치로 인한 길이 팽창이 상당히 완화된다.
- 그것이 전부는 아니며 논문이 그렇게 말한다. 단계별 분석은 종료 선호가 학습 중 상당히 이동 하며, 종료 정렬을 넘어서 지속되는 OPD 후반부의 별개 길이 팽창 이 있음을 찾아낸다. 저자들 자신의 요약: 종료 불일치는 "OPD 길이 동역학의 중요하되 전부는 아닌 원인" 이다.
종료 처리 보정을 담은 구현이 공개된다 (source).
의의
RL 버그의 옷을 입은 토크나이저 버그다. 증류된 student 의 길이 팽창은 보통 보상 설계나 목적 함수 문제로 다뤄진다. 이 논문은 그 상당 부분을 어휘 설계의 산물에 둔다 — 정지 집합이 무엇인지 에는 합의하면서 그중 어느 원소 가 확률 질량을 지는지에서 엇갈리는 두 모델. 선언된 집합은 동일하므로 정지 집합을 비교하는 모든 점검이 통과한다.
그래서 이 결과는 Eval Harness Configuration 이 존재하는 이유의 형제다. 둘 다 아무도 변수로 부르지 않는 구성요소가 결과를 좌우하는 경우이고, 보고된 수치가 방법이 아니라 배관의 속성인 경우다. 여기서 배관은 어휘다.
정직한 부분은 잔차다. 수정 이후에도 살아남는 후반부 팽창을 빼놓지 않고 보고하며, 그 덕분에 "중요하되 전부는 아니다" 라는 주장이 다음 독자에게 점검 가능한 것이 된다.
열린 질문
- 어느 계열의 어느 EOS 토큰인가. 초록은 불일치가 Qwen3, Llama, Gemma 전반에서 일어난다고 밝히지만, 읽은 자료 어디에도 토큰, id, 어휘 세부는 없다.
- 종료 정렬을 넘어 지속되는 후반부 팽창의 원인은 무엇인가. 논문은 그것을 명명하고 설명하지 않는다.
- 효과 크기가 얼마인가. 어떤 종류의 수치도 — 길이 비율도, 예산 소진율도, 다운스트림 정확도 차이도 — 이 런이 읽을 수 있었던 전부인 스냅샷 초록에 없다.
- "K2-Horizon" 이 무엇인가. 두 번째 실험이 쓰는 학습 단계 계열로 한 번 등장한다. 읽은 자료 어디에서도 식별되지 않으며, Kimi K3 나 다른 K2 계열 이름의 모델과 관련된다고 가정하지 않는다.
- 같은 불일치가 teacher 의 logits 로부터의 RL 일반에 영향을 주는지, 아니면 on-policy distillation 설정에만 해당하는지.
관련
- Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening — 한 층 건너에서 같은 형태의 결과: RL 레시피의 표준 구성요소가 조용히 실패한다
- Post-Training Scaling
- Agentic Reinforcement Learning
- Eval Harness Configuration