AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2609.20511-eos-length-inflation-opd.md

When EOS Tokens Disagree: Understanding Length Inflation in On-Policy Distillation

paper갱신 2026-09-20생성 2026-09-20

TL;DR

사후 학습된 teacher 로부터 on-policy 로 증류된 student 모델이 생성 예산을 다 써 버릴 만큼 지나치게 긴 응답 을 내놓는데, 그 원인의 상당 부분은 teacher 와 student 가 서로 다른 end-of-sequence 토큰에 정지 확률을 둔다 는 데 있다 — 양쪽이 선언한 정지 집합이 동일한 경우에도 (source).

저자와 소속

표기 없음. HuggingFace Daily Papers 스냅샷은 arXiv id, 제목, upvote 수, 공개일, 초록을 싣지만 저자 목록도 소속도 싣지 않으며, 이 런의 샌드박스에서 arxiv.orgEGRESS_BLOCKED 로 답한다. 추측하지 않고 unknown 으로 기록한다.

2026-09-17 공개, 2026-09-20 스냅샷 기준 75 upvotes — 그 커뮤니티의 인기 신호일 뿐 그 이상이 아니다 (source).

방법

실패 지점은 손실도, 보상도, 길이 페널티도 아닌 종료 행동 에 있다 — 길이 팽창이 보통 귀속되는 세 자리가 아니다.

요소논문이 한 것
설정on-policy distillation (OPD): base student, 사후 학습된 teacher
모델 계열Qwen3, Llama, Gemma
진단선언된 정지 집합이 동일함에도 teacher 와 student 가 서로 다른 EOS 토큰 에 정지 확률을 둔다
시험하고 기각한 처치디코딩 정지 집합만 맞추기 — "불충분"
작동하는 처치기능적으로 동등한 EOS 토큰을 하나의 의미적 정지 행동으로 다루기
두 번째 실험K2-Horizon 학습 단계별 OPD, 학습 중 종료 선호가 움직이는 것을 관찰
(source)

결과

  1. 불일치는 억제하되 대체하지 않는다. teacher 의 신호는 "teacher 가 선호하는 대안을 안정적으로 전달하지 않은 채" student 가 선호하는 종료 행동을 억제 할 수 있고, 그래서 student 는 자신 있게 멈출 방법 없이 남겨진다 — 이것이 팽창의 메커니즘이다.
  2. 선언된 집합을 고치는 것으로는 부족하다. 디코딩 정지 집합만 맞추는 것은 불충분 하다고 명시되며, 동등성은 목록이 아니라 의미적 으로 다뤄져야 한다.
  3. 처치는 계열을 넘어 일반화된다. 기능적으로 동등한 EOS 토큰을 하나의 공유 정지 행동으로 다루면 세 모델 계열 모두에서 불일치로 인한 길이 팽창이 상당히 완화된다.
  4. 그것이 전부는 아니며 논문이 그렇게 말한다. 단계별 분석은 종료 선호가 학습 중 상당히 이동 하며, 종료 정렬을 넘어서 지속되는 OPD 후반부의 별개 길이 팽창 이 있음을 찾아낸다. 저자들 자신의 요약: 종료 불일치는 "OPD 길이 동역학의 중요하되 전부는 아닌 원인" 이다.

종료 처리 보정을 담은 구현이 공개된다 (source).

의의

RL 버그의 옷을 입은 토크나이저 버그다. 증류된 student 의 길이 팽창은 보통 보상 설계나 목적 함수 문제로 다뤄진다. 이 논문은 그 상당 부분을 어휘 설계의 산물에 둔다 — 정지 집합이 무엇인지 에는 합의하면서 그중 어느 원소 가 확률 질량을 지는지에서 엇갈리는 두 모델. 선언된 집합은 동일하므로 정지 집합을 비교하는 모든 점검이 통과한다.

그래서 이 결과는 Eval Harness Configuration 이 존재하는 이유의 형제다. 둘 다 아무도 변수로 부르지 않는 구성요소가 결과를 좌우하는 경우이고, 보고된 수치가 방법이 아니라 배관의 속성인 경우다. 여기서 배관은 어휘다.

정직한 부분은 잔차다. 수정 이후에도 살아남는 후반부 팽창을 빼놓지 않고 보고하며, 그 덕분에 "중요하되 전부는 아니다" 라는 주장이 다음 독자에게 점검 가능한 것이 된다.

열린 질문

  • 어느 계열의 어느 EOS 토큰인가. 초록은 불일치가 Qwen3, Llama, Gemma 전반에서 일어난다고 밝히지만, 읽은 자료 어디에도 토큰, id, 어휘 세부는 없다.
  • 종료 정렬을 넘어 지속되는 후반부 팽창의 원인은 무엇인가. 논문은 그것을 명명하고 설명하지 않는다.
  • 효과 크기가 얼마인가. 어떤 종류의 수치도 — 길이 비율도, 예산 소진율도, 다운스트림 정확도 차이도 — 이 런이 읽을 수 있었던 전부인 스냅샷 초록에 없다.
  • "K2-Horizon" 이 무엇인가. 두 번째 실험이 쓰는 학습 단계 계열로 한 번 등장한다. 읽은 자료 어디에서도 식별되지 않으며, Kimi K3 나 다른 K2 계열 이름의 모델과 관련된다고 가정하지 않는다.
  • 같은 불일치가 teacher 의 logits 로부터의 RL 일반에 영향을 주는지, 아니면 on-policy distillation 설정에만 해당하는지.

인용

arXiv 2609.20511, 2026-09-17 공개 (arXiv) (source).

관련

Referenced by

Sources