$ cat wiki/papers/2026/2605.15155-self-distilled-agentic-rl.md
Self-Distilled Agentic Reinforcement Learning
paper갱신 2026-08-14생성 2026-05-16
arxiv: 2605.15155 Authors: 11명, 제1저자 Zhengxi Lu Submitted: 2026-05-14 · HF Daily 2026-05-16 에서 포착 (#3, 75 upvotes)
TL;DR
SDAR 은 멀티턴 에이전트를 위한 강화학습에 토큰 단위 distillation 유도를 더합니다. teacher 모델의 신호가 보조 목적함수 안의 sigmoid gate 를 통과하면서, 도움이 되는 교정은 증폭되고 도움이 안 되는 거부는 완화됩니다. 에이전트 벤치마크 세 개에서 GRPO 대비 7~10% 향상으로 보고됩니다 (source).
방법
self-distillation 은 별도의 사전학습 단계가 아니라 RL 목적함수에 얹히는 shaping 항입니다 (source):
| 요소 | 서술된 내용 |
|---|---|
| 기반 알고리즘 | 멀티턴 에이전트 trajectory 위의 강화학습 |
| 추가 신호 | teacher 모델로부터의 토큰 단위 distillation 유도 |
| 게이팅 | 보조 목적함수 안의 sigmoid gate |
| 게이트의 효과 | 도움이 되는 교정은 증폭, 도움이 안 되는 거부는 완화 |
| trajectory 전체를 distillation 하는 방식과 갈리는 지점이 바로 토큰 단위 게이팅입니다: | |
| teacher 를 한 턴의 일부에서는 신뢰하고 나머지에서는 할인할 수 있습니다. |
결과
동일 설정에서 GRPO 기준선 대비 향상 (source):
| 벤치마크 | GRPO 대비 Δ |
|---|---|
| ALFWorld | +9.4% |
| Search-QA | +7.0% |
| WebShop (정확도) | +10.2% |
| abstract 는 절대 점수를 보고하지 않습니다. 여기 있는 모든 수치는 GRPO 에 대한 차이값이라, | |
| 기준선 없이 인용하면 논문이 하지 않은 말을 하게 됩니다. |
의의
- 이 위키의 가중 관심사와 두 번 겹칩니다 — Agentic Reinforcement Learning (1.5x), RL (1.3x) — 그래서 노출되었습니다
- 2026-05-16 HF Daily #3, 75 upvotes: 그날 그 커뮤니티의 인기 신호이지 품질 판정이 아닙니다
- 게이팅된 보조 항 하나가 GRPO 대비 7~10% 를 벌어준다면, 흥미로운 주장은 agentic RL 의 한계가 trajectory 데이터의 양이 아니라 한 턴 안의 credit assignment 에 있다는 것입니다
열린 질문
- 벤치마크 셋, 모두 기준선 하나에 대한 차이값입니다. GRPO 이외의 방법론과 비교하면?
- teacher 는 어디서 오며, student 보다 강하지 않을 때는 어떻게 되는가 — 게이트가 평범한 RL 로 퇴화하는가?
- 더 긴 호라이즌에서의 안정성과 catastrophic forgetting 은 abstract 가 다루지 않습니다
인용
@article{self_distilled_agentic_rl_2026,
title={Self-Distilled Agentic Reinforcement Learning},
year={2026},
eprint={2605.15155},
archivePrefix={arXiv}
}