AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2605.15155-self-distilled-agentic-rl.md

Self-Distilled Agentic Reinforcement Learning

paper갱신 2026-08-14생성 2026-05-16

arxiv: 2605.15155 Authors: 11명, 제1저자 Zhengxi Lu Submitted: 2026-05-14 · HF Daily 2026-05-16 에서 포착 (#3, 75 upvotes)

TL;DR

SDAR 은 멀티턴 에이전트를 위한 강화학습에 토큰 단위 distillation 유도를 더합니다. teacher 모델의 신호가 보조 목적함수 안의 sigmoid gate 를 통과하면서, 도움이 되는 교정은 증폭되고 도움이 안 되는 거부는 완화됩니다. 에이전트 벤치마크 세 개에서 GRPO 대비 7~10% 향상으로 보고됩니다 (source).

방법

self-distillation 은 별도의 사전학습 단계가 아니라 RL 목적함수에 얹히는 shaping 항입니다 (source):

요소서술된 내용
기반 알고리즘멀티턴 에이전트 trajectory 위의 강화학습
추가 신호teacher 모델로부터의 토큰 단위 distillation 유도
게이팅보조 목적함수 안의 sigmoid gate
게이트의 효과도움이 되는 교정은 증폭, 도움이 안 되는 거부는 완화
trajectory 전체를 distillation 하는 방식과 갈리는 지점이 바로 토큰 단위 게이팅입니다:
teacher 를 한 턴의 일부에서는 신뢰하고 나머지에서는 할인할 수 있습니다.

결과

동일 설정에서 GRPO 기준선 대비 향상 (source):

벤치마크GRPO 대비 Δ
ALFWorld+9.4%
Search-QA+7.0%
WebShop (정확도)+10.2%
abstract 는 절대 점수를 보고하지 않습니다. 여기 있는 모든 수치는 GRPO 에 대한 차이값이라,
기준선 없이 인용하면 논문이 하지 않은 말을 하게 됩니다.

의의

  • 이 위키의 가중 관심사와 두 번 겹칩니다 — Agentic Reinforcement Learning (1.5x), RL (1.3x) — 그래서 노출되었습니다
  • 2026-05-16 HF Daily #3, 75 upvotes: 그날 그 커뮤니티의 인기 신호이지 품질 판정이 아닙니다
  • 게이팅된 보조 항 하나가 GRPO 대비 7~10% 를 벌어준다면, 흥미로운 주장은 agentic RL 의 한계가 trajectory 데이터의 양이 아니라 한 턴 안의 credit assignment 에 있다는 것입니다

열린 질문

  • 벤치마크 셋, 모두 기준선 하나에 대한 차이값입니다. GRPO 이외의 방법론과 비교하면?
  • teacher 는 어디서 오며, student 보다 강하지 않을 때는 어떻게 되는가 — 게이트가 평범한 RL 로 퇴화하는가?
  • 더 긴 호라이즌에서의 안정성과 catastrophic forgetting 은 abstract 가 다루지 않습니다

인용

@article{self_distilled_agentic_rl_2026,
  title={Self-Distilled Agentic Reinforcement Learning},
  year={2026},
  eprint={2605.15155},
  archivePrefix={arXiv}
}

Referenced by

Sources