$ cat wiki/concepts/agentic-rl.md
에이전틱 강화학습
정의
LLM 에이전트가 환경과 상호작용하며 RL로 학습하는 패러다임. 단일 응답이 아닌 multi-step tool use, planning, reflection 시퀀스를 reward 신호로 최적화.
왜 중요한가
- 본인 관심사 정중앙: agents + RL + reasoning 의 교차점
- 단순 RLHF (응답 1개 평가) 의 한계 — 에이전트는 sequence 평가 필요
- 2026 핵심 연구 흐름 중 하나
현재 수준 (2026-08-21)
-
하네스드 에이전틱 RL — 배포 시점 하네스가 이제 학습에 참여한다 (2026-08-18): Agent Lightning v1.0: Towards Harnessed Agentic RL (arXiv:2608.17528) 이 이 국면을 명명하고 약 3,500줄 프레임워크를 공개한다. 임의의 에이전트가 LLM 엔드포인트 프록시 를 통해 학습에 연결되므로 하네스가 환경 상호작용 루프를 소유 하고 트레이너는 LLM 요청/응답 쌍만 관찰한다. 논문은 verl Uni-Agent, AReaL 2.0, slime, Polar 등 네 프레임워크가 이 구조를 채택했다고 밝힌다. 보고된 결과: Qwen3.5-9B 가 SWE-bench Verified 에서 41.8% → 56.4%, 학습 예제 6K 개로. 귀결: 이렇게 후속 학습된 모델은 자기 하네스에 맞춰지며, 그것이 그런 모델이 하네스 불가지론적이기를 그친다는 ClawGym II: Exploring Black-Box RL on Agent Harness (arXiv:2608.16798) 의 발견 뒤에 있는 기제다. 56.4% 를 만든 하네스의 이름은 밝혀지지 않았다 (source)
-
정반대의 베팅: 신용 할당 기계를 고치는 대신 삭제한다 (2026-08-18): Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements (arXiv:2608.17310) 는 긴 구간 에이전트에 RL 보다 진화 전략 이 맞는다고 주장한다 — 추론 수준 GPU 메모리 에서 전체 파라미터 최적화, 그리고 보상을 구간에 걸쳐 분해하지 않는 궤적 수준 파라미터 귀인. 보고된 결과: Qwen-3.5-27B 로 WebArena-Lite 에서 No-Skill 기준선 대비 +6.69%, 테스트 시점 휴리스틱 설계 36개 중 28개 설정에서 매칭 기준선을 앞섬. 에이전틱 RL 과의 직접 비교는 보고되지 않았고 롤아웃 횟수도 공개되지 않아, 효율 주장은 컴퓨트가 아니라 메모리다 (source)
-
Anthropic AAR (2026-04-14): 9개 Claude Opus 4.6 인스턴스가 agentic RL 세팅에서 alignment 연구 문제(weak-to-strong supervision)를 1주간 수행 → PGR 97% vs 인간 연구자 23%. RL 에이전트가 실세계 연구 문제에서 인간을 대체한 첫 실증 케이스. → Automated Weak-to-Strong Researcher (AAR)
-
Self-Distilled Agentic RL (2026-05-16 HF Daily #3): Self-Distilled Agentic RL
-
Direct On-Policy Distillation / Direct-OPD (2026-07-06, Tsinghua AIR + ByteDance Seed): 값싼 약한 모델로 RL 을 돌린 뒤, RL 이 만들어낸 정책 변화분(
Δ = log π_T − log π_{T,ref})만 on-policy distillation 으로 큰 모델에 옮긴다. 프런티어 규모에서 RLVR 이득을 배포하는 비용을 낮춘다. 프런티어 RL 이 비싼 Anthropic AAR 류 워크로드에 실질적인 비용 지렛대. → Weak-to-Strong Generalization via Direct On-Policy Distillation -
관련 prior work: ReAct, Reflexion, AutoGPT 류 (페이지 작성 예정)
-
하네스들의 이름이 밝혀지고, 아무도 보고하지 않는 무결성 검사도 함께 나온다 (2026-08-18, 08-21 기록): LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents (arXiv:2608.17393) 은 Qwen3.5-35B-A3B 를 GSPO 로 수정하지 않은 프로덕션 하네스 세 곳 안에서 학습시킨다 — SWE-bench Verified 에서 OpenHands SDK 64.0% → 70.4%, Claude Code 62.4% → 68.2%, OpenCode 57.2% → 66.6%. Agent Lightning 이 감춘 것을 정확히, 그것도 세 번에 걸쳐 제공한다: 하네스의 정체. 메커니즘은 in-process LLM 프록시 와 트레이너 측 로그 확률 재계산 이며, 하네스가 롤아웃 도중 컨텍스트를 압축하거나 재직렬화해도 견딘다 — 그리고 그 분리가 파괴하는 양, 롤아웃–학습 확률 상관 0.99 초과 를 보고한다. 어떤 벤치마크 증분도 상관이 깨졌음을 드러내지 않으므로, 이 수치를 생략한 하네스 학습 논문은 자기 최적화가 유효했음을 보이지 않은 것이다 (source)
-
레이블을 제거하기, 두 방향에서 하루에 (2026-08-21): Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL (arXiv:2608.17253) 은 파라미터를 공유하지 않는 분리된 모델 여러 개 를 동료 로부터 도출된 리워드로 최적화하고, 자기보상 RL 의 실패를 심판 품질이 아니라 오류 상관 의 문제로 규정한다 — 코호트 다양성(계열, 크기, 재진술 샘플)을 늘리면 붕괴를 굴리는 상관된 오류가 줄어든다. 텍스트 벤치마크 일곱 개에서 3.0–8.6%, 멀티모달 네 개에서 2.3–7.2% 를 정답 레이블 없이 얻으며, 감독 학습 방법과 동등하거나 그 이상이라고 명시된다. SPADE: Self-Play in Adaptive Synthetic Executable Environments (arXiv:2608.19197) 는 같은 의존성을 과제 쪽에서 제거한다: 하나의 LLM 이
reset/step을 갖춘 완전한 실행 가능 학습 환경 을 작성하고, regret 추정치 — 특권적 힌트가 있을 때와 없을 때 학습자 리워드의 격차 — 로 조준해, 30B 에서 가장 강한 고정 환경 기준선 대비 평균 +5.3, BFCL-v4 멀티턴 +5.7, ACEBench-Agent +13.9 를 얻는다. Co-RL 은 레이블 없이 리워드 를, SPADE 는 과제 를 생성한다. 어느 쪽도 다른 쪽을 인용하지 않는다 (source)
열린 문제
- 다단계 신용 할당 — Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements (arXiv:2608.17310) 는 이를 푸는 대신 궤적 수준 귀인으로 비껴가자고 제안한다
- 도구 사용 환경에서의 보상 해킹 — LEGO-RL 은 세 기둥 중 하나를 통째로 단계별 방어 에 쓰고, SPADE 는 문제의 더 날카로운 형태를 안고 있다: 그 환경들은 자기 검증 코드를 직접 작성 하며, 그 저자는 학습 대상 에이전트와 가중치를 공유하는 모델이다
- Data efficiency (online RL은 비싸다) — Direct-OPD 가 약한 모델 롤아웃으로 일부 해소
- 장기 구간 안정성
주요 논문
- Automated Weak-to-Strong Researcher (AAR) — Anthropic AAR, 2026-04-14 (PGR 97%, 약→강 감독)
- Self-Distilled Agentic Reinforcement Learning — 2026-05
- Weak-to-Strong Generalization via Direct On-Policy Distillation — Direct-OPD, Tsinghua AIR/ByteDance, 2026-07-06 (비용 효율적 RL 전이)
- SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning — SEED, 2026-07-14 (에이전트를 위한 온폴리시 증류)
- Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning — Ring-Zero, Ant Group, 2026-07-12 (1조 파라미터 RLVR, 창발 행동 5가지)
- Agent Lightning v1.0: Towards Harnessed Agentic RL (arXiv:2608.17528) — Agent Lightning v1.0, 2026-08-18 (하네스드 에이전틱 RL; Qwen3.5-9B 로 SWE-bench Verified 41.8% → 56.4%)
- Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements (arXiv:2608.17310) — Agentic ESOpt, 2026-08-18 (긴 구간 에이전트에 RL 대신 진화 전략)
- LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents (arXiv:2608.17393) — LEGO-RL, 2026-08-18 (지명된 프로덕션 하네스 세 곳 안에서의 하네스 네이티브 RL; 롤아웃–학습 상관 0.99)
- Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL (arXiv:2608.17253) — Co-RL, 2026-08-19 (다양한 코호트의 동료 리워드; 레이블 없는 비지도 추론)
- SPADE: Self-Play in Adaptive Synthetic Executable Environments (arXiv:2608.19197) — SPADE, 2026-08-19 (학습 환경 자체를 학습된 구성 요소로)