AI Trend Notifier
EN
← wiki

$ cat wiki/concepts/agentic-rl.md

에이전틱 강화학습

concept갱신 2026-08-21생성 2026-05-16

정의

LLM 에이전트가 환경과 상호작용하며 RL로 학습하는 패러다임. 단일 응답이 아닌 multi-step tool use, planning, reflection 시퀀스를 reward 신호로 최적화.

왜 중요한가

  • 본인 관심사 정중앙: agents + RL + reasoning 의 교차점
  • 단순 RLHF (응답 1개 평가) 의 한계 — 에이전트는 sequence 평가 필요
  • 2026 핵심 연구 흐름 중 하나

현재 수준 (2026-08-21)

  • 하네스드 에이전틱 RL — 배포 시점 하네스가 이제 학습에 참여한다 (2026-08-18): Agent Lightning v1.0: Towards Harnessed Agentic RL (arXiv:2608.17528) 이 이 국면을 명명하고 약 3,500줄 프레임워크를 공개한다. 임의의 에이전트가 LLM 엔드포인트 프록시 를 통해 학습에 연결되므로 하네스가 환경 상호작용 루프를 소유 하고 트레이너는 LLM 요청/응답 쌍만 관찰한다. 논문은 verl Uni-Agent, AReaL 2.0, slime, Polar 등 네 프레임워크가 이 구조를 채택했다고 밝힌다. 보고된 결과: Qwen3.5-9B 가 SWE-bench Verified 에서 41.8% → 56.4%, 학습 예제 6K 개로. 귀결: 이렇게 후속 학습된 모델은 자기 하네스에 맞춰지며, 그것이 그런 모델이 하네스 불가지론적이기를 그친다는 ClawGym II: Exploring Black-Box RL on Agent Harness (arXiv:2608.16798) 의 발견 뒤에 있는 기제다. 56.4% 를 만든 하네스의 이름은 밝혀지지 않았다 (source)

  • 정반대의 베팅: 신용 할당 기계를 고치는 대신 삭제한다 (2026-08-18): Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements (arXiv:2608.17310) 는 긴 구간 에이전트에 RL 보다 진화 전략 이 맞는다고 주장한다 — 추론 수준 GPU 메모리 에서 전체 파라미터 최적화, 그리고 보상을 구간에 걸쳐 분해하지 않는 궤적 수준 파라미터 귀인. 보고된 결과: Qwen-3.5-27B 로 WebArena-Lite 에서 No-Skill 기준선 대비 +6.69%, 테스트 시점 휴리스틱 설계 36개 중 28개 설정에서 매칭 기준선을 앞섬. 에이전틱 RL 과의 직접 비교는 보고되지 않았고 롤아웃 횟수도 공개되지 않아, 효율 주장은 컴퓨트가 아니라 메모리다 (source)

  • Anthropic AAR (2026-04-14): 9개 Claude Opus 4.6 인스턴스가 agentic RL 세팅에서 alignment 연구 문제(weak-to-strong supervision)를 1주간 수행 → PGR 97% vs 인간 연구자 23%. RL 에이전트가 실세계 연구 문제에서 인간을 대체한 첫 실증 케이스. → Automated Weak-to-Strong Researcher (AAR)

  • Self-Distilled Agentic RL (2026-05-16 HF Daily #3): Self-Distilled Agentic RL

  • Direct On-Policy Distillation / Direct-OPD (2026-07-06, Tsinghua AIR + ByteDance Seed): 값싼 약한 모델로 RL 을 돌린 뒤, RL 이 만들어낸 정책 변화분(Δ = log π_T − log π_{T,ref})만 on-policy distillation 으로 큰 모델에 옮긴다. 프런티어 규모에서 RLVR 이득을 배포하는 비용을 낮춘다. 프런티어 RL 이 비싼 Anthropic AAR 류 워크로드에 실질적인 비용 지렛대. → Weak-to-Strong Generalization via Direct On-Policy Distillation

  • 관련 prior work: ReAct, Reflexion, AutoGPT 류 (페이지 작성 예정)

  • 하네스들의 이름이 밝혀지고, 아무도 보고하지 않는 무결성 검사도 함께 나온다 (2026-08-18, 08-21 기록): LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents (arXiv:2608.17393) 은 Qwen3.5-35B-A3B 를 GSPO수정하지 않은 프로덕션 하네스 세 곳 안에서 학습시킨다 — SWE-bench Verified 에서 OpenHands SDK 64.0% → 70.4%, Claude Code 62.4% → 68.2%, OpenCode 57.2% → 66.6%. Agent Lightning 이 감춘 것을 정확히, 그것도 세 번에 걸쳐 제공한다: 하네스의 정체. 메커니즘은 in-process LLM 프록시 와 트레이너 측 로그 확률 재계산 이며, 하네스가 롤아웃 도중 컨텍스트를 압축하거나 재직렬화해도 견딘다 — 그리고 그 분리가 파괴하는 양, 롤아웃–학습 확률 상관 0.99 초과 를 보고한다. 어떤 벤치마크 증분도 상관이 깨졌음을 드러내지 않으므로, 이 수치를 생략한 하네스 학습 논문은 자기 최적화가 유효했음을 보이지 않은 것이다 (source)

  • 레이블을 제거하기, 두 방향에서 하루에 (2026-08-21): Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL (arXiv:2608.17253)파라미터를 공유하지 않는 분리된 모델 여러 개동료 로부터 도출된 리워드로 최적화하고, 자기보상 RL 의 실패를 심판 품질이 아니라 오류 상관 의 문제로 규정한다 — 코호트 다양성(계열, 크기, 재진술 샘플)을 늘리면 붕괴를 굴리는 상관된 오류가 줄어든다. 텍스트 벤치마크 일곱 개에서 3.0–8.6%, 멀티모달 네 개에서 2.3–7.2%정답 레이블 없이 얻으며, 감독 학습 방법과 동등하거나 그 이상이라고 명시된다. SPADE: Self-Play in Adaptive Synthetic Executable Environments (arXiv:2608.19197) 는 같은 의존성을 과제 쪽에서 제거한다: 하나의 LLM 이 reset/step 을 갖춘 완전한 실행 가능 학습 환경 을 작성하고, regret 추정치 — 특권적 힌트가 있을 때와 없을 때 학습자 리워드의 격차 — 로 조준해, 30B 에서 가장 강한 고정 환경 기준선 대비 평균 +5.3, BFCL-v4 멀티턴 +5.7, ACEBench-Agent +13.9 를 얻는다. Co-RL 은 레이블 없이 리워드 를, SPADE 는 과제 를 생성한다. 어느 쪽도 다른 쪽을 인용하지 않는다 (source)

열린 문제

  • 다단계 신용 할당 — Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements (arXiv:2608.17310) 는 이를 푸는 대신 궤적 수준 귀인으로 비껴가자고 제안한다
  • 도구 사용 환경에서의 보상 해킹 — LEGO-RL 은 세 기둥 중 하나를 통째로 단계별 방어 에 쓰고, SPADE 는 문제의 더 날카로운 형태를 안고 있다: 그 환경들은 자기 검증 코드를 직접 작성 하며, 그 저자는 학습 대상 에이전트와 가중치를 공유하는 모델이다
  • Data efficiency (online RL은 비싸다) — Direct-OPD 가 약한 모델 롤아웃으로 일부 해소
  • 장기 구간 안정성

주요 논문

Referenced by

Agent Lightning v1.0: Towards Harnessed Agentic RL (arXiv:2608.17528)Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements (arXiv:2608.17310)에이전트 (LLM Agents)AI 정렬 (Alignment)Andrej KarpathyAREX: Towards a Recursively Self-Improving Agent for Deep ResearchAutomated Weak-to-Strong Researcher (AAR)Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development (arXiv:2608.13417)Claude Managed AgentsClawGym II: Exploring Black-Box RL on Agent Harness (arXiv:2608.16798)Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL (arXiv:2608.17253)DarwinX: Evolving Agent Harnesses Through Natural Selection (arXiv:2608.07545)DataPrep-Bench: Benchmarking LLMs as Training Data Preparators체화 에이전트 (Embodied Agents)ENPIRE: 실세계 에이전트 로봇 정책 자기개선How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review (arXiv:2608.08975)Intern-S2-Preview: Scientific Agentic Foundation Model (arXiv:2608.13505)Jim FanLaguna S 2.1LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents (arXiv:2608.17393)LFM2.5-2.6BLiquid AILong-Horizon-Terminal-Bench (LHTB)Mistral AIMolt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement LearningNVIDIAOpenAIPoolside사후 학습 스케일링추론 모델Ring-Zero: 창발적 추론을 위한 Zero RL의 1조 매개변수 규모 확장매개변수가 아닌 수평선을 확장: 35B 에이전트로 1조 매개변수 성능 달성SEED: 에이전트 강화학습을 위한 자기 진화 온폴리시 증류Self-Distilled Agentic Reinforcement LearningSkill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving SkillsSoftware 3.0Solipsistic Superintelligence is Unlikely to be CooperativeSPADE: Self-Play in Adaptive Synthetic Executable Environments (arXiv:2608.19197)The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning직접 온폴리시 증류를 통한 약한 모델에서 강한 모델로의 일반화주간 종합 — 2026-W21 (2026-05-11 ~ 2026-05-17)주간 종합 — 2026-W29 (2026-07-13 ~ 2026-07-19)

Sources