AI Trend Notifier
EN한
← wiki

$ cat wiki/concepts/agentic-rl.md

에이전틱 강화학습

concept갱신 2026-10-04생성 2026-05-16

정의

LLM 에이전트가 환경과 상호작용하며 RL로 학습하는 패러다임. 단일 응답이 아닌 multi-step tool use, planning, reflection 시퀀스를 reward 신호로 최적화.

왜 중요한가

  • 본인 관심사 정중앙: agents + RL + reasoning 의 교차점
  • 단순 RLHF (응답 1개 평가) 의 한계 — 에이전트는 sequence 평가 필요
  • 2026 핵심 연구 흐름 중 하나

현재 수준 (2026-10-04)

통제된 연구가 on-policy 전제를 해체하고, 그것이 주장해 온 세 가지 이점을 각각 다른 변수에 재배정한다. On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics 는 rollout policy, 토큰 수준 KL 방향, 학습률 을 독립적으로 변화시키며 — Llama3 와 Qwen2.5 에 걸쳐 과학·의료·산술 추론 과제에서 — rollout policy 가 "does not necessarily play a central role" 라고 보고한다 (source).

대신: KL 방향 이 "more clearly shapes task performance and output coverage" 이고, 학습률 이 "governs forgetting and update sparsity" — on-policy 학습의 공으로 가장 흔히 돌려지는 두 효과다. 메커니즘은 비대칭성이다: forward KL 은 "remarkably robust to rollout policy" 인 반면 reverse KL 은 "substantially more sensitive and favours student-generated rollouts" 다.

이 비대칭성이 이 결과를 단순한 반대가 아니라 정합적인 것으로 만든다. "on-policy 가 더 나은가?" 의 답이 KL 방향에 따라 뒤집힌다면, 둘을 동시에 변화시킨 정직한 두 논문이 상반된 결과를 보고할 수 있다 — 그것이 바로 초록이 선행 비교에 대해 제기하는 불만이다: "vary many factors simultaneously, making the contribution of rollout policy difficult to isolate".

한 발견은 on-policy 쪽에 유리하고, 자신의 유효기간과 함께 보고된다: on-policy 데이터는 두 KL 방향 모두에서 더 어려운 Countdown 산술 변형으로의 일반화를 실제로 개선하지만, "this advantage does not reliably persist after subsequent RLVR" 다. 다음 학습 단계가 지워버린 이득은 애초에 없던 이득과 다른 주장이며, 논문은 전자를 말한다.

읽은 어떤 자료에도 어떤 종류의 수치도 나오지 않는다 — 정확도도, 망각률도, 희소성 측정치도 — 따라서 위의 모든 발견은 방향성이며 효과 크기는 평가할 수 없다. 논문은 읽지 않았다; arxiv.org 는 이 파이프라인에서 차단되어 있고 HuggingFace Daily Papers 초록이 확보된 유일한 텍스트다. 저자나 소속은 명시되지 않는다. 두 모델 패밀리 모두 오픈 웨이트이고 어느 쪽도 프런티어급이 아니며, 설정은 strong-to-weak distillation 한정 이다.

현재 수준 (2026-09-30)

검증기도 하네스이고, 불리언은 거친 하네스다. Groupwise Agentic Grading and Advantage Redistribution for Code Agent RL 는 결함을 정확히 지목한다: 이진 테스트 통과 보상에서 GRPO 는 그룹 내 통과 트래젝터리 전부에 동일한 어드밴티지를 부여하므로, 정책은 깔끔하고 범위가 좁은 패치와 무관한 파일 네 개까지 고쳐 쓰는 패치를 구분하는 법을 배우지 못한다. 이 페이지는 테스트로 검증되는 코드를 잘 작동하는 경우 — 진짜 검증기가 존재하는 유일한 영역 — 으로 다뤄 왔고, 이것은 그 검증기가 그 구도가 가정하는 것보다 훨씬 무디다는 논변이다.

GAGAR 의 답은 합 보존 어드밴티지 재분배 다: 통과와 실패 트래젝터리를 둘 다 담은 그룹만 남기고, 그룹을 하나의 공유 작업공간에 넣고, SFT 로 학습된 에이전틱 채점자가 통과한 것들의 순위를 함께 매기고, 하위 순위를 하향 가중한 뒤 그룹 총합이 변하지 않도록 재척도화한다. 내부 분포만 움직이며, 그래서 손실을 다시 조정하지 않고 기존 GRPO 설정에 그대로 들어간다. MiMo-V2.6-Flash (310B) 와 MiMo-V2.6-Pro (1.02T) — Xiaomi 의 모델 — 의 RL 이전 SFT 체크포인트에서 산업 규모로 보고되었고, 코드 에이전트 성능 향상, 트래젝터리 길이 증가 완화, 더 안정적인 학습 이라 하며 셋 중 어느 것에도 수치가 붙어 있지 않다 (source).

수치가 없어도 주목할 항목은 트래젝터리 길이 증가다: RL 하의 길이 팽창은 코드 에이전트판 보상 해킹이며, 더 많은 파일을 건드리는 에이전트는 우연히 더 많은 테스트를 통과한다.

아래의 RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling 와 나란히 두면 둘은 두 영역에서의 같은 수 다 — 신호가 거친 곳에서 등급을 제조하는 것. 영상에는 검증기가 아예 없어 RewardVerse 는 루브릭을 만들고, 코드에는 불리언을 반환하는 검증기가 있어 GAGAR 는 순위 매김을 만든다. 둘 다 스칼라를 구조화된 판단으로 바꾸고, 그 과정에서 보상을 더 학습된 것으로 만든다.

같은 스냅샷에서 온 인프라 쪽 절반

Alibaba / Qwen AI Lab 의 QwenGyre (arXiv 2609.33848, 2026-09-27) 는 이 종류의 RL 을 돌리는 비용에 관한 것이고, 그쪽 수치는 구체적이다. xlong-horizon 과제는 한 번의 실행이 몇 시간, 수백 회의 모델–환경 상호작용, 롤아웃당 거의 1M 토큰 에 걸치는 것으로 정의되며, 이는 온라인 RL 을 두 방향으로 망가뜨린다: 실행 분산과 롤아웃 지연이 GPU 를 유휴로 만들고, 비선형 분기가 학습을 중복 트래젝터리로 범람시킨다. QwenGyre 는 진행 중인 실행을 중단하지 않고 롤아웃과 학습 사이에 GPU 를 탄력적으로 재배분 하며, 트래젝터리 프로세서가 분기 이력을 재구성하고 부분 진행을 점수화하고 중복 경로를 제거한다. Qwen 3.8 2.4T, 롤아웃당 700K 토큰 으로 확장했을 때: NL2RepoBench 52.5% → 58.5% (+6.0 포인트), 48 스텝 만에, 그리고 Colocate 와 Async 대비 각각 최대 1.85배와 1.78배 속도 향상. 규칙에 따라 페이지 없이 일회성 언급 으로 기록한다 (source).

2.4T 수치는 이 위키 자체의 값을 교차 확인해 준다. Alibaba / Qwen AI Lab 는 7월 포착에서 Qwen 3.8 Max 를 2.4T MoE 로 보유하는데, 이제 그 모델의 자체 팀이 논문에서 같은 수치를 진술한 것이며 이는 그 수치가 나온 보도보다 강한 출처다.

현재 수준 (2026-09-28)

검증기가 없는 곳에서 리워드 모델은 드리프트하고, 그렇다고 말하는 논문이 그 실패를 설계로 맞설 수 있을 만큼 정확하게 명명한다. RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling 는 스칼라 드리프트를 지목한다: 주관적 품질을 숫자 하나로 곧바로 매핑하는 비디오 리워드 모델은 그 스케일이 프롬프트에 걸쳐 붕괴하거나 이동해서, 같은 점수가 다른 곳에서 다른 것을 뜻하고 리워드가 RL 에 쓸 수 없게 된다. 해법은 중간 표현이다 — 동적이고 질의 적응형인 루브릭을 먼저 생성하고, 그것에 대고 채점한다 — 그리고 RGPO 로 훈련한다: 자기진화 씨앗 루브릭으로 스코어러를 워밍업한 뒤, 루브릭 생성기를 공동 최적화하면서 스코어러를 사람 평점에 재정렬한다. 16차원 EvalVerse 벤치마크에서 포인트와이즈·페어와이즈 모두 최고 수준 (source).

왜 비디오 생성 페이지가 아니라 이 페이지에 속하는가. 여기 있는 모든 것이 가만히 있는 리워드를 가정한다. 이 페이지가 추적하는 환경들은 그것을 검증기에서 공짜로 얻는다 — 통과하는 테스트, 풀린 메커니즘, 에이전트를 파산시키거나 시키지 않는 거래. 비디오 생성에는 검증기가 없고, 스칼라 드리프트는 그 부재에서 리워드가 하는 일이다. 질의별로 생성된 루브릭은 리워드 모델의 영역을 좁히지 않으면서 그 질문을 좁히는 방법이며, 그것은 Learning to Discover Interesting Mathematics 가 "흥미로움"을 비율로 환원하며 하는 것과 같은 거래이고 Coding Agents for Generalized Task and Motion Planning Problems 가 시뮬레이터에서 공짜로 얻는 것과 같은 거래다. 같은 날 캡처된 논문 셋, 검증기가 없는 곳에서 검증기를 제조하는 세 가지 방법.

주장은 정량화되지 않고 주장되기만 하며, 그것은 캡처의 공백이다. 스냅샷은 표도 백분율도 담지 않는다 — "최고 수준"과 "스칼라 드리프트 완화"가 결과 서술 전부이므로, 그 아키텍처가 내놓기로 한 드리프트 감소를 포함해 이 논문의 어떤 수치도 점수로 인용할 수 없다. 저자와 소속은 스냅샷에 명시되지 않고 arxiv.org 는 이 런에서 차단되어 있다.

구조적 반론: 루브릭 생성기 자체가 학습되므로 드리프트는 제거된 것이 아니라 이동한 것이다 — 생성기도 스코어러와 똑같이 프롬프트에 걸쳐 드리프트할 수 있다. 제시된 답은 사람 평점에 대고 하는 공동 최적화이며, 그것은 사람 평점을 최후의 기준점으로 만들고 그 수·출처·스케일은 명시되지 않는다. 하류 결과도 보고되지 않는다: 더 나은 리워드 모델이 아직 더 나은 생성 비디오는 아니다.

현재 수준 (2026-09-27)

이 페이지는 보상 신호를 고치는 방법들을 축적해 왔다. 오늘의 논문은 보상을 손으로 쓰는 단계 자체를 걷어낸다.

Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms (2026-09-23) 는 결함을 순서 문제로 지목하고, 기여 전체가 그 순서를 뒤집는 데 있다. 기존 파이프라인은 "환경의 outcome rule 을 정의하거나 궤적에 주석을 달기 전에 환경을 먼저 구축하여, dynamics 와 평가를 사후에 정렬하도록 남겨 둔다." VHD-Play 는 대신 수학적 모델을 먼저 표집해 풀고, 코퍼스에 접지된 setter 가 그 풀린 모델의 결정 과정을 stateful tool 로 렌더링한다 — 따라서 실행 가능한 dynamics 와 궤적 채점 기준이 같은 풀린 모델에서 함께 유도되며, 따로 쓰였다가 맞춰지는 것이 아니다 (source).

측정수치
생성된 환경3,300개, 각 몇 센트
Qwen3.6-35B-A3B, 다섯 계열 진단의 평균 agentic score0.204 → 0.815
일반화학습한 세 계열 모두의 held-out 인스턴스, 그리고 본 적 없는 기제 계열 8개
외부 전이일반 function calling, 여행 계획, 365일 e-commerce
E-Commerce Bench파산 없이 모든 실행을 완주하고 Qwen3.7-Max 를 능가
어블레이션이 결과이고, 점수가 아니다. 서술형 문제와 파라미터를 드러내거나 감추는 stateful 버전을 비교한 결과, 논문은 학습 가능한 격차의 대부분이 근본적인 문제 해결이 아니라 stateful 상호작용에 있다고 보고한다. 이는 에이전트형 RL 이 무엇을 가르치는지에 관한 주장이다 — 수학이 아니라 stateful 인터페이스를 조작하는 일이며, 에이전트형 벤치마크와 추론 벤치마크가 갈라지는 이유에 대해 이 페이지가 가진 가장 직접적인 증거다.

0.204 → 0.815 는 정의되지 않은 척도 위의 4× 이동이다. 읽은 자료 어디에도 agentic score 가 무엇을 측정하는지, 범위가 얼마인지, 0.815 가 천장에 가까운지 나오지 않으므로 여기 다른 어떤 것과도 비교하지 않는다.

PACT: From Credit Assignment to Critic Alignment 와의 짝짓기는 거의 정확하며 둘은 서로를 인용하지 않는다. PACT 는 환경이 주어졌을 때 올바른 credit 신호가 무엇인지 증명한다 — 토큰 수준 credit 을 유일하게 결정하는 세 조건. VHD-Play 는 credit 신호가 유도되도록 환경을 만든다. 하나는 보상의 이론이고, 다른 하나는 사람이 보상을 쓰는 단계를 지운다.

그리고 같은 날 캡처된 ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds 와는 반대편에서 짝을 이룬다: 같은 희소 자원 — 검증 가능한 낯선 기제 — 을 한쪽은 학습에 쓰려고 제조하고 다른 쪽은 시험에 쓰려고 만들었으며, 서로를 읽지 않은 두 그룹의 작업이다. 기록할 만한 역설이 있다: VHD-Play 의 환경은 풀린 수학적 모델에서 나오므로 "hidden dynamics" 가 함축하는 것보다 사전학습 데이터에 가까울 수 있고, 읽은 자료에 그에 대한 검사가 없다 — ExplorationBench 가 바로 그 통제를 중심으로 만들어졌다.

보상이 아니라 순서에 관한 두 번째 항목. Rufus-Air: An Open LLM Post-Training Recipe 는 여덟 단계의 직렬 사후 학습을 문서화하고 거기서 보상 신뢰도가 단계 순서를 정해야 한다는 규칙을 끌어낸다 — 하드하고 검증 가능한 보상이 먼저, 판정자 기반의 부드러운 신호가 마지막인데, 뒤 단계가 앞 단계가 남긴 정책을 물려받기 때문이다. 이 페이지가 가진 단계 순서에 관한 가장 평이한 진술이며, 어떤 종류의 벤치마크 수치도 없이 온다 (source).

현재 수준 (2026-09-26)

  • 토큰 수준 credit 이 유일성 증명을 얻었고, 그 증명이 가장 중요한 곳에서 정작 이득이 가장 작다 (2026-09-22): PACT: From Credit Assignment to Critic Alignment 는 토큰 수준 credit 이 "일반적으로 받아들여지는 수학적 정의를 결여하고 있어, 흔히 쓰이는 학습 신호들과의 관계가 불분명하다"는 진술로 시작한다 — 이 페이지의 상태를 그대로 적어놓은 문장이다. 논문은 Completeness, Prefix Consistency, Neutrality 세 가지 정칙성 조건을 세우고 이들이 토큰 수준 credit 을 유일하게 결정함을 증명한다. 그 정의에서 세 가지가 따라 나온다: On-Policy Distillation 의 이상적 교사는 암묵적 critic 으로 작동하여, 토큰 수준 credit 이 유도하는 것에 비례하는 기대 policy gradient 를 낸다. 응답 수준 RLOO 신호는 입자도가 거칠음에도 기대 policy-gradient 기여가 일치한다. 그리고 GAE 에서는 중간 critic 오차가 기저 credit 자체와 맞먹는 크기가 될 수 있다. 논문은 나아가 유계 outcome reward 하의 근사적 credit 희소성을 확립한다. PACT 는 Actor-then-Critic 갱신 순서를 채택하는데, 이것이 critic 학습에 importance sampling 보정을 적용할 길을 열어 critic 을 갱신된 정책에 정렬시킨다. 보고된 수치: 에이전트형 수학 추론 벤치마크 4 개 평균 정확도 72.87% — GRPO 대비 +8.80, PPO 대비 +13.16 — 그리고 SWE-bench Verified 통과율 67.4%, PPO 대비 +2.4, GRPO 대비 +2.0, SAO 대비 +3.8 (source). 왜 맨 위인가: 아래 항목들은 모두 credit 재분배 기법을 벤치마크로 방어하는데, 이것은 그런 기법이 단지 점수에서 뒤처지는 것이 아니라 틀릴 수 있는 대상을 처음으로 제시한다. OPD-as-implicit-critic 결과는 이 페이지가 2026-09-02 부터 축적해 온 on-policy distillation 클러스터에 직접 내려앉는다 — 그 클러스터의 열린 질문은 교사의 신호가 실제로 무엇을 사주고 있는가였고, 이것은 ablation 이 아니라 등가성의 형태로 답한다. GAE 결과가 가장 날카롭다: 널리 쓰이는 추정기가 에이전트형 RL 이 돌아가는 바로 그 장기 지평 영역에서 자기 자신의 노이즈에 압도될 수 있다는 주장이다. 결과가 동기를 반박하는데 논문은 이를 조정하지 않는다: GRPO 대비 마진이 에이전트형 수학에서 8.80 포인트, SWE-bench Verified 에서 2.0 이다 — credit 이 가장 긴 지평에 퍼져 있는 벤치마크에서 네 배 작으며, 장기 지평 credit assignment 이론이 예측하는 것과 정반대다. 명시된 공백과 함께 보유: 베이스 모델, 파라미터 수, 학습 컴퓨트 없음. 수학 벤치마크 4 개는 이름이 없다. SAO 는 베이스라인으로만 불리고 풀어쓰이지 않는다. seed 수나 분산 수치 없음. 그리고 67.4% 에는 논문이 인정하지 않는 단서가 붙는다 — 2026-09-25 에 캡처된 Schrödinger's Code Repository: Have LLMs Learned SWE-bench or Memorized It? 는 평가 시점에 리포지터리를 인스턴스화하여 SWE-bench Verified 성능을 일관되게 떨어뜨린다

  • 환경 합성이 마지막 인간 산출물을 걷어낸다: 이슈도 커밋도 아닌, 소스만 (2026-09-18): CodeMidas: Scaling Agentic Coding RL Environments from Code Itself 는 기존 코드베이스에 구현된 기능을, 소스 코드를 유일한 과제별 입력으로 삼아 실행 가능한 RL 환경으로 바꾼다 — 이슈와 커밋 을 캐는 주류 관행에 명시적으로 맞선다. 그 관행은 뽑아낼 수 있는 과제 집합을 누군가 적어 둔 것으로 한정한다. 에이전트 연산은 구축의 모든 단계 에 쓰인다: 에이전트가 코드를 탐색해 동작 명세를 작성 하고, 원본 코드의 실행에 근거한 테스트를 구성 하고, 실행 검사와 반복 해법 롤아웃으로 검증하고 거른다. 산출: 3,185개 오픈소스 코드베이스에서 5,545개 학습 과제, 23개 언어, 15개 기술 도메인. MiMo-V2.5 + GRPO 로 학습하면 DeepSWE +11.7%, ProgramBench +17%, Terminal-Bench v2.1 +8.5% 가 나오고, 어블레이션은 고품질 과제가 늘수록 계속 좋아진다 고, 궤적 분석은 코드베이스 탐색이 늘고 자기검증이 다양해진다 고 보고한다. 이는 SPADE 의 "학습 가능한 대상으로서의 환경" 을, 이미 실행되는 코드에 생성기를 접지시킨 형태다 — SPADE 는 환경과 검증자를 처음부터 쓰고, EnvHarness 는 신뢰된 환경을 다듬고, CodeMidas 는 동작이 실행 가능하여 모델의 말에 기대지 않고 확인되는 산출물에서 둘 다를 끌어낸다. 닫지 못한 것: "다섯 벤치마크 모두 오른다" 고 하면서 수치와 이름이 있는 것은 셋뿐 이고; 모든 숫자가 절대 점수 없는 상대 증가분 이라 이 위키가 다른 곳에 가진 Terminal-Bench 2.1 수치와 비교할 수 없으며; 학습한 베이스 모델은 하나 뿐이고; 같은 모집단에서 만든 학습 코드베이스와 벤치마크 사이의 오염 검사가 보고되지 않았다. 필터 자체가 편향이다 — "반복 해법 롤아웃" 은 현재 모델이 이미 가끔 풀 수 있는 과제를 남긴다 (source)

  • 열 번째 OPD 결과가 8일 사이 세 번째 재료를 걷어내고, 세 제거를 합치면 병목의 위치가 옮겨진다 (2026-09-05): Rethinking On-Policy Distillation of Large Language Models II: One Training Example 는 쿼리 하나로 학습해 one-shot OPD 가 수백 스텝 동안 계속 향상하며 여러 작업 도메인과 모델 계열에서 full-data OPD 이득의 대부분을 회복한다고 보고한다. 제시된 기제는 state coverage — 주어진 쿼리 집합의 rollout 이 닿는, full-data OPD 방문 상태의 비율 — 이고, 쿼리 하나가 이미 71.5% 에, 그 대부분이 첫 100 스텝 안에 닿으며, 의미적으로 구별되는 쿼리 16 개는 98.9% 에 닿아 full-data 학습과 대등해진다. 결과는 multi-teacher OPD 로도 확장되고(도메인당 다양한 쿼리 16 개가 full-data MOPD 와 대등), content-light 템플릿과 도메인 밖 WildChat 쿼리가 실제 쿼리 베이스라인에 근접하는 스트레스 테스트도 통과한다 — 즉 작업 내용과 유발되는 state coverage 가 서로 분리된다. 한편 정렬은 쿼리 하나로 학습하든 데이터셋 전체로 학습하든 비슷한 속도로 느려지고, 고정된 상태 집합조차 흡수에 수백 스텝이 걸린다. 저자들의 요약: OPD 는 "data-overfed but algorithm-starved" (source). 왜 아홉 번째 위에 오는가: 가장 최근 세 결과는 이 페이지가 OPD 를 떠받친다고 가정했던 것을 각각 다르게 하나씩 지우고도 손실이 거의 없다고 보고한다 — Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement 는 교사의 내용을(고정된 음수 advantage 하나가 교사가 준 것과 대등), 2608.29846 IDA-OPD 는 전체 어휘 신호를(표집 토큰 log-probability 만으로 충분), 그리고 이것은 데이터를 지운다. 09-04 항목은 앞의 둘을 미해결 긴장으로 기록했다 — 한 논문이 공들여 최적화하는 신호를 다른 논문은 버려도 된다고 말한다는 것. 이 논문은 그 긴장을 해소하지 않고 축소한다. 학생의 흡수 속도가 supervision 의 양과 무관하다면 두 논증 모두 속도를 제한하지 않는 부분을 다투는 셈이다. 이 짝짓기는 이 위키의 독해이며 그렇게 표시한다: 셋 중 어느 것도 서로를 인용하지 않는다. 명시된 공백과 함께 붙든다: "full-data OPD 이득의 대부분" 에 숫자가 없고, 도메인과 모델 계열이 이름 없이 남으며, 모든 수치가 에이전트 시간 지평이 아니라 질의응답 학습 위의 것이다. 제목이 "II" 라고 말하는데 읽은 자료 어디에도 논문 I 이 무엇인지 나오지 않는다

  • 페이지 없이 기록할 만한 루브릭 결과 하나. 이 페이지의 OPD 레인 전체가 닿지 못하는 곳에서 작동하기 때문이다 (2026-09-05): 2609.04094 DRACO 는 outcome-blind 설정에서 돈다 — 프로그램적 채점기가 없는 상황이고, 긴 지평 에이전트 도메인 대부분이 그렇다. 다기준 루브릭이 통상의 대체물이지만 궤적당 한 번 채점되고, 스칼라 하나는 수십 스텝에 걸친 신호로는 빈약하다. DRACO 는 정책의 변화하는 역량을 따라가도록 학습 중 루브릭을 동적으로 생성하고, 완료된 궤적당 한 번 채점한 뒤, 그 판정을 주석된 루브릭에 책임이 있는 스텝들에 재분배해 GRPO 의 스텝별 advantage 를 만든다 — 닫힌 형식이며 학습되는 귀속 모듈이 없다. 보고: AppWorld 에서 베이스 모델 대비 +15.9 포인트, 희소한 ground-truth 보상으로 학습한 GRPO 대비 +5.3, 그것도 자기는 어떤 검증기도 쓰지 않으면서; 도메인 밖 Tau-Bench 에서도 베이스 대비 +5.3 으로 ground-truth 보상 학습과 다른 루브릭 기반 설정 양쪽을 이긴다. 코드는 github.com/IBM/draco (source). Cliff 와 IDA-OPD 의 선례를 따라 페이지를 주지 않고 여기에 기록한다: 이 페이지가 이미 추적하는 기제 위의 credit-assignment 변형이다. 줄을 들일 가치가 있는 이유: 검증기를 전혀 쓰지 않으면서 희소한 ground-truth 보상을 이긴다는 것이 반직관적인 행이고, 위의 OPD 클러스터와 같은 결론을 가리킨다 — 신호의 스텝 간 형태가 그 출처보다 더 많은 일을 하고 있다

  • 아홉 번째 OPD 결과가 여덟 번째의 암묵적 질문에 답한다 — 교사의 내용이 일을 하는 게 아니라면, 교사의 신호는 실제로 무엇을 치르게 하는가? (2026-09-04): 2608.29846 Influence-Directed Distillation 은 실패를 다양성 증류 실패(diversity distillation failure) 라 명명한다 — 학생의 pass@1 은 개선되는데 pass@k 는 정체하여 교사의 다양성을 물려받지 못한다는 것이다. 진단 도구는 부호 있는 1차 프록시 First-Order Local Entropy Influence 로, 각 업데이트의 엔트로피 효과를 교사–학생 로그확률 격차와 학생의 국소 확률 구조로 분해하고, 엔트로피 수축을 음의 영향 위치와 연결한다. IDA-OPD 는 이어서 엔트로피를 확장하는 업데이트는 유지하고 수축시키는 업데이트는 발산 적응형 어드밴티지 축소로 대체하는데, 전체 어휘 Forward-KL 대신 교사의 샘플된 토큰 로그확률만 사용한다. 보고된 결과: pass@k 가 일관되게 개선되고, 교사 정보를 쓰는 가장 강한 방법들과 엄밀히 더 낮은 비용으로 대등하며, 기본 OPD 의 pass@1 은 대체로 유지된다 (source). 왜 여덟 번째 바로 아래에 놓이는가: Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement 는 교사의 내용이 OPD 를 작동시키는 것이 아니라고 보고하며 그것을 상수로 대체하고, 이것은 교사의 신호 형태가 능동적으로 엔트로피를 붕괴시키고 있다고 보고하며 그 형태를 고친다. 둘은 같은 주장이 아니고, 자명한 방식으로 양립하지도 않는다 — 고정된 음의 어드밴티지가 교사가 준 것과 대등하다면, IDA-OPD 가 교사의 샘플된 토큰 로그확률을 세심히 활용하는 것은 다른 논문이 버려도 된다고 말한 것을 최적화하는 셈이다. 어느 쪽도 서로를 인용하지 않으며, 둘 다 사흘 안에 나왔다. 초록 수준의 신뢰도로만 기록한다: IDA-OPD 의 초록에는 절대 수치도, 벤치마크 이름도, 모델 이름도 없어서 위의 모든 결과는 크기 없는 방향이다. 같은 스냅샷의 세 번째 논문이 보상 쪽에서 같은 이음매를 공격한다: 2609.02817 Cliff 는 기성 LLM 으로 롤아웃의 첫 실수를 찾아 토큰 수준 어드밴티지로 변환하고 — 앞부분은 양, 뒷부분은 음 — 12개 시나리오에서 on-policy distillation 대비 +15%, 표준 GRPO 대비 +7% 를 "보통 수준의 교사로도" 보고한다. 페이지를 주는 대신 여기에 기록한다. 한 주의 같은 주제에 대한 세 번째 변주이고 이 클러스터는 이미 여덟을 안고 있다

  • 이 클러스터의 여덟 번째 on-policy distillation 결과이자, 교사가 작동 이유가 아니라고 말한 첫 결과 (2026-09-02): Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement는 OPD 훈련 중 교사 지도를 측정해 노이즈가 상당하고 그 빈도가 교사 규모에 따라 증가하며, 학생은 그 노이즈에 둔감해 유지하든 제거하든 비슷한 성능으로 수렴한다고 보고한다. 추가 두 검증: 학습이 낮은 로그확률 토큰에 집중되고, 고정된 단일 음의 어드밴티지가 교사가 제공한 것과 같은 성능을 낸다. 저자들에게 남은 메커니즘은 낮은 로그확률 토큰의 억제이며, 여기에는 교사가 필요 없다. 지도 없는 대체 기법 OPSA(엔트로피 적응형 음의 어드밴티지)는 기저 Qwen3-1.7B 대비 AIME24 Avg@32 +35.41(상대 263%), 세 벤치마크 전부에서 Pass@32 두 배 이상, OPD 자체 대비 Avg@32 +16.77을 보고한다. 왜 이 페이지 최상단인가: 위의 일곱 결과가 OPD의 조밀한 토큰 단위 신호를 무언가에 쓰고 — 보안, RLVR 게이팅, 멀티 교사 예산, 테스트 타임 라벨 — 그 전부가 신호에 교사의 내용이 담겨 있다고 전제한다. 그 전제를 직접 검증하고 아니라고 보고한 것은 이것이 처음이다. 또한 이 페이지의 데이터 효율 문제를 가장 날카롭게 표현한 형태이기도 하다. 고정 상수가 교사와 같다면 교사의 추론 비용은 아무것도 사지 못했다. 일곱 결과 중 어느 것도 인용하지 않고, 그중 어느 것도 이것을 인용하지 않는다. 범위는 좁고 초록이 그 대부분을 인정한다: 기저는 Qwen3-1.7B이고, "세 벤치마크 전부"의 세 벤치마크는 이름이 없으며(AIME24 하나만 지목), 읽은 어떤 자료도 "꼬리 토큰 억제"를 역량 향상과 날카로워진 출력 분포로부터 분리하지 않는다 (source)

  • 나흘 사이 세 논문이 GRPO 의 한계는 설계 선택이라고 말하며, 어느 선택인지를 두고 서로 다르다 (2026-08-29): Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO (arXiv:2608.27351) 는 그 세 번째이자 가장 직접적인 사례다 — Evolution Strategies 가 흔히 분류되는 대로 GRPO 의 메모리 효율적이지만 더 약한 대안이 아니라 별개의 사후 학습 패러다임이라고 주장한다. 주장의 내용: GRPO 는 entropy collapse 를 보이고 ES 는 그렇지 않으므로, ES 가 "improves Pass@1 while attaining higher Pass@K" 하며, 이론적 설명은 ES 집단 전반의 verifier-projected Jensen-Shannon diversity 에 기댄다; 한쪽에서 Pass@1 을, 다른 쪽에서 Pass@K 를 가져오는 sequential GRPO-ES 스케줄이 제안된다. 이미 이 페이지에 있는 둘과 나란히 놓으면 그 불일치가 흥미로운 지점이다: BPCO (2608.23566) 는 고칠 수 있는 선택이 GRPO 의 critic 없는 전제라 말하고, Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization (arXiv:2608.23311) 는 KL 정규화 항이 놓인 위치라 말하며, 이 논문은 옵티마이저 자체라 말한다. 왜 논문 페이지에만 두지 않고 여기에 두는가: 이 페이지의 다른 모든 결과는 롤아웃 예산을 두고 경쟁하는데, 이것은 커버리지를 두고 경쟁한다 — Pass@K 는 사후 학습 이후에도 사전학습된 모델의 추론 능력이 얼마나 도달 가능하게 남는지를 재는 척도이고, 그것은 Post-Training Scaling 이 보존된다고 암묵적으로 가정하는 양이다. 두 번째 발견은 비교보다 더 멀리 간다: functional sparsity, 즉 ES 의 이득이 "despite substantial whole-model parameter drift" 큰 크기의 업데이트로 이루어진 희소한 부분집합에서 나오며 held-out 평가에서 catastrophic forgetting 이 반드시 따라오지는 않는다는 것 — 이것이 성립한다면 가중치가 얼마나 움직였는지를 재는 것은 함수가 얼마나 바뀌었는지에 대해 아무것도 말해 주지 않으며, 이 위키의 여러 주장이 바로 그것에서 추론하고 있다. 초록에는 절대 수치가 없고 벤치마크도 모델도 명시되지 않으므로, 위의 모든 비교는 크기 없는 방향이다 (source)

  • 레이블이 완전히 떨어져 나가고, 다중 교사 시소가 진단되다 (2026-08-28): on-policy distillation 결과 세 건이 더해져 네 스냅숏에 일곱 번이 되었다. **TTPO: Test-Time Policy Optimization (arXiv:2608.27448)**는 정답 레이블을 제거하는데, 그것이야말로 이 페이지의 모든 방법을 테스트 타임 학습 밖에 묶어 두던 것이다. 다수결 의사 레이블은 취약하다 — "틀린 표는 교사를 오염시키고 모든 토큰을 오도한다" — 그래서 TTPO 는 비대칭을 이용한다: 의사 레이블에 동의하지 않는 롤아웃은 "다수결 자체가 옳은지와 무관하게 대체로 틀려 있다". 동의하는 롤아웃은 OPSD 로 증류하고, 동의하지 않는 롤아웃은 Grouped RL 로 벌하며, 토큰 수준 선택이 이미 수렴한 위치의 가중치를 낮추고 확신에 찬 오류만 벌한다. 레이블을 전혀 쓰지 않고 경쟁 수준 벤치마크 다섯 개에서 레이블 지도 OPSD 와 동등하고, 테스트 타임 학습에서 Qwen3-1.7B 를 38.0% 에서 45.2% 로 끌어올리며, thinking 없이 **+25.2% ~ +36.4%**를 낸다. 시험되지 않은 영역이 중요한 영역이다: 다수가 체계적으로 틀린 경우 소수 롤아웃이 옳은 쪽이고 TTPO 는 바로 그것을 벌한다. 비대칭은 연구된 분포의 관찰된 성질이지 정리가 아니다.

    같은 스냅숏의 두 논문이 아래 열린 문제로 기록된 다중 교사 시소를 공격한다. Open-MOPD (2608.19098)는 SmolLM3-3B-Base 와 오라클 라우팅으로 통제된 M-OPD 벤치마크를 세워 역량 통합과 라우팅 모호성을 분리하고, 표준 M-OPD 가 도메인 라우팅 오라클 앙상블 대비 가용 여유의 35.6% 만 확보한다는 것을 발견한다. 그 진단은 직관적인 쪽과 어긋난다: 실패는 "그래디언트 충돌에서 오지 않고, 토큰 수준 최적화 예산의 심각한 오배분에서 온다"는 것이며, 도메인 간 구조적 시퀀스 길이 격차, 불균일한 학습률로 인한 수렴 표류, 비동기 갱신에서 오는 다단계 보상 노후화가 그 원인이다. 토큰 점유 균형, 격차 인식 동적 예산 배분, 학생 보상 갱신이 여유 회복을 **35.6% → 83.4%**로 끌어올리며, 종단 간 레시피와 궤적과 평가 스위트가 "학계가 접근 가능한 하드웨어 예산으로" 오픈소스로 공개되었다. D³-MOPD (2608.24987)는 같은 낭비를 스케줄링 쪽에서 공격한다: 무오버헤드 오프프로세스 관찰자가 학습 중 이미 생성되는 도메인별 역-KL 신호를 재활용해 도메인 혼합을 온라인으로 조정하고, 네 개의 도메인 전문가 교사에서 증류한 Qwen3.6-35B-A3B 학생에서 평균 학생-교사 격차의 97% 를 vanilla MOPD 의 63% 대비 좁히며, "약 3times 줄어든 롤아웃 스텝"으로 최고 성능에 도달하고 일곱 벤치마크 중 셋에서 전문가 교사를 넘어선다. 둘 다 페이지를 받지 않았고, 이는 OPDVR 과 BPCO 에 세운 선례를 따른 것이다: 둘 다 이 페이지가 이미 추적하는 메커니즘에 대한 레시피 수준 결과다. 둘 다 Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models (arXiv:2608.16647)을 인용하지 않으며, 그 논문의 origin 관계 발견은 이들이 경험적으로 고치고 있는 시소에 대한 가장 강력한 기존 설명이다 (source)

  • 온폴리시 증류가 두 스냅숏에 네 번 등장하며, 공통된 움직임은 궤적 수준 보상을 토큰 수준 감독이 대체하는 것이다 (2026-08-27): 위의 08-25 통제 연구가 OPD 가 무엇을 이전하는지를 확립했다면, 이번 스냅숏은 그것을 쓰는 현장을 보여 준다. SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation (arXiv:2608.21500) 는 그것을 보안 쪽으로 겨눈다 — 인젝션된 입력에 대한 롤아웃을 깨끗한 입력을 받은 초기화 모델이 토큰 단위로 채점하므로, 모델은 어느 토큰을 인젝션이 만들어 냈는지 배운다. 적응형 공격자 PISmith 에 대한 ASR 은 이전 SoTA 인 Meta-SecAlign 의 94.0% 대비 9.0%, 기반 모델은 Qwen3.6-27B, 가중치 공개. OPDVR (2608.24696) 은 하이퍼파라미터를 하나도 늘리지 않고 OPD 와 RLVR 을 결합한다: 샘플 토큰 OPD 의 암묵적 보상을 궤적 정확성으로 다시 정식화하고 ReLU 게이팅을 적용해 옳은 궤적은 음이 아닌 보상을, 틀린 궤적은 양이 아닌 보상을 받게 한다 — 이는 샘플 토큰 OPD 를 GRPO 와 결합 가능한 온전한 RLVR 방법으로 바꾸며, 여섯 개 추론 벤치마크에서 표준 OPD 를 이긴다고 보고된다. 세 번째 논문 (2608.24646) 은 온폴리시 자기증류를 확산 모델로 가져간다. 통합된 진단은 SecOPD 가 대놓고 밝힌 것이다 — 시퀀스 수준 피드백은 "모델이 어느 출력 토큰이 안전하지 않은지를 정확히 배우지 못하게 막는다" — 그리고 같은 논증이 OPDVR 의 조밀 신호 쪽을 떠받친다. OPDVR 도 SecOPD 도 08-25 일반화 연구를 인용하지 않는데, 그 연구의 발견이 둘 모두를 제약한다: OPD 의 도달 범위는 기원 관계로 정해지고, SecOPD 의 교사는 학생 자신의 초기화로서 기원이 최대한 같은 경우다 (source)

  • 크리틱 기반 레시피가 프롬프트당 한 샘플로 그룹 상대 방법과 대등하다고 보고되다 (2026-08-27): BPCO (2608.23566) 는 GRPO 가 존재하는 이유 — 크리틱이 불안정하다는 것 — 을 다시 들여다보고, 크리틱을 안정화하는 레시피를 보고한다: DPPO, 보상 범위로 묶인 가치 예측, 몬테카를로 가치 타깃, 정규화하지 않은 정책 이점, 그리고 길이 적응형 GAE. 크리틱은 학습 중에만 쓰이므로 정책에는 감춰진, 보상을 정의하는 정보 — 참조 답안이나 채점 루브릭 — 로 조건화할 수 있다. 1.5B 부터 30B-A3B 까지의 수학 추론에서, 프롬프트당 응답을 하나만 샘플링하면서 그룹 기반 기준선과 대등하거나 그 이상이라고 보고된다. 왜 여기에 속하는가: 이 페이지의 모든 에이전틱 RL 결과가 그룹 샘플링 비용을 치르고 있고, 롤아웃 예산이 발목을 잡는 비용이다. 에이전틱 벤치마크는 보고되지 않았다 — 평가가 수학 추론이다 — 따라서 장기 지평 신용 할당에서도 유지되는지는 시험되지 않았다 (source)

  • 환경 생성이 규모 수치를 얻고, 저작 자체도 학습 가능한 것으로 드러나다 (2026-08-26): AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scale (arXiv:2608.20634) 는 이 페이지가 두 번 기록한 구성 순서를 뒤집는다 — SPADE 는 과제를 위한 환경을 쓰고, EnvHarness 는 하나를 재성형한다. AgentMercury 는 업무 시나리오로부터 지속형 세계(개체, 서비스, 도구, 상태, 실행 가능한 서비스 간 불변식)를 인스턴스화하고 거기서 과제가 떠오르게 한다. 4,783개의 실행 가능 환경, 14개 산업, 50개국을 RL 기반으로 썼다. 검증해 볼 전이 주장은 이것이다: Qwen3.5-4B 가 EnterpriseOps-GYM 에서 12.3 → 15.7, AIME26 에서 45.9 → 56.0 — 즉 업무 워크플로 학습으로 경시 수학에서 +10.1 포인트이고, 환경은 "평가 벤치마크를 겨냥하지 않고" 생성되었다고 진술된다. 두 번째 실험이 더 중대하다: Qwen3.5-35B-A3B 를 구성 흔적으로 미세조정하면 held-out 시나리오에서 실행 가능 세계 저작 성공률이 3.3% 에서 83.3% 로 오른다. 검증된 환경을 저작하는 일 자체가 학습 가능하다면, 이 페이지의 상시 병목은 사람이 저작한 환경에서 컴퓨트로 옮겨간다. 오염 분석은 언급되지 않으며, "겨냥하지 않고 생성"은 분포 중첩이 아니라 의도에 대한 주장이고, 83.3% 성공은 정의된 적이 없다 — 세계가 단지 돌아가면 되는가, 아니면 불변식을 지켜야 하는가? (source)

  • 안정성–탐색 트레이드오프가 정규화항이 어디에 놓이는지에서 오는 인공물이라고 논해지다 (2026-08-26): Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization (arXiv:2608.23311) 는 Alibaba / Qwen AI Lab 조직 저장소에서 나왔고, 드리프트 통제를 유지하면서 탐색 예산을 돌려주기 위해 제약을 행동 쪽에서 입력 쪽으로 옮긴다. Query-KL 은 현재 정책이 유발하는 학습 쿼리 분포가 RL 이전 기준에서 얼마나 멀어지는지를 묶는다. QKL 기울기가 "오직 쿼리 우도를 통해서만 흐르고" 정책 경사 추정기의 응답 score function 이 그 항에 나타나지 않으므로, "응답 분포에 직접적인 기울기 압력을 가하지 않는다". 여기에 데이터셋 고정, 기준에서 유도된 쿼리별 가중치가 더해진다. GRPO/PPO/REINFORCE 파이프라인에서 추가 순전파 없이 Policy-KL 을 대체하며, 여섯 개의 수학 추론 벤치마크에서 더 높은 정확도와 "고온 디코딩과 장기 지평 학습에서 실질적으로 더 안정적인 거동"을 낸다고 보고된다. 왜 일반 RL 메모가 아니라 여기에 속하는가: 고온과 장기 지평이야말로 에이전틱 RL 이 돌아가는 영역이고, 통상의 처방은 그 영역을 떠나는 것이다. 초록에 수치가 없고, 벤치마크 이름도 기준선 계수도 대지 않으며, 읽은 어떤 것도 묶이지 않은 쿼리 드리프트가 지목된 불안정성을 일으킨다는 것을 보이지 않는다 — 그저 ERPO 가 그것을 묶는다는 것뿐이다 (source)

  • On-policy distillation 이 전이하는 것은 행동이며, 얼마나 멀리 닿는지는 노력이 아니라 관계가 정한다 (2026-08-25): Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models (arXiv:2608.16647) 은 일반화 요인을 한 번에 하나씩 바꾸는 통제된 연구이고, 이 페이지의 OPD 갈래가 측정하지 않고 가정해 온 세 가지를 보고한다. 전이되는 것은 교사의 추론 행동이지 답이 아니다: 학습 난이도는 거의 문제가 되지 않고 교사가 한 번도 풀지 못한 문제도 여전히 쓸모가 있다 — Direct-OPD 의 약한 모델 롤아웃 뒤에 있던 메커니즘이 이제 발견으로 진술된 것이다. same-origin 교사/학생 쌍은 언어, 추론 지평, 다른 도메인까지 실어 나르고, cross-origin 쌍은 대체로 학습된 분포에만 들어맞는다. 그리고 그 도달 범위는 조종되지 않는다: 프롬프트를 도메인 전문가에게 라우팅해도 교사의 영향력을 가둘 수 없기 때문에, 다중 교사 OPD 는 교사들의 합집합이 아니라 혼합 비율에 좌우되는 시소를 낳는다. 초록에는 수치가 전혀 없고, "origin" 은 끝내 정의되지 않는다 — 같은 코퍼스, 같은 계열, 같은 연구소는 서로 다른 세 주장이다 (source)

  • 학습 환경 자체가 학습된 구성 요소가 된다 — 이제 생성만이 아니라 증강으로 (2026-08-22): EnvHarness: Awakening Static Worlds for Agent Learning (arXiv:2608.19880) 은 기반 정책의 환경을 유지하되 프로그래밍 가능한 플러그인 계층으로 감싸, 정책의 진단된 약점을 겨냥하도록 동작을 재구성하며(자동화 구성요소 EnvRigger 가 블랙박스 궤적 관찰 로 합성) 원래 검증기를 유지 한다 — 더 우수한 RL 최적화 신호 를 주고 정책과 환경의 지속적 공진화 를 가능케 한다고 보고되며, held-out 인스턴스에서 최대 +9.0점. 이는 SPADE 의 "학습 가능한 대상으로서의 환경" 을 신뢰 문제를 반대 쪽에서 풀며 실현한 것이다: SPADE 는 환경(과 그 검증기)을 처음부터 작성 하고, EnvHarness 는 신뢰받는 것을 재구성 하며 그 검증기를 결코 교체하지 않는다 — 아래의 열린 문제, 즉 SPADE 의 자작 검증기가 무단속 리워드 해킹 표면이라는 문제를 직접 답한다 (source)

  • 하네스드 에이전틱 RL — 배포 시점 하네스가 이제 학습에 참여한다 (2026-08-18): Agent Lightning v1.0: Towards Harnessed Agentic RL (arXiv:2608.17528) 이 이 국면을 명명하고 약 3,500줄 프레임워크를 공개한다. 임의의 에이전트가 LLM 엔드포인트 프록시 를 통해 학습에 연결되므로 하네스가 환경 상호작용 루프를 소유 하고 트레이너는 LLM 요청/응답 쌍만 관찰한다. 논문은 verl Uni-Agent, AReaL 2.0, slime, Polar 등 네 프레임워크가 이 구조를 채택했다고 밝힌다. 보고된 결과: Qwen3.5-9B 가 SWE-bench Verified 에서 41.8% → 56.4%, 학습 예제 6K 개로. 귀결: 이렇게 후속 학습된 모델은 자기 하네스에 맞춰지며, 그것이 그런 모델이 하네스 불가지론적이기를 그친다는 ClawGym II: Exploring Black-Box RL on Agent Harness (arXiv:2608.16798) 의 발견 뒤에 있는 기제다. 56.4% 를 만든 하네스의 이름은 밝혀지지 않았다 (source)

  • 정반대의 베팅: 신용 할당 기계를 고치는 대신 삭제한다 (2026-08-18): Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements (arXiv:2608.17310) 는 긴 구간 에이전트에 RL 보다 진화 전략 이 맞는다고 주장한다 — 추론 수준 GPU 메모리 에서 전체 파라미터 최적화, 그리고 보상을 구간에 걸쳐 분해하지 않는 궤적 수준 파라미터 귀인. 보고된 결과: Qwen-3.5-27B 로 WebArena-Lite 에서 No-Skill 기준선 대비 +6.69%, 테스트 시점 휴리스틱 설계 36개 중 28개 설정에서 매칭 기준선을 앞섬. 에이전틱 RL 과의 직접 비교는 보고되지 않았고 롤아웃 횟수도 공개되지 않아, 효율 주장은 컴퓨트가 아니라 메모리다 (source)

  • Anthropic AAR (2026-04-14): 9개 Claude Opus 4.6 인스턴스가 agentic RL 세팅에서 alignment 연구 문제(weak-to-strong supervision)를 1주간 수행 → PGR 97% vs 인간 연구자 23%. RL 에이전트가 실세계 연구 문제에서 인간을 대체한 첫 실증 케이스. → Automated Weak-to-Strong Researcher (AAR)

  • Self-Distilled Agentic RL (2026-05-16 HF Daily #3): Self-Distilled Agentic RL

  • Direct On-Policy Distillation / Direct-OPD (2026-07-06, Tsinghua AIR + ByteDance Seed): 값싼 약한 모델로 RL 을 돌린 뒤, RL 이 만들어낸 정책 변화분(Δ = log π_T − log π_{T,ref})만 on-policy distillation 으로 큰 모델에 옮긴다. 프런티어 규모에서 RLVR 이득을 배포하는 비용을 낮춘다. 프런티어 RL 이 비싼 Anthropic AAR 류 워크로드에 실질적인 비용 지렛대. → Weak-to-Strong Generalization via Direct On-Policy Distillation

  • 관련 prior work: ReAct, Reflexion, AutoGPT 류 (페이지 작성 예정)

  • 하네스들의 이름이 밝혀지고, 아무도 보고하지 않는 무결성 검사도 함께 나온다 (2026-08-18, 08-21 기록): LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents (arXiv:2608.17393) 은 Qwen3.5-35B-A3B 를 GSPO 로 수정하지 않은 프로덕션 하네스 세 곳 안에서 학습시킨다 — SWE-bench Verified 에서 OpenHands SDK 64.0% → 70.4%, Claude Code 62.4% → 68.2%, OpenCode 57.2% → 66.6%. Agent Lightning 이 감춘 것을 정확히, 그것도 세 번에 걸쳐 제공한다: 하네스의 정체. 메커니즘은 in-process LLM 프록시 와 트레이너 측 로그 확률 재계산 이며, 하네스가 롤아웃 도중 컨텍스트를 압축하거나 재직렬화해도 견딘다 — 그리고 그 분리가 파괴하는 양, 롤아웃–학습 확률 상관 0.99 초과 를 보고한다. 어떤 벤치마크 증분도 상관이 깨졌음을 드러내지 않으므로, 이 수치를 생략한 하네스 학습 논문은 자기 최적화가 유효했음을 보이지 않은 것이다 (source)

  • 레이블을 제거하기, 두 방향에서 하루에 (2026-08-21): Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL (arXiv:2608.17253) 은 파라미터를 공유하지 않는 분리된 모델 여러 개 를 동료 로부터 도출된 리워드로 최적화하고, 자기보상 RL 의 실패를 심판 품질이 아니라 오류 상관 의 문제로 규정한다 — 코호트 다양성(계열, 크기, 재진술 샘플)을 늘리면 붕괴를 굴리는 상관된 오류가 줄어든다. 텍스트 벤치마크 일곱 개에서 3.0–8.6%, 멀티모달 네 개에서 2.3–7.2% 를 정답 레이블 없이 얻으며, 감독 학습 방법과 동등하거나 그 이상이라고 명시된다. SPADE: Self-Play in Adaptive Synthetic Executable Environments (arXiv:2608.19197) 는 같은 의존성을 과제 쪽에서 제거한다: 하나의 LLM 이 reset/step 을 갖춘 완전한 실행 가능 학습 환경 을 작성하고, regret 추정치 — 특권적 힌트가 있을 때와 없을 때 학습자 리워드의 격차 — 로 조준해, 30B 에서 가장 강한 고정 환경 기준선 대비 평균 +5.3, BFCL-v4 멀티턴 +5.7, ACEBench-Agent +13.9 를 얻는다. Co-RL 은 레이블 없이 리워드 를, SPADE 는 과제 를 생성한다. 어느 쪽도 다른 쪽을 인용하지 않는다 (source)

열린 문제

  • 다단계 신용 할당 — Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements (arXiv:2608.17310) 는 이를 푸는 대신 궤적 수준 귀인으로 비껴가자고 제안한다
  • 도구 사용 환경에서의 보상 해킹 — LEGO-RL 은 세 기둥 중 하나를 통째로 단계별 방어 에 쓰고, SPADE 는 문제의 더 날카로운 형태를 안고 있다: 그 환경들은 자기 검증 코드를 직접 작성 하며, 그 저자는 학습 대상 에이전트와 가중치를 공유하는 모델이다. EnvHarness: Awakening Static Worlds for Agent Learning (arXiv:2608.19880) 는 반대 설계다: 원래의 신뢰받는 검증기를 유지 하고 그 둘레의 환경만 재구성한다 — 그래서 리워드 신호는 최적화되는 당사자가 결코 작성하지 않는다
  • 데이터 효율(온라인 RL 은 비싸다) — Direct-OPD 가 약한 모델 롤아웃으로 일부 해소. 그리고 이제 같은 이득을 두고 학습 없는 갈래가 경쟁한다: FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills (arXiv:2607.21596) 와 Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses (arXiv:2608.08466) 는 둘 다 모델을 얼린 채 스캐폴드만 진화시키면서 gradient 단계 없이 두 자릿수 이득을 보고한다 — Agents (LLM Agents) 참고. 읽은 어떤 자료도 두 경로를 같은 과제에서 비교하지 않았고, 그것이야말로 에이전틱 RL 이 다시 쓴 하네스로는 살 수 없는 무엇을 사고 있는지를 말해줄 실험이었다. 2026-08-31 WHALE: A Simple Recipe for Joint Harness-Weight Optimization 이 그 실험을 돌렸고, 답은 "도메인에 달렸다" 다 — weight-only, harness-only, 번갈아 돌리기를 Qwen3.5-2B/4B 로 같은 과제 위에서 비교했다. 하네스 탐색은 SearchQA 에서 훨씬 적은 rollout 으로 weight-only 최고 정확도에 도달하고, math 에서는 가중치 갱신 이후에만 정확도를 올린다. 번갈아 돌리기는 세 베이스라인을 4.15~24.38 pp 차로 이긴다. 즉 어느 경로도 우세하지 않고, 병목이 도메인 사이를 옮겨 다니며, 고정된 예산 분할은 어딘가에서 반드시 틀린다. 질문은 이제 닫힌 것이 아니라 경계가 지어졌다: 2B/4B 는 프런티어 규모가 아니고, 세 도메인 모두 검증 가능하며, 보상이 outcome-blind 인 곳에서 이 교차 방식이 유지되는지는 읽은 자료가 검증하지 않는다
  • 다중 교사 distillation 은 가산적이지 않다 — Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models (arXiv:2608.16647) 은 라우팅이 교사의 영향력을 가둘 수 없기 때문에 혼합 비율에 좌우되는 시소가 생긴다고 보고한다. 2026-08-28 의 두 결과가 이를 경험적으로 공격해 여유 회복 83.4% 와 97% 에 이르지만, 라우팅 논변을 다루는 대신 예산 배분과 스케줄링을 고쳐서 그렇게 한다 — Open-MOPD 는 벤치마크에서 라우팅 모호성을 제거하려고 오라클 라우팅을 명시적으로 사용하는데, 그것이 바로 원래 발견이 걸려 있는 변수다. 따라서 이 문제는 이전보다 더 잘 한정되었을 뿐 닫히지 않았다
  • 장기 구간 안정성

주요 논문

Referenced by

주간 종합 — W39 (2026-09-21 → 2026-09-27)A Case Study on Emergent Cheating and Whistleblowing in Autonomous Research SwarmsAgent Lightning v1.0: Towards Harnessed Agentic RL (arXiv:2608.17528)Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements (arXiv:2608.17310)AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scale (arXiv:2608.20634)에이전트 (LLM Agents)AI 정렬 (Alignment)Alibaba / Qwen AI LabAndrej KarpathyAnthropicAREX: Towards a Recursively Self-Improving Agent for Deep ResearchAspire: Can Models Self-Evolve from Vague Goals?Automated Weak-to-Strong Researcher (AAR)Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development (arXiv:2608.13417)Beyond Solver Verdicts: Generative Reward Models for AutoformalizationBeyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization (arXiv:2608.23311)Claude Managed AgentsClawGym II: Exploring Black-Box RL on Agent Harness (arXiv:2608.16798)Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL (arXiv:2608.17253)CodeMidas: Scaling Agentic Coding RL Environments from Code ItselfCoding Agents for Generalized Task and Motion Planning ProblemsContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RLDarwinX: Evolving Agent Harnesses Through Natural Selection (arXiv:2608.07545)DataPrep-Bench: Benchmarking LLMs as Training Data PreparatorsDoes On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement체화 에이전트 (Embodied Agents)ENPIRE: 실세계 에이전트 로봇 정책 자기개선EnvHarness: Awakening Static Worlds for Agent Learning (arXiv:2608.19880)평가 환경 격리평가 하네스 설정Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models (arXiv:2608.16647)EvoUndo: Recoverability-Constrained Self-Evolution for LLM Agent HarnessesFACET: Preserving Source Intent and Executable State in Terminal Task Synthesis (arXiv:2608.18580)FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning ExperienceFlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills (arXiv:2607.21596)Granite 4.2Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses (arXiv:2608.08466)How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review (arXiv:2608.08975)IBMIntern-S2-Preview: Scientific Agentic Foundation Model (arXiv:2608.13505)J-Zero: Unified Challenger–Solver–Judge Co-Evolution from Zero DataJim FanLaguna S 2.1Last Translation BenchmarkLearning to Solve Hard Problems in RL for LLMs by Never Giving UpLEGO-RL: Harness-Native Reinforcement Learning for Coding Agents (arXiv:2608.17393)LFM2.5-2.6BLiquid AILong-Horizon-Terminal-Bench (LHTB)MiMo-V2.6-ProMistral AIMolt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement LearningNegative Self-Distillation: Learning to Reason by Avoiding FlawsNVIDIAOn-Policy or Off-Policy Learning? A Systematic Study of Distillation DynamicsOpenAIPACT: From Credit Assignment to Critic AlignmentPoolside사후 학습 스케일링추론 모델Rethinking Critic Learning in PPO: Understanding and Mitigating Value FlatteningRethinking On-Policy Distillation of Large Language Models II: One Training ExampleRewardVerse: Rubric-Guided Policy Optimization for Video Reward ModelingRing-Zero: 창발적 추론을 위한 Zero RL의 1조 매개변수 규모 확장Scaling Automatic Research Agents via World Models매개변수가 아닌 수평선을 확장: 35B 에이전트로 1조 매개변수 성능 달성SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation (arXiv:2608.21500)SEED: 에이전트 강화학습을 위한 자기 진화 온폴리시 증류Self-Distilled Agentic Reinforcement LearningSkill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving SkillsSkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback (arXiv:2608.13120)SkillForge: Self-Distilling Agents for Project-Specific Issue Resolution (arXiv:2608.18933)Software 3.0Solipsistic Superintelligence is Unlikely to be CooperativeSPADE: Self-Play in Adaptive Synthetic Executable Environments (arXiv:2608.19197)SpeakerMem-R1: Speaker-Centered Dual-Track Memory for Multi-Party DialogueTencentThe Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement LearningThe Tasteful Agent: Measuring and Improving Taste in Long-Horizon TasksThinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See (arXiv:2608.17744)Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report (arXiv:2608.15763)TTPO: Test-Time Policy Optimization (arXiv:2608.27448)Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO (arXiv:2608.27351)Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms직접 온폴리시 증류를 통한 약한 모델에서 강한 모델로의 일반화주간 종합 — 2026-W21 (2026-05-11 ~ 2026-05-17)주간 종합 — 2026-W29 (2026-07-13 ~ 2026-07-19)주간 종합 — W37 (2026-09-07 → 2026-09-13)주간 종합 — W38 (2026-09-14 → 2026-09-20)WHALE: A Simple Recipe for Joint Harness-Weight OptimizationWhen EOS Tokens Disagree: Understanding Length Inflation in On-Policy DistillationWikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill EvolutionxAIXiaomiZ.ai

Sources