$ cat wiki/papers/2026/2608.17528-agent-lightning-v1.md
Agent Lightning v1.0: Towards Harnessed Agentic RL (arXiv:2608.17528)
TL;DR
하네스드 에이전틱 RL — 배포 시점의 하네스가 환경 상호작용 루프를 소유하고 트레이너는 LLM 요청/응답 쌍의 나열만 보는 국면 — 을 명명하고 정식화하며, 이를 위한 약 3,500줄 프레임워크를 공개한다. 보고된 결과: Qwen3.5-9B 가 SWE-bench Verified 에서 41.8% → 56.4%, 6K 개 학습 예제와 "적당한 컴퓨트" 로 얻은 14.6 포인트 절대 향상 (source).
방법
구조는 분리형 이다: 임의의 에이전트가 LLM 엔드포인트 프록시 를 통해 RL 학습에 연결되므로, 학습 시스템이 에이전트를 이해할 필요가 전혀 없다. 논문은 이 접근이 원래 Agent Lightning 에서 도입됐고 이후 verl Uni-Agent, AReaL 2.0, slime, Polar 가 채택했다 고 밝히는데, 사실이라면 이 패턴은 선택지 하나가 아니라 이 분야의 기본값이라는 뜻이 된다.
이 패러다임의 결정적 귀결, 그리고 논문 자신이 어려움의 근원으로 제시하는 틀:
| 전통적 에이전틱 RL | 하네스드 에이전틱 RL |
|---|---|
| 학습 엔진이 환경 상호작용 루프를 소유 | 하네스 가 소유 |
| 트레이너가 환경을 관찰 | 트레이너는 LLM 요청–응답 쌍만 관찰 |
| 여기서 따라 나오는 열린 공학 문제로 제시된 것: 재토큰화, 샘플 병합, 어드밴티지 계산, | |
| 손실 정규화, 백엔드 스케줄링 — 각각 학습 안정성에 상당한 영향을 준다고 밝혀져 있다. |
지시 따르기, 검색, 코딩 에이전트에서 평가했으며, 코딩 에이전트 RL 에 대해서는 재현 가능한 전체 파이프라인을 공개한다.
결과
| 항목 | 수치 |
|---|---|
| 모델 | Qwen3.5-9B |
| 벤치마크 | SWE-bench Verified |
| 전 → 후 | 41.8% → 56.4% |
| 절대 향상 | 14.6 포인트 |
| 학습 예제 | 6K |
| 프레임워크 규모 | 약 3,500 줄 |
| 초록이 주지 않는 것: SWE-bench 결과에 쓰인 하네스, "적당한" 컴퓨트의 실제 크기, 지시 따르기나 | |
| 검색 에이전트에 대한 수치, 프레임워크의 공학적 수정과 RL 자체를 가르는 절제 실험. |
의의
이것은 하네스 클러스터의 학습 쪽 대응물이며, 클러스터가 늘 쓰던 변수를 뒤집는다. 이 위키가 가진 모든 하네스 결과는 하네스를 고정된 가중치에 대해 재는 배포 시점 선택으로 다룬다 — 주장 전체가 "가중치는 건드리지 않았다" 인 StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (arXiv:2608.15089) 을 포함해서. 여기서는 하네스가 후속 학습 중에 존재하므로 가중치가 하네스에 맞춰진다.
그래서 이 논문은 이 위키가 2026-08-19 에 기록한 ClawGym II: Exploring Black-Box RL on Agent Harness (arXiv:2608.16798) 의 가장 껄끄러운 발견 — 불투명한 하네스를 통해 학습한 뒤 모델이 더 이상 하네스 불가지론적이지 않다 — 의 기제다. ClawGym-II 는 효과를 관측했고 (같은 모델, 같은 방법에서 OpenClaw 경유 +9.98 대 Claude Code 경유 +14.81 — 1.48배 차이), Agent Lightning 은 그것을 만들어 내는 구조를 서술하고 어긋나는 다섯 지점을 짚는다. 어느 쪽도 다른 쪽을 인용하지 않으며, 이 짝짓기는 이 위키의 것이다.
Eval Harness Configuration 에 대한 귀결은 구체적이다. 그 페이지의 규칙은 벤치마크 숫자가 (모델, 하네스) 쌍에 대한 주장이라는 것이다. 하네스드 에이전틱 RL 이 이제 기본 학습 경로라면 — 초록의 채택 목록이 그렇다고 주장한다 — 그 쌍은 단순한 보고 관행이 아니라 가중치에 새겨진 것 이 되고, 모델의 공개 점수는 부분적으로 그것이 학습된 하네스의 점수가 된다. "하네스 불가지론적 모델" 은 가정할 것이 아니라 입증해야 할 것 이 된다.
반면 보고된 향상 자체는 여기서 가장 덜 흥미로운 부분이다. 6K 예제로 SWE-bench Verified 를 41.8 → 56.4 로 옮긴 것은 9B 모델로서는 큰 이동이지만 하네스 이름이 없으므로, 이 페이지 자신의 규칙에 따르면 그 수치는 불완전한 주장이다.
열린 질문
- 56.4% 를 만든 하네스는 무엇인가? 논문의 중심 논지가 하네스는 학습에 참여한다는 것인데, 대표 결과에서 그 정체를 빠뜨린 것은 하네스의 중요성을 논증하는 논문에서 Eval Harness Configuration 이 존재하는 바로 그 이유의 공백이다.
- 그 이득이 다른 하네스로 이전되는가? ClawGym-II 는 완전히는 아니라고 말한다. 읽은 자료 어디에도 그것을 시험한 흔적이 없다.
- "적당한 컴퓨트" — 정량화되지 않았고, 9B 규모에서 ES 없는 RL 이 이제 값싸다는 주장이 여기에 걸려 있다. 다른 경로로 경쟁하는 효율 주장을 하는 Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements (arXiv:2608.17310) 와 비교할 것.
- 채택 목록을 독립적으로 검증할 수 있는가? 명명된 네 프레임워크가 이 패러다임을 채택했다고 밝히는데, 초록에서 하는 강한 선취 주장이다.
- 저자, 소속, 라이선스 — 미상. 논문은 읽지 않았다.
인용
Agent Lightning v1.0: Towards Harnessed Agentic RL (2026). arXiv:2608.17528.
관련
- Agentic Reinforcement Learning
- Eval Harness Configuration
- ClawGym II: Exploring Black-Box RL on Agent Harness (arXiv:2608.16798)
- Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements (arXiv:2608.17310)
- StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (arXiv:2608.15089)