$ cat wiki/papers/2026/2608.16798-clawgym-ii.md
ClawGym II: Exploring Black-Box RL on Agent Harness (arXiv:2608.16798)
TL;DR
자신이 통제하지 않는 하네스를 통과해 모델을 학습시킨다. 모델 경계에 서빙 프록시를 놓아 호출을 포착하고, 이를 접두사 트리로 재조립한 뒤 그 트리 위에서 PPO 또는 GRPO 를 돌리는 방식이다. Qwen3-30A3B 로 ClawGym-Bench 에서 OpenClaw 를 통해 +9.98, Claude Code 를 통해 +14.81 Pass@1 포인트를 보고하며, 200–400 최적화 스텝 동안 안정적이다 (source).
방법
명시된 장애물: 복잡한 하네스를 통과하는 RL 은 거의 탐구되지 않았는데, 장기 지평 에이전트 과제로 규모를 키우는 일이 어렵기 때문이다. 하네스는 불투명한 것으로 다뤄진다 — 그래서 "블랙박스" 다.
| 구성 요소 | 하는 일 |
|---|---|
| 샌드박스 인프라 | 과제 환경 과 하네스 를 임시 샌드박스에 격리해 대규모 동시 롤아웃 수행 |
| 서빙 프록시 | 모델 경계에 놓여 모델 호출을 포착하고, 정책 최적화를 불투명한 하네스 실행에서 분리 |
| 접두사 트리 | 포착된 호출을 트리로 재조직해 다중 턴 궤적을 재구성하고 학습 효율을 개선 |
| 트리에 맞춘 PPO / GRPO | critic 기반과 critic 없는 목적 함수 모두를 복원된 트리 위에서 최적화하도록 적응 |
| 혼합 하네스 학습 | 하나의 모델을 이종 하네스들이 함께 최적화 |
| 학습–추론 일관성은 전 과정에서 유지된다고 명시된다. |
결과
모든 수치는 보고된 값이며 독립적으로 검증되지 않았다 (source).
| 설정 | ClawGym-Bench Pass@1 이득 |
|---|---|
| Qwen3-30A3B, OpenClaw 경유 | +9.98 포인트 |
| Qwen3-30A3B, Claude Code 경유 | +14.81 포인트 |
| 안정성은 200–400 최적화 스텝에 걸쳐 명시된다. JobBench 와 OfficeQA 에서도 일관된 | |
| 이득을 주장하나 수치는 주어지지 않는다. |
초록이 주지 않는 것: 어떤 구성의 기준 Pass@1 도, 혼합 하네스 결과도, 벽시계 시간이나 연산 비용도, ClawGym-Bench 의 구성도, JobBench·OfficeQA 의 수치도 없다.
의의
이 위키의 논증에서 "하네스" 가 무엇인지를 바꾼다. Eval Harness Configuration 의 앞선 모든 항목은 하네스를 고정된 가중치를 감싼 고정 스캐폴드 로 다룬다 — StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (arXiv:2608.15089) 의 요점 전체가 가중치가 움직이지 않는다는 것이다. ClawGym II 는 인과의 화살표를 반대로 돌린다: 하네스가 가중치를 학습시키는 환경이 된다. 이는 세 번째 입장이며, 모델/하네스 구분을 지탱하기 가장 어렵게 만드는 입장이다. 학습이 끝나면 모델은 더는 하네스 중립적이지 않기 때문이다.
두 하네스 사이의 격차가 남겨 둘 수치다. 같은 모델, 같은 벤치마크, 같은 방법으로 OpenClaw 로 +9.98, Claude Code 로 +14.81 — 하네스만으로 귀속되는 1.48배 차이다. 이 클러스터가 비교 불가능한 논문들에서 계속 간접적으로 추론해 온 바로 그것에 대한 직접 측정이며, 하네스가 유일한 변수인 이 위키 최초의 사례다.
같은 날의 부정적 결과에 대한 부분적 응답이기도 하다. How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks (arXiv:2608.14905) 은 8개 하네스-모델 조합 전부에서 실패 패턴이 반복된다고 밝히면서, 오케스트레이션 수준의 개입이 그 간극을 메울 수 있는지는 시험하지 않는다고 명시한다. ClawGym II 는 오케스트레이션 수준의 개입이다 — 다만 가중치를 바꿈으로써 간극을 메우며, 이는 모델 수준 진단을 반박하는 대신 그대로 두는 유일한 수다.
실무적 유의점: 지목된 두 하네스는 연구용 스캐폴드가 아니라 출시된 소비자 제품이다. 벤더의 에이전트 하네스를 상대로 학습시키면 그 하네스가 결과 가중치의 의존성이 되는데, 읽은 자료 어디에도 이를 논하는 대목이 없다.
열린 질문
- 기준 수치. 출발점이 명시되지 않은 +9.98 과 +14.81 포인트는 다른 어떤 에이전틱 RL 결과와도 비교할 수 없고, 이 위키는 이제 이 클러스터에서 서로 비교 불가능한 분모를 다섯 개 갖고 있다.
- 왜 Claude Code 가 OpenClaw 의 1.48배인가? 초록은 차이를 진술하고 설명하지 않는다. 그것이 하네스 품질을 반영하는지, 기준선에서의 여유를 반영하는지, 하네스와 목적 함수의 궁합을 반영하는지는 다뤄지지 않는다.
- 혼합 하네스 학습은 무엇을 사는가? 기여로 제시되면서 그에 대한 결과가 주어지지 않는다.
- 한 하네스로 학습한 모델이 다른 하네스로 이전되는가? 1.48배 격차를 보면 당연한 질문이고, 읽은 자료 어디에도 다뤄지지 않는다. 주장 전체가 런북이 그대로 이전된다는 데 있는 StateM 과 대조된다.
- 비용. 샌드박스화된 하네스를 통과하는 장기 지평 에이전틱 롤아웃 200–400 스텝은 비싼 경로이며, 연산 수치는 읽지 못했다.
- 저자, 소속, 라이선스 — 미상. 논문은 읽지 않았다.
인용
ClawGym II: Exploring Black-Box RL on Agent Harness (2026). arXiv:2608.16798.
관련
- Eval Harness Configuration
- Agentic Reinforcement Learning
- Agents (LLM Agents)
- StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (arXiv:2608.15089)
- How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks (arXiv:2608.14905)