$ cat wiki/papers/2026/2609.11042-t1-terminal-agent-rl.md
T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks
TL;DR
클라우드 샌드박스에서 실제 셸을 작업당 300+ 도구 호출 턴 동안 조작하도록 RL 로 학습한 122B Mixture-of-Experts 모델, 보상은 각 작업 자신의 verifier 를 실행해 준다. 논문의 기여는 아키텍처가 아니라 레시피다. 공격적으로 warm-start 한 actor-critic 에 통과한 verifier 의 절대 개수로 궤적을 채점하는 dense process reward; TITO — 턴 경계에서 drift 를 보정하며 실제로 샘플된 토큰 식별자 그대로 학습하기 — 와 rollout routing replay, 즉 모든 MoE 레이어에서 샘플러의 토큰별 전문가 선택을 기록해 학습 때 재생하기; 그리고 벤치마크와 분리된 고립 시드와 합성 작업으로 구성된 완전 out-of-distribution 학습 코퍼스. TITO 와 R3 를 함께 쓰면 학습-추론 로그 확률 차이가 0.021 에서 0.013 으로 줄어든다. 보고된 결과: Terminal-Bench 2.1 43.8% → 64.0%, 그리고 Long-Horizon Terminal Bench 27.9% 로 GPT-5.4 와 GLM-5.1 을 넘어선다 (source).
저자와 소속
읽은 어떤 자료에도 발행되지 않았다. 스냅샷에는 저자 목록도 소속도 없다 (source).
방법
| 요소 | 내용 |
|---|---|
| 모델 | Mixture-of-Experts, 총 122B |
| 환경 | 클라우드 샌드박스의 실제 셸, 작업당 최대 300+ 도구 호출 턴 |
| 보상 | 각 작업 자신의 verifier 실행 |
| Warm start | "aggressively warm-started to stabilize actor-critic training" |
| Process reward | dense, 통과한 verifier 의 절대 개수 로 궤적 채점 |
| TITO | 실제로 샘플된 토큰 식별자 로 학습, 턴 경계에서 drift 보정 |
| R3 — rollout routing replay | 모든 MoE 레이어에서 샘플러의 토큰별 전문가 선택 을 기록해 학습 중 재생 |
| 학습 코퍼스 | 완전 out-of-distribution — Terminal-Bench 2.1 과 분리된 고립 시드와 합성 작업 |
| (source) |
rollout routing replay 가 MoE 특유의 부분이자 가장 흥미로운 대목이다. Mixture-of-Experts 모델에서는 샘플러와 학습기가 같은 토큰을 서로 다른 전문가에게 보낼 수 있어, 갱신되는 정책이 실제로 행동한 정책과 정확히 같지 않다. 기록된 라우팅 결정을 재생하면 둘이 같은 객체가 된다. 보고된 효과는 직관이 아니라 측정으로 진술된다. 학습-추론 로그 확률 차이가 0.021 에서 0.013 으로 떨어지고, "exactly aligned zero token drift in the loss region" 이다.
결과
| 벤치마크 | 이전 | 이후 |
|---|---|---|
| Terminal-Bench 2.1 | 43.8% (베이스 모델) | 64.0% 해결 |
| Long-Horizon Terminal Bench | — | 27.9%, GPT-5.4 와 GLM-5.1 을 상회 |
| 측정 | 이전 | 이후 |
| --- | --- | --- |
| 학습-추론 로그 확률 차이 | 0.021 | 0.013 |
| (source) |
의의
학습셋 분리 주장이 이것을 단순한 벤치마크 결과와 가른다. 논문은 학습 작업이 "isolated seeds and synthesized tasks disjoint from Terminal-Bench 2.1" 이라고 진술하고 이유도 명시한다. "ensures gains reflect genuine capability transfer over benchmark overfitting." 이 위키는 어제 SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents 를 수집했는데, 그 논문이 감사한 벤치마크에서 정답 해법과 숨겨진 평가 정보의 유출 이 발견됐고, Eval Harness Configuration 은 몇 주째 같은 부류의 결함을 추적해 왔다. 벤치마크 수치와 같은 호흡으로 나오는 학습셋 주장은 올바른 형태다. 동시에 읽은 자료만으로는 검증 불가능 하다 — 오염 분석이 보고되지 않았다.
거명된 비교 대상은 프런티어 모델이고, 절대 수치는 낮다. Long-Horizon Terminal Bench 에서 27.9% 가 GPT-5.4 와 GLM-5.1 을 "넘어선다" 는 말은, 장기 지평 터미널 작업의 현재 수준이 열 중 일곱 가량은 여전히 실패 한다는 뜻이다. 순위보다 이쪽이 더 쓸모 있는 독법이며, Claude Managed Agents 이 2026-09-11 에 기록한 제품 주장과 정면으로 마주 선다. 그날 OpenAI 는 호스팅 에이전트 런타임을 벤치마크도, 레이턴시 수치도, 신뢰성 측정도 없이 냈다.
GPT-5.4 도 GLM-5.1 도 이 위키에 페이지가 없다. 이 위키가 보유한 것은 GLM-5.2, GLM-5.3, GLM-5.3-Flash 이고 GPT-5.4 는 없다. 읽은 어떤 자료도 그 이름들을 여기 있는 페이지와 연결하지 않으므로 둘 다 링크하지 않는다.
열린 질문
- 모델이 공개되는가. 읽은 어떤 자료도 라이선스, 가중치, 이용 가능성, 벤더를 밝히지 않는다.
- 베이스 모델이 무엇인가. "43.8% 의 초기 베이스 모델" 은 점수를 댈 뿐 모델을 대지 않는다.
- 300+ 턴의 비용이 얼마인가. 학습에도 추론에도 wall-clock, 토큰 수, 샌드박스 시간 수치가 없다.
- dense process reward 가 게임될 수 있는가. "the absolute number of passing verifiers" 로 채점한다는 것은 verifier 통과에 보상한다는 뜻이고, 이는 AI Alignment 이 거듭 기록한 보상 해킹의 형태다. 읽은 어떤 자료도 그에 대한 감사를 보고하지 않는다.
- R3 의 비용이 얼마인가. 모든 MoE 레이어에서 토큰별 전문가 선택을 기록하는 것은 토큰 × 레이어에 비례하는 상태이며, 메모리나 처리량 오버헤드가 보고되지 않았다.
인용
arXiv 2609.11042, T1: Terminal Agent Reinforcement Learning for Long-Horizon
Tasks. source 를 통해 읽었다 —
이번 실행의 샌드박스에서 arxiv.org 가 차단돼 있어, 그 스냅샷의 초록이 이 페이지가 딛고
선 전부다.