$ cat wiki/papers/2026/2608.23552-prime-agent.md
Prime Agent: A Self-Improving RLM Harness (arXiv:2608.23552)
TL;DR
장기 지평 평가와 코딩 에이전트 작업을 위한 오픈소스 하네스로, Recursive Language Model 추상을 따르는 지속형 IPython REPL 위에 세워졌고, 여기에 히스토리·메모리·스킬· 프롬프트·서브에이전트 명세를 궤적 사이에 걸쳐 실어 나르는 Continual Harness 가 더해진다. 설계 목표로 내건 문장이 곧 주장이다 — "하네스의 실패가 모델의 실패가 되는 것을 막는다", 그리고 측정을 "모델의 진짜 최대 잠재 역량" 쪽으로 밀어 올린다. ARC-AGI-3 RHAE Best@1 을 30% 에서 95.5% 로 끌어올렸다고 보고한다 (source).
방법
논문이 세우는 틀. 언어 모델은 "순차 처리기"이지만, 장기 지평의 행위주체성은 모델 가중치와 활성 맥락 바깥의 정보와 연산을 필요로 한다. 그 바깥이 사는 곳이 하네스다.
명명된 네 구성요소:
- 지속형 IPython REPL — Recursive Language Model 추상을 따르며, 프로그램적 맥락 처리와 test-time compute 에 쓰인다.
- Continual Harness — 히스토리·메모리·스킬·프롬프트·서브에이전트 명세를 궤적 사이에 걸쳐 보존한다. 즉 한 번의 실행보다 오래 사는 상태다.
- 재귀적 서브에이전트, 직접적인 에이전트 간 통신으로 협응한다.
- Agents View — 데몬으로 떠 있는 세션을 사람이 들여다보고 관리하는 인터페이스.
논문이 주장하는 역할 분담. Prime Agent 는 "실행·복구·검증·자원 회계를 표준화하되 전략 구성은 모델에 남긴다". 초록 자신의 표현으로는 "마찰이 적고 표현력 있는 막".
결과
| 측정 | 보고값 |
|---|---|
| ARC-AGI-3 RHAE Best@1 | 30% → 95.5% |
| 또한 장문 맥락 코딩, GPU 커널 생성, 에뮬레이터 구축, 자율 nanoGPT 스피드런에 걸쳐 | |
| 네이티브 하네스 및 널리 쓰이는 하네스와 대등하거나 그 이상이라고 보고한다. | |
| Factorio 에서는 정련(refinement)이 연속적인 기술 진척을 가능하게 했고 전담 | |
| 서브에이전트가 병렬 작업을 가능하게 했다고 한다. |
이 수치들 어디에도 모델 이름이 없다 — 30% 기준선에도, 95.5% 에도. 주장 전체가 하네스와 모델을 분리하는 데 걸려 있으므로, 이 누락은 여느 때보다 더 문제가 된다.
의의
이 위키가 기록한 하네스 편차 중 가장 크며, 문제를 성립시킨 바로 그 벤치마크에서 나왔다. Eval Harness Configuration 는 2026-07-29 ARC-AGI-3 사건을 축으로 세워진 페이지이고, 그때 한 모델이 세 하네스에서 7.8% → 13.3% → 38.3% 로 움직였다 — 4.9× 편차다. 이번 보고는 같은 벤치마크 계열에서 30% → 95.5% 다.
두 숫자는 직접 비교할 수 없고, 이 페이지는 그 점을 명시한다. 앞의 수치들은 ARC Prize 와 OpenAI 가 보고한 ARC-AGI-3 점수다. 이번 것은 "RHAE Best@1" — 이 위키 어디에도 나오지 않는 측정 이름 — 을, 이름이 밝혀지지 않은 모델에 대해 잰 값이다. 95.5% 를 Claude Opus 5 가 2026-07-27 에 세운 검증된 SOTA 30.2% 와 나란히 읽는 것은 바로 그 페이지가 막으려고 존재하는 오독이다. 말할 수 있는 것은 더 좁고 여전히 말할 값어치가 있다: 제3자가 벤더가 보고한 것보다 큰 ARC-AGI-3 하네스 델타를 이제 발표했다. 이는 하네스가 변수라는 주장을 강화하되, 어떤 모델이 어디에 있는지는 전혀 정하지 않는다.
"하네스의 실패가 모델의 실패가 되는 것을 막는다"는 주장이 대놓고 진술되었다. Eval Harness Configuration 는 그 주장을 열하루치 논문에서 하나씩 함의로만 모아 왔다. 이번 것은 그것을 설계 목표로 단언하고, 오픈소스이므로 리더보드의 한 줄과 달리 검증 가능한 형태로 단언한다.
두 번째 자기개선 스캐폴드가 이틀 사이에 나왔다. Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses (arXiv:2608.08466) 와 FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills (arXiv:2607.21596) 를 합치면 이제 셋이다: 가중치는 얼어 있고, 그 주위의 것이 누적된다.
열린 질문
- 어느 모델인가? 모든 대표 수치에 모델이 없다. 3.2× 상승은 프런티어 모델에서와 작은 모델에서 뜻이 다른데, 읽은 어떤 것도 어느 쪽인지 말하지 않는다.
- RHAE 란 무엇이고, Best@1 은 무엇에 대한 것인가? Best@1 은 후보들 중의 선택을 함의한다 — 몇 개 중에서, 어떻게 골랐는지가 진술되지 않았고, 선택이 하네스의 일부라면 95.5% 의 일부는 스캐폴딩이 아니라 탐색이다.
- 기준선은 같은 모델을 맨 하네스에 얹은 것인가, 다른 시스템인가? "30% 에서"는 주장의 절반을 떠받치는데 출처가 없다.
- Continual Harness 는 궤적 사이에 무엇을 실어 나르며, 그것이 벤치마크 정보를 새게 하는가? 실행보다 오래 사는 상태야말로 held-out 과제 집합이 held-out 이기를 그만두게 만드는 기제다.
- 컴퓨트는 얼마나 드는가? test-time compute 가 기제로 명명되지만 예산도, 토큰 수도, 실측 시간도 주어지지 않는다.
인용
Prime Agent: A Self-Improving RLM Harness (2026). arXiv:2608.23552.
관련
- Eval Harness Configuration
- Agents (LLM Agents)
- Test-Time Compute (Inference-Time Compute Scaling)
- Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses (arXiv:2608.08466)
- FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills (arXiv:2607.21596)