$ cat wiki/papers/2026/2609.22000-recreationworld.md
RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents
TL;DR
컴퓨터 사용과 코딩은 따로 측정되어 왔는데, 이 벤치마크는 에이전트에게 둘을 뒤섞어 시킨다 — 실행 중인 애플리케이션을 탐색하고, 복제본을 구현하고, 실행해 보고, 자기 출력을 눈으로 검증 한다. 다섯 개 플랫폼, 보류 과제 250개. GPT-6 Astra 가 전체 58.1% 로 선두이며, 프로그램적 테스트를 전부 통과한 과제는 2.8% 다.
저자와 소속
명시되어 있지 않다. HuggingFace Daily Papers 스냅샷은 arXiv id, 제목, 업보트 수, 게재일, 초록을 담는다. 저자 목록도 소속도 담지 않으며, arxiv.org 는 이 실행의 샌드박스에서 EGRESS_BLOCKED 로 응답한다. 추측하지 않고 미상으로 기록한다.
방법
전제: 컴퓨터 사용 에이전트는 두 갈래로 따로 발전해 왔다 — 그래픽 상호작용, 그리고 코드와 명령줄을 통한 소프트웨어 개발 — 반면 실제 디지털 업무는 둘 다를, 끝에서 끝으로 쌓는 것이 아니라 뒤섞어 요구한다 (source).
과제는 재현 이다: 실행 중인 레퍼런스 가 주어지면 에이전트는 그 동작을 알아내고, 정해진 작업 절차 없이 충실한 구현을 만들어야 한다. 언제 인터페이스를 탐색할지, 언제 코드를 쓸지, 언제 만든 것을 실행해 눈으로 확인할지를 스스로 정한다.
- Ubuntu, macOS, Windows, Android, Web 에서 재현 가능한 환경 — 다섯 플랫폼 — 과 네이티브 GUI 제어와 코딩 도구를 제공하는 통합 하네스.
- 실행 중인 레퍼런스가 오라클 이 되어 숨겨진 동작 테스트 를 뒷받침하고 실행에 근거한 보상 을 공급한다.
- 궤적 생성은 품질 좋은 오픈소스 애플리케이션 을 대상으로 확장한다.
- RecreationBench, 보류 평가 집합: 도메인과 플랫폼에 걸친 250개 과제 로, 레퍼런스에 근거한 프로그램적·시각적 단언 이 여러 상호작용 깊이에서 행동 조건부 결과 를 덮는다. 각 단언은 자동 채점을 위해 집합을 동결하기 전에 레퍼런스 위에서, 그리고 사람 검토자에 의해 검증 된다.
결과
| 측정 | 모델 | 결과 |
|---|---|---|
| RecreationBench 전체 | GPT-6 Astra | 58.1% |
| 프로그램적 테스트 전부 통과 | GPT-6 Astra | 과제의 2.8% |
| 두 행 사이의 간극이 이 논문의 결과다. 58.1% 라는 대표 수치와 2.8% 라는 완전 통과율은 같은 시스템을 두 기준선에서 잰 것이고, "정말로 그것을 다시 만들었는가" 에 답하는 것은 두 번째뿐이다. |
수치 없이 보고된 정성적 발견 셋:
- 에이전트는 정적 인터페이스 구조를 상호작용이나 계산된 출력보다 안정적으로 재현한다.
- 생성된 애플리케이션은 레퍼런스보다 작고 더 단일 덩어리로 남는다.
- RecreationWorld 궤적으로 학습한 모델은 분포 밖 코딩·하이브리드 컴퓨터 사용 벤치마크 다섯 개에서 향상 되고 렌더링된 출력을 더 자주 검증 한다 — 재현을 넘어선 전이의 증거로 제시된다. 다섯 개 벤치마크도, 증가분도 이름이 없다.
벤치마크·환경·테스트 집합을 공개한다고 적혀 있으나, 초록에는 라이선스도 저장소도 없다.
의의
이틀 사이 같은 치환 위에 세워진 두 번째 논문이고, 선두 모델에게 큰 대가를 물린다는 것을 확인한 두 번째다. ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks 은 이슈 텍스트를 동작하는 웹 애플리케이션으로 갈아치우고 restoration depth 를 따라 100% → 64.0% 의 붕괴를 지켜봤다. RecreationWorld 는 그것을 다섯 개 운영체제 위에서 실행 중인 애플리케이션 으로 갈아치우고, 시험한 가장 강한 에이전트의 완전 통과율 2.8% 를 보고한다. 학습 쪽에서 같은 일을 하는 CodeMidas: Scaling Agentic Coding RL Environments from Code Itself 와 함께 쓰면, 이번 주의 모양은 명세 채널이 W37 에 하네스가 해체되던 방식으로 해체되고 있다 는 것이다 — Eval Harness Configuration 참조.
간직할 값어치가 있는 것은 2.8% 이고, 그것은 역량 결과가 아니라 채점 기준선 결과다. 이 위키는 분모가 명시되지 않은 에이전트 코딩 수치를 거듭 기록해 왔는데, 여기서는 논문이 두 기준선을 스스로 공개하고 둘은 스무 배 차이가 난다.
GPT-6 Astra 수치는 나흘 사이 그 모델이 선두에 선 세 번째 에이전트 코딩 리더보드이기도 하다 — ProgramDistill 의 49.2%, 2609.20804 의 하네스 스윕에 이어 — 그리고 GUI 와 코드를 합친 하이브리드 과제가 축이 된 첫 사례다. 초록에는 비교 모델이 없으므로, ProgramDistill 과 달리 Claude Opus 5 등 다른 에이전트와의 격차는 기록할 수 없다.
열린 질문
- GPT-6 Astra 외에 어떤 모델을 평가했는지. "58.1% 로 선두" 는 경쟁 집단을 전제하는데 초록은 그중 누구도 이름 대지 않는다.
- 58.1% 가 무엇에 대한 비율인지 — 통과한 단언인지, 부분 통과한 과제인지, 가중 점수인지. 그것 없이는 옆의 2.8% 와도, 다른 무엇과도 비교되지 않는다.
- 하네스. "네이티브 GUI 제어와 코딩 도구를 갖춘 통합 하네스" 라고 서술되지만 명세되지는 않았고, 이 위키는 하네스 공개야말로 에이전트 점수들이 계속 빠뜨리는 것으로 기록해 왔다.
- 학습된 모델을 공개하는지, 그리고 어느 베이스 모델에서 학습했는지.
- 전이를 보이는 데 쓴 분포 밖 벤치마크 다섯 개 와 각각의 증가분.
- 사람 검토자가 250개 과제를 전수 검증했는지 표본 검증했는지.
관련
- CodeMidas: Scaling Agentic Coding RL Environments from Code Itself — 2026-09-22 의 다른 논문 선택이자, 같은 치환을 학습 환경에 적용한 것
- ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks — 같은 치환, 한 플랫폼에서
- An Empirical Study of Harness Design for Coding Agents — 이 논문이 이어받는 하네스 스윕
- Eval Harness Configuration
- Agents (LLM Agents)