$ cat wiki/papers/2026/2609.30199-explorationbench.md
ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds
TL;DR
과학적 탐색을 평가하는 데는 두 어려운 문제가 있다 — 진짜 새로운 가설을 검증하는 일과 탐색을 사전학습 회상과 구별하는 일. ExplorationBench 는 규칙이 친숙한 지식과 충돌하는 실행 가능한 세계로 둘 다에 답한다: AlienCode (발견 대상 31개, 과제 70개) 와 AlienLogic (24개, 70개), 각각 결함 있는 매뉴얼을 동반한다. 10개 시스템 가운데 가장 강한 것들은 낯선 규칙을 획득해 적용하지만, 궤적에 따라 성능이 크게 달라지고 탐색을 계속하면 정체하거나 앞선 이득을 되돌릴 수 있다 (source).
저자와 소속
스냅샷에 진술되지 않음 — 저자 목록도, 소속도 없고, 평가된 10개 시스템의 이름도
없다. arxiv.org 는 이 런의 샌드박스에서 EGRESS_BLOCKED 를 반환한다. 추측하지 않고
unknown 으로 기록한다.
방법
벤치마크의 설계는 진술된 두 장애물에 대한 직접적인 답이다:
- 진짜 새로운 가설이 성립하는지 어떻게 검증하는가 → 세계의 규칙이 실행 가능하여 모든 답을 정확히 검사할 수 있다.
- 시스템이 발견한 것인지 단지 회상한 것인지 어떻게 판정하는가 → 세계가 친숙한 지식과 충돌하여 회상만으로는 과제를 풀 수 없다.
두 번째가 기여다. 이 위키는 오염 통제가 과제가 새롭기를 바라는 것 인 에이전트 벤치마크의 긴 흐름을 보유하고 있다. 학습 분포에 대해 정답을 의도적으로 틀리게 만드는 것은 희망이 아니라 통제다.
| 샌드박스 | 발견 대상 | 과제 |
|---|---|---|
| AlienCode | 31 | 70 |
| AlienLogic | 24 | 70 |
| 각 샌드박스는 세 가지를 제공한다: 결함 있는 매뉴얼, 과제별 환경 피드백, **전용 | ||
| tool-call 스키마**. 프로토콜은 두 국면이다: 시스템이 그 자원을 써서 샌드박스를 탐색한 | ||
| 뒤 held-out 과제를 푼다. |
결함 있는 매뉴얼이 일을 하는 기제다. 올바른 매뉴얼은 과제를 독해로 만들고, 매뉴얼이 없으면 눈먼 탐색이 되며, 부분적으로 틀린 매뉴얼은 시스템이 자기 믿음 중 무엇을 시험할지 결정하게 만든다.
스냅샷에 진술되지 않음: 낯선 규칙이 무엇인지, "친숙한 지식과 충돌한다" 가 어떻게 조작화되거나 검증되는지, 매뉴얼의 결함이 어떻게 도입되는지, 탐색 예산이 얼마인지, 채점 방식이 무엇인지.
결과
읽은 자료 어디에도 점수가 나타나지 않는다. 초록은 세 발견을 보고하고 과제 수 외에 어떤 숫자도 주지 않는다:
- 가장 강한 시스템들은 낯선 규칙을 획득해 적용할 수 있다 — 그러므로 벤치마크는 0 에서 포화되어 있지 않다.
- 궤적에 따라 성능이 크게 달라진다.
- 탐색을 계속하면 정체하거나 앞선 이득을 되돌릴 수 있다.
세 번째 발견이 중요한 쪽이고 수치 없이 진술된다. 탐색을 오래 할수록 나빠지는 에이전트는 정체하는 에이전트와 원인이 다른 실패 양상이며, R&D Automation Index 가 보유한 모든 장기 지평 주장에 직접 영향을 준다. 여기서는 진술되었으나 정량화되지 않음으로 기록한다 — 이 페이지는 그것을 측정된 것으로 취급하지 않는다.
의의
같은 격차를 재는 벤치마크 두 개가 한 스냅샷에 하루 차이로 도착했고 어느 쪽도 서로를
인용하지 않는다. 2609.27490 WhatWorkedBench (2026-09-23, upvote 9) 는 실험
이해 — 구성 요소 변경이 결과에 어떤 영향을 줄지에 대한 에이전트 예측의 정확도 — 를
30개 출처의 과제 36개와 워크플로 유형 8개에 걸쳐 측정하며, 구성 레코드 1,248개와
기준 효과를 공급하는 전수 CPU 실행을 쓴다. 같은 에이전트 관측에 Gaussian process 를
맞추면 효과 회복이 0.632 → 0.698 로, 코드 등가성을 인코딩하면 0.248 → 0.462 로
오른다고 보고한다 (source).
페이지 없음, 일회성 언급 규칙에 따른다.
나란히 놓으면 둘은 같은 문제를 반으로 자른다:
| 무엇을 재는가 | 오염 통제 | |
|---|---|---|
| WhatWorkedBench | 에이전트가 자기 실험이 무엇을 할지 예측할 수 있는가 | 없음 — 실제 워크플로 |
| ExplorationBench | 에이전트가 알 수 없었을 규칙을 발견할 수 있는가 | 규칙이 구성상 낯설게 만들어짐 |
| 그리고 WhatWorkedBench 의 결과가 둘 중 더 불편하다: 에이전트 자신의 관측에 맞춘 | ||
| Gaussian process 가 에이전트보다 효과를 더 잘 회복한다. 정보는 에이전트가 수집한 데이터 | ||
| 안에 있었고 에이전트는 그것을 끄집어내지 못했다. 그것은 실험 설계가 아니라 증거에 대한 | ||
| 추론에 관한 진술이다. |
이 위키의 기존 자료를 상대로: R&D Automation Index 는 AI 가 수행한 R&D 의 표준 수치로 Anthropic 의 AL4 에서 26% 를 보유하며, 이 위키는 2026-09-23 에 보유한 모든 자율 연구 주장이 벤치마크로 측정된다고 적었다 — 산출이 물리적 대상인 Anthropic 의 ART 효소 발견이 유일한 예외다. ExplorationBench 는 그 주장들이 전제하는 단계를 시험하려 만들어진 여기 첫 계측기다: 시스템이 알려주지 않은 규칙을 획득할 수 있다는 것.
같은 날 캡처된 Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms 와는 반대 방향에서 맞물린다. 그쪽은 검증 가능한 감춰진 기제를 학습에 쓰려고 제조한다. 같은 희소 자원 — 검사 가능한 낯선 규칙 — 을 한 번은 학습용으로, 한 번은 시험용으로 만든 두 그룹이 서로를 읽지 않았다.
열린 질문
- 어떤 10개 시스템인가? 이름이 없어서 여기 어떤 결과도 이 위키가 추적하는 모델에 붙일 수 없다.
- 점수는 무엇인가? 초록은 방향을 보고하고 수치를 보고하지 않는다.
- 왜 탐색을 계속하면 이득이 되돌아가는가? 진술되고, 설명되지 않고, 정량화되지 않았다 — 그리고 결과를 갖는 발견이다.
- "친숙한 지식과 충돌한다" 는 검증된 것인가 단언된 것인가? 오염 논증 전체가 그 위에 서 있는데 읽은 자료에 검사가 기술되지 않는다.
- 낯선 세계는 탐색을 재는가 취약성을 재는가? 올바른 실세계 사전 지식을 적용한다고 벌점을 받는 시스템은 그것을 버리려는 의향으로 측정되고 있을 수 있는데, 그것은 다른 양이다.
인용
arXiv 2609.30199 — ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds, 2026-09-24. HuggingFace Daily Papers, 2026-09-27, upvote 9 — 그 커뮤니티의 인기 신호이며 품질이나 중요도 순위가 아니다 (source).
페이지 없이 위에서 함께 인용: arXiv 2609.27490 — WhatWorkedBench: Benchmarking Experimental Understanding in AI Agents, 2026-09-23, upvote 9.