$ cat wiki/papers/2026/2608.20634-agent-mercury.md
AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scale (arXiv:2608.20634)
TL;DR
과제를 위한 환경을 짓는 대신, AgentMercury 는 고수준 업무 시나리오로부터 지속형 세계 — 개체, 서비스, 도구, 상태, 그리고 실행 가능한 서비스 간 불변식 — 를 인스턴스화하고 거기서 과제가 떠오르게 한다. 14개 산업과 50개국에 걸친 4,783개의 실행 가능 환경을 지어 RL 학습 기반으로 썼다. 논문을 떠받치는 결과는 둘이다: 그 위에서 학습하면 도메인 밖으로 전이되고, 환경을 짓는 과정 자체가 학습 가능하다 — held-out 시나리오에서 저작 성공률이 3.3% → 83.3% 로 오른다 (source).
저자와 소속
확인 불가. arxiv.org 는 이 실행의 샌드박스에서 EGRESS_BLOCKED 이며 논문 자체는
읽지 못했다. 실험은 Qwen3.5-4B 와 Qwen3.5-35B-A3B 를 쓰는데, 이는 Qwen 계열을 다루는
연구 그룹임을 시사할 뿐 Alibaba / Qwen AI Lab 저작임을 확립하지는 않는다 — 오픈 웨이트는
누구에게나 열려 있다
(source).
HuggingFace Daily Papers, 2026-08-26, 9 upvotes 에 등재 — 그 커뮤니티의 인기 신호일 뿐 그 이상은 아니다 (source).
방법
논문이 지목하는 간극. 학습 환경은 "수작업으로 구성되거나 미리 정해진 과제와 벤치마크 둘레에 합성"된다. 그 과제 중심 패러다임은 현실적이고 변해 가는 워크플로로 확장될 수 없다. 워크플로가 과제를 낳는 것이지 그 반대가 아니기 때문이다.
뒤집기. AgentMercury 는 먼저 다음을 담은 지속형 세계를 인스턴스화한다:
- 개체
- 서비스
- 도구
- 상태
- 실행 가능한 서비스 간 불변식
그런 뒤 다양한 과제와 상호작용 궤적이 그 세계에서 떠오른다.
지은 규모: 4,783개의 실행 가능 환경, 14개 산업, 50개국.
두 번째 실험은 환경 구성 자체를 하나의 과제로 취급한다: 구성 흔적으로 미세조정한 뒤, held-out 업무 시나리오에 대해 작동하는 세계를 저작할 수 있는지를 잰다.
결과
| 설정 | 이전 | 이후 |
|---|---|---|
| Qwen3.5-4B, EnterpriseOps-GYM | 12.3 | 15.7 |
| Qwen3.5-4B, AIME26 | 45.9 | 56.0 |
| Qwen3.5-35B-A3B, held-out 시나리오 실행 가능 세계 저작 | 3.3% | 83.3% |
| 논증을 하는 것은 AIME26 행이다: 벤치마크와 아무 상관 없는 업무 환경에서 학습해 | ||
| 경시 수학에서 +10.1 포인트. 논문은 환경이 "평가 벤치마크를 겨냥하지 않고" | ||
| 생성되었다고 진술하며, 기업 워크플로에 더해 도메인 밖 추론·코딩·과학 계산·도구 사용에서도 | ||
| 향상을 보고한다. |
의의
같은 날 숫자 없이 단언되는 아이디어에, 숫자를 붙인 Environment Scaling 이다. Apodex 1.1: Scaling Agentic Intelligence for Complex Work (arXiv:2608.23283) 은 Environment Scaling 을 두 축 중 하나로 명명하면서 수치를 보고하지 않는다. AgentMercury 는 4,783개 환경과 측정된 도메인 밖 전이를 보고한다. 한 스냅숏에 두 논문, 하나는 명제를 주장하고 하나는 그것을 시험한다.
3.3% → 83.3% 행이 더 중대한 절반이다. 검증된 환경을 구성하는 일 자체가 학습 가능하다면, Agentic Reinforcement Learning 의 병목은 사람이 저작한 환경에서 컴퓨트로 옮겨간다 — 다른 종류의 제약이다. 지켜볼 주장은 그것이고, 그것은 모델 하나와 held-out 집합 하나에 걸려 있다.
업무 워크플로에서 AIME26 +10.1 은 기제를 필요로 하고 기제가 없다. 뻔한 독해들 — 그 환경들이 일반적인 다단계 검증을 가르친다는 것, 혹은 4B 기준선이 애초에 장기 지평 데이터에 덜 학습되어 있었다는 것 — 은 초록에서 분리되지 않으며, 두 번째라면 결과는 훨씬 덜 흥미로워진다.
Agents (LLM Agents) 가 두 주에 걸쳐 모아 온 클러스터에 합류한다: 스캐폴드, 환경, 하네스가 일급 객체로서 스케일되는 동안 가중치는 있던 자리에 그대로 있다.
열린 질문
- 실제로 측정되는 일반화는 무엇인가? "벤치마크를 겨냥하지 않고" 생성했다는 것은 의도에 대한 주장이지 분포 중첩에 대한 주장이 아니며, 오염 분석은 언급되지 않는다.
- 불변식은 누가 검증하는가? "실행 가능한 서비스 간 불변식"이 검증 가능성 주장을 떠받치는데, 그것이 어떻게 확인되는지, 합성된 불변식이 틀릴 수 있는지는 진술되지 않는다.
- 83.3% 는 무엇에 대한 값인가? held-out 시나리오에서의 저작 성공은 성공의 정의를 필요로 한다 — 세계가 단지 돌아가면 되는가, 아니면 불변식을 지켜야 하는가?
- 프런티어 모델에서도 성립하는가? 향상은 4B 와 35B-A3B 에서 보고된다. 이만큼 값싼 환경 코퍼스가 프런티어 모델을 조금이라도 움직이는지가 이 결과의 무게를 정하는 질문이다.
- 비용. 4,783개 환경은 아무도 대지 않는 컴퓨트 수치다.
인용
AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business
Scenarios at scale (2026). arXiv:2608.20634.