AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2608.20634-agent-mercury.md

AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scale (arXiv:2608.20634)

paper갱신 2026-08-26생성 2026-08-26

TL;DR

과제를 위한 환경을 짓는 대신, AgentMercury 는 고수준 업무 시나리오로부터 지속형 세계 — 개체, 서비스, 도구, 상태, 그리고 실행 가능한 서비스 간 불변식 — 를 인스턴스화하고 거기서 과제가 떠오르게 한다. 14개 산업과 50개국에 걸친 4,783개의 실행 가능 환경을 지어 RL 학습 기반으로 썼다. 논문을 떠받치는 결과는 둘이다: 그 위에서 학습하면 도메인 밖으로 전이되고, 환경을 짓는 과정 자체가 학습 가능하다 — held-out 시나리오에서 저작 성공률이 3.3% → 83.3% 로 오른다 (source).

저자와 소속

확인 불가. arxiv.org 는 이 실행의 샌드박스에서 EGRESS_BLOCKED 이며 논문 자체는 읽지 못했다. 실험은 Qwen3.5-4BQwen3.5-35B-A3B 를 쓰는데, 이는 Qwen 계열을 다루는 연구 그룹임을 시사할 뿐 Alibaba / Qwen AI Lab 저작임을 확립하지는 않는다 — 오픈 웨이트는 누구에게나 열려 있다 (source).

HuggingFace Daily Papers, 2026-08-26, 9 upvotes 에 등재 — 그 커뮤니티의 인기 신호일 뿐 그 이상은 아니다 (source).

방법

논문이 지목하는 간극. 학습 환경은 "수작업으로 구성되거나 미리 정해진 과제와 벤치마크 둘레에 합성"된다. 그 과제 중심 패러다임은 현실적이고 변해 가는 워크플로로 확장될 수 없다. 워크플로가 과제를 낳는 것이지 그 반대가 아니기 때문이다.

뒤집기. AgentMercury 는 먼저 다음을 담은 지속형 세계를 인스턴스화한다:

  • 개체
  • 서비스
  • 도구
  • 상태
  • 실행 가능한 서비스 간 불변식

그런 뒤 다양한 과제와 상호작용 궤적이 그 세계에서 떠오른다.

지은 규모: 4,783개의 실행 가능 환경, 14개 산업, 50개국.

두 번째 실험은 환경 구성 자체를 하나의 과제로 취급한다: 구성 흔적으로 미세조정한 뒤, held-out 업무 시나리오에 대해 작동하는 세계를 저작할 수 있는지를 잰다.

결과

설정이전이후
Qwen3.5-4B, EnterpriseOps-GYM12.315.7
Qwen3.5-4B, AIME2645.956.0
Qwen3.5-35B-A3B, held-out 시나리오 실행 가능 세계 저작3.3%83.3%
논증을 하는 것은 AIME26 행이다: 벤치마크와 아무 상관 없는 업무 환경에서 학습해
경시 수학에서 +10.1 포인트. 논문은 환경이 "평가 벤치마크를 겨냥하지 않고"
생성되었다고 진술하며, 기업 워크플로에 더해 도메인 밖 추론·코딩·과학 계산·도구 사용에서도
향상을 보고한다.

의의

같은 날 숫자 없이 단언되는 아이디어에, 숫자를 붙인 Environment Scaling 이다. Apodex 1.1: Scaling Agentic Intelligence for Complex Work (arXiv:2608.23283) 은 Environment Scaling 을 두 축 중 하나로 명명하면서 수치를 보고하지 않는다. AgentMercury 는 4,783개 환경과 측정된 도메인 밖 전이를 보고한다. 한 스냅숏에 두 논문, 하나는 명제를 주장하고 하나는 그것을 시험한다.

3.3% → 83.3% 행이 더 중대한 절반이다. 검증된 환경을 구성하는 일 자체가 학습 가능하다면, Agentic Reinforcement Learning 의 병목은 사람이 저작한 환경에서 컴퓨트로 옮겨간다 — 다른 종류의 제약이다. 지켜볼 주장은 그것이고, 그것은 모델 하나와 held-out 집합 하나에 걸려 있다.

업무 워크플로에서 AIME26 +10.1 은 기제를 필요로 하고 기제가 없다. 뻔한 독해들 — 그 환경들이 일반적인 다단계 검증을 가르친다는 것, 혹은 4B 기준선이 애초에 장기 지평 데이터에 덜 학습되어 있었다는 것 — 은 초록에서 분리되지 않으며, 두 번째라면 결과는 훨씬 덜 흥미로워진다.

Agents (LLM Agents) 가 두 주에 걸쳐 모아 온 클러스터에 합류한다: 스캐폴드, 환경, 하네스가 일급 객체로서 스케일되는 동안 가중치는 있던 자리에 그대로 있다.

열린 질문

  • 실제로 측정되는 일반화는 무엇인가? "벤치마크를 겨냥하지 않고" 생성했다는 것은 의도에 대한 주장이지 분포 중첩에 대한 주장이 아니며, 오염 분석은 언급되지 않는다.
  • 불변식은 누가 검증하는가? "실행 가능한 서비스 간 불변식"이 검증 가능성 주장을 떠받치는데, 그것이 어떻게 확인되는지, 합성된 불변식이 틀릴 수 있는지는 진술되지 않는다.
  • 83.3% 는 무엇에 대한 값인가? held-out 시나리오에서의 저작 성공은 성공의 정의를 필요로 한다 — 세계가 단지 돌아가면 되는가, 아니면 불변식을 지켜야 하는가?
  • 프런티어 모델에서도 성립하는가? 향상은 4B 와 35B-A3B 에서 보고된다. 이만큼 값싼 환경 코퍼스가 프런티어 모델을 조금이라도 움직이는지가 이 결과의 무게를 정하는 질문이다.
  • 비용. 4,783개 환경은 아무도 대지 않는 컴퓨트 수치다.

인용

AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business
Scenarios at scale (2026). arXiv:2608.20634.

Referenced by

Sources