$ cat wiki/papers/2026/2609.27321-vhd-play.md
Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms
TL;DR
환경 생성 파이프라인은 세계를 먼저 만들고 보상을 나중에 붙인다. VHD-Play 는 수학적 모델을 먼저 표집해 풀고, 그 결정 과정을 stateful tool 로 렌더링한다 — 그래서 실행 가능한 dynamics 와 궤적 채점 기준이 같은 풀린 모델에서 함께 유도된다. 3,300개 환경을 각 몇 센트에 만들고, 세 계열로 Qwen3.6-35B-A3B 를 학습시키면 평균 agentic score 가 0.204 에서 0.815 로 오른다 (source).
저자와 소속
스냅샷에 진술되지 않음 — 저자 목록도, 소속도 없다. arxiv.org 는 이 런의
샌드박스에서 EGRESS_BLOCKED 를 반환한다. 추측하지 않고 unknown 으로 기록한다.
학습된 모델은 Qwen3.6-35B-A3B 이고 비교 대상은 Qwen3.7-Max 로, 둘 다 Alibaba / Qwen AI Lab 모델이지만 이는 소속 주장이 아니다.
방법
기존 파이프라인의 진술된 결함은 순서 문제이고, 논문의 기여 전체가 그것을 뒤집는 데 있다:
기존 생성 파이프라인은 통상 환경의 outcome rule 을 정의하거나 궤적에 주석을 달기 전에 환경을 구축하여, dynamics 와 평가를 사후에 정렬하도록 남겨 둔다.
VHD-Play 의 순서는 대신:
- 수학적 모델을 표집해 푼다 — 해가 알려진 기제.
- 코퍼스에 접지된 setter 가 그 풀린 모델의 결정 과정을 stateful tool 로 렌더링한다.
- 실행 가능한 dynamics 와 궤적 채점 기준이 둘 다 풀린 모델에서 유도된다 — 따로 쓰였다가 맞춰지는 것이 아니다.
결과적으로 보상이 사후에 검증되는 것이 아니라 구성상 올바르다. 비용은 환경당 몇 센트, 환경 3,300개 생성으로 진술된다.
스냅샷에 진술되지 않음: 어떤 수학 계열이 쓰이는지, setter 가 무엇인지, 어떤 코퍼스가 그것을 접지하는지, "stateful tool" 이 구체적으로 무엇인지, 채점 기준이 풀린 모델을 궤적별 점수로 어떻게 변환하는지.
결과
| 측정 | 수치 |
|---|---|
| 생성된 환경 | 3,300개, 각 몇 센트 |
| Qwen3.6-35B-A3B, 다섯 계열 진단의 평균 agentic score | 0.204 → 0.815 |
| 일반화 | 학습한 세 계열 모두의 held-out 인스턴스, 그리고 본 적 없는 기제 계열 8개 |
| 외부 전이 | 일반 function calling, 여행 계획, 365일 e-commerce |
| E-Commerce Bench | 학습된 체크포인트가 파산 없이 모든 실행을 완주하고 Qwen3.7-Max 를 능가 |
| 어블레이션이 결과이고, 점수가 아니다. 논문은 서술형 문제를 **파라미터를 드러내거나 | |
| 감추는 stateful 버전**과 비교하고, **학습 가능한 격차의 대부분이 근본적인 문제 해결이 | |
| 아니라 stateful 상호작용에 있다**고 보고한다. 이는 에이전트형 RL 이 실제로 무엇을 | |
| 가르치는지에 관한 주장이다 — 수학이 아니라 stateful 인터페이스를 조작하는 일. |
두 스케일링 결과: 동결된 35B setter 가 더 큰 환경을 실현하고, 규모를 맞춘 학습이 기제 크기와 지평이 커져도 이득을 유지한다 — "진화하는 학습 기질의 가능성" 을 시사한다고 진술된다.
0.204 → 0.815 는 4× 이동이며 척도가 정의되지 않았다. 읽은 자료 어디에도 agentic score 가 무엇을 측정하는지, 범위가 얼마인지, 0.815 가 천장에 가까운지 진술되지 않는다. 정의되지 않은 척도 위의 네 배 이득은 이 위키의 다른 어떤 것과도 비교할 수 없고, 그렇게 취급하지도 않는다.
의의
Agentic Reinforcement Learning 은 고정된 환경 집합 안에서 credit assignment 를 고치는 방법들을 축적해 왔다 — 가장 최근에는 PACT: From Credit Assignment to Critic Alignment 와 그 토큰 수준 credit 유일성 증명. VHD-Play 는 다른 입력을 공격한다: 환경이 애초에 어디서 오는가.
PACT: From Credit Assignment to Critic Alignment 와의 짝짓기는 거의 정확하고 둘은 서로를 인용하지 않는다. PACT 는 환경이 주어졌을 때 올바른 credit 신호가 무엇인지 증명한다. VHD-Play 는 credit 신호가 설계되는 대신 유도되도록 환경을 만든다. 하나는 보상의 이론이고, 다른 하나는 보상이 손으로 쓰이는 단계를 제거한다.
이 런의 다른 주제와도 반대편에서 맞물린다. 같은 날 캡처된 ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds 는 시스템이 학습받지 않은 규칙을 배울 수 있는지 측정하고, 세계를 낯설게 만들어 사전학습 회상을 통제한다. VHD-Play 는 규칙이 알려져 있고 감춰진 세계를 제조한다. 같은 통찰 — 검증 가능한 낯선 기제가 희소 자원이라는 것 — 을 한 번은 학습에, 한 번은 시험에 쓴 것이며, 하루 차이로 발표되고 어느 쪽도 서로를 인용하지 않는다.
이것을 유망한 결과가 아니라 대표 결과로 만들 수 있는 것: 외부 전이가 function calling, 여행 계획, e-commerce 로 가는데 이들은 도구 사용 벤치마크다. 읽은 자료 어디에도 이 위키가 이미 추적하는 벤치마크로의 전이가 없다 — SWE-bench 없음, τ²-bench 없음, ALFWorld 없음 — 그래서 Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents 이나 여기 다른 어떤 것과도 나란히 놓을 수 없다.
열린 질문
- agentic score 는 무엇인가? 범위, 구성, 천장이 모두 진술되지 않으며 모든 대표 수치가 그것으로 표현된다.
- 어떤 기제 계열인가? "세 계열" 과 "본 적 없는 여덟 계열" 은 셈해지고 이름이 주어지지 않아 일반화 주장의 크기를 잴 수 없다.
- setter 의 코퍼스가 다양성을 제한하는가? 코퍼스에 접지된 setter 는 기술할 수 있는 기제만 렌더링할 수 있고, 기질은 "진화한다" 고 주장된다.
- Alibaba 것이 아닌 모델에서도 살아남는가? 백본 하나, 비교 대상 하나, 둘 다 같은 계열.
- 오염 이야기는 무엇인가? 풀린 수학적 모델에서 생성된 환경은 "hidden dynamics" 가 함축하는 것보다 사전학습 데이터에 가까울 수 있고, 읽은 자료에 그 검사가 없다 — ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds 가 자기 벤치마크를 중심으로 세운 바로 그 통제다.
인용
arXiv 2609.27321 — Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms, 2026-09-23. HuggingFace Daily Papers, 2026-09-27, upvote 12 — 그 커뮤니티의 인기 신호이며 품질이나 중요도 순위가 아니다 (source).