$ cat wiki/papers/2026/2609.28416-agent-editing-world-model.md
Agent-Editing World Model: Rethinking World Modeling for LLM Agents
TL;DR
에이전트를 위한 언어 월드 모델은 환경 관찰을 예측한다. 이 논문은 "실제 피드백을 쓸 수 있을 때 고엔트로피·실행 의존적인 도구 응답을 재구성하는 것은 가치가 제한적" 이라고 논증하고, 대신 추론과 행동이 이후의 과제 진행 상태를 어떻게 바꾸는지를 모델링한다. AEWM 은 자체 Action Judge 벤치마크에서 70.5% macro-F1 — 가장 강한 프런티어 베이스라인 대비 +10.6 — 에 이르고, EditAct 통합은 벤치마크 6 개와 백본 3 개에서 3.2–6.7 포인트를 개선한다 (source).
저자와 소속
스냅숏에 명시되어 있지 않다 — 저자 목록도 소속도 없다. arxiv.org 는 이 런의
샌드박스에서 EGRESS_BLOCKED 를 반환한다. 추측하지 않고 미상으로 기록한다.
방법
명시된 두 문제이고, 두 번째는 이 위키가 전에 보유하지 않은 것이다:
- 도구 응답 예측은 가치가 낮은 일이다. 도구 응답은 고엔트로피이고 실행 의존적이며, 실제 응답을 쓸 수 있다 — 그래서 모델은 그냥 관찰하면 될 것을 재구성하는 데 용량을 쓴다.
- 과제 상태 오염. "뒷받침되지 않은 가정과 낡은 계획이 이력에 남아 이후 결정을 왜곡한다." 에이전트 자신의 앞선 추론이 오류원이 된다.
AEWM (Agent-Editing World Model) 은 관찰이 아니라 과제 진행 상태를 두 구성 요소로 모델링한다:
| 구성 요소 | 역할 |
|---|---|
| Action Judge | 결정을 Critical, Exploratory, Noisy 로 분류 |
| State Revision | 같은 관찰 이력으로부터 잡음 섞인 reasoning–action 연속을 편집 |
| EditAct 는 이 둘을 실제 실행과 통합하며, 명시된 차이가 이 논문에서 가장 | |
| 날카로운 문장이다: 그것은 **단지 비평을 제공하는 것이 아니라 이후 결정의 기저가 되는 | |
| 상태를 직접 바꾼다**. 나쁜 단계에 주석을 다는 비평자는 그 나쁜 단계를 이력에 그대로 | |
| 남기지만, 이것은 그것을 고쳐 쓴다. |
학습: Search, Terminal, Software Engineering 에 걸친 mid-training 과 supervised fine-tuning. 추가 변형인 AEWM-RFT 는 검증된 EditAct 트래젝토리에 대한 rejection sampling fine-tuning 을 적용한다.
결과
| 설정 | 수치 |
|---|---|
| Action Judge 벤치마크 (논문 자체의 것) | 70.5% macro-F1, 가장 강한 프런티어 베이스라인 대비 +10.6 |
| 벤치마크 6 개 × 에이전트 백본 3 개 | 가장 강한 베이스라인 대비 평균 +3.2 ~ +6.7 포인트 |
| AEWM-RFT 대 Self-RFT, 도메인 3 개 | +2.2 ~ +2.6, 온라인 AEWM 가이던스 없이 |
| AEWM-RFT 줄이 가장 하중을 받으면서 가장 덜 강조된다: 이득이 **체크포인트에 구워질 수 | |
| 있고** 추론 시점에 월드 모델을 돌리지 않아도 유지된다는 뜻이다. |
스냅숏에 명시되지 않은 것: 벤치마크 6 개의 이름, 백본 3 개, +10.6 이 측정된 프런티어 베이스라인, Action Judge 를 제외한 모든 절대 점수, 그리고 Action Judge 벤치마크의 규모. 70.5% 는 저자들이 만든 계측기 위의 수치이며, 이는 이 위키가 추적하는 Eval Harness Configuration 패턴이다 — 주장은 비교적이고, harness 는 주장하는 쪽의 것이다.
의의
이것은 World Models 의 에이전트 지향 독법이며, 생성형 독법인 GWM Worlds 2 와 같은 런에 캡처됐다 — 그리고 어느 쪽도 다른 쪽의 계보를 인용하지 않는다. 한쪽은 보고 조종할 세계를 생성하고, 다른 쪽은 에이전트가 더 잘 행동하도록 과제 상태를 예측한다. 둘은 이름과 입수 날짜를 공유한다.
에이전트 문헌 안에서 이 발견은 이번 주 같은 모양의 세 번째다. 같은 스냅숏의 Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents 은 원본 트래젝토리를 보존하며 쓰기 시점에 그것을 압축하기를 거부하는데, 근거는 아직 가서 볼 수 있는 것을 요약해서는 안 된다는 것이다. 이 논문은 같은 이유로, 거의 같은 방식으로 도구 응답 예측을 거부한다. 서로 무관한 두 그룹, 한 스냅숏, 하나의 원칙.
오염 결과는 두 논문 모두와 다른 방향을 가리키고 더 불편한 쪽이다: 에이전트의 이력은 불완전한 기록일 뿐 아니라 능동적인 오류원이며, 해법은 그것을 편집하는 것이다. 그것은 이력을 짧게 만드는 Context Compaction 과도, 그중에서 고르는 retrieval 과도 다른 자세다.
열린 질문
- 이력을 편집하면 감사 가능성에서 무엇을 잃는가? reasoning 이 수정된 트래젝토리는 더 이상 에이전트가 무엇을 했는지의 기록이 아니다. 읽은 어떤 것도 그것이 사후 검토에 무엇을 하는지 다루지 않으며 — Safety Monitoring and Data Retention 이 그것에 의존한다.
- Action Judge 벤치마크는 공개되어 있는가? 핵심 수치를 싣고 있고 저자들 자신의 것이다.
- 어떤 벤치마크 6 개, 어떤 백본 3 개인가? 일반성 주장이 전적으로 그것들에 기대는데 스냅숏에는 하나도 이름이 없다.
- Critical / Exploratory / Noisy 분류가 도메인 이동에서도 유지되는가? Search, Terminal, Software Engineering 에서 학습되었고, 그 분류가 이후 모든 것의 축이다.
인용
arXiv 2609.28416 — Agent-Editing World Model: Rethinking World Modeling for LLM Agents, 2026-09-23. HuggingFace Daily Papers, 2026-09-26, 업보트 13 — 해당 커뮤니티의 인기 신호일 뿐이며 품질이나 중요도의 순위가 아니다 (source).