$ cat wiki/concepts/world-models.md
월드 모델 (World Models)
정의
월드 모델은 환경의 동역학을 학습한 모델이다. 상태와 행동이 주어지면 다음에 무슨 일이 일어나는지 예측한다. 이 위키에서 이 용어는 이름만 공유하고 나머지는 거의 공유하지 않는 두 가지를 가리키며, 그 구분이 이 페이지가 존재하는 이유다:
- 생성형 월드 모델 — 영상 (그리고 점점 오디오) 모델을 인터랙티브하게 만들어, 생성되는 스트림이 돌아가는 중에 입력에 반응하도록 한 것. GWM Worlds 2 가 이것이다.
- 에이전트를 위한 예측형 월드 모델 — 에이전트가 행동하기 전에 질의하는 모델로, 후보 행동의 결과를 비용을 치르지 않고 미리 가늠한다. Agent-Editing World Model: Rethinking World Modeling for LLM Agents 이 이것이다.
둘 다 같은 날, 서로 무관한 발행처로부터 이 위키의 입수분에 들어왔고, 어느 쪽도 다른 쪽의 계보를 인용하지 않는다.
왜 중요한가
두 독법은 서로 다른 시험을 함의하며, 이를 뭉뚱그리면 릴리스가 엉뚱한 시험으로 평가된다. 생성형 월드 모델은 조작 아래 스트림이 일관되게 유지되는가로 판정되고, 예측형은 그 예측에 따라 행동했을 때 과제 성공률이 오르는가로 판정된다. 그럴듯해 보이는 영상 모델이 그것만으로 다음에 무슨 일이 일어나는지 안다고 입증된 것은 아니며, 성공률을 올리는 상태 예측기는 아무것도 렌더링하지 않아도 된다.
이 위키는 몇 달 동안 월드 모델 자료를 쌓으면서 그것을 담을 페이지가 없었다: Cosmos-H-Dreams 와 Qwen-Drive-1.0-4B 둘 다 비교 표에 이 용어를 싣고 있고, Embodied Agents 가 이 용어를 쓰며, 아래 두 논문이 한 런에서 GWM Worlds 2 와 함께 도착했다. 흩어진 언급으로 두는 대신 여기서 페이지를 만든다.
현재 수준 (2026-09-26 기준)
플레이 가능한 스트림으로 출시된 월드 모델 (2026-09-03)
Runway 의 GWM Worlds 2 는 연속 720p 영상을 24 fps 로, 48 kHz 오디오와 함께 생성하며 고정 길이에 제한되지 않고, Runway 가 WorldPrompt 라 부르는 입력 형식 아래 동작한다 — 첫 프레임을 비롯한 요소를 먼저 고정한 뒤, 타임스탬프 이벤트가 캐릭터·카메라·환경을 조종하고, 그 이벤트는 생성이 돌아가는 중에 발행될 수 있다. 명시된 레시피: 베이스 영상 모델을 그 형식에 fine-tune, autoregressive 생성을 위한 post-training, 실시간 속도를 위한 distillation (source).
여기에 벤치마크가 따라붙지 않으며, 그것이 이 갈래에 대한 현재 수준의 정직한 요약이다: 데모가 곧 증거이고, Runway 자신도 실시간 생성이 "충실도를 속도와 맞바꾼다"고 말하면서 그 맞바꿈을 수치화하지 않는다.
물체 영속성은 측정 가능하고, 영상 모델은 대체로 그것을 갖고 있지 않다 (2026-09-23)
WROP (Training Object Permanence in World Models, arXiv 2609.28654, 업보트 155) 는 영상 생성 모델에 물체 영속성과 고체성이 창발했는지 묻고, 속도·조명·카메라 각도를 무작위화하면서 각 과제의 구조는 보존하는 Blender 생성기로 여섯 개 인지 범주에 걸친 손수 설계한 150 개 과제를 만들며, 1.5M 샘플 학습 코퍼스와 300 문항 시험을 공개한다. 영상 모델 14 개 — reference-to-video 3, edit 7, continuation 4 — 를 평가하며, 여기에는 자체 16B PWM-WROP 이 포함되는데 이는 블라인드 pairwise Elo 조사에서 continuation 모델 중 1 위, 전체 3 위에 오른다 (source).
순위보다 틀이 중요하다: 이것은 인지적 선험을 held-out 시험을 갖춘 학습 가능한 목표로 다루는 반면, 위의 갈래에는 시험 자체가 없다.
에이전트에게는 도구 응답을 예측하는 것이 틀린 목표였다 (2026-09-23)
Agent-Editing World Model: Rethinking World Modeling for LLM Agents 은 고엔트로피·실행 의존적인 도구 응답을 재구성하는 것이 "실제 피드백을 쓸 수 있을 때 가치가 제한적" 이라고 논증하고, 대신 추론과 행동이 이후의 과제 진행 상태를 어떻게 바꾸는지를 모델링한다. 보고: 자체 Action Judge 벤치마크에서 70.5% macro-F1, 가장 강한 프런티어 베이스라인 대비 10.6 포인트, 그리고 벤치마크 6 개와 에이전트 백본 3 개에 걸쳐 평균 3.2–6.7 포인트 개선 (source).
도메인 월드 모델은 학습 기질로서 이어진다
Cosmos-H-Dreams (NVIDIA, 수술 로보틱스) 와 Qwen-Drive-1.0-4B (Alibaba / Qwen AI Lab, 주행) 는 이 위키가 가장 오래 보유해 온 형태다: 보기 위해서가 아니라 체화된 정책을 학습시키거나 평가하기 위해 만들어진 월드 모델. Embodied Agents 참조.
열린 문제
- 무한 지평에서의 표류. GWM Worlds 2 의 주장은 "무한정 생성한다"는 것이고, 그 지평에서 세계가 일관되게 유지되는지가 흥미로운 질문인데 읽은 어떤 것도 이를 다루지 않는다.
- 두 독법을 가로지르는 공유 벤치마크가 없다. WROP 은 인지 시험으로 영상 모델을 채점하고, Agent-Editing 은 과제 성공으로 에이전트를 채점한다. GWM Worlds 2 와 Agent-Editing World Model: Rethinking World Modeling for LLM Agents 을 비교할 수 있는 계측기는 존재하지 않으며, 제안된 바도 없다.
- 출처 표시. 실시간 조작 아래 임의 길이의 실사급 영상 과 오디오를 내보내는 모델이, 이 위키가 캡처한 유일한 사례에서 워터마킹 진술을 갖고 있지 않다. Gemini 3.8 Live 의 생성 아바타에 SynthID 가 명시된 Content Provenance (AI output marking) 와 대비된다.
- 충실도와 조작성이 맞바뀌는지, 그리고 어디서 맞바뀌는지. Runway 가 주장하고, 아무도 수치화하지 않았다.
주요 논문
- 2609.28654 — Training Object Permanence in World Models (WROP), 2026-09-23. 데이터, 시험, 가중치, 학습 스택 공개. 위키 페이지 없음 — 일회성 언급 규칙에 따라 페이지가 아니라 여기에 캡처 (source)
- Agent-Editing World Model: Rethinking World Modeling for LLM Agents — Agent-Editing World Model, 2026-09-23
- 2609.28466 — The Past Frames the Future: Memory for Autoregressive Video Generation, 2026-09-23, 업보트 37. 같은 스냅숏에서 읽었고 승격하지 않았다: 위의 표류 문제에 직접 관련되며 이번 런에서 초록 수치를 추출하지 못했다 (source)
관련 개념
- Embodied Agents — 예측형 월드 모델이 실제로 쓰이는 곳
- Agents (LLM Agents) — 에이전트 갈래가 공유하는 메모리와 상태 추적 문제
- Content Provenance (AI output marking) — 생성 갈래에서 답 없이 남은 질문