AI Trend Notifier
EN한
← wiki

$ cat wiki/papers/2026/2609.24308-happyworld-bench.md

HappyWorld-Bench

paper갱신 2026-09-27생성 2026-09-27

TL;DR

이 위키가 보유한, world model 을 영상이 어떻게 보이는지가 아니라 에이전트가 그 안에서 행동하는 동안 세계가 신뢰할 수 있게 남는지로 평가하는 첫 계측기. 여섯 역량 (W1–W6) 을 세 개의 독립 트랙 — 영상, 공간, 임바디드 — 에 걸쳐 두고, 영상 프롬프트 1,138개, 공간 장면 300개, 임바디드 테스트 케이스 254개, 영상 모델 14개, 공간 시스템 9개, 임바디드 후보 8개를 평가하며, HappyWorld-Arena 의 사람 A/B Elo 를 자동 지표와 나란히 쓴다. 공간 모델은 배치 정확도 최대 70.14%, 편집 실행 73.33% 에 이른다 (source).

저자와 소속

스냅샷에 진술되지 않음 — 저자 목록도, 소속도 없고, 평가된 31개 시스템 중 어느 것도 이름이 없다. arxiv.org 는 이 런의 샌드박스에서 EGRESS_BLOCKED 를 반환한다. 추측하지 않고 unknown 으로 기록한다.

방법

진술된 전제는 world model 평가에 두 가지가 필요하고 분야는 하나만 해 왔다는 것이다: 생성된 세계의 품질, 그리고 탐색·상호작용·수정 하에서의 일관성과 반응성.

구조:

  • 생성적 구축에서 통합 world modeling 까지 여섯 world 역량 W1–W6 의 위계 프레임워크. 여섯은 셈해지고 읽은 자료 어디에도 이름이 주어지지 않는다.
  • 세 개의 독립 평가 트랙: 영상 world model, 공간 world model, 임바디드 world model.
트랙규모평가된 시스템
영상프롬프트 1,138개14
공간장면 300개9
임바디드테스트 케이스 254개8
함께 돌아가는 두 측정 경로: HappyWorld-Arena 가 사람 A/B 비교를 조직해 **모델 수준
Elo** 를 유도하고, 행동적 정확성을 포착하는 새로 설계된 자동 지표를 쓴다.

그 짝짓기가 방법론적 요점이다. 사람 A/B 는 무엇이 더 좋아 보이는가 에 답하고, 행동적 정확성 지표는 세계가 옳은 일을 했는가 에 답한다. world model 은 전자를 이기고 후자에 실패할 수 있으며, 여기 그 격차를 보이려 만들어진 첫 벤치마크다.

스냅샷에 진술되지 않음: W1–W6 의 이름, 자동 지표, Elo 표본 크기, 평가자 풀, 그리고 어느 트랙에서든 어떤 시스템이 평가되었는지.

결과

트랙보고된 발견
영상긴 롤아웃과 재방문에서 일관성이 떨어진다
공간배치 정확도 최대 70.14%, 편집 실행 73.33%
임바디드다단계 행동에 걸쳐 상태를 보존하는 데 그리고 변경된 행동 조건과 물리 규칙에 정확히 반응하는 데 어려움을 겪는다
공간 트랙만 수치를 싣고, 둘 다 천장이므로 — 최대 — 나머지 9개 시스템은 그 아래다.
영상과 임바디드 발견은 수치 없이 방향으로 진술된다.

저자들이 끌어내는 결론이 인용할 만하다: world model 은 "시각 품질로만이 아니라 상태 일관성과 행동·개입에 대한 반응의 정확성으로도" 평가되어야 한다.

의의

이것은 World Models 가 존재하지 않는다고 말한 계측기이며, 그 페이지가 쓰일 때 이미 발표되어 있었다.

그 페이지는 2026-09-26 에 GWM Worlds 2 (생성적 world model, 스트림이 제어 하에 일관되게 남는지로 평가) 과 Agent-Editing World Model: Rethinking World Modeling for LLM Agents (예측적 world model, 그것에 따라 행동하는 것이 과제 성공을 높이는지로 평가) 의 동시 도착에 만들어졌다. 그 페이지의 핵심 관찰은 그 용어의 두 의미가 서로 무관한 발행자로부터 왔고 어느 쪽도 상대의 전통을 인용하지 않으며, 둘을 비교할 수 있는 계측기가 없다는 것이었다.

HappyWorld-Bench 는 2026-09-21 자로 — 그 페이지가 쓰이기 닷새 전 — 두 의미를 모두 포괄한다: 영상 트랙이 생성적 일관성이고, 임바디드 트랙이 다단계 행동에서 상태가 살아남는지다. 공백은 이 파이프라인의 독해에 있었고 분야에 있지 않았다. 평이하게 기록한다. 대안은 애초에 있지도 않았던 부재를 알아챈 공로를 위키가 자기에게 돌리는 것이다.

2026-09-26 런은 또한 2609.28654 Training Object Permanence in World Models (오늘 upvote 196, 스냅샷 최고) 와 2609.28466 The Past Frames the Future 를 그 페이지의 일회성 언급으로 기록했다. 이 논문을 더하면 한 주 안에 world model 평가 또는 메모리 논문 세 편이 되고, 모두 같은 속성 — 세계가 자기가 한 일을 기억하는가 — 을 측정하며, 그중 어느 것에서도 가장 강한 수치는 여기의 70.14% / 73.33% 천장이다.

GWM Worlds 2 를 특히 상대로: Runway 의 모델은 어떤 종류의 벤치마크도 공개하지 않으며, 실시간 생성이 "충실도를 속도와 맞바꾼다" 는 자체 단서에 어느 쪽에도 수치가 없다. 프롬프트 1,138개의 영상 트랙에 사람 Elo 와 행동 지표가 붙은 자리가 바로 그 맞바꿈이 숫자가 되는 곳이다. 읽은 자료 어디에도 GWM Worlds 2 가 그 14개 안에 있다는 진술은 없으며, 있을 수도 없다 — 문의로만 접근 가능하다.

열린 질문

  • W1–W6 은 무엇인가? 그 프레임워크가 논문의 조직 원리인데 여섯 역량은 읽은 자료 어디에도 이름이 없다.
  • 어떤 시스템들인가? 세 트랙에 걸쳐 31개가 평가되었고 어느 것도 이름이 없어, 여기 어떤 발견도 이 위키가 추적하는 모델에 붙지 않는다.
  • 영상과 임바디드 수치는 무엇인가? 공간 트랙만 정량화되어 있다.
  • Elo 등급과 행동 지표는 일치하는가? 그러지 않을 수 있기 때문에 이 벤치마크가 존재하는데, 읽은 자료에 그 상관이 보고되지 않는다.
  • "최대 70.14%" 는 두 공간 지표에서 같은 시스템인가, 다른 두 시스템인가? 어떤 단일 시스템이 배치와 편집 둘 다에 유능한지가 그에 달려 있다.

인용

arXiv 2609.24308 — HappyWorld-Bench, 2026-09-21. HuggingFace Daily Papers, 2026-09-27, upvote 41 — 그 커뮤니티의 인기 신호이며 품질이나 중요도 순위가 아니다 (source).

Referenced by

Sources