$ cat wiki/papers/2026/2609.11561-map-wam.md
Memory as Plans: World-Action Modeling with Memory-Grounded Planning
TL;DR
로봇 정책은 대개 마르코프적이고, 실제 조작 과제는 상당수가 그렇지 않다. MaP-WAM 은 기억 의존적 제어를 기억 기반 계획 과 계획 조건부 실행 으로 나눠, 긴 멀티모달 에피소드 맥락을 실행기에 통째로 먹이는 대신 계획 시점의 근거 로 쓴다. RMBench 83.3%, 실제 로봇 과제 78.0%, 이력이 길어져도 실행기 추론 지연은 "거의 일정" (source).
저자와 소속
명시되지 않음 — HuggingFace Daily Papers 스냅샷은 id, 제목, 날짜, 업보트, 초록만 담는다. 1 차 자료 미확인.
방법
기존 기억 메커니즘 — 언어 요약, 커지는 시각 윈도, 또는 둘의 조합 — 의 문제로 명시된 것은 "세밀한 시각적 증거를 잃거나" 아니면 "이력 커버리지와 실행 효율 사이의 트레이드오프에 부딪친다" 는 점이다.
- 완료된 구간 기록으로서의 기억: 각 기록은 언어 지시와 희소한 시각 맥락 을 담으며, 전체 프레임 이력이 아니다.
- 압축된 계획: 에피소드 기억은 다음 구간 수준의 언어 계획 과 그에 대응하는 시각적 가이던스 로 변환된다.
- World-Action-Progress (WAP) 모델: 각 계획을 미지의 길이 동안 수행하되, 추론 시점에 행동 청크와 실행 진행도를 함께 예측 하고, 그 진행도를 계획-관측 정렬 로 보정해 적응적 구간 전환과 폐루프 맥락 갱신을 한다.
- 실행기 컨텍스트 길이 고정, 그리고 구조화된 어텐션 으로 계획과 실행 양쪽에서 key-value 캐싱 이 가능해진다.
결과
| 주장 | 수치 |
|---|---|
| RMBench 성공률 | 83.3% (state-of-the-art 로 명시) |
| 실제 로봇 과제 | 78.0% 성공 |
| 과제 이력 대비 실행기 추론 지연 | 거의 일정 |
| 베이스라인 수치도, 절제 실험 수치도, 과제 개수도 초록에 없으므로, state-of-the-art | |
| 주장은 보고된 것이고 그 격차는 아니다. |
의의
흥미로운 수는 수치가 아니라 구조적인 것이다: 이력은 계획 시점에 소비되고 실행기의 컨텍스트는 고정되므로, 기억하는 비용이 매 행동 단계마다 따라붙지 않는다. 그것은 Agents (LLM Agents) 가 장기 소프트웨어 에이전트에 대해 기록해 온 것과 같은 압력 — 컨텍스트 증가가 가장 자주 돌아야 하는 루프를 열화시키는 것 — 을, 증가를 가장 드물게 도는 부분으로 옮겨 푸는 방식이다.
확인해야 할 것은 일정 지연 주장 인데, 그것이 이 접근을 배치 가능하게 만드는 성질이고, 초록이 그 성질을 부사("거의") 하나와 측정 없음으로 뒷받침하기 때문이다. → Embodied Agents
열린 질문
- 베이스라인 부재. 83.3% 는 무엇에 대비한 것인가? 논문이 반박하는 언어 요약·커지는 윈도 메커니즘의 RMBench 수치가 주어지지 않는다.
- 잘못된 계획의 대가는? 미지의 길이에 걸친 구간 수준 계획이란, 잘못된 구간 경계는 실행기가 볼 수 없는 실패라는 뜻이다. 초록은 보정이 존재한다고만 말하고 그것이 얼마나 자주 필요한지는 말하지 않는다.
- 실제 로봇 과제 집합이 서술되지 않는다 — 명시되지 않은 개수의 과제에서, 명시되지 않은 하드웨어로 78.0%.
- 저자와 소속이 미상 이므로 조직 가중치는 적용하지 않았다.
인용
- arXiv: 2609.11561
- HuggingFace Daily Papers 를 통해 포착, 2026-09-14, 업보트 36 — 해당 커뮤니티의 인기 신호일 뿐 품질 순위가 아니다 (source)