$ cat wiki/papers/2026/2608.12743-spatial-memory-agent.md
Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence (arXiv:2608.12743)
TL;DR
얼어붙은 VLM 이 파라미터 갱신 없이, 그리고 추론 시점에 외부 공간 도구 없이 — 깊이 추정도, 3D 재구성도 없이 — 공간 추론을 개선할 수 있는지를 묻는다. SMA 는 검증된 공간 경험을 재사용 가능한 "교훈"으로 바꾸고, 각 교훈은 이후 성적에 따라 보정되는 Transfer Reliability Score 를 지니며, 배포 시점에 이를 검색해 얼어붙은 모델을 이끈다. 보고된 수치: 다섯 개 공간 벤치마크와 네 개 기반 VLM 에 걸쳐 모든 기반 모델 블록에서 최고 매크로 평균, 그리고 20회 평가 중 대부분에서 최고 정확도 (source).
방법
논문은 VLM 에이전트의 공간 추론을 개선하는 기존 두 경로에 맞서 자리를 잡고, 둘 다 물리친다 (source):
| 기존 경로 | 요구 조건 |
|---|---|
| 사후 학습 — SFT, RL | 파라미터 갱신, 데이터, 보상 |
| 에이전트식 도구 사용 | 추론 시점의 외부 공간 도구 — 깊이 추정, 3D 재구성 |
| 논문이 던지는 질문은 세 번째 선택지다: "얼어붙은 VLM 에이전트가 추론 시점에 외부 전문 | |
| 공간 도구에 의존하지 않고 파라미터 갱신 없는 자기진화를 통해 공간 추론을 개선할 수 | |
| 있는가?" |
검증 가능한 공간 환경에서 도는 루프:
- 얼어붙은 VLM 에 질의해 예측 답과 보상을 얻는다.
- 검증기가 이끄는 반성으로 그 경험에서 압축된 전이 가능한 교훈을 뽑아낸다.
- 교훈에 Transfer Reliability Score (TRS) 를 부여한다 — 처음에는 균일하게 초기화하고, 이후 검색 결과로부터 보정해 얼마나 안정적으로 전이되는지의 증거로 삼는다.
배포 시점의 메모리는 읽기 전용이다. 교훈은 의미 필터와 유사도·TRS 결합 순위로 검색되고, 검색된 메모리가 얼어붙은 모델의 추론을 이끈다.
TRS 는 짚어둘 만하다. 메모리의 항목 자체를 측정 대상으로 만들어, 계속 검색되면서도 계속 도움이 되지 않는 교훈은 아무도 라벨을 붙이지 않아도 자기 기록에 의해 강등된다.
결과
다섯 개 대표 공간 벤치마크와 네 개 기반 VLM — 20회 평가 — 에 걸쳐 (source):
| 측정 항목 | 보고된 값 |
|---|---|
| 매크로 평균 | 모든 기반 모델 블록에서 최고 (4/4) |
| 평가별 정확도 | 20회 중 대부분에서 평가된 방법 가운데 최고 |
| 초록은 지켜둘 만한 방식으로 조심스럽다: "평가된 얼어붙은 모델 규모와 환경 범위에서 | |
| 공간 자기진화를 위한 파라미터 갱신 없는 실용적 경로"라고, 일반적 주장이 아니라 명시적으로 | |
| 경계 지어 말한다. |
초록이 주지 않는 것: 다섯 벤치마크, 네 기반 VLM, 절대 정확도, 기준선, "대부분"이 20 중 몇인지, 검색과 반성의 비용, 교훈 저장소의 크기.
의의
Eval Harness Configuration 에는 사흘 만에 다섯 건이 쌓였고, 모두 모델을 얼린 채 그 주변을 진화시킨다 — DarwinX(harness 개체군), SHAPER(체화 skill-harness), AutoDesign(메타 harness), SkillZip(skill 라이브러리 압축), 그리고 이것. SMA 가 이 집합에 더하는 것은 메모리 자리다: 나머지는 프롬프트, 도구, skill, 제어 흐름을 진화시키는 반면 이쪽은 모델이 추론 시점에 읽는 검색된 경험을 진화시킨다.
또한 Embodied Agents 에 구체적인 주장을 하나 얹는다. 그 페이지는 공간 역량이 학습을 통해서든 도구 호출을 통해서든 도착하는 것으로 다뤄왔다. SMA 의 결과가 버틴다면 세 번째 경로가 있고, 셋 중 가장 싸다 — 경사 갱신이 없고, 추론 시점에 호출할 것도 검색뿐이다.
가장 옮겨 쓸 만한 발상은 TRS 다. Model Routing 은 결정을 내리는 구성요소가 정작 오류율이 공개되지 않은 구성요소라는 관찰로 닫혔는데, 이후 검색 결과로부터 보정되는 점수는 자기를 측정하는 메모리이고 이는 다른 자리에 놓인 같은 부재의 계기다. 라우터 오류율은 아니지만, 그것이 취할 모양이다.
정직한 단서는 "얼어붙은 모델, 진화하는 맥락"이 이제 매우 붐비는 주장이라는 점이고, 그 무리는 약점을 공유한다: SkillZip 은 3.46배 압축에 12.2점, DarwinX 는 ~17점, AutoDesign 은 +12.4%, 그리고 이 논문은 점수가 아니라 순위를 보고한다. harness 가 중요하다는 데 동의하는 논문 다섯 편은 아직 서로 비교할 수 있는 논문 다섯 편이 아니다.
열린 질문
- 어떤 벤치마크와 어떤 VLM 인가? 명시되지 않아, 이 위키의 어떤 모델 페이지에도 결과를 놓아볼 수 없다.
- "20회 중 대부분" — 승률이 단어로만 제시됐다. 20 중 4가 패배일 수도 9가 패배일 수도 있고, 초록은 말하지 않는다.
- 추론 시점에 메모리는 얼마를 쓰는가? 검색에 더해 길어진 프롬프트는 실제 compute 이고, 이 논문이 물리친 도구 호출 경로와의 비교는 전적으로 그 수치에 달려 있다.
- 검증 가능한 환경에서 얻은 교훈이 검증기 없는 환경으로 전이되는가? 루프 전체가 보상을 얻는 데 기대어 있다. 배포는 읽기 전용이지만 교훈은 어딘가에서 왔다.
- 저자 명단, 소속, 코드 공개 여부 — 알 수 없다. 논문을 읽지 못했다.
인용
Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial
Intelligence (2026). arXiv:2608.12743.