AI Trend Notifier
EN한
← wiki

$ cat wiki/papers/2026/2610.11794-memento-3.md

Memento 3: 성찰적 규칙집을 통한 모델 기반 재귀적 자기개선

paper갱신 2026-10-10생성 2026-10-10

TL;DR

고정된 LLM 에이전트가 자연어 규칙집을 수정하고 실행 가능한 세계 모델 코드로 컴파일한 뒤, 관측된 상태 전이와 대조하여 수정을 검증한다. 기반 모델은 고정된 채 외부 메모리와 코드에서 개선이 이루어진다. (source)

저자와 소속

저자는 Haoyu Zhao, Zhengxu Yu, Zhiyuan He, Meng Fang, Rasul Tutunov, Haitham Bou-Ammar, Weilin Luo, Jun Wang이다. 저장된 초록 기록으로는 소속을 확인할 수 없다. 제출일은 2026-10-08이다. (source)

방법

규칙집은 수정 가능한 가설을 저장하고, 알 수 없는 동역학은 미지정 상태로 남긴다. 예측 오류가 성찰, 규칙 수정, 재컴파일을 유발한다. 새 코드는 LLM의 충실도 판단과 관측된 전이의 셀 단위 정확한 재현을 모두 통과해야 채택된다. 여러 세계 모델을 유지하는 확장 방식은 상호작용 근거를 공유하여 탐색 방향을 정한다. (source)

결과

단일 모델 에이전트는 공개 ARC-AGI-3 게임 25개의 모든 단계를 완료하고, 평균 Relative Human Action Efficiency (RHAE) 100.0을 기록하며, 사람 행동 수의 **44%**를 사용한다. Atari Pong 제어기는 서로 다른 시작 조건으로 시험한 세 에피소드에서 추가 LLM 호출 없이 각각 21:0으로 이긴다. 이는 저자가 보고한 공개 게임 및 사례 연구 결과이며, 초록은 비공개 시험 점수나 전체 학습 비용을 확정하지 않는다. (source)

의의

Agents (LLM Agents)와 World Models의 관점에서 이 연구는 LLM 가중치를 갱신하지 않고 상호작용으로 학습하는 구체적인 방식을 제시한다. 검증은 관측된 상태 전이를 확인하며, 모든 미관측 상태에서의 정확성을 입증하지는 않는다. (source)

열린 질문

  • 학습한 규칙은 관측된 전이와 공개 게임을 넘어 얼마나 잘 일반화되는가? (source)
  • 전체 탐색·컴파일 비용은 얼마이며, 채택 여부는 LLM 심사자에 얼마나 민감한가? 초록은 이를 미해결로 남긴다. (source)

인용

arXiv:2610.11794. 근거 범위는 제목, 저자, 초록이며 논문 전문은 읽지 않았다. (source)

Referenced by

Sources