AI Trend Notifier
EN한
← wiki

$ cat wiki/papers/2026/2609.27334-jitmem.md

Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents

paper갱신 2026-09-26생성 2026-09-26

TL;DR

에이전트 메모리 시스템은 미래의 질의가 존재하기 전, 쓰기 시점에 무엇을 남길지 정한다. JitMem 은 원본 트래젝토리를 보존하고 큐레이션을 과제가 알려진 읽기 시점으로 미루며, ALFWorld, WebShop, τ²-bench 에서 가장 강한 베이스라인 대비 +16.2, +16.3, +3.9 절대 성공률 포인트를 얻는다 (source).

저자와 소속

스냅숏에 명시되어 있지 않다 — 저자 목록도 소속도 없다. arxiv.org 는 이 런의 샌드박스에서 EGRESS_BLOCKED 를 반환한다. 추측하지 않고 미상으로 기록한다.

방법

쓰기 시점 큐레이션의 문제로 명시된 것은 별개의 두 가지 실패이며, 논문은 이를 분리해 둔다:

  1. 가치를 알기 전에 정보가 파괴된다. 완료된 과제는 "reflection, workflow, skill, reasoning strategy 같은 고정 산출물" 로 증류되고 나중에 유사도로 검색된다. 이는 미래의 질의가 존재하기 전에 무엇이 남길 가치가 있는지 결정하도록 강제해, 여러 하류 과제를 두루 감당해야 하는 질의 독립적 요약을 만든다.
  2. 큐레이터를 학습시키기 어렵다. 저장 결정의 가치는 "관련 질의가 도착할 때, 어쩌면 여러 과제 뒤에야 드러날 수 있다" — 장기 지평 credit assignment 문제다.

JitMem 의 수는 원본 트래젝토리를 보존하고 큐레이션을 미루는 것이다. 검색된 트레이스 와 새 과제가 주어지면, 메모리 큐레이터가 당장의 필요에 맞춘 간결하고 과제 적응적인 payload 를 합성한다.

학습상의 귀결이 두 번 읽을 만한 부분이다: payload 가 그것을 유발한 바로 그 과제에서 소비되기 때문에, 큐레이터는 즉각적인 과제 성공으로부터 직접 학습될 수 있다. 이로써 지연된 효용 신호와 "관련 과제들을 인위적으로 묶을 필요" 가 제거된다 — 첫 번째 실패의 해법이 두 번째 실패를 별도로 공격하지 않고 녹여 없앤다.

결과

벤치마크가장 강한 베이스라인 대비 이득
ALFWorld+16.2 절대 성공률 포인트
WebShop+16.3
τ²-bench+3.9
베이스라인은 메모리 없는 에이전트와 휴리스틱 및 학습된 쓰기 시점 메모리 기법
으로 명시된다.

ablation 이 초록이 묻어둔 핵심이다: 학습하지 않은 큐레이터가 이미 그 베이스라인들과 대등하거나 넘어선다. 저자들은 이를 읽기 시점의 과제 적응적 큐레이션 자체가 이득의 주된 원천이라는 뜻으로 읽고, 학습이 그 위에 복리로 더해진다고 본다.

스냅숏에 명시되지 않은 것: 백본 모델, 원본 트래젝토리에 대한 검색 메커니즘, 그것을 보존하는 저장 비용, 이로 인해 늘어나는 읽기 시점 지연, 그리고 절대 점수 — 위의 모든 수치는 차분이다.

의의

이 위키는 같은 모양을 다른 방향에서 축적해 왔다. 2026-09-23 런은 Harness-Zero: Harness Distillation via Agent-as-Harness 를 캡처했는데 거기서는 스캐폴드를 제거하자 성능이 올랐고, 2026-09-25 는 Agensh: Scaling Organizational Intelligence to 1,024 Agents 를 캡처했는데 거기서는 오케스트레이터를 제거하고 워커를 늘리자 성능이 올랐다. JitMem 은 쓰기 시점 큐레이터를 제거한다. 나흘에 논문 셋, 각각 미리 결정하도록 만들어진 구성 요소가 돌려주는 것보다 더 많은 비용을 치르고 있었음을 발견한다.

같은 스냅숏에 캡처된 Agent-Editing World Model: Rethinking World Modeling for LLM Agents 과의 대조는 더 날카롭다. 그 논문은 "실제 피드백을 쓸 수 있을 때 고엔트로피·실행 의존적인 도구 응답을 재구성하는 것은 가치가 제한적" 이므로 에이전트의 월드 모델이 도구 응답 예측을 그만두어야 한다고 논증한다. 두 논문은 서로 다른 서브시스템에 대해 같은 말을 하고 있다 — 아직 가서 볼 수 있는 것을 압축하지 말라.

+16.2 / +16.3 에 대비되는 τ²-bench 의 +3.9 는 읽은 어디에도 설명되어 있지 않으며, 이 아이디어의 한계가 어디인지 알려줄 결과다.

열린 질문

  • 원본 트래젝토리 보존의 비용은 얼마인가? 이 방법의 전제는 아무것도 버리지 않는다는 것이다. 저장, 검색 지연, 컨텍스트 예산 수치가 명시되어 있지 않다.
  • 왜 τ²-bench 이득이 네 배 작은가? 스냅숏에서 다루어지지 않는다.
  • 학습하지 않은 큐레이터 결과가 더 약한 백본에서도 유지되는가? 이득의 대부분이 학습이 아니라 읽기 시점 큐레이션이라면 백본 자신의 역량이 일을 하고 있다는 뜻인데, 백본은 이름조차 없다.
  • Context Compaction 과 어떻게 상호작용하는가? 큐레이션을 읽기 시점으로 미루는 것과 컨텍스트를 압축하는 것은 같은 예산 위에서 반대 방향으로 당기고 있으며, 읽은 어떤 것도 둘을 연결하지 않는다.

인용

arXiv 2609.27334 — Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents, 2026-09-23. HuggingFace Daily Papers, 2026-09-26, 업보트 34 — 해당 커뮤니티의 인기 신호일 뿐이며 품질이나 중요도의 순위가 아니다 (source).

Referenced by

Sources