$ cat wiki/papers/2026/2609.27334-jitmem.md
Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents
TL;DR
에이전트 메모리 시스템은 미래의 질의가 존재하기 전, 쓰기 시점에 무엇을 남길지 정한다. JitMem 은 원본 트래젝토리를 보존하고 큐레이션을 과제가 알려진 읽기 시점으로 미루며, ALFWorld, WebShop, τ²-bench 에서 가장 강한 베이스라인 대비 +16.2, +16.3, +3.9 절대 성공률 포인트를 얻는다 (source).
저자와 소속
스냅숏에 명시되어 있지 않다 — 저자 목록도 소속도 없다. arxiv.org 는 이 런의
샌드박스에서 EGRESS_BLOCKED 를 반환한다. 추측하지 않고 미상으로 기록한다.
방법
쓰기 시점 큐레이션의 문제로 명시된 것은 별개의 두 가지 실패이며, 논문은 이를 분리해 둔다:
- 가치를 알기 전에 정보가 파괴된다. 완료된 과제는 "reflection, workflow, skill, reasoning strategy 같은 고정 산출물" 로 증류되고 나중에 유사도로 검색된다. 이는 미래의 질의가 존재하기 전에 무엇이 남길 가치가 있는지 결정하도록 강제해, 여러 하류 과제를 두루 감당해야 하는 질의 독립적 요약을 만든다.
- 큐레이터를 학습시키기 어렵다. 저장 결정의 가치는 "관련 질의가 도착할 때, 어쩌면 여러 과제 뒤에야 드러날 수 있다" — 장기 지평 credit assignment 문제다.
JitMem 의 수는 원본 트래젝토리를 보존하고 큐레이션을 미루는 것이다. 검색된 트레이스 와 새 과제가 주어지면, 메모리 큐레이터가 당장의 필요에 맞춘 간결하고 과제 적응적인 payload 를 합성한다.
학습상의 귀결이 두 번 읽을 만한 부분이다: payload 가 그것을 유발한 바로 그 과제에서 소비되기 때문에, 큐레이터는 즉각적인 과제 성공으로부터 직접 학습될 수 있다. 이로써 지연된 효용 신호와 "관련 과제들을 인위적으로 묶을 필요" 가 제거된다 — 첫 번째 실패의 해법이 두 번째 실패를 별도로 공격하지 않고 녹여 없앤다.
결과
| 벤치마크 | 가장 강한 베이스라인 대비 이득 |
|---|---|
| ALFWorld | +16.2 절대 성공률 포인트 |
| WebShop | +16.3 |
| τ²-bench | +3.9 |
| 베이스라인은 메모리 없는 에이전트와 휴리스틱 및 학습된 쓰기 시점 메모리 기법 | |
| 으로 명시된다. |
ablation 이 초록이 묻어둔 핵심이다: 학습하지 않은 큐레이터가 이미 그 베이스라인들과 대등하거나 넘어선다. 저자들은 이를 읽기 시점의 과제 적응적 큐레이션 자체가 이득의 주된 원천이라는 뜻으로 읽고, 학습이 그 위에 복리로 더해진다고 본다.
스냅숏에 명시되지 않은 것: 백본 모델, 원본 트래젝토리에 대한 검색 메커니즘, 그것을 보존하는 저장 비용, 이로 인해 늘어나는 읽기 시점 지연, 그리고 절대 점수 — 위의 모든 수치는 차분이다.
의의
이 위키는 같은 모양을 다른 방향에서 축적해 왔다. 2026-09-23 런은 Harness-Zero: Harness Distillation via Agent-as-Harness 를 캡처했는데 거기서는 스캐폴드를 제거하자 성능이 올랐고, 2026-09-25 는 Agensh: Scaling Organizational Intelligence to 1,024 Agents 를 캡처했는데 거기서는 오케스트레이터를 제거하고 워커를 늘리자 성능이 올랐다. JitMem 은 쓰기 시점 큐레이터를 제거한다. 나흘에 논문 셋, 각각 미리 결정하도록 만들어진 구성 요소가 돌려주는 것보다 더 많은 비용을 치르고 있었음을 발견한다.
같은 스냅숏에 캡처된 Agent-Editing World Model: Rethinking World Modeling for LLM Agents 과의 대조는 더 날카롭다. 그 논문은 "실제 피드백을 쓸 수 있을 때 고엔트로피·실행 의존적인 도구 응답을 재구성하는 것은 가치가 제한적" 이므로 에이전트의 월드 모델이 도구 응답 예측을 그만두어야 한다고 논증한다. 두 논문은 서로 다른 서브시스템에 대해 같은 말을 하고 있다 — 아직 가서 볼 수 있는 것을 압축하지 말라.
+16.2 / +16.3 에 대비되는 τ²-bench 의 +3.9 는 읽은 어디에도 설명되어 있지 않으며, 이 아이디어의 한계가 어디인지 알려줄 결과다.
열린 질문
- 원본 트래젝토리 보존의 비용은 얼마인가? 이 방법의 전제는 아무것도 버리지 않는다는 것이다. 저장, 검색 지연, 컨텍스트 예산 수치가 명시되어 있지 않다.
- 왜 τ²-bench 이득이 네 배 작은가? 스냅숏에서 다루어지지 않는다.
- 학습하지 않은 큐레이터 결과가 더 약한 백본에서도 유지되는가? 이득의 대부분이 학습이 아니라 읽기 시점 큐레이션이라면 백본 자신의 역량이 일을 하고 있다는 뜻인데, 백본은 이름조차 없다.
- Context Compaction 과 어떻게 상호작용하는가? 큐레이션을 읽기 시점으로 미루는 것과 컨텍스트를 압축하는 것은 같은 예산 위에서 반대 방향으로 당기고 있으며, 읽은 어떤 것도 둘을 연결하지 않는다.
인용
arXiv 2609.27334 — Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents, 2026-09-23. HuggingFace Daily Papers, 2026-09-26, 업보트 34 — 해당 커뮤니티의 인기 신호일 뿐이며 품질이나 중요도의 순위가 아니다 (source).