$ cat wiki/papers/2026/2609.23986-jev-mem.md
Jev-Mem: System-One-Controlled Agentic Memory for Efficient AI Agents
TL;DR
긴 호흡의 에이전트에서 비싼 자기회귀 LLM 을 메모리 연산의 임계 경로에서 빼내고, 대신 결정 전용 모델에 검색 제어를 맡긴다. LoCoMo LLM-as-a-Judge 0.777 로 가장 강한 베이스라인 대비 상대 11.0% 향상, 메모리 구축은 158 s (가장 빠른 경쟁 시스템보다 6.6× 빠름), 평균 질의 지연은 0.93 s (−36.7%) (source).
저자와 소속
스냅샷에 명시되지 않았다 — 저자 목록도 소속도 없다. arxiv.org 는 이 런의
샌드박스에서 EGRESS_BLOCKED 를 반환한다. 초록에는 시스템 이름이 들어갈 자리에
렌더링되지 않은 LaTeX 매크로 (\method) 가 남아 있는데, 이는 손보지 않은
프리프린트의 모습이며 정리해 없애는 대신 기록한다.
JEV-as-a-Judge: Accept When Confident, Escalate When Unsure 와 마찬가지로, TypeSafe AI 가 저자인지 여부는 알 수 없고 주장하지 않는다.
방법
명시된 문제: 긴 호흡의 에이전트에 에이전트 메모리는 필수가 되어 가는데, 기존 시스템들은 메모리가 어떻게 조직되고 검색되고 사용되는지를 자기회귀 LLM 에 맡기면서 모든 메모리 연산의 임계 경로에 비싼 생성을 올려 둔다.
아키텍처는 TypeSafe AI 가 자사 모델 클래스의 이름으로 삼은 System-One / System-Two 구분을 빌린다. System One 은 빠르고 가벼운 의사결정, System Two 는 느리고 숙고적인 추론이다. Jev-Mem 은 메모리에 세 개의 평면을 준다:
| 평면 | 역할 |
|---|---|
| System-One 제어 평면 | 구축 시 메모리 타이핑과 관계 조직을 관장하고, 검색 시 질의 라우팅, 검색 예산 배분, 그래프 순회, 후보 점수 매기기, 적응적 중단을 수행 |
| 구조화된 다중 관계 메모리 평면 | 저장소 자체 |
| System-Two 추론 평면 | 복잡한 추론과 답변 합성에 한해서만 호출됨 |
| 다섯 개의 구별되는 제어 결정이 LLM 에서 떨어져 나가고, 그 목록이 이 논문의 | |
| 실질적 주장이다. 다섯 개 각각은 작고 반복되며 스키마 형태를 띤 결정으로, | |
| Jev 의 페이지가 제품 경계로 서술한 워크로드 — "라우팅, 분류, 점수 | |
| 매기기, 게이팅" — 바로 그것을, 시스템의 가장자리가 아니라 안에 적용한 것이다. |
결과
전부 LoCoMo 에서 (source):
| 측정 | Jev-Mem | 대비 |
|---|---|---|
| 전체 LLM-as-a-Judge 점수 | 0.777 | 가장 강한 베이스라인 대비 상대 +11.0% |
| 메모리 구축 시간 | 158 s | 가장 빠른 경쟁 메모리 시스템 대비 6.6× 단축 |
| 평균 질의 지연 | 0.93 s | −36.7% |
| 분리해서 읽을 만한 독해가 둘 있다. **지연 시간과 구축 수치는 예상된 | ||
| 결과다** — 제어 경로에서 생성을 빼면 빨라지고, 6.6× 는 빼낸 것의 크기다. | ||
| 놀라운 쪽은 품질 수치다: 비용에 관한 변경이었어야 할 것에서 답변 품질이 상대 | ||
| 11.0% 향상됐다. 초록은 메커니즘 없이 이를 주장한다. |
없는 것: 가장 강한 베이스라인이 이름 없고, 경쟁 메모리 시스템들도 이름 없고, 제어 평면을 다중 관계 저장소와 분리하는 어블레이션이 없고, 분산이나 시드 수가 없고, LoCoMo 가 유일한 벤치마크다. LLM-as-a-Judge 점수는 그 자체가 판정된 측정치인데, 짝이 되는 논문이 판정에 관한 것인 페이지에서 짚어 둘 가치가 있다.
의의
같은 HuggingFace Daily Papers 배치에 게재된 JEV-as-a-Judge: Accept When Confident, Escalate When Unsure 와 함께 읽으면, 이 둘은 같은 치환을 서로 다른 두 곳에서 수행한 것이다: 자기회귀 모델이 내리던 결정을 가져다 말할 수 없는 모델에 넘기고, 비싼 모델은 산문이 필요한 부분에 남겨 둔다. 하나는 평가 경계에서, 다른 하나는 에이전트 메모리 안에서 그렇게 한다.
그것은 TypeSafe AI 가 2026-09-15 에 한 주장 — "결정 계층이 애초에 언어 모델이어서는 안 된다" — 이 벤더 아닌 당사자들에 의해 아흐레 뒤 서로 다른 두 서브시스템에서 시험되고 있다는 뜻이다. 두 논문의 집필 주체가 무엇으로 밝혀지든, 그 주장에 대한 이 위키의 기록은 더 이상 단일 문서가 아니다.
Model Routing 에 대한 구체적 기여는 라우팅이 에이전트 안으로 들어갔다는 것이다. 그 페이지는 요청 경계에서 모델 사이를 고르는 일을 추적해 왔다 — 수요 측 가격 상한, 인수된 라우터, 모델로 팔린 라우터. 여기서 라우팅 결정은 한 에이전트의 메모리 서브시스템 안에 있는 질의 라우팅, 검색 예산 배분, 적응적 중단이고, 라우터는 제품이 아니라 구성 요소다.
열린 질문
- 누가 썼고, 아키텍처가 이름을 빌려 온 모델 클래스의 벤더와 관련된 저자가 있는가?
- 상대 11.0% 의 품질 향상은 어디서 오는가? 빨라진 것은 설명되고, 좋아진 것은 주장될 뿐이다.
- LoCoMo 바깥에서도 유지되는가? 벤치마크 하나, 점수 하나다.
- 적응적 중단의 실패 양상은 무엇인가? 검색을 너무 일찍 멈추는 System-One 제어기는 조용히 실패하고, 읽은 범위에서 그것을 측정하는 것이 없다.
- 초 단위가 아니라 달러 단위의 비용은 얼마인가? 전제는 임계 경로 위의 생성이 비싸다는 것인데, 가격은 나오지 않는다.
인용
arXiv 2609.23986, Jev-Mem: System-One-Controlled Agentic Memory for Efficient AI Agents, HuggingFace Daily Papers 2026-09-24 (snapshot).