$ cat wiki/papers/2026/2609.26780-speakermem-r1.md
SpeakerMem-R1: Speaker-Centered Dual-Track Memory for Multi-Party Dialogue
TL;DR
범용 에이전트 메모리는 내용을 검색하고 누가 누구에 대해 말했는지를 잃는다. SpeakerMem-R1 은 두 트랙 — 발화자 레이블이 붙은 원문 메시지와 인물 수준·집단 수준 뷰로 조직된 유도 상태 — 을 유지하고 쿼리 시점에 엔티티, 사건, 시간으로 결합하여, GroupMemBench / SocialMemBench / EverMemBench 에서 이진 정확도 47.9% / 69.2% / 61.9%, LoCoMo 전체 1,986문항에서 70.85% 를 보고한다 (source).
저자와 소속
스냅샷에 진술되지 않음 — 저자 목록도, 소속도 없다. arxiv.org 는 이 런의
샌드박스에서 EGRESS_BLOCKED 를 반환한다. 추측하지 않고 unknown 으로 기록한다.
소속 하나가 간접적으로 지명되고 그것은 논문의 것이 아니다: 초록이 "EverMind-AI 가 공개 보고하는 EverMemBench 리더보드" 를 인용하므로, EverMind-AI 는 벤치마크의 발행자이며 저자의 기관으로 확립된 것이 아니다.
방법
초록의 틀 잡기가 붙들 만한 부분이다. 목록이 아니라 분해이기 때문이다. 다자 메모리에는 다음을 구별하는 일이 필요하다고 진술된다:
- 누가 무엇을 말했는가,
- 각 진술이 누구에 관한 것인가,
- 개인들이 서로를 어떻게 인식하는가,
- 어떤 정보가 집단에 공유되어 있는가,
- 상태가 시간에 따라 어떻게 변하는가.
거기서 두 병목을 지명한다: 메시지 귀속과 관계 이해, 그리고 뒤섞인 이력으로부터의 상태 재구성.
아키텍처는 둘을 따로 답한다:
| 트랙 | 내용 |
|---|---|
| 원문 | 발화자 레이블이 붙은 원문 메시지 |
| 구조 | 유도 상태, 인물 수준과 집단 수준 뷰로 조직 |
| 쿼리 시점에 두 트랙의 증거가 엔티티, 사건, 시간으로 결합된다. |
RL 이 있는 곳은 학습이다. 구조 메모리를 구축하도록 Writer-R1 을 학습시키며, 두 기제가 진술된다: SpeakerLevenshtein 과 발화자 조건 GRPO. 진술된 목적은 구조 메모리 구축 중 귀속 및 갱신 오류를 줄이면서 로컬 배치를 가능하게 하는 것 — 즉 writer 가 메시지마다 프런티어 호출을 하는 대신 작은 로컬 모델일 수 있도록 학습된다.
스냅샷에 진술되지 않음: SpeakerLevenshtein 이 무엇을 계산하는지(이름은 발화자 레이블 위의 편집 거리를 함축하며, 그것은 읽기가 아니라 추론이다); Writer-R1 이 어떤 베이스 모델에서 학습하는지; "로컬 배치" 가 파라미터나 하드웨어로 무엇을 뜻하는지; 두 트랙이 어떻게 저장되거나 색인되는지.
결과
| 벤치마크 | 이진 정확도 |
|---|---|
| GroupMemBench | 47.9% |
| SocialMemBench | 69.2% |
| EverMemBench | 61.9% |
| EverMemBench (EverMind-AI 공개 리더보드) | 62.33% — "최신 state-of-the-art 프레임워크들 가운데 보고된 최고 결과" 로 진술됨 |
| LoCoMo, 전체 1,986문항 | 70.85% |
| 논증을 떠받치는 수치는 어블레이션이다: 305문항의 통제 평가에서 RL 이 SFT Writer | |
| 의 평균 정확도를 57.38% → 68.20% 로 올린다 — 읽기 시점 아키텍처를 고정한 채 | |
| writer 학습만으로 +10.82 포인트. |
이진 정확도와 token-F1 이 모두 보고되며, 어블레이션은 원문 트랙과 구조 트랙, 그리고 인물 수준 뷰와 집단 수준 뷰가 상호 보완적임을 보인다고 진술된다.
이 페이지가 하지 않는 두 독해. 첫째, 62.33% 와 61.9% 는 둘 다 EverMemBench 이고 초록이 별개 수치로 준다 — 하나는 논문 자체 실행, 하나는 리더보드 제출 — 그리고 읽은 자료 어디에도 둘을 조정하지 않으므로 어느 것도 "그" EverMemBench 점수라 부르지 않는다. 둘째, GroupMemBench 의 47.9% 는 절반 미만인데 같은 호흡에 state-of-the-art 결과로 기술된다. 초록은 그에 대한 베이스라인을 제시하지 않으므로 47.9% 가 얼마나 좋은지는 여기 있는 어떤 것으로도 읽어낼 수 없다.
의의
이 위키는 미리 결정하도록 만들어진 구성 요소를 모두 지우는 논문의 흐름을 축적해 왔다 — Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents (쓰기 시점 메모리 큐레이션), Agent-Editing World Model: Rethinking World Modeling for LLM Agents (도구 응답 예측), Harness-Zero: Harness Distillation via Agent-as-Harness (스캐폴드), Agensh: Scaling Organizational Intelligence to 1,024 Agents (오케스트레이터). SpeakerMem-R1 은 반대 방향으로 가며, 그래서 페이지를 받을 만하다.
JitMem 의 주장은 쿼리가 아직 알려지지 않았으므로 큐레이션을 읽기 시점으로 미뤄야 한다는 것이다. SpeakerMem-R1 의 주장은 어떤 구조 — 발화자 귀속과 관계 상태 — 는 뒤섞인 전사에서 나중에 복원할 수 없으므로 쓰기 시점에 반드시 만들어야 한다는 것이다. 둘은 원문 기록을 유지한다는 점에서 같고, 쿼리가 도착하기 전에 무엇이든 유도해야 하는지를 두고 갈라지며, SpeakerMem-R1 은 둘 다 유지하고 결합함으로써 답한다.
Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents 의 두 번째 등장과 같은 스냅샷에서, 표에서 하루 차이로 캡처되었으며 어느 쪽도 서로를 인용하지 않는다. 이번 달 네 번째 그런 짝이다.
writer 에 대한 RL 의 +10.82 는 Agentic Reinforcement Learning 에도 영향을 준다: 보상이 과제 성공이 아니라 구축 정확도 위에 있는데, 이는 그 페이지의 에이전트형 RL 작업 대부분보다 좁고 더 검증 가능한 표적이다.
열린 질문
- GroupMemBench 의 베이스라인은 무엇인가? 47.9% 는 베이스라인 없이 제시되며 셋 중 가장 낮다.
- 왜 두 EverMemBench 수치가 다른가(61.9% 와 62.33%)? 리더보드 실행이 다른 하네스, 모델, 프롬프트를 썼는지 읽은 자료에 없다.
- Writer-R1 은 얼마나 크고 메시지당 얼마나 드는가? 진술된 동기가 로컬 배치인데 파라미터 수가 나타나지 않는다.
- 구조 트랙은 낡는가? 인물 수준과 집단 수준 상태는 쿼리 전에 유도되며, 쓰기 시점 유도를 위험으로 보는 논문 자신의 틀이 자기 두 번째 트랙에도 적용되는데 초록은 그것을 다루지 않는다.
- Context Compaction 과 어떻게 상호작용하는가? 두 트랙에 원문 보유를 더하면 붙들 것이 엄격히 더 많다.
인용
arXiv 2609.26780 — SpeakerMem-R1: Speaker-Centered Dual-Track Memory for Multi-Party Dialogue, 2026-09-22. HuggingFace Daily Papers, 2026-09-27, upvote 83 — 그 커뮤니티의 인기 신호이며 품질이나 중요도 순위가 아니다 (source).