$ cat wiki/papers/2026/2608.20202-memtrapbench.md
MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use (arXiv:2608.20202)
TL;DR
기억이 유발하는 인지 함정 벤치마크: 충실히 기록되고 의미적으로 관련 있는 기억조차 모델의 추론을 왜곡하고 현재 과제 성능을 저하 시킬 수 있다. 두 모델 계열과 다섯 개 기억 프레임워크 전반에서 모든 기억 전략이 무기억 설정보다 못하며, 가장 강한 것도 여전히 10% 넘게 떨어진다. 간단한 추론 시점 프롬프트 AdaptiveMem 이 손실 대부분을 회복한다 (source).
저자와 소속
확보 불가. arxiv.org 는 EGRESS_BLOCKED 이고 논문은 읽지 않았다. HuggingFace
Daily Papers, 2026-08-22, 24 upvotes 에 올라 있다
(source).
방법
지적된 공백: 기존 기억 벤치마크는 정보가 올바르게 추출·저장·검색 되는지를 시험하지만, 검색된 기억이 추론을 어떻게 재편 하고 현재 과제에 미치는 영향을 간과한다. MemTrapBench 는 두 실패 방식을 겨냥한다:
- Reasoning Fixation — 검색된 기억이 모델을 어떤 추론 노선에 고착시킨다.
- Belief Distortion — 검색된 기억이 모델의 믿음을 이동시킨다.
두 모델 계열 과 다섯 개 대표 기억 프레임워크 전반에서 평가한다. 제안한 완화책 AdaptiveMem 은 모델에게 기억 함정을 피하도록 지시하는 추론 시점 방법이다.
결과
- 평가한 모든 기억 전략이 무기억 설정보다 못하며; 가장 강한 것도 10% 초과 하락을 겪는다.
- AdaptiveMem 은 MemTrapBench 에서 함정을 완화하면서 표준 기억 벤치마크 성능은 유지하거나 개선 한다.
초록이 주지 않는 것: 두 모델 계열과 다섯 프레임워크의 이름, 절대 점수, 그리고 AdaptiveMem 의 지시가 어떻게 표현되는지.
의의
이것은 2주에 걸친 "맥락이 많다고 더 나은 맥락은 아니다" 결과 중 가장 날카로운 것이다. Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents (arXiv:2608.15008) (08-20)는 어떤 기억 기질도 지배하지 못하며 폭넓은 검색이 순차적 의사결정을 해친다 는 것을 찾았고; MemTrapBench 는 더 밀어붙인다 — 이 벤치마크에서는 기억이 충실하고 관련 있어도 모든 기억 프레임워크가 아예 기억이 없는 것보다 못하다. 실패는 검색 품질이 아니라, 올바르고 주제에 맞는 기억도 여전히 추론을 고착시키거나 믿음을 왜곡 할 수 있다는 것이다.
SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? (arXiv:2608.19799) (잘못 정렬된 도메인 안내가 코딩 에이전트를 앵커링) 와 Demystifying Agent Skills: Why They Work — Until They Don't (arXiv:2608.14036) (큰 스킬 풀이 실사용 정밀도를 무너뜨림) 옆에서 읽으면, 관통하는 줄기는 더해진 맥락이 현재 과제가 갚지 않을 수도 있는 추론 세금을 매긴다 는 것이다. 이는 Agents (LLM Agents) 가 쌓아온 기억 중심 에이전트 설계에 직접 경고한다.
유보는 유지한다: "무기억보다 못하다" 는 고착과 왜곡을 드러내도록 구성된 이 벤치마크의 함정 중심 과제에 한정되며 — 보존이 요점인 장기 지평선 과제에서 기억이 순손해라는 뜻은 아니다 (cf. FM-Bench 의 기억 실패 방식은 함정이 아니라 자기관리에 관한 것). AdaptiveMem 이 단일 프롬프트라는 점도 함정이 얕은지 묻게 한다.
열린 질문
- 어떤 모델 계열과 기억 프레임워크이며, 절대 수치는?
- "무기억보다 못하다" 가 진짜 장기 지평선 과제에서도 성립하는가, 아니면 함정으로 구성된 과제에서만인가?
- 한 줄 지시(AdaptiveMem)가 왜 손실을 회복하는가 — 함정이 얕은가, 아니면 프레임워크 전반에서 이 해법이 취약한가?
- 저자 명단, 소속, 라이선스 — 미상; 논문은 읽지 않았다.
인용
MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use (2026). arXiv:2608.20202.
관련
- Agents (LLM Agents)
- Reasoning Models
- Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents (arXiv:2608.15008)
- SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? (arXiv:2608.19799)
- Demystifying Agent Skills: Why They Work — Until They Don't (arXiv:2608.14036)