AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2608.24876-recuris.md

Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses (arXiv:2608.24876)

paper갱신 2026-08-28생성 2026-08-28

TL;DR

Recuris 는 에이전트의 메모리를 둘로 나눈다 — 과제 진행을 추적하는 Working Memory, 스킬을 담는 Experiential Memory — 그래서 스킬 선택이 전체 히스토리가 아니라 현재 상태에 근거한다. 고정된 Meta-Agent 가 실행에서 나온 증거를 Skill Memory 에 대한 검증 관문을 거친 갱신으로 바꾸며, 경계가 있는 재귀 루프를 이룬다. 이번 주 군집에서 자신이 끌어올린 모델의 이름을 밝히는 유일한 하네스 논문이다: tau-bench 에서 GPT-5.6 Sol 에 +17.8 점, Claude Opus 5 에 +15.6 점을 더해 Opus 5 를 87.9% 로 올린다 (source).

저자와 소속

Zhaochen Yu, Yingcheng Wu, Zhenfei Yin, Kaiyuan Chen, Zhe Zhao, Mengdi Wang, Shuicheng Yan, Ling Yang (arXiv:2608.24876). 2026-08-25 투고; cs.AI, cs.CL. arXiv 목록에 소속이 표시되지 않는다. 코드는 github.com/Gen-Verse/Recuris 에 있다.

HuggingFace Daily Papers, 2026-08-27, 21 upvotes 에 등재 — 그 커뮤니티의 인기 신호일 뿐 그 이상은 아니다 (source).

방법

장기 과제에서 재귀적 자기개선을 가로막는 장애로 논문이 지목하는 것: "불어나는 히스토리가 과제 상태를 가리고 스킬 호출을 어긋나게 한다."

  • Working Memory 가 과제 진행을 추적하고 Experiential Memory 로부터의 스킬 선택을 안내하여, 스킬 사용을 "전체 히스토리가 아니라 현재의 필요"에 근거시킨다.
  • 이 결합은 실행을 실패를 특정 메모리 구성요소로 국소화하는 구조화된 증거로 바꾼다.
  • 고정된 Meta-Agent 가 그 증거를 Skill Memory 에 대한 국소적이고 검증 관문을 거친 갱신으로 변환하며, 이 갱신이 실행을 다시 형성해 새로운 증거를 낳는다 — 경계가 있는 재귀적 메모리 진화 루프다 (source).

"고정된"과 "경계가 있는"이 이 설계를 떠받치는 표현이다: Meta-Agent 는 자기 자신을 수정하지 않으며, 그것이 재귀가 불안정해지지 않게 막는다.

결과

네 개의 장기 지평 벤치마크와 열 개의 모델에 걸쳐 측정되었고, 모든 수치는 저자 보고다.

MeasureReported
개선된 모델-벤치마크 쌍완료된 37 쌍 중 35
tau-bench, GPT-5.6 Sol+17.8 점
tau-bench, Claude Opus 5+15.6 점 → 87.9%
SkillFlow, Qwen3.6-27B+16.6 점
SkillFlow, Qwen3.6-35B+13.5 점
가장 긴 과제+32.2 점
흔한 장기 지평 실패최대 80% 감소
보고된 이점은 상호작용 지평이 길어질수록 벌어진다 — +32.2 는 가장 긴 과제에서의
수치이고, 표제 수치는 +17.8 이다.

"완료된 37 개의 모델-벤치마크 쌍 중 35" 는 벤치마크 네 개 × 모델 열 개 = 40 중 세 쌍이 완료되지 않았음을 함의한다. 어느 쌍인지, 왜인지는 읽은 어떤 자료에도 없다.

의의

이번 주 하네스 군집에서 그 수치가 이름 붙은 프런티어 모델에 붙는 유일한 논문이다. Prime Agent: A Self-Improving RLM Harness (arXiv:2608.23552) 는 모델을 밝히지 않은 채 30% → 95.5% 를 보고했고, AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces (arXiv:2608.23041) 는 절대 점수 없이 세 개의 증분을 보고했다. Recuris 는 Claude Opus 5 의 tau-bench 87.9% 를 +15.6 이라는 명시된 증분과 함께 내놓는다 — 확인할 수 있고, 반박할 수 있고, 비교할 수 있는 수치다.

다만 그것은 보고 문제를 완화하는 것이 아니라 날카롭게 만든다. tau-bench 에서 Opus 5 의 87.9% 는 Eval Harness Configuration 이 경고하는 바로 그 의미의 (모델, 하네스) 수치이고, +15.6 은 하네스의 기여분을 대놓고 밝힌 것이다. 스캐폴드를 빼고 87.9% 를 인용하는 사람은 Recuris 의 결과를 Anthropic 의 것으로 인용하는 셈이다.

지평에 따라 커진다는 주장이 진짜 새로운 부분이다. 이 군집의 이전 결과는 모두 고정된 증분을 보고한다. "상호작용 지평이 길어질수록 이점이 벌어져 가장 긴 과제에서 +32.2 점"은 스캐폴딩이 어디에서 값을 하는지에 대한 주장이고, 이 위키에서 기울기가 붙은 첫 주장이다. 동시에 벤치마크 자체의 구성에 가장 많이 노출된 주장이기도 하다 — 긴 과제는 어떤 방법이든 여유 공간이 가장 큰 지점이다.

JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution (arXiv:2608.25593) 와 저자를 공유한다. Zhaochen Yu 와 Shuicheng Yan 이 양쪽에 이름을 올렸고, 하루 차이로 같은 스냅숏에 투고되었다.

열린 질문

  • 완료되지 않은 세 모델-벤치마크 쌍은 무엇이고 왜인가? 35/37 이 보고되었고, 시도된 것은 40 이다.
  • 네 벤치마크는 무엇인가? tau-bench 와 SkillFlow 만 이름이 밝혀져 있다.
  • Opus 5 의 87.9% 에 대한 베이스라인 하네스는 무엇인가? 증분은 출발 구성이 명시되어야 의미를 갖는데, 72.3% 는 여기에서 추론한 값이지 발표된 값이 아니다.
  • Skill Memory 가 벤치마크 인스턴스를 가로질러 정보를 실어 나르는가? 지속되는 검증 관문 갱신은 보류된 과제 집합이 보류이기를 그치는 경로이며, Prime Agent: A Self-Improving RLM Harness (arXiv:2608.23552) 의 Continual Harness 가 제기하는 것과 같은 질문이다.
  • "흔한 장기 지평 실패가 최대 80% 감소"는 무엇을 측정한 것인가? 실패 분류 체계도 절대 비율도 주어지지 않았다.

인용

Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses (2026). arXiv:2608.24876.

Referenced by

Sources