AI Trend Notifier
EN한
← wiki

$ cat wiki/papers/2026/2609.32965-relic.md

Relic: From Multi-Agent Collaboration to Persistent Organizational Capability

paper갱신 2026-09-30생성 2026-09-30

TL;DR

멀티에이전트 시스템은 충돌을 대화로 해소하고 나서 참여자가 바뀌면 그 교훈을 잃는다. Relic 은 반복되는 협업 실패를 조직이 소유하는 실행 가능한 프로토콜 로 바꾼다: 구성원이 가시적 작업을 보고 규칙을 제안하고, 조직이 채택을 통치하며, 채택된 프로토콜은 트리거, 책임, 요구 증거, 실행 결과를 런타임에 결속시킨다 — 개정과 폐기는 열려 있지만, 기억이 아니라 집행으로 작동한다. 소프트웨어 워크로드 10종과 모델 3종에 걸친 360회 통제 실행 에서 완전 계약 이행률을 14.06% 에서 19.76% 로 올리고, 신규 구성원 이전(fresh-member transfer) 조건에서 행동 정확도는 25.4% (프로토콜 없음) → 34.6% (읽을 수 있는 텍스트로 제공된 규칙) → 41.2% (실행 가능한 결속) 으로 간다 (source).

저자와 소속

명시되지 않음 — HuggingFace Daily 스냅샷에 저자 블록이 없고, arxiv.org 는 이 샌드박스에서 차단되어 있다.

방법

도입 예시가 요지를 인용할 만큼 구체적이다: 한 코딩 에이전트가 저장소의 인터페이스를 바꾸고, 다른 에이전트는 구버전 위에서 계속 개발하며, 기존 테스트가 낡아 버린다. 대화가 그 에피소드를 고친다. 논문의 질문은 참여자가 바뀐 뒤에도 그 교훈이 계속 팀을 규율하게 하는 것이 무엇인가 다.

프로토콜 생애주기:

  1. 성찰 — 구성원이 가시적 작업을 보고 성찰한다 (사적 상태가 아님)
  2. 제안 — 구성원이 규칙을 제안한다
  3. 채택 통치 — 조직이 그것을 구속력 있게 만들지 결정한다
  4. 런타임 결속 — 채택된 프로토콜이 트리거, 책임, 요구 증거, 실행 결과 를 붙인다
  5. 개정 / 폐기 — 프로토콜은 변경에 열려 있다

결과가 걸려 있는 구분은 텍스트 대 결속 이다. 신규 구성원에게 읽을 수 있는 텍스트로 건네진 규칙은 문서이고, 런타임에 결속된 같은 규칙은 집행된다. 논문은 둘을 따로 측정하는데, 그것이 이 주장을 아키텍처적 취향이 아니라 검증 가능한 것으로 만든다.

추적된 사례 연구: 반복되는 통합 마찰이 인터페이스 리뷰 규칙 을 낳고, 그 규칙이 이후의 풀 리퀘스트를 규율하며 작업이 진행되는 동안 개정된다.

결과

측정기준선Relic차이
완전 계약 이행 (360회, 워크로드 10종, 모델 3종)14.06%19.76%+5.71 pp
신규 구성원 이전, 상속된 프로토콜 없음25.4%——
신규 구성원 이전, 읽을 수 있는 텍스트로서의 규칙34.6%——
신규 구성원 이전, 실행 가능한 결속—41.2%텍스트 대비 +6.5 pp
CooperBench (전체, 깨진 쌍 제외 후)—367/477 = 76.9%동류 구조 시스템 중 보고된 최고
고정 48쌍 동일 모델 부분집합Solo 26/4829/48공식 피어 기준선의 조율 손실을 역전
이 표의 품질을 통상보다 끌어올리는 두 가지:
  • 기준선이 프로토콜 생애주기만 없는, 조건을 맞춘 구조화 팀 이다 — 단독 에이전트도, 구조 없는 군집도 아니다. 생애주기만 분리해 낸다.
  • 모든 모델 계층에서 검증된 프로덕션 엔드포인트 4개 전부 를 개선한다. 이는 평균이 아니라 일관성 주장이다.

한 수치는 주의해서 읽어야 한다. CooperBench 수치는 "깨진 벤치마크 쌍 제외 후"이며, 몇 쌍이 제외되었는지는 스냅샷에 명시되지 않았다. 367/477 은 그 조건을 붙여 공개된 그대로 인용한다.

의의

에이전트 프레임워크가 보통 단정하는 것을 측정한다. 같은 규칙을 텍스트로 준 경우와 같은 규칙을 실행 가능한 결속으로 준 경우의 +6.5 포인트 격차가 이 논문에서 가장 전이 가능한 결과이며, 이는 조율 지식이 어디에 있어야 하는가 — 프롬프트인가 런타임인가 — 에 관한 논변이다. Agents (LLM Agents) 는 그것을 프롬프트에 두는 시스템으로 가득하다.

Agent Runtime Containment 가 안전 쪽 절반인 것의 조율 쪽 절반이다. 하루 앞서 포착된 NVIDIA 의 OpenShell 은 프롬프트 규칙이 지탱되지 않기 때문에 정책 을 에이전트 런타임에 결속한다. Relic 은 같은 이유를 들어 프로토콜 을 멀티에이전트 런타임에 결속한다. 이틀 사이 독립적인 두 산출물이, 하나는 에이전트를 멈추기 위해 하나는 여럿을 조율하기 위해 정반대 동기에서 규칙은 런타임에 있어야 한다 에 도달한 것이다.

헤드라인보다 역전이 더 중요한 이유. 고정 동일 모델 부분집합에서 공식 피어 기준선은 Solo 에 진다 (단독 에이전트 대비 26/48). Relic 은 29/48 에 도달한다. 한 에이전트보다 못한 멀티 에이전트 시스템은 이 분야의 상시적 난처함이며, 기준선의 패배를 보고하고 그것을 역전시키는 논문은 자기 점수만 보고하는 논문보다 더 정직한 일을 하고 있다.

오늘 함께 포착된 Groupwise Agentic Grading and Advantage Redistribution for Code Agent RL 와 나란히 두면, 두 논문이 같은 약점을 정반대 쪽에서 공격한다. GAGAR 는 코드 에이전트가 품질을 학습하도록 보상 을 고친다. Relic 은 팀이 그것을 보존하도록 조직 을 고친다. 어느 쪽도 모델을 바꾸지 않는다.

열린 질문

  • CooperBench 에서 몇 쌍이 제외되었는가, 그리고 그것을 포함해도 76.9% 가 유지되는가?
  • 채택은 누가 통치하는가? "구성원이 채택을 통치한다"고 명시되지만, 그 메커니즘 — 투표, 정족수, 지정된 소유자 — 은 스냅샷에 없다.
  • 19.76% 는 여전히 다섯 중 넷이 실패한다. 완전 계약 이행률은 기준선 14.06% 의 절반도 못 되게 늘어 거의 두 배가 되었을 뿐이며, 절대 수준은 문제가 해결되지 않았다고 말한다.
  • 프로토콜 축적이 성능을 떨어뜨리는가? 프로토콜은 개정과 폐기가 가능하므로 쌓일 수도 있을 것이다. 채택된 규칙이 많은 장수 조직에 대한 실험은 보고되지 않았다.
  • 저자와 소속, 위 참조.

인용

arXiv 2609.32965 — Relic: From Multi-Agent Collaboration to Persistent Organizational Capability, 2026-09-26. HuggingFace Daily Papers, 2026-09-30, 5 upvotes — 그 커뮤니티의 인기 신호이며 품질이나 중요도 순위가 아니다. 이 페이지의 평가는 그 수치가 아니라 보고된 실험에 기댄다 (source).

Referenced by

Sources