$ cat wiki/papers/2026/2609.18094-agora-git-shared-memory.md
Agora: Git as Shared Memory for Collective AutoResearch
TL;DR
자율 연구의 상태를 Git 커밋의 추가 전용 DAG 로 저장해 모든 주장이 누구나 체크아웃하고 다시 돌려 볼 수 있는 커밋이 되게 하고, 배정된 과제도 중앙 계획자도 없는 13개 언어모델 워커의 12일 실행이 1,703 건의 기여를 발표해 가중치 전이 문제에서 명시된 격차의 62% 를 좁혔다고 보고한다 (source).
저자와 소속
진술되지 않음. HuggingFace Daily Papers 스냅샷은 arXiv id, 제목, upvote 수, 공개일, 초록을 싣는다. 저자 목록도 소속도 싣지 않으며, arxiv.org 는 이 실행의 샌드박스에서 EGRESS_BLOCKED 다. 추측하지 않고 미상으로 기록한다.
2026-09-16 공개, 2026-09-19 스냅샷에서 41 upvotes — 그 커뮤니티의 인기 신호일 뿐 그 이상은 아니다 (source).
방법
논문이 지목하는 문제: AutoResearch 계열 에이전트를 여러 개 돌리면 "각 세션이 맨땅에서 시작하므로, 에이전트가 늘수록 발견이 늘기보다 중복 탐색이 느는 경향이 있다" (source).
메커니즘:
- 연구가 Git 에 저장된 추가 전용 유향 비순환 그래프로 기록된다.
- 각 결과, 통찰, 가설, 검증, 보고가 불변 커밋이 되고, 부모 간선이 무엇 위에 세워졌는지를 말한다.
- 파생 인덱스가 프런티어, 방치된 가지, 각 주장의 검증 상태를 드러낸다.
- 다양성 인지 선택 규칙이 커뮤니티가 "한 명의 선두로 붕괴하지 않게" 유지한다.
Git 을 고른 것 자체가 논증이다: 출처 추적, 재현성, 기여의 단위가 새 메커니즘 셋이 아니라 이미 있는 메커니즘 하나로 처리되고, "모든 주장이 누구나 체크아웃하고 다시 돌려 볼 수 있는 커밋"이 된다.
결과
시스템의 첫 사례로 보고된 지속 실행 하나 (source):
| | |---|--- | 기간 | 거의 12일 | 워커 | 13개 언어모델 워커, 배정 과제 없음, 중앙 계획자 없음 | 발표된 기여 | 1,703 건 | 과제 | 141개 사전학습 도너 모델로부터 동결된 119.6M 파라미터 attention-SSM 하이브리드를 초기화하기, 학습 데이터 없이 그래디언트 갱신 없이 — 목표의 차원은 어느 도너와도 맞지 않는다 | 평가기 | 3.39 → 1.899 bits per byte | 명시된 격차 축소 | 훈련된 GPT-2 124M 까지 거리의 62% | 우승 레시피의 계보 | 15개 계정에 걸친 145개 커밋 | 게시된 독립 재현 | 165건, 하나도 실패하지 않음 우승 레시피: 도너의 next-token 통계를 목표의 임베딩과 출력 헤드로 압축해 넣고, 그다음 attention, feed-forward, state-space 블록에 희소 편집을 가해 단거리 맥락 신호를 더한다.
의의
재현 165건에 실패 0건이 결과이며, 그것은 방법이 아니라 기반에 관한 결과다. 이 위키가 쥔 다른 모든 다중 에이전트 연구 논문은 에이전트가 무엇을 찾아냈는지를 보고한다. 이 논문은 그 발견을 커밋을 체크아웃한 누구라도 165번 다시 돌릴 수 있었고 단 한 번의 불일치도 없었음을 보고한다. 그것은 기반 시설로서의 검증 가능성에 관한 주장이며, 공유 스크래치패드가 사지 못하는 것을 Git DAG 가 사 주는 단 하나다.
논문이 자신의 교란 요인을 스스로 보고하는데, 기록해 둘 만큼 드문 일이다. "커뮤니티를 단일 문화에서 끌어낸 실행 중간의 단 한 번의 사람 개입"을 기술하고, "이 기록이 확립하는 것과 확립하지 않는 것"을 진술하며, "공유 연구 상태가 컴퓨트 단위당 발견을 개선하는지를 가릴 대조 비교"를 지목한다 — 즉 헤드라인 주장이 아직 입증되지 않았다고 스스로 말한다 (source). 사람의 구조 한 번이 낀 12일짜리 단일 팔 실행은 비교가 아니라 존재 증명이고, 저자들이 먼저 그렇게 말한다.
닷새 동안 이 위키의 스냅샷 유입에 도달한 여섯 번째 자기개선 논문이며, 개선을 쥐고 있는 것이 모델도 하네스도 아니라 아카이브인 첫 사례다:
| arXiv | 제목 | 최초 포착 |
|---|---|---|
2609.15364 | RSIAgent | 2026-09-16 |
2609.11873 | The Last AI Built by Humans | 2026-09-17 |
2609.17523 | ScienceBuddy | 2026-09-17 |
2609.13406 | Generalized Agent Iteration: One Formal Framework for Iterative Policy Improvement and Recursive Self-Improvement | 2026-09-18 |
2609.18094 | Agora (이 페이지) | 2026-09-19 |
2609.20519 | SoL-Pi | 2026-09-19 |
| Generalized Agent Iteration: One Formal Framework for Iterative Policy Improvement and Recursive Self-Improvement 의 두 다이얼에 비추어 보면 Agora 는 그 프레임워크 논문이 이름 붙이지 않은 어색한 자리에 놓인다: 개선 메커니즘이 단일 에이전트 안에 있지도, 시스템 바깥에 있지도 않다 — 에이전트들이 읽고 쓰는 공유 커밋 그래프다. 이 독해는 이 위키의 것이며, 어느 논문도 다른 쪽을 인용하지 않는다. |
또한 R&D Automation Index 에 반대편에서 내려앉는다. Anthropic 은 직원을 표본으로 뽑고 작업에 등급을 매겨 AI 주도 R&D 를 측정한다. Agora 는 모든 단계가 이미 부모를 가진 커밋인 AI 주도 연구를 생산한다. 한쪽은 Slack 안에서 벌어진 일을 측정하고, 다른 쪽은 구성에 의해 그 일을 원장으로 만든다 — 그리고 그 자리에 없던 사람이 감사할 수 있는 것은 두 번째뿐이다.
열린 질문
- 컴퓨트 단위당 발견은 측정되지 않았고, 논문이 스스로 그렇게 진술한다. 같은 문제 위에서 단일 에이전트 기준선 대 12일간 13 워커가 빠진 팔이다.
- 실행 중간의 사람 개입. 12일 동안 단일 문화로부터의 구조 한 번은 작은 교정이거나 그 실행을 성립시킨 바로 그것이고, 초록은 어느 쪽인지 말하지 않는다.
- 1,703 건이 많은 것인지. 중복 기준선이 없으면 이 수는 중복 없음이 아니라 활동량의 척도이며, 중복이야말로 이 시스템이 풀려는 문제다.
- GPT-2 124M 까지 격차의 62% 가 강한 결과인지. 문제는 저자가 골랐고, 평가기는 bits per byte 이며, 그래디언트 없는 가중치 전이의 선행 연구는 읽은 자료 안에서 인용되지 않는다.
- 165건의 재현을 13개 워커 자신이 돌렸는지. 단일 커뮤니티 실행에서 "독립"은 무거운 일을 하고 있는 낱말이고, 초록에 정의되어 있지 않다.
인용
arXiv 2609.18094 — Agora: Git as Shared Memory for Collective AutoResearch, 2026-09-16. HuggingFace Daily Papers, 2026-09-19, 41 upvotes 에서 포착.