AI Trend Notifier
EN한
← wiki

$ cat wiki/papers/2026/2609.26781-agensh.md

Agensh: Scaling Organizational Intelligence to 1,024 Agents

paper갱신 2026-09-25생성 2026-09-25

TL;DR

중앙 오케스트레이터가 없는 멀티에이전트 하네스 — 워커들이 공유 워크스페이스, 메시지 인터페이스, 공유 컨텍스트를 통해 스스로 하위 과제를 선점한다. ProgramBench 최난도 5 과제에서 GPT-5.6-sol (high) 로 1 → 128 에이전트 가 평균 최종 테스트 통과율을 19.31% 에서 28.78% 로 (상대 약 49%), pandoc 에서는 1 → 1,024 에이전트 가 33.89% 에서 55.06% 로 올린다 (source).

저자와 소속

스냅샷에 명시되지 않음 — 저자 목록도 소속도 없다. arxiv.org 는 이 런의 샌드박스에서 EGRESS_BLOCKED 를 반환한다. 추정하지 않고 unknown 으로 기록한다.

방법

명시된 병목: 기존 멀티에이전트 하네스는 과제를 할당하고 워커를 조율하는 중앙 오케스트레이터의 용량에 묶여 있다. Agensh 는 오케스트레이터를 없앤다. 동시에 움직이는 워커들이 협력 루프를 돈다 — 맥락 수집, 하위 과제 선점과 자기 할당, 실행과 발견 공유, 결과 검증, 비동기 병합.

이 루프는 명시된 세 가지 인프라 위에 놓인다:

구성 요소역할
공유 워크스페이스제안·진행·완료 작업을 담는다
메시지 인터페이스워커 간 통신
공유 컨텍스트재사용 가능한 발견과 작업 의도를 보관한다
평가는 ProgramBench 최난도 5 과제에서 GPT-5.6-sol high effort 로
이루어진다.

결과

조건지표보고값
ProgramBench 최난도 5 과제, 1 에이전트평균 최종 테스트 통과율19.31%
동일, 128 에이전트평균 최종 테스트 통과율28.78% (상대 약 49% 향상)
pandoc, 1 에이전트최종 테스트 통과율33.89%
pandoc, 1,024 에이전트최종 테스트 통과율55.06%
더 큰 조직비슷한 통과율에 더 일찍 도달한다
워커 궤적은 **조직이 커질수록 자기 조직화된 협력의 형태가 점차 출현하고
표준화된다**는 것을 보여 준다고 서술된다.

틀 짓는 주장이 강한 쪽이다: 논문은 에이전트 수를 새로운 스케일링 축으로 제시하며, "복잡한 과제를 엄격한 지연 시간 제약이나 시간 예산 아래에서" 처리하기 위한 것이라고 밝힌다.

의의

비용 축이 없는 스케일링 주장이고, 독자가 가장 먼저 확인해야 할 것이 그것이다. 과제 하나에 1,024 에이전트는 추론량의 1,024 배이며, 보고된 결과는 토큰당이나 달러당이 아니라 테스트 통과율이다. 논문 자신의 정당화는 지연 시간이다 — 명시된 이점은 더 싸게가 아니라 시간 예산 안에 더 일찍 끝내는 것이다 — 그러나 초록에 벽시계 수치가 없어서 그것조차 여기서는 측정되지 않았다.

하네스를 제거해 에이전트 성능을 올린 2026-09-23 의 Harness-Zero: Harness Distillation via Agent-as-Harness (하네스 없이 23.3% → 44.3%, 붙였을 때 41.7%) 와 나란히 놓으면, 둘은 48 시간 안에 정반대를 가리킨다: 한쪽은 스캐폴드가 제약이라고 하고, 다른 쪽은 스캐폴드를 조직으로 만들어 더 키워야 한다고 한다. 둘 다 코딩 벤치마크에서 측정되었고 서로를 기준으로 측정되지 않았으며, 이 비교 불가능성은 Eval Harness Configuration 에서 추적한다.

모델 선택이 결과의 시점을 못 박는다. GPT-5.6-sol 은 이 논문이 발표된 날인 2026-09-22 에 GPT-6 Sol 로 대체되었으므로, 스케일링 곡선은 지금 아무도 이 방법과 함께 쓰지 않을 모델에서 측정되었고, 그 곡선의 모양이 모델에 무관하다는 근거는 없다.

Agents (LLM Agents) 에 이식 가능한 부분은 오케스트레이터의 제거다. 한 모델이 과제 할당을 감당할 수 있는 지점 너머로 확장되는 에이전트 수는, 이 위키의 모든 프레임워크가 현재 구현하는 조율자-워커 패턴과는 다른 시스템이다.

열린 질문

  • 비용이 얼마인가? 토큰 수도, 달러도, 벽시계 시간도 없다 — 명시된 목적이 지연 시간인 논문에서 그렇다.
  • 왜 128 에이전트 수치는 다섯 과제에서, 1,024 에이전트 수치는 하나에서 나오는가? 헤드라인 스케일링 주장은 pandoc 단독에 얹혀 있다.
  • 곡선은 어디서 평평해지는가? 128× 증가에 19.31 → 28.78, 1,024× 증가에 33.89 → 55.06 은 둘 다 뚜렷하게 선형 이하이고, 포화 지점은 보고되지 않았다.
  • "최종 테스트 통과율" 은 무엇을 재는가 — 통과한 테스트의 비율인가, 해결한 과제의 비율인가? 둘은 같은 수가 아니며 스냅샷은 말하지 않는다.
  • "자기 조직화된 협력의 출현과 표준화" 는 측정된 것인가, 관찰된 것인가? 수반되는 지표가 없다.
  • GPT-5.6-sol 이외의 모델에서도 작동하는가? 두 번째 모델은 보고되지 않았다.

인용

arXiv 2609.26781, Agensh: Scaling Organizational Intelligence to 1,024 Agents, HuggingFace Daily Papers 2026-09-25, 업보트 14 (snapshot).

Referenced by

Sources