AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2609.01481-harness-of-harness.md

Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement

TL;DR

HoH 는 기존 코딩 에이전트 하네스를 감싸는 프레임워크로, 그 실행들을 반복적인 계획–코딩–테스트 루프로 조직한다. 세 벤치마크에 걸친 세 하네스–모델 조합에서 단독 하네스 대비 평균 상대 향상 52.25%, 최대 82.86% 를 3회 반복 이후에 보고하고, 70회 넘는 반복의 다일간 실행에서는 플레이 가능한 1인칭 슈터 게임을 자율적으로 개발한다 (source).

저자와 소속

읽은 어떤 자료에도 공개되지 않았다. HuggingFace Daily Papers 스냅샷은 제목·초록·업보트 수는 담지만 저자 목록은 담지 않고, arxiv.org 는 이 실행의 샌드박스에서 EGRESS_BLOCKED 로 응답한다. 그래서 저자와 소속은 추측하지 않고 기록하지 않는다. HuggingFace Daily Papers, 2026-09-03, 10 업보트. arXiv 공개일 2026-09-01 (source).

방법

HoH 는 코딩 에이전트 하네스를 대체하지 않고 그 위에 앉는다. 이름이 거기서 나온다. 명시된 설계 원칙은 다음과 같다 (source):

  • 고치기만 하지 않고 수리역량 성장의 균형을 잡는다
  • 개발을 작고 검증 가능한 증분으로 구획한다
  • 구현 시점의 테스트독립 평가를 분리한다
  • 에이전트 워크플로를 규정하는 대신 검증 가능한 산출물을 제약한다
  • 산출물, 역할별 도구, 스킬을 점진적으로 노출한다
  • 재생성이 아니라 재사용을 권장한다
  • 버전 관리된 프로젝트 이력을 유지한다

네 번째가 하중을 지는 항목이다. 산출물에 대해 무엇이 참이어야 하는지를 제약하고 에이전트의 절차는 자유롭게 두는 것은 스캐폴드 중심 접근의 반대이며, 자신이 설계하지 않은 하네스에 걸쳐 HoH 가 이식 가능한 이유다.

결과

세 하네스–모델 조합, 의도적으로 벤더를 가로지른다 (source):

HarnessModel
CodexGPT-5.5
OpenCodeDeepSeek-V4-Pro
PiMiniMax-M3
벤치마크는 GameCraft-Bench, FrontierSWE, ProgramBench. HoH 는 "대응하는 단독 하네스를
일관되게 능가" 하며, 평균 상대 향상 52.25%, 최대 82.86%, 3회 반복 이후다.

다일간 배치는 70회 넘는 반복을 돌려 "일관된 스토리라인, 완전히 구현된 핵심 메커닉, 사람이 플레이할 수 있는 경험, 다듬어진 비주얼과 통합된 오디오" 를 갖춘 1인칭 슈터 게임을 만들었다.

헤드라인을 주의해 읽어야 한다. 이것들은 각 하네스 자신의 베이스라인 대비 상대 향상이고, 읽은 어떤 자료에도 절대 점수가 없다. 낮은 기준선에서의 52.25% 상대 향상과 높은 기준선에서의 그것은 매우 다른 주장인데, 초록은 둘을 구분하지 않는다. 게임 시연도 마찬가지로 "사람이 플레이할 수 있는", "다듬어진" 같은 정성적 서술이고, 두 표현 어느 쪽 뒤에도 사람 평가나 루브릭이나 수치가 없다.

의의

이 위키가 여기서 취할 결과는 백분율이 아니다. 세 다른 하네스, 세 다른 벤더의 모델 위에 얹힌 프레임워크가 셋 모두를 개선했다는 것이고 — 코딩 에이전트의 보고된 역량 중 얼마나가 가중치가 아니라 스캐폴드에 사는지를 다시 한번 측정한 것이다. Eval Harness Configuration 를 관통하는 흐름이고, 이 논문은 유난히 직접적인 형태를 더한다. 모델을 고정한 채 하네스 위의 하네스만 바꾼다.

Agents (LLM Agents) 가 추적해 온 경계도 밀어낸다. 에이전트 코딩 평가는 대부분 단일 에피소드다. HoH 의 단위는 버전 관리된 이력과 지속적 개선을 동반한 다일간 70회 이상 반복이고, 거기서의 실패 양상은 과제 실패가 아니라 축적 문제 — 데드 코드, 구조 침식, 장황함 — 다. 같은 주 인테이크의 다른 두 논문이 같은 문제군을 다른 각도에서 친다. 2608.29310 Super Library Agent 는 코드베이스 포트폴리오에 걸친 중복을, EvoUndo: Recoverability-Constrained Self-Evolution for LLM Agent Harnesses 는 에이전트의 자기 수정이 복구 가능한지를 다룬다.

같은 날 포착한 AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling 와는 해소하지 말고 명명해 둘 긴장이 있다. HoH 의 향상은 벤치마크로 채점되고, AgentJudgeBench 는 에이전트 작업의 judge 가 어려운 경우에서 77–82% 에 정체한다고 보고한다. GameCraft-Bench, FrontierSWE, ProgramBench 가 산출물을 어떻게 채점하는지는 읽은 어떤 자료에도 없으므로, HoH 의 52.25% 가 그 대역 위에 앉는지 안에 앉는지는 두 논문 어느 쪽으로도 판정할 수 없다.

열린 질문

  • 절대 점수가 없어서 상대 향상을 다른 어떤 시스템에도 위치시킬 수 없다.
  • 벤치마크 수치는 "3회 반복", 시연은 "70회 이상". 향상 곡선이 어디서 평평해지는지, 혹은 평평해지기는 하는지가 보고되지 않았다.
  • 비용이 빠져 있다. 하네스를 여러 날 루프로 돌리는 프레임워크는 토큰 지출을 배가시키는데, 읽은 자료에 컴퓨트나 비용 수치가 없다.
  • FPS 게임은 평가가 아니라 시연이다. 같은 하네스들이 HoH 없이 70회 반복하면 무엇을 만드는지에 대한 베이스라인이 없다.

인용

arXiv 2609.01481, Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement, 공개일 2026-09-01 — https://arxiv.org/abs/2609.01481 · 코드 https://github.com/Flesymeb/HarnessOfHarness → (snapshot)

Referenced by

Sources