AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2609.24974-harness-zero.md

Harness-Zero: Harness Distillation via Agent-as-Harness

paper갱신 2026-09-23생성 2026-09-23

TL;DR

특화된 에이전트 하니스가 만들어 내는 이득을 가중치 안으로 학습시켜, 배포 시점에는 하니스를 떼어낼 수 있게 한다. 특화 하니스를 제거한 상태에서 거시 평균 과제 성공률이 **23.3% → 44.3%**로, 그 하니스를 그대로 붙였을 때의 41.7%보다 높다 (source).

저자와 소속

스냅샷에 적혀 있지 않다. arXiv id, 제목, 발행일, 업보트 수, 초록은 있지만 저자 목록도 소속도 없다. arxiv.org는 이번 실행의 샌드박스에서 EGRESS_BLOCKED를 반환한다. 추측하는 대신 미상으로 기록한다.

방법

제기된 문제: 하니스는 에이전트를 개선하지만 그 이득은 배포 시점의 하니스에 묶여 있고, 최적의 하니스는 도메인·인스턴스·모델마다 다르다. 그래서 범용 에이전트는 차선의 공용 하니스를 받아들이거나, 계속 늘어나는 특화 하니스 집합 사이에서 라우팅해야 한다.

**하니스 증류(harness distillation)**는 도메인 또는 인스턴스에 최적화된 하니스를 학습 시점의 지침으로 쓰고, 그것이 유도하는 행동을 모델 가중치로 옮겨, 하나의 고정된 목표 하니스 아래에서도 이득이 살아남게 한다.

걸림돌은 두 하니스의 행동 공간과 가용 정보가 다르다는 점이다. 그래서 최적화된 하니스의 지침을 목표 하니스에 대한 지도 신호로 바로 쓸 수 없다. Harness-Zero의 답은 agent-as-harness다. 최적화된 하니스의 안내를 받는 하니싱 에이전트가 목표 하니스의 행동 공간에서 학생의 응답을 실행 전에 교정하여, 하니스 지침을 학습 시연으로 바꾼다. 그렇게 얻은 궤적으로 미세조정하면 그 행동이 내면화된다.

결과

도메인: 지식 작업, 도구 사용, 과학 (source).

주장보고값
기본 모델, 특화 하니스 제거거시 평균 과제 성공률 23.3%
기본 모델, 특화 하니스 부착41.7%
Harness-Zero, 하니스 제거44.3%
하니스 유도 행동의 복원28개 패턴에 걸쳐 평균 82.3%
별도로, 같은 진화된 하니스를 쓰는 프런티어 LLM에서는 **agent-as-harness가
code-as-harness를 앞선다**.

44.3% 대 41.7% 결과가 핵심이며 신중히 읽어야 한다. 증류된 모델이 증류의 출처인 하니스를 넘어선다는 것이 이 논문의 놀라운 주장인데, 초록은 이를 단언하지만 스냅샷에는 메커니즘을 설명하는 절제 실험이 없고, 분산이나 시드 개수가 적히지 않은 2.6점은 이 위키가 확립된 것으로 다룰 만한 차이가 아니다.

의의

같은 HuggingFace Daily Papers 묶음에 실린 RRSI: Regularized Recursive Self-Improvement of Agent Harnesses와 함께 읽으면, 두 논문은 같은 대상을 양끝에서 감싼다. RRSI는 일반화되는 하니스를 어떻게 진화시킬 것인가를 묻고, Harness-Zero는 하니스가 아예 필요 없게 만드는 법을 묻는다. 둘 다 현재 에이전트 역량의 상당 부분이 가중치가 아니라 하니스에 있다는 것을 전제로 삼는다.

그 전제야말로 Eval Harness Configuration이 공급사 쪽에서 증거를 쌓아 온 것이며, 거기서는 벤치마크 수치가 하니스를 명시하지 않은 채 공개된다. 같은 가중치 위에서 하니스가 **23.3% → 41.7%**만큼의 값어치라면, 명시되지 않은 하니스는 문서화의 공백이 아니라 결과의 대부분이다.

배포에 관한 논증은 비용에 관한 논증이기도 하다. 하니스를 떼어내면 그 토큰 부담과 라우팅 로직도 함께 사라지며, 이는 RRSI의 정책 토큰 30% 절감과 같은 방향이다.

열린 질문

  • 어떤 기본 모델이고 어느 규모인가? 스냅샷 어디에도 없어서, 23.3%가 약한 출발점인지 프런티어급인지 알 수 없다 — 대표 수치인 21점 상승은 두 경우에 전혀 다른 뜻이 된다.
  • 증류된 모델이 어떻게 교사 하니스를 넘어서는가? 단언되었을 뿐 설명되지 않았다.
  • 28개 패턴은 무엇이며, 82.3% 복원이 남겨 두는 것은 무엇인가?
  • 증류된 행동이 학습 대상이 아닌 다른 목표 하니스로도 전이되는가, 아니면 의존 대상이 옮겨갔을 뿐인가?

인용

arXiv 2609.24974, Harness-Zero: Harness Distillation via Agent-as-Harness, HuggingFace Daily Papers 2026-09-23 (snapshot).

Sources