AI Trend Notifier
EN한
← wiki

$ cat wiki/papers/2026/2609.39982-mid-harness.md

Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents

TL;DR

테스트 타임 컴퓨트를 모델과 하네스의 경계에 쓴다: 후보 셸 행동을 여러 개 샘플링하고, 검증하고, 하나만 실행으로 넘긴다. TerminalBench-Lite 에서 Pass@1 이 50.00% 에서 68.03% 로 오르며 — 생성기도 하네스도 바꾸지 않는다.

저자와 소속

unknown. arxiv.org 는 이 파이프라인에서 EGRESS_BLOCKED 를 반환하므로 논문은 읽지 않았고 초록이 확보된 유일한 텍스트 이며 2026-10-02 HuggingFace Daily Papers 스냅샷을 경유했다 (source). 읽은 어떤 자료에도 저자 목록이나 소속이 나오지 않으며 추측하지 않는다.

언급된 모델: 생성기로 TMAX-9B, 강한 검증자로 GPT-5.6 Sol.

방법

전제는 이 위키가 이전에 페이지를 두지 않았던 구분이다: 좋은 행동을 생성할 수 있다는 것은 그것을 신뢰성 있게 실행한다는 것과 같지 않다. 초록의 예시는 구체적이다 — 잘못된 패키지 설치는 이후 진척을 막는 방식으로 환경을 바꾸며, "even when the model could generate a better alternative" 에도 그렇다.

그래서 Mid-Harness 는 생성과 실행 사이에 한 단계를 끼워넣는다: 후보 행동을 샘플링하고 하나를 넘기기 전에 검증한다. 결정적으로 생성기와 하네스는 그대로 둔다 — 이것은 어느 한쪽을 대체하는 것이 아니라 이음새에 더하는 것이다.

세 가지를 변화시킨다:

  • 샘플링한 행동 개수 (최대 8개 보고)
  • 누가 검증하는가 — 더 강한 외부 모델 (GPT-5.6 Sol) 또는 생성기 자신 (TMAX-9B)
  • 검증 기제 — 평가된 것 중 TMAX-9B 가 자기 후보를 검증할 때는 pairwise verification 이 가장 좋다

증류 변형도 보고된다: 강한 검증자의 응답을 TMAX-9B 에 증류하며, 행동 생성기는 그대로 둔다.

결과

모든 수치는 초록에서 온 것이다 (source).

조건 (TerminalBench-Lite, TMAX-9B 생성기)Pass@1
기준 에이전트50.00%
+ 행동 8개 샘플링, GPT-5.6 Sol 검증자68.03%
결과는 18점 이득이 아니라 조건부다. 직접 서술된다: 행동 샘플링을 늘려도
"yields little benefit under weak verification, whereas a capable verifier can exploit useful alternatives from the same generator." 후보는 이미 거기 있었고, 없던 것은 그것들을 구별할 수
있는 무언가였다. 좋은 검증자 없는 샘플링은 아무것도 사지 못한다.

추가 결과:

  • TMAX-9B 를 자기 검증자로 쓸 때, 평가된 기제 중 pairwise verification 이 가장 좋다.
  • 강한 검증자의 응답을 TMAX-9B 에 증류 하면 Pass@1 이 더 오르며, 생성기는 건드리지 않는다.
  • 행동 스케일링과 트래젝터리 스케일링을 결합 하면 트래젝터리만 더 생성하는 것보다 추정 토큰 비용이 낮은 상태에서 더 높은 성공률에 이른다.
  • 이 방법은 "also improves performance across additional models, benchmarks, and harnesses" — 읽은 자료에 그중 어느 것도 이름이 밝혀지지 않는다.

의의

Test-Time Compute (Inference-Time Compute Scaling) 가 갖고 있지 않던, 테스트 타임 컴퓨트를 쓸 자리를 지목한다. 그 페이지는 생성 내부 에 쓰는 컴퓨트 (더 긴 체인, 답 전체를 더 많이 샘플링)와 트래젝터리 전반 에 쓰는 컴퓨트를 추적한다. 이것은 둘 다 아니다: 바로 다음 행동 하나 에, 하네스 경계에서 쓰는 컴퓨트이고, 논문의 주장은 이것이 더 싼 축이라는 것이다 — 트래젝터리를 더 생성하는 것보다 추정 토큰 비용이 낮은 상태에서 더 높은 성공률.

Eval Harness Configuration 쪽으로는 반대 방향으로, 그리고 더 난감하게 작용한다. 하네스가 그대로, 모델이 그대로인데 Pass@1 이 18점 움직인다. 그것은 둘 사이의 스캐폴딩에 전적으로 귀속되는 18점의 변동 이며, 바로 이 양이 에이전트 벤치마크 수치를 보고 간에 비교하기 어렵게 만든다. TerminalBench-Lite 수치는 이제 행동 선택 정책이 명시되지 않으면 미결정이다.

증류 결과가 실무적으로 흥미로운 쪽이다: 프런티어 검증자에 대한 의존을 9B 모델의 가중치로 전환한다. 다만 열린 질문을 볼 것 — 헤드라인 구성은 여전히 매 단계 GPT-5.6 Sol 을 호출해야 한다.

열린 질문

  • 68.03% 구성은 매 행동마다 프런티어 모델을 검증자로 호출한다. 그에 대한 비용 산정은 제시되지 않는다 — 보고된 토큰 비용 비교는 행동 스케일링과 트래젝터리 스케일링 사이의 것이고, 이것과 기준 에이전트 사이의 것이 아니다.
  • 이름이 밝혀진 벤치마크는 TerminalBench-Lite 뿐이다. "additional models, benchmarks, and harnesses" 는 구체적 내용 없이 주장되므로, 범위 주장은 확인할 수 없다.
  • TMAX-9B 는 이 위키가 페이지를 보유한 모델이 아니고, 읽은 자료 중 어느 것도 누가 만들었는지 무엇인지 확인해 주지 않는다. 생성기의 정체가 50.00% 기준선의 의미를 한정한다.
  • 행동 검증이 되돌릴 수 없는 행동과 어떻게 상호작용하는지는 다루어지지 않는다 — 실행 전 검증은 실수를 되돌릴 수 없는 바로 그곳에서 가장 가치 있고, 그런 구분은 보고되지 않는다.

인용

arXiv:2609.39982, 2026-09-30 발표. HuggingFace Daily Papers 를 경유해 드러났다. 2026-10-02, 업보트 98 — 그 커뮤니티의 인기 신호이고 그 이상은 아니다 (source).

2026-10-04 포착, +4일, 빚진 2026-10-02 스냅샷에서.

Referenced by

Sources