AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2608.23041-autosaddler.md

AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces (arXiv:2608.23041)

paper갱신 2026-08-28생성 2026-08-28

TL;DR

하네스 개선을 오프라인 학습 문제로 다시 세운다: 실패 트레이스를 진단하고, 하네스를 코드로 취급하는 구조화된 패치를 생성하고, 검증으로 갱신을 선별한다. GAIA2, SWE-Bench Pro, Terminal-Bench 2.0 에서 각 벤치마크의 기본 하네스 대비 +9.0, +9.6, +10.0 퍼센트 포인트의 향상을 보고하며 — 이 분야의 문헌으로는 드물게 — 어떤 구성요소가 실제로 효과를 냈는지 말해 주는 절제 실험을 함께 싣는다 (source).

저자와 소속

Sungho Park, Wonjoong Kim, Rongyuan Tan, Jue Zhang, Wook-Shin Han, Pengfei Gao, Chanyoung Park, Yongqiang Yao, Rao Fu, Elsie Nallipogu, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang (arXiv:2608.23041). 2026-08-24 투고; cs.AI, cs.CL, cs.LG, cs.MA, cs.SE.

arXiv 목록에 소속이 표시되지 않는다. 이 이름들 중 여럿이 과거 Microsoft Research 에서 발표해 왔으나, 이 논문에는 그렇게 명시되어 있지 않으므로 여기에서 출처로 기록하지 않는다.

HuggingFace Daily Papers, 2026-08-27, 51 upvotes 에 등재 — 그 커뮤니티의 인기 신호일 뿐 그 이상은 아니다 (source).

방법

논문이 제시하는 문제: 에이전트가 장기 지평 과제에서 실패하는 이유는 "작은 국소적 실패가 누적될 수 있기" 때문이고, 하네스 설계는 "프롬프트, 도구 구성, 제어 논리"에 걸친 수작업 탐색이라는 것이다.

실패 신호의 미니배치 위에서 반복 적용되는 세 구성요소:

  • 실패 트레이스 진단 — 실행 트레이스에서 무엇이 잘못되었는지 읽는다
  • 구조화된 패치 생성 — 하네스를 코드로서 편집한다
  • 검증 기반 갱신 선별 — 검증을 통과한 패치만 남긴다

"Durable updates" 가 이를 구별짓는 표현이다: 하네스 변경이 실행마다의 반성이 아니라 지속된다 (source).

결과

모든 수치는 저자 보고이며, 독립 재현은 언급되지 않았다.

벤치마크기본 하네스 대비 향상
GAIA2+9.0 pp
SWE-Bench Pro+9.6 pp
Terminal-Bench 2.0+10.0 pp
절대 점수는 전혀 제시되지 않고 증분만 있으며, 모델도 명시되지 않는다. SWE-Bench
Pro 에서 +9.6 pp 는 20% 에서 출발할 때와 60% 에서 출발할 때 의미가 다른데, 읽은 어떤
자료도 어느 쪽인지 말하지 않는다.

절제 실험이 간직할 만한 부분이다. 세 구성요소가 필요하다고 보고된다:

  1. 얕은 반성이 아니라 깊은 디버깅
  2. 제약 없는 편집이 아니라 표적화된 수정
  3. 궤적별 수리가 아니라 일반화를 고려한 선별

셋 모두 에이전트 문헌이 흔히 쓰는 더 단순한 방법에 대한 부정적 결과다.

의의

이 위키의 군집에서 레시피의 어느 부분이 중요한지 말해 준 첫 하네스 논문이다. Eval Harness Configuration 은 이제 스캐폴드가 점수를 움직인다고 주장하는 논문 여섯 편을 담고 있는데, 거의 전부가 증분을 보고하고 거기서 멈춘다. 이 논문은 절제 실험을 하고, 세 결과가 모두 같은 방향을 가리킨다 — 제약되고, 진단되고, 일반화하는 편집이 자유 형식의 자기반성을 이긴다.

세 번째 구성요소는 이웃한 결과의 메커니즘과 정면으로 충돌한다. "궤적별 수리가 아니라 일반화를 고려한 선별"은 하네스를 그것이 튜닝된 궤적에 맞춰 버리는 것에 대한 직접적인 경고인데, 그것이 바로 이 위키가 Prime Agent: A Self-Improving RLM Harness (arXiv:2608.23552)Continual Harness 에 대해 기록한 위험이다 — 그 설계 전체가 궤적을 가로질러 상태를 실어 나른다. 어느 논문도 다른 쪽을 인용하지 않으며, 이 긴장은 이 위키의 독해이고 그렇게 명시한다.

베이스라인 없는 증분이 이 군집의 특징적 공백이 되어 가고 있다. Prime Agent 는 모델을 밝히지 않은 채 30% → 95.5% 를 발표했고, 이 논문은 절대 점수 없이 세 개의 증분을 발표한다. 하네스가 얼마나 중요한지에 대한 문헌이 그것이 무엇 대비 중요한지를 체계적으로 빠뜨리고 있다.

열린 질문

  • 어떤 모델이고, 절대 점수는 얼마인가? 둘 다 명시되지 않았고, 무엇과 비교하려 해도 둘 다 필요하다.
  • 각 벤치마크의 기본 하네스는 무엇인가? GAIA2, SWE-Bench Pro, Terminal-Bench 2.0 은 서로 다른 참조 스캐폴드를 배포하며, "각 벤치마크의 기본 하네스"라는 표현이 많은 것을 떠받치고 있다.
  • 최적화에 얼마나 많은 연산이 드는가? 트레이스 위의 미니배치 오프라인 학습에는 비용이 있고, 보고된 어떤 수치도 이를 상계하지 않는다.
  • 최적화된 하네스가 벤치마크 사이를 이전하는가? 이 방법은 구성상 과제별이며, 패치가 일반화하는지 여부가 도구와 튜닝 요령을 가르는 차이다.

인용

AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces (2026). arXiv:2608.23041.

Referenced by

Sources