$ cat wiki/papers/2026/2608.23041-autosaddler.md
AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces (arXiv:2608.23041)
TL;DR
하네스 개선을 오프라인 학습 문제로 다시 세운다: 실패 트레이스를 진단하고, 하네스를 코드로 취급하는 구조화된 패치를 생성하고, 검증으로 갱신을 선별한다. GAIA2, SWE-Bench Pro, Terminal-Bench 2.0 에서 각 벤치마크의 기본 하네스 대비 +9.0, +9.6, +10.0 퍼센트 포인트의 향상을 보고하며 — 이 분야의 문헌으로는 드물게 — 어떤 구성요소가 실제로 효과를 냈는지 말해 주는 절제 실험을 함께 싣는다 (source).
저자와 소속
Sungho Park, Wonjoong Kim, Rongyuan Tan, Jue Zhang, Wook-Shin Han, Pengfei Gao, Chanyoung Park, Yongqiang Yao, Rao Fu, Elsie Nallipogu, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang (arXiv:2608.23041). 2026-08-24 투고; cs.AI, cs.CL, cs.LG, cs.MA, cs.SE.
arXiv 목록에 소속이 표시되지 않는다. 이 이름들 중 여럿이 과거 Microsoft Research 에서 발표해 왔으나, 이 논문에는 그렇게 명시되어 있지 않으므로 여기에서 출처로 기록하지 않는다.
HuggingFace Daily Papers, 2026-08-27, 51 upvotes 에 등재 — 그 커뮤니티의 인기 신호일 뿐 그 이상은 아니다 (source).
방법
논문이 제시하는 문제: 에이전트가 장기 지평 과제에서 실패하는 이유는 "작은 국소적 실패가 누적될 수 있기" 때문이고, 하네스 설계는 "프롬프트, 도구 구성, 제어 논리"에 걸친 수작업 탐색이라는 것이다.
실패 신호의 미니배치 위에서 반복 적용되는 세 구성요소:
- 실패 트레이스 진단 — 실행 트레이스에서 무엇이 잘못되었는지 읽는다
- 구조화된 패치 생성 — 하네스를 코드로서 편집한다
- 검증 기반 갱신 선별 — 검증을 통과한 패치만 남긴다
"Durable updates" 가 이를 구별짓는 표현이다: 하네스 변경이 실행마다의 반성이 아니라 지속된다 (source).
결과
모든 수치는 저자 보고이며, 독립 재현은 언급되지 않았다.
| 벤치마크 | 기본 하네스 대비 향상 |
|---|---|
| GAIA2 | +9.0 pp |
| SWE-Bench Pro | +9.6 pp |
| Terminal-Bench 2.0 | +10.0 pp |
| 절대 점수는 전혀 제시되지 않고 증분만 있으며, 모델도 명시되지 않는다. SWE-Bench | |
| Pro 에서 +9.6 pp 는 20% 에서 출발할 때와 60% 에서 출발할 때 의미가 다른데, 읽은 어떤 | |
| 자료도 어느 쪽인지 말하지 않는다. |
절제 실험이 간직할 만한 부분이다. 세 구성요소가 필요하다고 보고된다:
- 얕은 반성이 아니라 깊은 디버깅
- 제약 없는 편집이 아니라 표적화된 수정
- 궤적별 수리가 아니라 일반화를 고려한 선별
셋 모두 에이전트 문헌이 흔히 쓰는 더 단순한 방법에 대한 부정적 결과다.
의의
이 위키의 군집에서 레시피의 어느 부분이 중요한지 말해 준 첫 하네스 논문이다. Eval Harness Configuration 은 이제 스캐폴드가 점수를 움직인다고 주장하는 논문 여섯 편을 담고 있는데, 거의 전부가 증분을 보고하고 거기서 멈춘다. 이 논문은 절제 실험을 하고, 세 결과가 모두 같은 방향을 가리킨다 — 제약되고, 진단되고, 일반화하는 편집이 자유 형식의 자기반성을 이긴다.
세 번째 구성요소는 이웃한 결과의 메커니즘과 정면으로 충돌한다. "궤적별 수리가 아니라 일반화를 고려한 선별"은 하네스를 그것이 튜닝된 궤적에 맞춰 버리는 것에 대한 직접적인 경고인데, 그것이 바로 이 위키가 Prime Agent: A Self-Improving RLM Harness (arXiv:2608.23552) 의 Continual Harness 에 대해 기록한 위험이다 — 그 설계 전체가 궤적을 가로질러 상태를 실어 나른다. 어느 논문도 다른 쪽을 인용하지 않으며, 이 긴장은 이 위키의 독해이고 그렇게 명시한다.
베이스라인 없는 증분이 이 군집의 특징적 공백이 되어 가고 있다. Prime Agent 는 모델을 밝히지 않은 채 30% → 95.5% 를 발표했고, 이 논문은 절대 점수 없이 세 개의 증분을 발표한다. 하네스가 얼마나 중요한지에 대한 문헌이 그것이 무엇 대비 중요한지를 체계적으로 빠뜨리고 있다.
열린 질문
- 어떤 모델이고, 절대 점수는 얼마인가? 둘 다 명시되지 않았고, 무엇과 비교하려 해도 둘 다 필요하다.
- 각 벤치마크의 기본 하네스는 무엇인가? GAIA2, SWE-Bench Pro, Terminal-Bench 2.0 은 서로 다른 참조 스캐폴드를 배포하며, "각 벤치마크의 기본 하네스"라는 표현이 많은 것을 떠받치고 있다.
- 최적화에 얼마나 많은 연산이 드는가? 트레이스 위의 미니배치 오프라인 학습에는 비용이 있고, 보고된 어떤 수치도 이를 상계하지 않는다.
- 최적화된 하네스가 벤치마크 사이를 이전하는가? 이 방법은 구성상 과제별이며, 패치가 일반화하는지 여부가 도구와 튜닝 요령을 가르는 차이다.
인용
AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces (2026). arXiv:2608.23041.
관련
- Eval Harness Configuration
- Agents (LLM Agents)
- JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution (arXiv:2608.25593)
- Prime Agent: A Self-Improving RLM Harness (arXiv:2608.23552)
- Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses (arXiv:2608.08466)