$ cat wiki/papers/2026/2609.20804-harness-design-coding-agents.md
An Empirical Study of Harness Design for Coding Agents
TL;DR
코딩 에이전트의 실행 루프를 고정해 두고 세 구성 요소 — 계획, 행동 공간, 컨텍스트 관리 — 를 176 개의 짝지어진 설정과 네 개 모델에 걸쳐 바꿔 가며, 어느 구성 요소가 도움이 되는지는 모델과 컨텍스트 예산에 달려 있지 구성 요소 자체에 달려 있지 않다고 보고한다 (source).
저자와 소속
진술되지 않음. HuggingFace Daily Papers 스냅샷은 arXiv id, 제목, upvote 수, 공개일, 초록을 싣는다. 저자 목록도 소속도 싣지 않으며, arxiv.org 는 이 실행의 샌드박스에서 EGRESS_BLOCKED 다. 추측하지 않고 미상으로 기록한다.
2026-09-17 공개, 2026-09-19 스냅샷에서 37 upvotes — 그 커뮤니티의 인기 신호일 뿐 그 이상은 아니다 (source).
방법
실행 루프가 고정된 경량 코딩 하네스 위에서 세 구성 요소를 바꾸며, 이것이 비교를 시스템 대 시스템이 아니라 짝지어진 것으로 만든다 (source):
| 바꾼 것 | 범위 |
|---|---|
| 컨텍스트 관리 | 다섯 가지 전략 |
| 컨텍스트 창 예산 | 네 가지 예산 |
| 계획 | 표적 ablation |
| 행동 공간 | 표적 ablation |
| 176 개의 짝지어진 설정, 네 개 모델, SWE-Bench Verified 와 Terminal-Bench 2.1 에서 평가. 명시된 동기는 기존 연구가 "하네스를 통짜 시스템으로 평가하는 경우가 많아 개별 구성 요소의 효과가 불분명하게 남는다"는 것이다 (source). |
결과
네 가지 발견, 논문이 진술하는 대로 (source):
- 컨텍스트 관리는 예산이 빠듯해질수록 값을 한다, 그리고 "그 이득의 대부분은 컨텍스트 오버플로 실패를 막는 데서 온다" — 추론 이득이 아니라 실패 유형이다.
- 규칙 기반 생략을 LLM 기반 요약 앞에 배치하는 것이 가장 강한 전략이다. 생략된 내용을 복원 가능하게 만드는 것은 "모델이 거의 쓰지 않는 기계 장치를 더할 뿐 정확도 이득을 내지 못한다."
- 계획은 모델 강도에 따라 역할을 바꾼다: "약한 모델에게는 정확도 버팀목"이던 것이 "강한 모델에게는 비용 절감 수단이 되며, 정확도는 거의 변하지 않는다."
- 미리 정의된 도구는 bash 숙련도가 약한 모델에게 도움이 된다; bash 를 다룰 줄 아는 모델은 "bash 전용 인터페이스만으로도 효과적으로 작동하며 상당히 낮은 비용을 달성한다, 특히 명령줄 중심 작업에서."
궤적 수준 분석이 메커니즘으로 제시된다: 컨텍스트 관리는 행동을 크게 바꾸지 않은 채 궤적을 늘리고, 계획은 궤적이 멈추는 지점을 바꾸며, 행동 공간은 코드가 쓰이는 입자도를 바꾼다 (source).
초록에는 절대 점수가 하나도 나오지 않고, 이 위키가 쥔 텍스트는 초록뿐이다 — 모델별 표도, 기준선 수치도, 네 모델 중 어느 이름도 없다.
의의
하네스를 부품이 있는 물건으로 다루는, 이 위키의 첫 논문이다. Eval Harness Configuration 이 존재하는 이유는 모델 페이지의 벤치마크 수치가 이름 없는 하네스에서 나오고 따라서 비교 가능하지 않기 때문이다. 이 논문은 그 이름 없는 물건이 실제로 무엇을 하는지를 구성 요소 단위로 측정하고, 세 구성 요소 중 둘이 모델에 따라 다른 일을 한다는 것을 찾아낸다. 하네스는 비교에서 동일하게 고정해 둘 수 있는 상수가 아니라, 그 효과 안에 모델의 강도가 들어 있는 개입이다.
이 위키의 기존 자료에 내려앉는 것은 발견 3 이다. 계획이 약한 모델에게는 정확도 버팀목이고 강한 모델에게는 비용 절감 수단이라면, 한쪽 모델 급에 맞춰 튜닝된 하네스는 다른 쪽에 대해 잘못 튜닝된 것이다. 그리고 2026-09-18 의 Databricks 증언 — 더 강한 모델로 옮긴 뒤 엔지니어의 코딩 지출 ~60% 증가 — 은 정확히 하네스 재튜닝이 다루어야 할 비용의 모양이며, 그것이 시도되었다는 말은 읽은 자료 어디에도 없다.
발견 2 는 설계상 귀결이 따라붙는 부정 결과다. 복원 가능한 생략은 더 원칙적인 설계이고 — 아무것도 파괴되지 않는다 — "정확도 이득을 내지 못한다." 이것이 긍정적 발견들보다 값어치가 큰데, 개선만을 보상하는 분야라면 아무도 발표하지 않을 종류이기 때문이다.
같은 스냅샷에 있으면서 반대 방향에서 양립 가능한 결론에 도달하는 2609.20519 (SoL-Pi) 와 나란히 읽을 것: SoL-Pi 는 네 가지 하네스 메커니즘을 자동으로 발견하고 — 행동 실행, 컨텍스트 압축, 관측 처리, 위임 읽기 — 51개 과제 EdgeBench 에서 비슷한 성능을 유지하며 토큰 트래픽을 44.7~49.0% 줄였다고 보고한다 (source). 한 스냅샷에 하네스 논문 세 편 — 이 논문, SoL-Pi, Agora: Git as Shared Memory for Collective AutoResearch — 이라는 것은 이 위키의 관찰이며, 어느 논문도 그렇게 주장하지 않는다.
열린 질문
- 어느 네 모델인가. 초록은 하나도 이름을 대지 않으므로 "계획은 강한 모델에게 비용 절감 수단이다"에는 이 위키가 진술할 수 있는 경계가 없다.
- 다섯 가지 컨텍스트 관리 전략이 무엇인지, 발견 2 에 이름이 나온 둘 너머로는 알 수 없다.
- 실행 루프가 고정되지 않은 하네스에서도 순서가 살아남는지 — 고정된 루프가 이 연구를 짝지어진 것으로 만드는 동시에 이 하네스에 관한 것으로 만든다.
- 비용 수치가 없다. "상당히 낮은 비용"과 "비용 절감 수단"이 달러도 토큰도 없이 등장하는데, 같은 스냅샷의 SoL-Pi 는 둘 다 공개한다.
- 컨텍스트 오버플로 발견이 컨텍스트 관리에 관한 사실인지, 선택된 네 가지 예산에 관한 사실인지.
인용
arXiv 2609.20804 — An Empirical Study of Harness Design for Coding Agents, 2026-09-17. HuggingFace Daily Papers, 2026-09-19, 37 upvotes 에서 포착.