$ cat wiki/papers/2026/2609.18805-programdistill.md
ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks
TL;DR
명세가 이슈 텍스트가 아니라 동작하는 애플리케이션 인 코딩 에이전트 벤치마크: 에이전트는 레퍼런스 앱과 상호작용하며 소프트웨어가 무엇을 하는지 알아낸 뒤, 그것을 미완성 앱에 구현해야 한다. 26개 애플리케이션에 걸친 4,063개 과제를, 사람 개입 없이 구축했다. 누적 워크플로에서 GPT-6 Astra 가 49.2%, Claude Opus 5 가 28.8% 에 이른다.
저자와 소속
명시되어 있지 않다. HuggingFace Daily Papers 스냅샷은 arXiv id, 제목, 업보트 수, 게재일, 초록을 담는다. 저자 목록도 소속도 담지 않으며, arxiv.org 는 이 실행의 샌드박스에서 EGRESS_BLOCKED 로 응답한다. 추측하지 않고 미상으로 기록한다.
방법
애플리케이션을 서로 다른 입도의 기능들로 인수분해 하고, 각 기능에 gold patch 를 통해 실행 가능한 재생 가능 동작 을 연결한다. 파이프라인 mine-craft-patch 는 26개 애플리케이션에 걸쳐 1,975개의 재생 검증된 동작 을 발굴하고 사람 개입 없이 4,063개 과제 를 구성한다 (source).
저자들이 기존 관행에 맞세우는 전제: 코딩 에이전트는 보통 이슈나 지시문으로 명시된 원하는 동작 에 대해 평가되지만, 실제 웹 개발에서 에이전트는 동작하는 소프트웨어로부터 동작을 추론 해 미완성 애플리케이션에 구현해야 할 수 있다. 레퍼런스 앱이 곧 명세다.
난이도는 과제 집합의 성질이 아니라 다이얼이다 — "restoration depth" 가 대상 애플리케이션에서 얼마나 많은 부분을 걷어냈는지를 제어한다.
결과
아홉 개의 프런티어 코딩 에이전트 를 평가했다. 공개된 수치:
| 설정 | 모델 | 결과 |
|---|---|---|
| 누적 워크플로, 전체 애플리케이션 재구성 | GPT-6 Astra | 49.2% |
| 누적 워크플로, 전체 애플리케이션 재구성 | Claude Opus 5 | 28.8% |
| 부분 애플리케이션 재구성, depth 1 → 8 | (보고된 첫 에이전트) | 100% → 64.0% |
| 부분 애플리케이션 재구성, depth 1 → 8 | (보고된 두 번째 에이전트) | 96% → 32% |
| 남길 만한 결과는 depth 곡선이다. 두 에이전트 모두 천장이거나 그 근처에서 시작하는데, 한쪽은 depth 8 까지 가며 성공의 삼분의 이 를 잃고 다른 쪽은 삼분의 일 남짓을 잃는다. depth 1 에서 선두가 100% 와 96% 에 앉아 있는 벤치마크는 아무것도 말해주지 않는다. 같은 벤치마크가 depth 8 에서는 둘을 32 포인트 로 갈라놓는다. 초록은 두 depth 곡선이 아홉 에이전트 중 각각 누구의 것인지 밝히지 않으므로, 위 두 행은 여기서 귀속시키지 않는다. |
초록에는 4,063개 과제 전체에 대한 종합 점수가 없고 애플리케이션별 분해도 없다.
의의
이것은 Eval Harness Configuration 이 W37 이래 쌓아 온 흐름 위에 내려앉는다: 에이전트에게 무엇이 어떤 경로로 전달되는지가 모델만큼이나 많은 일을 하고 있다. ProgramDistill 은 명세 경로 자체를 바꾼다 — 산문에서, 에이전트가 직접 찔러 봐야 하는 동작하는 산출물로 — 그리고 점수는 크게 떨어진다.
또한 이것은 이 위키에서 이틀 사이 GPT-6 Astra 와 Claude Opus 5 가 에이전트형 코딩 과제에서 넓은 격차로 갈린 두 번째 측정이며, 여기서의 격차는 20.4 포인트 다. 이 위키는 두 수치 어느 쪽에 대해서도 하네스 공개를 갖고 있지 않고, 그것이 바로 그 페이지가 기록하려고 존재하는 공백이다.
더 조용한 주장은 구축 비용 쪽이다: 사람이 단언문을 쓰는 것이 아니라 재생으로 검증하여, 사람 개입 없이 4,063개 과제를 만들었다. 그것이 성립한다면 에이전트형 코딩 벤치마크의 제약은 주석 예산에서, 인수분해할 애플리케이션을 갖고 있느냐로 옮겨간다.
열린 질문
- depth 곡선이 어느 에이전트를 가리키는지. 두 곡선이 공개되었고 아홉 에이전트가 돌았는데, 초록은 어느 쪽도 귀속시키지 않는다.
- "누적 워크플로" 가 무엇을 분모로 채점되는지 — 분모가 명시되어 있지 않으므로 49.2% 와 28.8% 는 서로에게만 비교 가능하고 다른 무엇에도 비교되지 않는다.
- 재생 검증이 gold patch 와 다른 올바른 해법을 인정하는지. "gold patch 를 통해 실행 가능한" 동작은 강력하면서 동시에 좁은 검증자이고, 대안 구현을 어떻게 판정하는지는 초록에 없다.
- 26개 애플리케이션이 공개인지 — 초록은 라이선스도 저장소도 명시하지 않는다.
- 아홉 에이전트에 걸쳐 하네스가 고정되었는지. 명시되어 있지 않고, 그것 없이는 20.4 포인트 격차는 이 위키가 확인할 수 없는 비교다.
관련
- Confidence Comes from Experience: Experiential Confidence Estimation from Reasoning to Agents — 2026-09-21 의 다른 Paper Pick 이자 이 논문의 짝: ProgramDistill 은 에이전트가 성공했는지를 재고, XConf 는 에이전트가 알고 있었는지를 잰다.
- Eval Harness Configuration — 이것이 속한 흐름
- Agents (LLM Agents)