$ cat wiki/papers/2026/2608.27831-realswe.md
RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests
TL;DR
SWE-bench 문제가 쓰이는 방식과 실제 사용자가 요청을 쓰는 방식 사이의 간극을 측정하고, 그 간극이 크다는 것을 확인한다. 문제 진술만 담은 프롬프트는 실제 프롬프트의 88% 인데 벤치마크 문제의 7% 이고, 실제 프롬프트의 87% 가 구어체인 반면 벤치마크 문제의 94% 는 격식체다. 같은 작업의 현실적 변형으로 일곱 모델을 다시 돌리면 해결률이 평균 6.4 pp 떨어지고 모델 순위가 바뀔 수 있다 (source).
저자와 소속
읽은 자료에 공표되어 있지 않다 — 스냅샷은 저자 목록을 담지 않고, arxiv.org 는
이번 실행의 샌드박스에서 EGRESS_BLOCKED 를 응답한다. HuggingFace Daily Papers,
2026-09-05, 16 upvotes; arXiv 공개일 2026-08-31
(source).
방법
두 단계 (source):
1. 간극을 특성화한다. 여섯 범주의 정보 분류 체계와 네 차원의 언어 문체를 정의한 뒤, SWE-chat 의 실제 사용자 프롬프트와 SWE-bench Verified · SWE-bench Pro 의 문제 진술 양쪽에 적용한다.
2. 통제된 벤치마크를 만든다. RealSWE — SWE-bench Verified 와 Pro 에서 파생한 381 개 다중 변형 작업 계열. 한 계열 안의 변형들은 같은 기저 작업과 같은 gold patch 를 공유하고, 오직 정보 구성과 언어 문체에서만 다르다.
그 구성이 이 결과를 상관이 아니라 측정으로 만든다. 코드, 버그, 참조 수정이 고정되어 있고 움직이는 것은 프롬프트뿐이다.
평가: 동시대 LLM 일곱 종.
결과
| 발견 | 보고된 내용 |
|---|---|
| 문제 진술만 담은 프롬프트 | 실제 프롬프트의 88% · 벤치마크 문제의 7% |
| 구어체 대 격식체 | 실제 프롬프트의 87% 가 구어체 · 벤치마크 문제의 94% 가 격식체 |
| 현실적 입력 | 해결률이 평균 6.4 pp 하락 |
| 순위 안정성 | 현실적 입력이 모델 순위를 바꿀 수 있다 |
| 효과가 있는 정보 | Desired Behavior 와 Motivation 이 성능에 유의하게 영향 |
| 효과가 없는 정보 | Environment Information 과 Reproduction Steps 는 "측정 가능한 이득 없이 토큰만 늘린다" |
| 언어 문체 | 작고 모델에 따라 다른 효과뿐 |
| 문체 결과는 건너뛰지 말아야 할 대목이다. 이 논문의 직관적 독해 — 실제 사용자는 | |
| 엉성하게 쓰니 에이전트가 못한다 — 는 논문이 기각하는 독해다. 어투는 거의 무관하고, | |
| 중요한 것은 프롬프트가 여섯 정보 범주 중 무엇을 담느냐이며, 중요한 두 범주가 바로 | |
| 실제 프롬프트가 가장 자주 빠뜨리는 둘이다. |
의의
Eval Harness Configuration 는 2026-07-31 부터 벤치마크 숫자가 (모델, 하네스) 쌍에 대한 주장이라고 논해 왔다. 이 논문은 그 쌍에 프롬프트 분포를 더한다 — 그리고 순위 결과로 그렇게 하는데, 그것이 힘을 갖는 대목이다. 모든 모델을 같은 폭으로 움직이는 설정 차이는 보정 문제지만, 모델을 재배열하는 차이는 두 연구소가 서로에게 인용하는 SWE-bench 수치가 프롬프트 문체의 산물을 비교하고 있을 수 있다는 뜻이다.
그 페이지는 이미 GPT-5.6 Sol (and Terra, Luna) 의 ARC-AGI-3 가 하네스 설정만으로 7.8% → 38.3% 를 오가는 것을, 그리고 2026-09-04 부터는 Astra 의 ARC-AGI-3 가 98.6% 와 99.9% 두 값으로 실리며 높은 쪽이 OpenAI 자체 provider-adapter 하네스를 조건으로 한다는 것을 들고 있다. RealSWE 는 아무도 보고하지 않는 변수에서 나오는 6.4 pp 효과를 더한다. 둘 중 어느 것보다 작지만, 이 위키가 들고 있는 모든 SWE-bench 수치에 적용되는 유일한 것이다 — Claude Opus 5 의 SWE-bench Verified 96%, Claude Fable 5 의 SWE-bench Pro 80.3%, 그리고 Gemini 3.8 Flash 에서 Terminal-Bench 2.1 이 9.2 포인트 움직일 때 SWE-bench Pro 는 1.2 움직였다는 09-03 발견까지 포함해서.
이것이 그 수치들을 무효화하지 않으며 이 페이지는 그렇게 주장하지 않는다. 그 전부는 격식체 분포 위에서 일관되게 측정되었다. 발견은 그 분포가 배포 환경의 분포가 아니라는 것, 그리고 순위가 분포 변화를 견딘다는 보장이 없다는 것이다.
평가 논문치고는 드물게 여기엔 실무적 결과도 하나 있고 분명히 적어 둘 가치가 있다. 에이전트에게 원하는 동작과 동기를 말해 주는 것이, 재현 절차와 환경 세부를 주는 것보다 값지다. 벤치마크 논증과 무관하게, 코딩 에이전트를 쓰는 누구에게나 실행 가능한 조언이다.
열린 질문
- 일곱 모델은 어느 것인가? 읽은 자료에 이름이 없어, 순위 변동 주장을 이 위키가 추적하는 어떤 쌍에 대해서도 확인할 수 없다 — 그런데 그것이 바로 중요한 주장이다
- 재배열의 크기는 얼마인가? "모델 순위를 바꿀 수 있다" 는 인접한 모델을 뒤바꾸는지 멀리 떨어진 모델을 뒤바꾸는지 말하지 않는다. 1 포인트 차이의 인접 교체라면 대수롭지 않고, Qwen 3.8 Max 에 대한 09-03 기록 — 주장된 3 포인트 차이 대 ±18 구간 — 이 그 구별이 왜 중요한지 보여 주는 상존 사례다
- SWE-chat 이 "실제" 를 대표하는가? 프롬프트 말뭉치 하나가 모든 실제 사용자 행동을 대신하고 있는데, 읽은 자료가 그 출처나 규모를 설명하지 않는다
- gold patch 는 여전히 들어맞는가? 변형들은 구성상 gold patch 를 공유하지만, 원하는 동작을 빠뜨린 프롬프트는 여러 올바른 수정을 허용할 수 있다. 그러면 하나의 patch 로 채점하는 것은 수리가 아니라 프롬프트 추론을 채점하는 셈이고, 보고된 하락폭을 부풀리게 된다
- 6.4 pp 간극은 스캐폴딩으로 좁혀지는가? 되묻는 에이전트가 명백한 해법인데, 읽은 자료가 그것을 검증하지 않는다
인용
RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests. arXiv:2608.27831, 2026-08-31. HuggingFace Daily Papers, 2026-09-05 에서 기록 (source).