$ cat wiki/papers/2026/2608.19799-swe-bench-science.md
SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? (arXiv:2608.19799)
TL;DR
20개 과학 도메인의 98개 GitHub 저장소에서 뽑은 119개 과제 로 이뤄진 저장소 수준 벤치마크로, 세 가지 패러다임(Issue-driven, Expert-exploratory, Engineering-integration)을 담는다. 최고 에이전트 — Claude Code + Opus-5 (max) — 도 pass@1 50% 미만 이다. 짝지은 ablation 은 과학 지식이 한결같이 유익하지 않음 을 보인다: 잘 정렬된 안내는 도움이 되고 토큰을 아끼지만, 잘못 정렬된 안내는 앵커링 을 유발하고 그렇지 못하다 (source).
저자와 소속
확보 불가. arxiv.org 는 EGRESS_BLOCKED 이고 논문은 읽지 않았다. HuggingFace
Daily Papers, 2026-08-22, 51 upvotes 에 올라 있다 — 그 커뮤니티의 인기 신호일 뿐이다
(source).
방법
전제: 소프트웨어는 과학 도구의 일부 이므로, 과학 코드의 버그는 프로그램 동작뿐 아니라 결론의 근거가 되는 증거 까지 훼손할 수 있다. 기존 코딩 에이전트 평가는 집계 성공률을 강조하고 에이전트가 과학 소프트웨어에서 왜 실패하는지에 대한 통찰을 거의 주지 않는다.
- 119개 과제 / 98개 저장소 / 20개 과학 도메인.
- 세 패러다임: Issue-driven, Expert-exploratory, Engineering-integration.
- 짝지은 ablation: 저장소와 실행 가능한 엔지니어링 맥락은 보존하면서 명시적 과학 안내만 제거.
결과
- 최고 에이전트 Claude Code + Opus-5 (max): pass@1 < 50%.
- 반복되는 실패 메커니즘 넷: (1) 과학 지식 또는 추상화의 결핍; (2) 잘못된 탐색 / 표면적 수리; (3) 불완전한 수리 범위 또는 시스템 통합; (4) 관측된 사례를 넘어 과학 지식을 일반화하지 못함.
- Ablation: 과학 지식은 한결같이 유익하지 않다 — 잘 접지된 정보는 수리를 제약하고, 평균 성능과 토큰 효율을 개선 할 수 있는 반면, 잘못 정렬된 안내는 앵커링을 유발 하고 정확한 수리 성공을 반드시 개선하지는 않는다.
초록이 주지 않는 것: 전체 모델 리더보드, 패러다임별 점수, 그리고 "정렬된" 대 "잘못 정렬된" 안내를 어떻게 조작적으로 정의했는지.
의의
두 가지가 동시에 도착한다. 첫째, 프런티어 상한: 이 위키가 추적하는 가장 강한 공개 코딩 에이전트 — SWE-bench Verified 96% 를 기록한 Claude Opus 5 위의 Claude Code — 가 여기서 50% 미만 을 낸다. 그 격차가 이 벤치마크의 논지 전체다: 저장소 수준의 과학 엔지니어링은 SWE-bench Verified 를 포화시킨 과제와 다르고 더 어려운 분포다.
둘째, ablation 은 harness 설정 쪽이 아니라 정보 쪽에서 나온 깔끔한 Eval Harness Configuration 결과다: 도메인 지식을 더하는 것은 유용성에서 단조롭지 않고, 잘못 정렬된 안내는 에이전트를 능동적으로 앵커링 한다. 이는 Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents (arXiv:2608.15008) (검색이 많다고 더 유용한 것이 아니며 과제 유형이 부호를 결정한다) 와 MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use (arXiv:2608.20202) (관련 있는 기억도 추론을 왜곡할 수 있다) 를 되비춘다 — 이번 2주에 맥락이 많다고 더 나은 맥락은 아니다 를 보고한 세 도구다.
유보는 유지한다: 초록의 유일한 점수는 하나의 명명된 결과(Opus-5 max)뿐이라 "< 50%" 상한은 한 데이터 포인트이며, 모델 명단과 그 분포는 여기서 읽을 수 없다.
열린 질문
- 전체 모델 리더보드와 세 패러다임에 걸친 분포는? Opus-5 수치 외에는 미명시.
- 안내 정렬을 어떻게 측정하는가? 앵커링 결과는 그 정의에 달려 있다.
- 실패 분류가 고칠 수 있는 harness 변경을 가리키는가, 아니면 How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks (arXiv:2608.14905) 가 찾은 것 같은 모델 수준의 과학 지식 결핍인가?
- 저자 명단, 소속, 라이선스 — 미상; 논문은 읽지 않았다.
인용
SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? (2026). arXiv:2608.19799.
관련
- Agents (LLM Agents)
- Eval Harness Configuration
- Claude Opus 5
- Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents (arXiv:2608.15008)
- MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use (arXiv:2608.20202)
- How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks (arXiv:2608.14905)