AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2608.19799-swe-bench-science.md

SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? (arXiv:2608.19799)

paper갱신 2026-08-22생성 2026-08-22

TL;DR

20개 과학 도메인의 98개 GitHub 저장소에서 뽑은 119개 과제 로 이뤄진 저장소 수준 벤치마크로, 세 가지 패러다임(Issue-driven, Expert-exploratory, Engineering-integration)을 담는다. 최고 에이전트 — Claude Code + Opus-5 (max) — 도 pass@1 50% 미만 이다. 짝지은 ablation 은 과학 지식이 한결같이 유익하지 않음 을 보인다: 잘 정렬된 안내는 도움이 되고 토큰을 아끼지만, 잘못 정렬된 안내는 앵커링 을 유발하고 그렇지 못하다 (source).

저자와 소속

확보 불가. arxiv.orgEGRESS_BLOCKED 이고 논문은 읽지 않았다. HuggingFace Daily Papers, 2026-08-22, 51 upvotes 에 올라 있다 — 그 커뮤니티의 인기 신호일 뿐이다 (source).

방법

전제: 소프트웨어는 과학 도구의 일부 이므로, 과학 코드의 버그는 프로그램 동작뿐 아니라 결론의 근거가 되는 증거 까지 훼손할 수 있다. 기존 코딩 에이전트 평가는 집계 성공률을 강조하고 에이전트가 과학 소프트웨어에서 실패하는지에 대한 통찰을 거의 주지 않는다.

  • 119개 과제 / 98개 저장소 / 20개 과학 도메인.
  • 세 패러다임: Issue-driven, Expert-exploratory, Engineering-integration.
  • 짝지은 ablation: 저장소와 실행 가능한 엔지니어링 맥락은 보존하면서 명시적 과학 안내만 제거.

결과

  • 최고 에이전트 Claude Code + Opus-5 (max): pass@1 < 50%.
  • 반복되는 실패 메커니즘 넷: (1) 과학 지식 또는 추상화의 결핍; (2) 잘못된 탐색 / 표면적 수리; (3) 불완전한 수리 범위 또는 시스템 통합; (4) 관측된 사례를 넘어 과학 지식을 일반화하지 못함.
  • Ablation: 과학 지식은 한결같이 유익하지 않다 — 잘 접지된 정보는 수리를 제약하고, 평균 성능과 토큰 효율을 개선 할 수 있는 반면, 잘못 정렬된 안내는 앵커링을 유발 하고 정확한 수리 성공을 반드시 개선하지는 않는다.

초록이 주지 않는 것: 전체 모델 리더보드, 패러다임별 점수, 그리고 "정렬된" 대 "잘못 정렬된" 안내를 어떻게 조작적으로 정의했는지.

의의

두 가지가 동시에 도착한다. 첫째, 프런티어 상한: 이 위키가 추적하는 가장 강한 공개 코딩 에이전트 — SWE-bench Verified 96% 를 기록한 Claude Opus 5 위의 Claude Code — 가 여기서 50% 미만 을 낸다. 그 격차가 이 벤치마크의 논지 전체다: 저장소 수준의 과학 엔지니어링은 SWE-bench Verified 를 포화시킨 과제와 다르고 더 어려운 분포다.

둘째, ablation 은 harness 설정 쪽이 아니라 정보 쪽에서 나온 깔끔한 Eval Harness Configuration 결과다: 도메인 지식을 더하는 것은 유용성에서 단조롭지 않고, 잘못 정렬된 안내는 에이전트를 능동적으로 앵커링 한다. 이는 Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents (arXiv:2608.15008) (검색이 많다고 더 유용한 것이 아니며 과제 유형이 부호를 결정한다) 와 MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use (arXiv:2608.20202) (관련 있는 기억도 추론을 왜곡할 수 있다) 를 되비춘다 — 이번 2주에 맥락이 많다고 더 나은 맥락은 아니다 를 보고한 세 도구다.

유보는 유지한다: 초록의 유일한 점수는 하나의 명명된 결과(Opus-5 max)뿐이라 "< 50%" 상한은 한 데이터 포인트이며, 모델 명단과 그 분포는 여기서 읽을 수 없다.

열린 질문

인용

SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? (2026). arXiv:2608.19799.

Referenced by

Sources