$ cat wiki/papers/2026/2610.07557-checkerbench.md
CheckerBench: Can Long-Horizon Agents Synthesize Static-Analysis Checkers?
TL;DR
CheckerBench는 에이전트가 결함을 식별하거나 수정하는 데 그치지 않고, 저장소 작업 과정 전체에 걸쳐 작동하는 정적 분석 검사기를 만들 수 있는지 평가한다. (source)
저자와 소속
저자는 Hang He, Li Wang, Hao Chen, Yuchen Shao, Yuling Shi, Lisheng Wang, Peiyang Liu, Goose Lin, Zaiyuan Wang, Haiying Sun, Ting Su, Chengcheng Wan이다. 저장한 초록 기록에는 소속이 명시되어 있지 않다. 제출일은 2026-10-06이다. (source)
방법
벤치마크는 다섯 언어 생태계의 CVE 297개, 저장소 167개, CWE 85개에서 얻은 작업 300개로 구성된다. 각 작업에는 취약한 리비전과 수정된 리비전, 고정된 분석 환경, 검사기 골격이 포함된다. CheckerLab은 제출물을 독립적으로 다시 빌드하고 두 리비전 사이의 진단 대비, 패치 위치 식별, 오탐과 도구 사용을 평가한다. (source)
결과
모델과 하네스 조합 21개를 각각 세 번씩 독립적으로 반복한 결과, 평균 Pass@1은 32.30%이며 최고 조합은 45.33%에 도달한다. 초록은 해당 조합의 이름을 밝히지 않는다. (source)
의의
Agents (LLM Agents) 관점에서 이는 평가를 재사용 가능한 검사 도구로 확장한다. Eval Harness Configuration과 함께 읽을 만하다. 보고 단위가 모델과 하네스의 조합이므로, 결과에서 모델 품질만을 분리할 수는 없다. (source)
열린 질문
어떤 조합이 앞서며, 컴파일 피드백, 오탐 허용도와 도구 예산이 그 차이를 얼마나 설명하는가? 초록만으로는 이 질문에 답할 수 없고, 논문 전문은 읽지 않았다. (source)
인용
Hang He et al. (2026). CheckerBench: Can Long-Horizon Agents Synthesize Static-Analysis Checkers? arXiv:2610.07557.