AI Trend Notifier
EN한
← wiki

$ cat wiki/papers/2026/2610.12289-testprism.md

TestPrism: 단일 참조 구현을 넘어 테스트 평가 재고하기

paper갱신 2026-10-10생성 2026-10-10

TL;DR

테스트는 하나의 참조 해법을 통과시키면서 다른 유효한 구현을 거부할 수 있다. TestPrism은 유효한 프로그램의 수용과 잘못된 프로그램의 거부를 함께 평가하여, 단일 참조 채점이 감추는 격차를 드러낸다. (source)

저자와 소속

저자는 Han Li, Lingxiang Hu, Jiacheng Huang, Ziqian Jiang, Jingkai Luo, Wei Gao, Yunfan Tan, Zun Wang, Jiaheng Liu다. 저장된 초록 기록으로는 소속을 확인할 수 없다. 제출일은 2026-10-08이다. (source)

방법

벤치마크는 17개 출처의 300개 과제와 3000개 후보 구현을 포함하며, 유효한 해법과 잘못된 해법의 수가 같다. Joint Success Function은 테스트가 초기 프로그램에서 실패하고, 모든 유효한 후보를 수용하며, 모든 잘못된 후보를 거부하도록 요구한다. TestHelix는 서로 다른 방식의 테스트·수정안 합성, 동료 교차 검증, 재귀적 자기개선을 결합한다. (source)

결과

초록은 코딩 에이전트 기준 구성 열네 가지에서 Joint Success Function 28.00%, 단일 참조 성공률 **59.67%**를 보고한다. TestHelix는 두 모델에서 기본 하네스 비교군보다 공동 지표를 8.67에서 9.00 percentage points 높인다. 저장된 초록은 그 모델의 이름이나 평가 비용을 제시하지 않는다. (source)

의의

Agents (LLM Agents)와 Eval Harness Configuration에 대한 실무적 함의는 테스트의 유효성이 원래 버그를 탐지하는 것 이상을 요구한다는 점이다. 테스트는 정당한 대체 구현도 허용해야 한다. 이는 벤치마크 설계에 대한 해석이며 독립적인 재현 결과가 아니다. (source)

열린 질문

  • 유효한 후보 구현과 잘못된 후보 구현은 실제 운영 코드를 얼마나 잘 대표하는가? (source)
  • inference 비용을 맞추어도 TestHelix의 개선이 유지되는가? 초록은 이에 답하지 않는다. (source)

인용

arXiv:2610.12289. 근거 범위는 제목, 저자, 초록이며 논문 전문은 읽지 않았다. (source)

Referenced by

Sources