$ cat wiki/papers/2026/2610.00972-veriharness.md
VeriHarness: 합의를 증거로 검증하기
TL;DR
VeriHarness는 고정된 모델에 도구와 작업 공간을 제공해 장기 에이전트 작업의 출력을 검증한다. 합의에도 오류가 숨을 수 있으므로 불일치와 공통 주장 모두를 확인한다. (source)
저자와 소속
저자란에는 Caiqi Zhang, Rujun Han, Zifeng Wang, Zoey CuiZhu, Nigel Collier, Tomas Pfister, Chen-Yu Lee가 기재되어 있다. 캡처한 초록 페이지에는 소속을 확인할 정보가 없다. 제출일은 2026-10-01이다. (source)
방법
반복 실행에서 후보 산출물을 얻는다. 불일치 해결기는 서로 다른 주장을 환경의 증거와 대조하고, 합의 검토기는 공통 주장을 시험하며 누락된 요구사항을 찾는다. 작업 공간, 증거 도구와 재사용 가능한 검증 스킬이 선택과 수정을 지원한다. 테스트 시점에는 정답이나 채점 기준을 제공하지 않는다. (source)
결과
- 저자들은 장기 작업 공간 벤치마크 다섯 개와 모델 두 개에서 평가한 베이스라인 중 가장 높은 선택 점수를 보고한다. 초록에는 절대 점수가 없다. (source)
- 증거에 근거한 수정은 단일 실행 대비 평균 성능을 Gemini 3.5 Flash에서 6.2포인트, Claude Opus 4.8에서 6.4포인트 높인다. (source)
- 저자들은 $100,000가 넘는 비용으로 생성한 약 26,000개 실행 기록을 공개하며, 실패 피드백으로 검증 스킬이 개선된다고 보고한다. 이 수집 비용은 검증기를 배포할 때의 한계 비용이 아니다. (source)
의의
Agents (LLM Agents)에서 합의는 완료 증명서가 아니라 증거와 대조해 시험할 가설이다. 모델 가중치를 바꾸지 않고 Eval Harness Configuration에 검증 메커니즘을 더한다. 보고된 개선은 저자들의 평가에서 얻은 결과라는 한계가 있다. (source)
열린 질문
작업당 추가 검증 비용은 얼마이며, 총예산을 맞춰 비교해도 개선이 얼마나 유지되는가? 초록은 둘 다 정량화하지 않는다. 비용 효율성 결과로 해석하려면 논문 전체를 검토해야 한다. (source)
인용
arXiv:2610.00972. 읽은 범위는 초록과 저자 메타데이터이며, 일일 스냅샷으로 보완했다. 논문 전체는 읽지 않았다. (source)