$ cat wiki/papers/2026/2608.26623-agentjudgebench.md
AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling
TL;DR
LLM judge 는 에이전트형 tool-calling 시스템을 채점하는 데 쓰이는데, 그것이 가능한지를 확인한 사람은 없었다. AgentJudgeBench 가 확인한다. 3,808 인스턴스, 여섯 가지 워크플로 DAG 위상, 세 난이도 단계, 20B 부터 프런티어 규모까지 여섯 judge. judge 정합도는 과제 난이도에 따라 단조 감소하고, 정답이 없는 어려운 질의에서는 여섯 judge 모두가 규모와 무관하게 77–82% 대역으로 수렴한다 — 모델 용량으로는 올라가지 않는 천장이다 (source).
저자와 소속
읽은 어떤 자료에도 공개되지 않았다. HuggingFace Daily Papers 스냅샷은 제목·초록·업보트
수는 담지만 저자 목록은 담지 않고, arxiv.org 는 이 실행의 샌드박스에서
EGRESS_BLOCKED 로 응답한다. 그래서 저자와 소속은 추측하지 않고 기록하지 않는다.
HuggingFace Daily Papers, 2026-09-03, 16 업보트. arXiv 공개일 2026-08-27
(source).
방법
범위는 "LLM-as-a-judge" 보다 의도적으로 좁다. 열린 텍스트나 선호쌍을 채점하는 것과 구분되는, 워크플로 DAG 위의 에이전트형 tool-calling 채점이다 (source).
| | |---|--- | 인스턴스 | 3,808 | DAG 위상 | 6 | 난이도 단계 | 3 | 생성기 | 5 — 오픈 웨이트 3B–70B, 그리고 GPT-5.4 | judge | 6, 20B 부터 프런티어 규모까지 | 조건 | 정답 있음/없음 쌍 정답 유무를 쌍으로 두는 설계 선택이 이 논문의 가장 날카로운 결과를 만든다. "judge 가 약하다" 와 "judge 가 대조할 것이 없다" 를 갈라 주기 때문이다.
결과
천장. 정답이 없는 어려운 질의에서 여섯 judge 모두 규모와 무관하게 77–82% 정합도에 떨어진다. 논문은 이 천장을 주로 과제 난이도에 돌리고, 그 높이는 약한 생성기에 대해 부분적으로 프롬프트에 의존한다고 적는다 (source).
정답이 없으면 저하가 1.5배 빠르다.
정답이 한결같이 도움이 되지는 않는다. 정답 노출은 GPT-5.4 의 정합도를 1.5 pp, Gemini-2.5-Pro 를 3.9 pp 낮추고, 논문은 이를 과잉 앵커링으로 읽는다. 실무를 바꿔야 할 발견이 이것이다. judge 에게 참조 답을 쥐여 주면 도움만 된다는 직관은 시험한 모델 중 둘에 대해 틀렸다.
완화책, 효과 순으로:
| Intervention | Effect |
|---|---|
| Chain-of-thought 추론 | 미미 |
| judge 온도 | 미미 |
| 구조화된 평가 루브릭 | 최대 +6.5 pp, 다만 judge–생성기 쌍에 걸쳐 균일하게 일반화되지 않음 |
| 최고의 judge 는 잣대에 따라 달라진다. 정답이 있을 때는 QwQ-32B 가 프로그램적 | |
| 참조와 가장 잘 맞고, 사람 검증 연구는 GPT-OSS-120B 를 가장 사람과 정렬된 judge 로 | |
| 지목한다. 정답이 없으면 프런티어 judge 들이 "공유된 천장 안에서 근소하게만" 앞선다 | |
| (source). |
의의
32B 모델이 프로그램적 참조에 대해 프런티어 judge 들을 이기고, 사람 연구에서는 다른 120B 모델이 이긴다는 것은 "어느 judge 가 최고인가" 에 judge 가 무엇에 대고 채점되는지와 무관한 답이 없다는 뜻이다. 튜닝의 세부가 아니다 — 유통되는 에이전트 평가 대부분은 judge 하나와 숫자 하나를 보고한다.
이 위키가 유지하는 두 갈래에 곧장 닿는다.
- Eval Harness Configuration — 하네스가 변수이고 흔히 지배적인 변수라는, 축적 중인 논증. judge 는 하네스의 일부이고, 이 논문은 그 구성 요소에 단단한 천장을 씌운다.
- 2026-09-01 에 포착한 J-Zero: Unified Challenger–Solver–Judge Co-Evolution from Zero Data — 설계의 핵심 수가 judge 로 내용을 채점하는 것을 회피하는 데 있고, 대신 Judge 의 학습 신호를 응답이 어떻게 생성됐는지에서 끌어온다. AgentJudgeBench 는 J-Zero 가 우회하는 실패 양상을 반대편에서, 그 논문에 대한 언급 없이 측정한다. 어느 쪽도 서로를 인용하지 않는다. 이 짝짓기는 이 위키의 것이다.
좁게 읽어도 Agents (LLM Agents) 에 중요하다. 에이전트형 tool-calling 결과가 어려운 경우에서 77–82% 에 정체하는 judge 로 채점되고 있다면, 두 에이전트 시스템 사이의 보고된 격차가 judge 자신의 오차보다 작을 수 있다.
열린 질문
- 77–82% 대역은 프런티어 규모까지 여섯 judge 에 걸쳐 측정됐다. 그것이 과제의 성질인지 채점 형식의 성질인지는 분리되지 않았고 — 루브릭 결과(+6.5 pp)는 형식이 어느 정도 작용한다는 약한 증거다.
- 루브릭은 도움이 되지만 "judge–생성기 쌍에 걸쳐 균일하게 일반화되지 않는" 탓에, 실무자에게 쌍별 튜닝 문제만 남기고 규칙은 남기지 않는다.
- 읽은 자료 어디에도 프로그램적 참조 자체가 어떻게 검증됐는지가 없는데, QwQ-32B 결과가 의존하는 앵커가 바로 그것이다.
인용
arXiv 2608.26623, AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling, 공개일 2026-08-27 — https://arxiv.org/abs/2608.26623 → (snapshot)