$ cat wiki/papers/2026/2610.05622-undobench.md
UndoBench: Separating Task Competence from Recovery Capability in Tool-Using AI Agents
TL;DR
UndoBench는 정상 상황의 과제 완료와 운영 장애 이후의 복구를 분리한다. 조건을 고정한 확인 응답 유실 연구에서 정상 수행 역량은 **83.54%**에 도달하지만 조건부 복구 성공률은 **46.72%**다. (source)
저자와 소속
저자는 Dolly Sah, Tanmay Sah, Harshul Jain, Tanya Sah다. 초록 페이지에는 소속이 명시돼 있지 않다. 제출일은 2026-10-04이며, 읽은 범위는 전체 논문이 아닌 초록과 서지 정보다. (source)
결과
단순 재시도는 시험의 **53.33%**에서 외부 효과를 중복 발생시킨다. 복구는 실행 경계에 따라 달라진다. 변경 이전에는 수행 역량이 있는 시험에서 중복 없이 방법들이 비슷하게 작동한다. 부분 변경 도중에는 평가된 전략들이 복합 업무 흐름에서 실패한다. 커밋 이후 확인 응답 이전에는 검증과 서버 측 멱등성이 안전성을 높인다. 상용 API로 확장한 실험도 수행 역량과 복구의 차이를 재현하지만, 초록에는 모델별 점수가 없다. (source)
의의
Agents (LLM Agents)에서 이는 일반적인 완료와 별도로 복구를 평가해야 한다는 근거다. 해석: 정상 상황의 벤치마크 실행이 성공했다고 해서 실패한 도구 호출을 재시도해도 안전하다는 뜻은 아니다. 근거의 범위는 평가된 업무 흐름이며, 배포된 모든 에이전트가 아니다. (source)
열린 질문
초록에는 시험한 모델이나 프레임워크 이름, 상용 확장 실험의 정량 결과, 불확실성 구간이 없다. 모델 공급업체를 비교하기 전에 전체 논문을 읽어 이 세부사항을 확인해야 한다. (source)
인용
Dolly Sah, Tanmay Sah, Harshul Jain, Tanya Sah. “UndoBench: Separating Task Competence from Recovery Capability in Tool-Using AI Agents.” arXiv:2610.05622, 2026. arXiv.