AI Trend Notifier
EN한
← wiki

$ cat wiki/papers/2026/2610.05622-undobench.md

UndoBench: Separating Task Competence from Recovery Capability in Tool-Using AI Agents

paper갱신 2026-10-07생성 2026-10-07

TL;DR

UndoBench는 정상 상황의 과제 완료와 운영 장애 이후의 복구를 분리한다. 조건을 고정한 확인 응답 유실 연구에서 정상 수행 역량은 **83.54%**에 도달하지만 조건부 복구 성공률은 **46.72%**다. (source)

저자와 소속

저자는 Dolly Sah, Tanmay Sah, Harshul Jain, Tanya Sah다. 초록 페이지에는 소속이 명시돼 있지 않다. 제출일은 2026-10-04이며, 읽은 범위는 전체 논문이 아닌 초록과 서지 정보다. (source)

방법

벤치마크는 36개 기본 업무 흐름, 36개 장애 시나리오와 8개 기업 업무 영역을 다룬다. 반사실적 쌍대 시험은 동일한 시드를 사용하고, 효과 이력 및 환경 상태 오라클을 통해 에이전트가 시도한 일과 실제로 변경된 일을 구분한다. (source)

조건을 고정한 연구는 보류된 업무 흐름 12개, 공개 가중치 모델 두 개, 프레임워크 두 개와 복구 패러다임 세 개를 다루며, 총 5,760회 실행 / 2,880회 쌍대 시험으로 구성된다. (source)

결과

단순 재시도는 시험의 **53.33%**에서 외부 효과를 중복 발생시킨다. 복구는 실행 경계에 따라 달라진다. 변경 이전에는 수행 역량이 있는 시험에서 중복 없이 방법들이 비슷하게 작동한다. 부분 변경 도중에는 평가된 전략들이 복합 업무 흐름에서 실패한다. 커밋 이후 확인 응답 이전에는 검증과 서버 측 멱등성이 안전성을 높인다. 상용 API로 확장한 실험도 수행 역량과 복구의 차이를 재현하지만, 초록에는 모델별 점수가 없다. (source)

의의

Agents (LLM Agents)에서 이는 일반적인 완료와 별도로 복구를 평가해야 한다는 근거다. 해석: 정상 상황의 벤치마크 실행이 성공했다고 해서 실패한 도구 호출을 재시도해도 안전하다는 뜻은 아니다. 근거의 범위는 평가된 업무 흐름이며, 배포된 모든 에이전트가 아니다. (source)

열린 질문

초록에는 시험한 모델이나 프레임워크 이름, 상용 확장 실험의 정량 결과, 불확실성 구간이 없다. 모델 공급업체를 비교하기 전에 전체 논문을 읽어 이 세부사항을 확인해야 한다. (source)

인용

Dolly Sah, Tanmay Sah, Harshul Jain, Tanya Sah. “UndoBench: Separating Task Competence from Recovery Capability in Tool-Using AI Agents.” arXiv:2610.05622, 2026. arXiv.

Referenced by

Sources