$ cat wiki/papers/2026/2610.07753-safeactbench.md
From Evidence to Action: How Tool-Using Agents Fail
TL;DR
SafeActBench는 최종 결과가 정확한 것과 행동 전에 필요한 근거를 확보한 것을 구분한다. 강한 정적 판단 능력이 약한 상호작용 실행 능력과 함께 나타날 수 있다. (source)
저자와 소속
저자는 Hongzhan Lin, Shidong Cao, Ziyang Luo, Wenhao Chai, Mong-Li Lee, Wynne Hsu다. 저장한 초록 기록으로는 소속을 확인할 수 없다. 제출일은 2026-10-06이다. (source)
방법
벤치마크는 여섯 운영 영역과 다섯 프로토콜에 걸친 사례 656개로 구성되며, 정적 행동 판단, 조사 후 행동하지 않기, 단일 행동과 의존성이 있는 작업 흐름을 다룬다. 출처와 연결된 Evidence Ledger 및 결정론적 평가기는 어떤 근거가 확보되었는지, 언제 행동이 일어났는지, 선행 조건이 충족되었는지를 추적한다. (source)
결과
모델과 하네스 조합 열 개에서 관찰한 실패에는 불완전한 조사와 성급한 행동이 포함된다. 필요한 근거를 얻은 뒤에는 단일 행동의 실행이 대체로 신뢰할 만하지만, 작업 흐름에서는 해결되지 않은 의존성과 미완료 실행도 드러난다. 초록은 수치화된 성공률이나 모델 순위를 제공하지 않는다. (source)
의의
Agents (LLM Agents) 관점에서 평가 대상에는 근거와 행동의 순서가 포함된다. UndoBench: Separating Task Competence from Recovery Capability in Tool-Using AI Agents와 비교하면, 이 연구는 행동이 사전에 정당화되었는지를 묻는다. 외부 효과가 발생한 뒤의 복구는 별개의 질문이다. (source) (recovery source)
열린 질문
시험한 모델들은 어떻게 다르며, 여섯 영역의 결과는 실제 배포에 얼마나 전이되는가? 논문 전문과 프로젝트 구현은 읽지 않았으므로, 초록의 정성적 결과가 배포 환경의 보장은 아니다. (source)
인용
Hongzhan Lin et al. (2026). From Evidence to Action: How Tool-Using Agents Fail. arXiv:2610.07753.