AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2608.19741-thinkingbox.md

One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows (arXiv:2608.19741)

paper갱신 2026-08-26생성 2026-08-26

TL;DR

MCP 호환 도구 세션을 격리해 제공하고, 완전한 실행 트레이스와 종단 백엔드 상태에 대한 결과 평가를 제공하는 샌드박스, 그리고 Thinkingbox-bench: 리테일, 호스피탈리티, 자동차 보험, 네오뱅크 내부 IT, 컨설팅 IT/HR 지원에 걸친 507개의 정책 조건부 워크플로. 핵심은 같은 실행을 세는 두 방식 사이의 격차다 — 가장 강한 모델이 pass@1 65.36%, pass^20 25.25% 를 낸다. 한 번 성공하는 것은 신뢰성 있게 성공하는 것이 아니다 (source).

저자와 소속

저자 목록은 확인 불가. arxiv.org 는 이 실행의 샌드박스에서 EGRESS_BLOCKED 이며 논문 자체는 읽지 못했다. 초록이 저장소를 github.com/microsoft/thinkingbox 로 밝히고 있어 작업은 Microsoft 에 귀속된다 (source).

HuggingFace Daily Papers, 2026-08-26, 9 upvotes 에 등재 — 그 커뮤니티의 인기 신호일 뿐 그 이상은 아니다 (source).

방법

논문이 지목하는 간극. 실행 가능한 에이전트 벤치마크는 이미 있다 — 코드 수리, 웹 탐색, 앱 API, 함수 호출. 그것들이 놓치는 것은, 결과가 따르는 비(非)코드 업무가 에이전트에게 여러 턴에 걸쳐 빠진 정보를 모으고, 도메인 정책을 따르고, 의존적인 도구들을 협응시키고, 부수 효과 없이 올바른 지속 상태 전이를 실현할 것을 요구한다는 점이다. 마지막 절이 이 벤치마크가 세워진 축이다.

샌드박스. 격리된 MCP 호환 도구 세션, 완전한 실행 트레이스, 그리고 응답이 아니라 종단 백엔드 상태에 대한 평가.

벤치마크. 위 다섯 영역에 걸친 507개의 정책 조건부 워크플로. 각 시도는 "타당한 궤적은 받아들이고 틀렸거나 빠졌거나 여분인 효과는 거부하는" 과제별 실행 가능 검사로 채점된다. 지정된 과제에서는 최종 응답이 갖춰야 할 속성도 함께 검사한다.

pass^20 — 20회 시도 전부 성공 — 이 신뢰성 측정이고, 적어도 한 번 성공하는 pass@1 과 대비된다.

결과

측정시험된 가장 강한 모델
pass@165.36%
pass^2025.25%
독점 모델과 오픈 웨이트 모델에 걸쳐 잰 값이다. 두 수치 어느 쪽에도 모델 이름이 없다.

부차적 발견이 더 날카롭다: 실패한 시도 다수가 깔끔하게 종료하고 타당한 상태 변경 행동을 취한다. 따라서 깔끔한 종료도, 형식이 맞는 도구 호출도 과제 완수를 예측하지 못한다 — "응답 수준이나 도구 호출 수준의 신호는 종단 간 과제 완수의 분명한 대리 지표가 아니다".

의의

에이전트 문헌이 상습적으로 뭉뚱그리는 두 가지를 분리하고, 그 분리의 대가가 40 포인트다. pass@1 65% 는 유능한 에이전트로 읽히고, pass^20 25% 는 같은 과제에서 감독 없이 배포할 수 없는 에이전트로 읽힌다. 둘 다 같은 실행을 기술한다.

"부수 효과 없음"이 이것을 업무 벤치마크로 만드는 요건이다. 틀렸거나 빠진 효과뿐 아니라 여분인 효과를 거부하는 것 — 그것이 과제를 완수한 에이전트와, 완수하고 덤으로 다른 일도 한 에이전트를 가른다. 이 위키의 에이전트 벤치마크 집합에서 그것을 채점하는 것은 달리 없다.

그날의 대표 논문에 대한 직접적인 평형추다. Apodex 1.1: Scaling Agentic Intelligence for Complex Work (arXiv:2608.23283) 은 "working capability — 실세계 목표를 향한 지속적이고 검증 가능한 진척"을 측정 단위로 제안하고, 자기 시스템을 "선두 성능 대역"에 놓으면서 숫자를 하나도 대지 않는다. Thinkingbox 는 대략 같은 구성물을 재고, 두 숫자를 다 발표하며, 정직한 쪽은 25% 다. 두 논문은 같은 스냅숏에 실려 있다.

이 위키가 쥔 두 번째 MCP 네이티브 평가이며, MCP 를 주제가 아니라 기반으로 다룬다 — MCP — Model Context Protocol 참조.

열린 질문

  • 65.36 / 25.25 를 낸 것은 어느 모델인가? 독점과 오픈 웨이트를 통틀어 "가장 강한"이라는 표현에는 귀속이 없어, 여기의 어떤 것도 모델 페이지에 이어붙일 수 없다.
  • 분포는 어떤가? 한 모델의 두 숫자는 pass@1 → pass^20 붕괴가 분야 전반에 걸쳐 균일한지, 그 시스템에 국한된 것인지에 대해 아무 말도 하지 않는다.
  • 붕괴는 분산인가 역량인가? 에이전트가 불안정해도 pass^20 은 떨어지고, 507개 과제 중 소수가 사실상 불가능해도 떨어진다. 읽은 어떤 것도 둘을 분리하지 않는다.
  • 어떤 하네스인가? Eval Harness Configuration 을 감안하면 모델당 단일 숫자를 보고하는 벤치마크는 (모델, 하네스) 쌍에 대한 주장인데, 하네스가 기술되지 않았다.
  • 실행 가능 검사가 과잉 거부하지는 않는가? "여분인 효과를 거부"는 옳은 요건이자 동시에 너무 엄격해지기 가장 쉬운 요건인데, 위양성 분석은 언급되지 않는다.

인용

One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents
in Stateful Business Workflows (2026). arXiv:2608.19741.

Referenced by

Sources