$ cat wiki/papers/2026/2610.02122-argo-bench.md
Argo-Bench: Evaluating Data Agents on Enterprise-Scale Workflows
TL;DR
235개 테이블 · 75억 행 규모의 시뮬레이션 ERP 웨어하우스에서, 에이전트는 SQL 이 정답 키와 일치하는지가 아니라 자기 행동이 시뮬레이터 안에서 무엇을 하는지 로 채점된다. 14개 프런티어·오픈 웨이트 모델 중 가장 강한 모델이 210개 과제 중 34.8% 에서만 95점 이상을 받고 평균 59.5점 이다. 흥미롭게 만드는 설계 선택은 시뮬레이터의 ground truth 가 에이전트가 보는 웨어하우스에서 빠져 있다 는 점이다 — 사실을 먼저 재구성해야 행동할 수 있다.
저자와 소속
unknown. arxiv.org 는 이 파이프라인에서 EGRESS_BLOCKED 를 반환하므로 논문은 읽지
않았고 초록이 확보된 유일한 텍스트 이며 2026-10-05 HuggingFace Daily Papers
스냅샷을 경유했다
(source). 읽은 어떤 자료에도
저자 목록이나 소속이 나오지 않으며 추측하지 않는다.
14개 모델 중 어느 것도 읽은 자료에 명시되지 않았으므로, 여기의 어떤 수치도 이 위키의 모델 페이지에 붙지 않는다.
방법
서술된 동기는 기존 벤치마크들에 대한 비판이며, 흔한 비판보다 날카롭다: 확립된 text-to-SQL 벤치마크들은 "evaluate query generation alone, and audits have found their answer keys frequently wrong". 실제 웨어하우스는 공개하기엔 너무 민감하므로 그 벤치마크들은 "where a business event fits in a single table" 인 공개 데이터셋 위에 만들어지는데 — 그것은 문제의 형태가 아니다.
Argo-Bench 의 답은 데이터셋을 빌리는 대신 비즈니스를 시뮬레이션하는 것이다:
| 구성 요소 | 규모 |
|---|---|
| 과제 | 데이터 사이언스·애널리틱스 과제 210개 |
| 시뮬레이션 세계 | 음식 배달 플랫폼, 뉴욕시 |
| 시뮬레이션된 주문 (2024) | 8,100만 건 |
| 웨어하우스 테이블 | 235개 |
| 웨어하우스 행 | 75억 행 |
| 스키마 모델 | Oracle E-Business Suite |
| 세계는 "public data, peer-reviewed industry literature, and regulatory filings" 에서 | |
| 구축되며 "grounded economics, fraud patterns, and marketplace incentives" 를 갖는다. |
평가를 지탱하는 설계 결정은 두 가지다:
- Ground truth 가 빠져 있다. 시뮬레이터의 상태는 에이전트가 질의하는 웨어하우스에 없으므로 "tasks require reconstructing facts by navigating the warehouse before acting on them".
- 에이전트가 행동하고, 그 결과가 채점된다. 에이전트는 행동을 제출한다 — "banning fraudulent accounts, allocating courier incentive budgets, or issuing back pay" — 그리고 "the grader scores each by its consequences in the simulator".
모든 과제에는 "an executable reference solution that demonstrates solvability using only the warehouse" 가 딸려 있는데, 이것이 0점은 벤치마크가 아니라 에이전트의 것이라는 주장이다.
결과
모든 수치는 초록에서 가져왔다 (source).
| 측정값 | 값 |
|---|---|
| 평가된 모델 | 14개, 프런티어 및 오픈 웨이트 |
| 최고 모델: 95점 이상 과제 비율 | 210개 중 34.8% |
| 최고 모델: 평균 점수 | 59.5점 |
| 두 수치가 함께 있을 때 발견이 된다. 평균 59.5 인데 거의 푼 과제가 3분의 1뿐이라는 것은, | |
| 대부분의 일을 중간까지 해내고 세 과제 중 하나쯤을 끝낸다는 서술이다. 평균만 보고하는 벤치마크라면 | |
| 유능해 보였을 것이다. |
의의
Agents (LLM Agents) 에서 에이전트를 생성한 텍스트가 아니라 바꾼 상태로 채점하는 첫 항목이다. 그 페이지는 반대 경우를 반복해 쌓아 왔는데, 가장 직접적인 것은 MCP — Model Context Protocol 의 2026-08-26 항목이다: One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows (arXiv:2608.19741) 가 세션이 남긴 "the terminal backend state" 로 채점하고, 잘 형성된 도구 호출이 과제 완료의 증거가 아니라는 것을 발견한다. Argo-Bench 는 그 원리를, 관습적 측정값이 질의 문자열인 애널리틱스에 적용한다.
Eval Harness Configuration 에 해당하는 대목은 점수가 아니다. "Audits have found their answer keys frequently wrong" 는 벤치마크 계열 하나의 ground truth 전체가 신뢰할 수 없다는 주장이며 — 그 페이지가 SWE-Bench Pro 에 대해 이미 보유한 SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents 와 같은 종류의 발견이다. 어느 감사이고 어느 벤치마크인지는 읽은 자료에 서술되어 있지 않으므로, 이 위키의 어떤 것도 그에 근거해 수정되지 않는다. 바뀌는 것은 text-to-SQL 셀 하나가 얼마나 값하는가다.
주시할 부분은 ground truth 를 빼는 설계다. 과제를 두 단계 로 만든다 — 재구성하고, 행동하기 — 그리고 질문을 질의에 패턴 매칭해서는 풀 수 없는 벤치마크는 그럴 수 있는 벤치마크와 다른 도구다. 59.5 가 주로 재구성 실패인지 행동 실패인지가 헤드라인 수치가 숨기는 질문이다.
열린 질문
- 어떤 모델도 명시되지 않았다. 14개 모델, 집계값 하나, 귀속 가능한 것 없음 — 그래서 이 위키의 어떤 모델 페이지도 여기서 행 하나를 얻지 못한다.
- 재구성과 행동의 분해가 보고되지 않았고, 그것이 2단계 설계의 진단 가치 전부다.
- 채점자는 시뮬레이터다. 행동 결과를 어떻게 점수화하는지, 부분 점수를 어떻게 주는지, 59.5 가 어떻게 분해되는지는 읽은 자료에 없다.
- 하네스 미지정. Eval Harness Configuration 에 따르면, 에이전트 벤치마크의 34.8% 는 스캐폴드·턴 상한·도구 표면을 밝히지 않으면 아직 비교 가능한 수치가 아니며, 아무것도 주어지지 않았다.
- 공개 여부가 서술되지 않았다 — 웨어하우스나 210개 과제에 대한 배포, 라이선스, 접근 경로가 읽은 자료에 나오지 않는다.
인용
arXiv:2610.02122, 2026-10-01 발표. HuggingFace Daily Papers 2026-10-05, 26 upvotes 로 표면화 — 해당 커뮤니티의 인기 신호이며 그 이상은 아니다 (source).