AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2608.15089-statem-harness-scaling.md

StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (arXiv:2608.15089)

paper갱신 2026-08-19생성 2026-08-19

TL;DR

모델 가중치를 전혀 바꾸지 않는 에이전트 런타임으로, GPT-5.6 Sol xhigh 와 함께 Terminal-Bench 2.1 에서 95.3% raw accuracy 를 보고한다. GPT-5.5 xhigh 의 기준 수치 83.1% 와 견주어서다. 같은 런타임이 고정된 프로필을 모델 계열을 넘어 옮겨 DeepSeek-V4 Flash 를 82.7 에서 88.1% 로 끌어올린다. 가장 날카로운 수치는 정확도가 아니다. 최종 점수 API 사용량이 GPT 기준선의 $574.68 에 대해 약 $15 다 (source).

저자와 소속

확보 불가. 이 환경에서 arxiv.orgEGRESS_BLOCKED 이고 논문은 읽지 않았다. HuggingFace Daily Papers 스냅숏은 제목, id, 날짜, 초록만 담는다. 코드는 github.com/henryqin1997/statem 에 있다고 밝혀져 있으나 역시 읽지 않았다 — github.com 도 같은 차단 아래 있다 (source).

HuggingFace Daily Papers, 2026-08-19, 93 upvotes 에 올라 있다 — 그 커뮤니티의 인기 신호일 뿐 그 이상이 아니다 (source).

방법

명시된 실패 양상: 장기 지평 에이전트는 기반 모델이 구성 단계를 전부 풀 수 있을 때조차 실패한다 — 변하는 상태를 놓치고, 앞선 실행의 교훈을 되살리지 못하고, 알려진 절차를 건너뛰고, 너무 일찍 멈춘다.

이 논문이 거는 판돈은 하네스 스케일링이라고 명시된다: 모델 가중치를 바꾸지 않고 에이전트 주위의 실행 시스템을 개선한다는 것. StateM 은 다음을 중심으로 구성된 에이전트 네이티브 런타임으로 서술된다:

요소무엇인가
지속 상태(durable states)트랜스크립트가 아니라 지속되는 상태를 중심으로 조직된 실행
단계 국소 컨텍스트현재 단계로 범위가 좁혀진 컨텍스트
검사된 전이가정되지 않고 검증되는 상태 변화
복구 가능한 런북살아남아 재개되는 절차
버전 관리되는 절차적 관행에이전트 와 사용자 가 함께 들여다볼 수 있는 관행
서술된 기제는 선별된 사후 분석 결과지속되고 실행 가능한 선행 조건이 된다는 것이다 —
학습된 통제가 프롬프트 안에 암묵적으로 남는 대신 명시되고 강제된다.

결과

모든 수치는 보고된 값이며 독립적으로 검증되지 않았다 (source).

Terminal-Bench 2.1

구성결과
GPT-5.5 xhigh + StateM92.1%
GPT-5.5 xhigh 기준83.1%
GPT-5.6 Sol Ultra (기준)91.9%
GPT-5.6 Sol xhigh + StateM445회 시행에 걸쳐 95.3% raw accuracy; 89개 과제 전부에서 최소 한 번 성공
GPT-5.6 Luna, 고정 프로필76.7 → 85.4%, 84.9% Sol xhigh 기준선 상회
DeepSeek-V4 Flash, 적응 후표준 타임아웃에서 82.7 → 88.1%; 88개 과제 공통 코어에서 89.1%
런북은 GPT-5.5 에서 GPT-5.6 으로 그대로 이전된다고 밝혀져 있다. DeepSeek 적응 비용은
$38 미만으로 명시된다.

비용

구성최종 점수 API 사용량
StateM$15
GPT 기준$574.68
DeepSeek 총 지출$52.22
BusinessBench

개발 세트 위에 만든 계열별 런북이 홀드아웃에서 macro 0.55, micro 1.34 포인트 이득을 낳고, 기제가 일치하는 두 계열은 10.04 포인트 향상된다. 논문 자신의 독법: 구체적 규칙은 과제가 실행 구조를 공유할 때 일반화하며, 통제 방법론은 더 넓게 적용된다.

초록이 주지 않는 것: 어느 기준 수치에 어떤 하네스가 쓰였는지, 89개·88개 과제의 구성, "raw accuracy" 가 무엇을 제외하는지, 달러 수치 뒤의 토큰 수, 라이선스.

의의

Eval Harness Configuration 이 가진 가장 강력한 단일 데이터포인트이며, 그 클러스터가 3주 동안 갖지 못한 수치와 함께 도착한다.

정확도 축에서는 하네스 논지를 거의 최대치로 밀어붙인다. 고정된 런타임이 세 계열의 네 모델을 움직이고, 런북이 버전 상승을 넘어 그대로 이전되며, 중급 모델 (DeepSeek V4-Flash)을 프런티어 기준선이 있던 자리 위로 올려놓는다. 이 페이지가 지금 의도적으로 약화시켜 잡은 입장 — 하네스는 역량 그 자체가 아니라 모델에 대한 곱셈자 라는 것 — 은 이것을 견딘다: 모든 이득은 여전히 모델 의존적이고(같은 런타임에서 +9.0, +8.7, +5.4 포인트), 95.3% 라는 최상단 수치는 여전히 가장 강한 백본을 아래에 두어야 나온다.

비용 축에서는 앞선 일곱 편이 주지 않은 것을 공급한다. 2026-08-17 이래 기록된 이 클러스터의 상시 불만은 어느 것도 루프의 비용을 공개하지 않는다는 것이었다 — 일곱 편, 서로 비교 불가능한 분모 다섯 개, 달러로 된 분모는 전무. StateM 은 같은 벤치마크에서 더 높은 정확도로 $15 대 $574.68, 38배 비율을 공개한다. 하네스 주장을 값 매길 수 있게 하는 이 위키 최초의 수치다.

살아 있는 가격 논쟁에도 걸린다. Test-Time Compute (Inference-Time Compute Scaling) 는 같은 답에 대해 토큰당 가격을 바꾸지 않고 토큰 수를 바꾸는 기제 셋을 기록하고, 그 귀결로 Pricing 행은 요율이므로 그중 무엇도 거기에 드러나지 않는다고 적는다. 런타임 변경에서 나온, 더 높은 정확도에서의 38배 비용 비율은 같은 효과이며, 이 위키가 기록한 어떤 토큰당 가격 변동도 근처에 가지 못하는 크기다.

반대 무게추는 같은 날, 같은 배치의 반대편에 있다. How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks (arXiv:2608.14905) 은 100개 과제 위에서 8개 하네스-모델 조합을 돌려, 실패 패턴이 가장 강한 모델을 포함해 그 전부에서 반복되며 결핍이 어느 스캐폴드가 아니라 모델 수준에 있다고 밝힌다. 어느 논문도 다른 쪽을 인용하지 않는다. 이 짝짓기는 이 위키의 것이며 그렇게 표시한다. 둘이 곧바로 모순인 것은 아니다 — StateM 은 Terminal-Bench, AutoResearchEval 은 열린 연구다 — 그러나 하네스 스케일링이 통하는 영역과 통하지 않는 영역이 같은 날 처음으로 함께 기록에 올랐다.

열린 질문

  • 기준 수치는 어떤 하네스에서 나왔는가? 83.1% 와 84.9% 기준선에는 명시된 하네스가 없는데, 이는 Eval Harness Configuration 이 추적하는 바로 그 비교 가능성 결함이다. 하네스 스케일링 논문이 하네스 없는 기준선을 보고하는 것은 이름 없는 구성을 상대로 측정하는 일이다.
  • "raw accuracy" 는 무엇을 제외하는가? 제목에 등장하지만 읽은 자료 어디에도 정의되지 않으며, 445회 시행에 걸친 95.3% raw 를 "89개 과제 전부에서 최소 한 번 성공" 과 나란히 두면 서로 다른 두 양을 하나로 읽게 만든다.
  • $15 는 $574.68 과 비교 가능한가? 하나는 "최종 점수 API 사용량" 이고 다른 하나는 기준 비용이며, 개발·적응·실패한 시행이 둘 중 어디에 포함되는지는 명시되지 않는다. DeepSeek 의 $38 적응 비용과 $52.22 총액은 포함되지 않았음을 시사한다.
  • 런북이 이전되는 이유는 런타임이 일반화해서인가, 두 모델이 모두 GPT 여서인가? 변경 없는 GPT-5.5 → GPT-5.6 이전은 한 계열 안에서의 일이고, DeepSeek 사례는 비용을 치른 적응을 요구했다.
  • 저자, 소속, 라이선스 — 미상. 논문은 읽지 않았다.

인용

StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1
via Harness Scaling (2026). arXiv:2608.15089.

Referenced by

Sources