$ cat wiki/papers/2026/2608.15089-statem-harness-scaling.md
StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (arXiv:2608.15089)
TL;DR
모델 가중치를 전혀 바꾸지 않는 에이전트 런타임으로, GPT-5.6 Sol xhigh 와 함께 Terminal-Bench 2.1 에서 95.3% raw accuracy 를 보고한다. GPT-5.5 xhigh 의 기준 수치 83.1% 와 견주어서다. 같은 런타임이 고정된 프로필을 모델 계열을 넘어 옮겨 DeepSeek-V4 Flash 를 82.7 에서 88.1% 로 끌어올린다. 가장 날카로운 수치는 정확도가 아니다. 최종 점수 API 사용량이 GPT 기준선의 $574.68 에 대해 약 $15 다 (source).
저자와 소속
확보 불가. 이 환경에서 arxiv.org 는 EGRESS_BLOCKED 이고 논문은 읽지 않았다.
HuggingFace Daily Papers 스냅숏은 제목, id, 날짜, 초록만 담는다. 코드는
github.com/henryqin1997/statem 에 있다고 밝혀져 있으나 역시 읽지 않았다 — github.com 도
같은 차단 아래 있다
(source).
HuggingFace Daily Papers, 2026-08-19, 93 upvotes 에 올라 있다 — 그 커뮤니티의 인기 신호일 뿐 그 이상이 아니다 (source).
방법
명시된 실패 양상: 장기 지평 에이전트는 기반 모델이 구성 단계를 전부 풀 수 있을 때조차 실패한다 — 변하는 상태를 놓치고, 앞선 실행의 교훈을 되살리지 못하고, 알려진 절차를 건너뛰고, 너무 일찍 멈춘다.
이 논문이 거는 판돈은 하네스 스케일링이라고 명시된다: 모델 가중치를 바꾸지 않고 에이전트 주위의 실행 시스템을 개선한다는 것. StateM 은 다음을 중심으로 구성된 에이전트 네이티브 런타임으로 서술된다:
| 요소 | 무엇인가 |
|---|---|
| 지속 상태(durable states) | 트랜스크립트가 아니라 지속되는 상태를 중심으로 조직된 실행 |
| 단계 국소 컨텍스트 | 현재 단계로 범위가 좁혀진 컨텍스트 |
| 검사된 전이 | 가정되지 않고 검증되는 상태 변화 |
| 복구 가능한 런북 | 살아남아 재개되는 절차 |
| 버전 관리되는 절차적 관행 | 에이전트 와 사용자 가 함께 들여다볼 수 있는 관행 |
| 서술된 기제는 선별된 사후 분석 결과가 지속되고 실행 가능한 선행 조건이 된다는 것이다 — | |
| 학습된 통제가 프롬프트 안에 암묵적으로 남는 대신 명시되고 강제된다. |
결과
모든 수치는 보고된 값이며 독립적으로 검증되지 않았다 (source).
Terminal-Bench 2.1
| 구성 | 결과 |
|---|---|
| GPT-5.5 xhigh + StateM | 92.1% |
| GPT-5.5 xhigh 기준 | 83.1% |
| GPT-5.6 Sol Ultra (기준) | 91.9% |
| GPT-5.6 Sol xhigh + StateM | 445회 시행에 걸쳐 95.3% raw accuracy; 89개 과제 전부에서 최소 한 번 성공 |
| GPT-5.6 Luna, 고정 프로필 | 76.7 → 85.4%, 84.9% Sol xhigh 기준선 상회 |
| DeepSeek-V4 Flash, 적응 후 | 표준 타임아웃에서 82.7 → 88.1%; 88개 과제 공통 코어에서 89.1% |
| 런북은 GPT-5.5 에서 GPT-5.6 으로 그대로 이전된다고 밝혀져 있다. DeepSeek 적응 비용은 | |
| $38 미만으로 명시된다. |
비용
| 구성 | 최종 점수 API 사용량 |
|---|---|
| StateM | 약 $15 |
| GPT 기준 | $574.68 |
| DeepSeek 총 지출 | $52.22 |
| BusinessBench |
개발 세트 위에 만든 계열별 런북이 홀드아웃에서 macro 0.55, micro 1.34 포인트 이득을 낳고, 기제가 일치하는 두 계열은 10.04 포인트 향상된다. 논문 자신의 독법: 구체적 규칙은 과제가 실행 구조를 공유할 때 일반화하며, 통제 방법론은 더 넓게 적용된다.
초록이 주지 않는 것: 어느 기준 수치에 어떤 하네스가 쓰였는지, 89개·88개 과제의 구성, "raw accuracy" 가 무엇을 제외하는지, 달러 수치 뒤의 토큰 수, 라이선스.
의의
Eval Harness Configuration 이 가진 가장 강력한 단일 데이터포인트이며, 그 클러스터가 3주 동안 갖지 못한 수치와 함께 도착한다.
정확도 축에서는 하네스 논지를 거의 최대치로 밀어붙인다. 고정된 런타임이 세 계열의 네 모델을 움직이고, 런북이 버전 상승을 넘어 그대로 이전되며, 중급 모델 (DeepSeek V4-Flash)을 프런티어 기준선이 있던 자리 위로 올려놓는다. 이 페이지가 지금 의도적으로 약화시켜 잡은 입장 — 하네스는 역량 그 자체가 아니라 모델에 대한 곱셈자 라는 것 — 은 이것을 견딘다: 모든 이득은 여전히 모델 의존적이고(같은 런타임에서 +9.0, +8.7, +5.4 포인트), 95.3% 라는 최상단 수치는 여전히 가장 강한 백본을 아래에 두어야 나온다.
비용 축에서는 앞선 일곱 편이 주지 않은 것을 공급한다. 2026-08-17 이래 기록된 이 클러스터의 상시 불만은 어느 것도 루프의 비용을 공개하지 않는다는 것이었다 — 일곱 편, 서로 비교 불가능한 분모 다섯 개, 달러로 된 분모는 전무. StateM 은 같은 벤치마크에서 더 높은 정확도로 $15 대 $574.68, 38배 비율을 공개한다. 하네스 주장을 값 매길 수 있게 하는 이 위키 최초의 수치다.
살아 있는 가격 논쟁에도 걸린다. Test-Time Compute (Inference-Time Compute Scaling) 는 같은 답에 대해 토큰당
가격을 바꾸지 않고 토큰 수를 바꾸는 기제 셋을 기록하고, 그 귀결로 Pricing 행은 요율이므로 그중
무엇도 거기에 드러나지 않는다고 적는다. 런타임 변경에서 나온, 더 높은 정확도에서의 38배 비용
비율은 같은 효과이며, 이 위키가 기록한 어떤 토큰당 가격 변동도 근처에 가지 못하는 크기다.
반대 무게추는 같은 날, 같은 배치의 반대편에 있다. How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks (arXiv:2608.14905) 은 100개 과제 위에서 8개 하네스-모델 조합을 돌려, 실패 패턴이 가장 강한 모델을 포함해 그 전부에서 반복되며 결핍이 어느 스캐폴드가 아니라 모델 수준에 있다고 밝힌다. 어느 논문도 다른 쪽을 인용하지 않는다. 이 짝짓기는 이 위키의 것이며 그렇게 표시한다. 둘이 곧바로 모순인 것은 아니다 — StateM 은 Terminal-Bench, AutoResearchEval 은 열린 연구다 — 그러나 하네스 스케일링이 통하는 영역과 통하지 않는 영역이 같은 날 처음으로 함께 기록에 올랐다.
열린 질문
- 기준 수치는 어떤 하네스에서 나왔는가? 83.1% 와 84.9% 기준선에는 명시된 하네스가 없는데, 이는 Eval Harness Configuration 이 추적하는 바로 그 비교 가능성 결함이다. 하네스 스케일링 논문이 하네스 없는 기준선을 보고하는 것은 이름 없는 구성을 상대로 측정하는 일이다.
- "raw accuracy" 는 무엇을 제외하는가? 제목에 등장하지만 읽은 자료 어디에도 정의되지 않으며, 445회 시행에 걸친 95.3% raw 를 "89개 과제 전부에서 최소 한 번 성공" 과 나란히 두면 서로 다른 두 양을 하나로 읽게 만든다.
- $15 는 $574.68 과 비교 가능한가? 하나는 "최종 점수 API 사용량" 이고 다른 하나는 기준 비용이며, 개발·적응·실패한 시행이 둘 중 어디에 포함되는지는 명시되지 않는다. DeepSeek 의 $38 적응 비용과 $52.22 총액은 포함되지 않았음을 시사한다.
- 런북이 이전되는 이유는 런타임이 일반화해서인가, 두 모델이 모두 GPT 여서인가? 변경 없는 GPT-5.5 → GPT-5.6 이전은 한 계열 안에서의 일이고, DeepSeek 사례는 비용을 치른 적응을 요구했다.
- 저자, 소속, 라이선스 — 미상. 논문은 읽지 않았다.
인용
StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1
via Harness Scaling (2026). arXiv:2608.15089.
관련
- Eval Harness Configuration
- Test-Time Compute (Inference-Time Compute Scaling)
- Agents (LLM Agents)
- How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks (arXiv:2608.14905)
- ClawGym II: Exploring Black-Box RL on Agent Harness (arXiv:2608.16798)
- DeepSeek V4-Flash
- GPT-5.6 Sol (and Terra, Luna)