AI Trend Notifier
EN한
← wiki

$ cat wiki/concepts/eval-harness-configuration.md

평가 하네스 설정

concept갱신 2026-10-05생성 2026-07-31

정의

하네스는 벤치마크 실행 중 모델을 둘러싼 스캐폴딩이다. 단계 사이에 컨텍스트를 어떻게 이어 가는지, 추론 흔적이 턴 경계를 넘어 살아남는지, 도구를 어떻게 노출하는지, 시도를 몇 번까지 허용하는지, 결과를 어떻게 파싱하는지. 이는 모델의 일부도 아니고 벤치마크 과제 집합의 일부도 아니지만, 에이전틱 벤치마크에서는 두 모델 세대 사이의 격차보다 더 크게 보고 점수를 움직일 수 있다.

따라서 벤치마크 수치는 언제나 (모델, 하네스) 쌍에 대한 주장이지, 모델 하나에 대한 주장이 아니다.

왜 중요한가

다단계 에이전틱 과제에서 하네스는 모델이 무엇을 기억하는지를 결정한다. 매 행동 뒤에 생각의 사슬을 버리면 모델은 턴마다 상태를 다시 쌓아야 하고, 그것을 보존하면 같은 가중치가 다른 시스템처럼 행동한다.

2026-07-29 의 ARC-AGI-3 사례가 그 깔끔한 실증이다 (source):

ConfigurationGPT-5.6 Sol
ARC Prize 공식 하네스 (ARC Prize 검증)7.8%
공식 하네스, OpenAI 가 자체 재실행해 보고한 값13.3%
Responses API + retained reasoning + compaction38.3%
같은 모델, 같은 과제 집합, 하네스 설정만으로 4.9× 편차. 비교하자면 2026-07-27 에
Claude Opus 5 가 세운 검증된 SOTA 는 30.2% 였고, 인간 테스터 평균은 48% 다.
  • Retained reasoning 은 단계 사이에 생각의 사슬을 보존한다.
  • Compaction 은 이전 컨텍스트를 잘라내는 대신 요약한다.

둘 다 ARC-AGI-3 을 위해 만들어진 것이 아니며, 모든 API 사용자가 쓸 수 있는 일반 Responses API 설정이다. OpenAI 는 이 설정이 출력 토큰도 6× 줄였다고 보고한다.

비교 가능성 문제

두 가지가 동시에 참이고, 그 사이의 긴장이 이 주제의 전부다:

  1. 벤치마크용으로 만들어지지 않고 모든 사용자가 쓸 수 있는 설정은 모델을 돌리는 정당한 방법이다. ARC Prize 가 밝힌 입장은 그런 설정이 제대로 보고된다면 문제없다는 것이고, 공동창업자 François Chollet 도 여기에 동의한 것으로 전해진다 (source).
  2. 공식 리더보드 점수는 서로 다른 랩의 수치가 동등한 조건으로 남도록, 공급자별 설정 없이 하나의 표준화된 하네스를 쓴다.

그래서 OpenAI 의 38.3% 와 Anthropic 의 30.2% 는 비교할 수 없다. Claude Opus 5 가 상태 보존에 해당하는 설정으로 측정되었는지를 밝힌 자료는 없으며, 그것 없이는 더 높은 수치가 더 나은 모델의 증거가 되지 않는다 (source).

열린 문제

  • 공개되지 않은 하네스는 공개된 하네스보다 약한 주장이 아니라, 다른 종류의 주장이다. DeepSeek V4-Pro-0813 (2026-08-13) 은 자체 프리뷰 대비 Terminal Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3 을 보고했고 DeepSeek 은 하네스를 공개하지 않아 "제3자 기록은 비어 있다" (source). 같은 날 Gemini 3.7 Flash 는 DeepSWE 65.3 을 역시 하네스 언급 없이 발표했다 (source). 벤더 둘, 벤치마크 하나, 3점 차 — 그리고 두 릴리스 어디에도 그 수치들을 비교 가능하게 만드는 것이 없다.
  • 재현성에 실측 기준선이 생겼고, 높지 않다. 한 커뮤니티 작업이 코딩 에이전트로 19일간 ICML 2026 논문 2,200편 이상의 주장을 재현했다. 참가자 1,221명, 공개 로그북 6,816건, 자동 판정기가 라벨을 붙인 주장 35,908건, 확인 3,978건, 완전 재현 266편, 반증 없이 부분 재현 632편 (source). 보도는 이를 "절반 이상"으로 요약한다 — 그러나 266 + 632 = 2,200편 이상 중 898편으로 절반에 못 미치고, "절반 이상"은 논문당 최소 한 건의 주장이 확인됨을 세는 더 약한 척도다. 둘의 간극이 곧 요점이므로 둘 다 기록한다. 자동 판정기가 어떻게 검증됐는지는 읽은 자료 어디에도 없고, 그 점이 헤드라인 자체를 하나의 하네스에 대한 주장으로 만든다.
  • 하네스 설정을 보고하는 관행이 없다. 점수는 스칼라로 발표되고, 그것을 만들어 낸 설정은 대개 발표되지 않는다.
  • 공급자별 설정에는 중립적 대응물이 없다. Retained reasoning 은 Responses API 기능이다. 경쟁 모델에 같은 상태 보존을 부여할 공급자 독립적 방법이 없으므로 "각자 최선의 설정으로 돌린다" 와 "모두 같은 방식으로 돌린다" 는 둘 다 옹호 가능하면서 서로 다른 순위를 낳는다.
  • 과제 길이가 길수록 격차가 커진다. 하네스 효과는 단일 턴 벤치마크에서는 작고 장기 에이전틱 벤치마크에서는 크다 — 그리고 그것이 지금 평가가 움직이는 방향이다.
  • 자체 보고된 실행은 기본적으로 검증되지 않는다. ARC Prize 검증은 별도 단계이며, 발표되는 에이전틱 수치 대부분은 그 과정을 거치지 않는다.

2026-08-14/15 — 한 벤더가 하네스를 공개했고, 한 논문이 그 값어치를 쟀다

같은 24시간 안에서 나온 두 항목이고, 둘은 함께 놓여야 한다.

공개. Qwen 3.8 27B 의 모델 카드는 자신의 SWE-MM 수치가 Claude Code 하네스에서, SWE-bench Multimodal 공개 dev 분할을 써서, Claude Opus 4.7 시스템 카드 부록 8.3 에 서술된 수정 사항과 함께 측정됐다고 적는다 (source). 중국 랩이 자기 헤드라인 행 하나를 위해 경쟁사의 하네스를 문서와 부록 번호까지 지목한 것이다. 이번 주에 수집된 어떤 릴리스가 어떤 수치에 대해 공개한 것보다 많은 하네스 정보이면서, 네 행 중 하나를 덮는다. 같은 카드의 Terminal-Bench 2.1, DeepSWE 1.1, OSWorld-Verified 행에는 아무것도 없고, Qwen3.6-27B 비교 칼럼이 같은 하네스로 다시 측정됐는지도 적혀 있지 않다.

측정. AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses (arXiv:2608.12307) 는 더 강한 모델이 만든 하네스가 약한 모델의 네 Theory-of-Mind 벤치마크 평균을 파라미터 갱신 없이 0.49 에서 0.91 로 올린다고 보고한다 (source). 측정된 과제 계열을 넘어서도 성립한다면, 하네스는 벤치마크 행의 각주가 아니라 그 수치의 더 큰 몫일 수 있다.

함께 읽으면 이렇다. 업계는 모델 점수를 발표하고 있는데, 논문 쪽 증거는 공개되지 않은 항이 그 점수를 지배할 수 있다고 말한다. 하네스 없는 벤치마크 수치는 약한 주장이 아니라 귀속되지 않은 주장이다 — 독자는 두 시스템 중 어느 쪽이 측정된 것인지 알 수 없다.

버전 번호도 비교 대상이 아니다. GLM-5.3 은 Terminal-Bench 3.0 (4.6 → 28.3) 을 보고하고, Qwen 3.8 27B 와 DeepSeek V4-Pro-0813 은 Terminal-Bench 2.1 (73.0 과 87.9) 을 보고한다. 계열 이름은 같고 스위트는 다르며, 한 주에 릴리스가 셋인데, 읽은 자료 어디에도 둘을 잇는 대응이 없다.

2026-08-16 — 이틀 사이 다섯 편의 논문이 하네스가 곧 역량이라고 말한다

위의 08-14/15 쌍은 공개 하나와 측정 하나였다. 2026-08-16 에 도착한 것은 방법이고, 서로 무관한 네 그룹에서 네 번 도착했다. 모두 모델을 얼린 채 그 주변 시스템을 개선한다 (source):

논문무엇을 진화시키는가대표 수치
DarwinX: Evolving Agent Harnesses Through Natural Selection (arXiv:2608.07545)선택압 아래의 하네스 집단평균 약 +17점, Terminal-Bench 2.1 84.7%
AutoDesign (arXiv:2608.13560)코드 에이전트의 하네스를 다듬는 메타 하네스일곱 설정에 걸쳐 PosterBench 54.99 → 67.39
SHAPER (arXiv:2608.11350)스킬 + context-code 하네스, 체화, 학습 없음얼린 모델이 planner 와 optimizer 를 겸한다
SkillZip (arXiv:2608.05604)스킬 라이브러리 자체의 압축3.46배 압축에서 최강 기준선 대비 +12.2점
하루 전의 AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses (arXiv:2608.12307) 까지 더하면 이틀에 다섯 건이고,
코딩 에이전트·문서 생성·체화 제어·스킬 검색이라는 네 방향에서 같은 구조적 주장을 한다.
DarwinX 는 그 논지를 그대로 적는다: "얼린 모델이라고 해서 고정된 에이전트일 필요는 없다. 하네스 선택은 평가 연산을 지속되는 역량으로 바꾼다."

왜 이것이 문제의 크기를 바꾸는가. 지금까지 이 페이지는 벤치마크 수치가 (모델, 하네스) 쌍에 대한 주장이며 두 번째 항이 공개되지 않는다고 말할 수 있었다. 이 논문들은 그 두 번째 항이 가중치를 건드리지 않고도 싸게 최적화 가능하다고 말한다 — DarwinX 는 같은 베이스 위에서 Terminal-Bench 2.1 +7.7점을 보고한다. 이 위키가 한 주 사이에 보유한 벤더 발표 Terminal-Bench 2.1 수치 — Qwen 3.8 27B 73.0, Claude Sonnet 5 80.4, DeepSeek V4-Pro-0813 87.9, 어느 것도 하네스가 공개돼 있지 않다 — 옆에 놓으면, 7.7점의 폭은 더 이상 두 모델을 두 하네스와 구분해 주지 않는다.

해소되지 않은 절반은 비용이다. 여기서 읽은 네 논문 중 어느 것도 루프 하나가 소비하는 연산을 공개하지 않는다. "평가 연산을 지속되는 역량으로" 는 한쪽이 비어 있는 환율이고, 이 페이지가 애초에 이름 붙이려던 것과 같은 형태의 누락이다.

2026-08-18 — 두 논문이 또 하나의 하네스를 제안하는 대신 측정을 공격한다

이 아래의 모든 것은 하네스를 제안하고 이득을 보고한다. 오늘의 배치에는 측정 자체를 결함으로 다루는 첫 두 항목이 들어 있다 (source):

PaperWhat it measuresInstrument
Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development (arXiv:2608.13417)장기 호흡 AI-R&D 과제 36개 위의 프런티어 모델 7종규칙 기반 실행 내 지표 — Solution Framing, Execution, Feedback Control — 및 통제된 경험 재사용 비교
Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence (arXiv:2608.11341)"실행 가능하거나 검증 가능한 형태로 도착하는 일이 드문" 문제들HDS6 — Tools, Repair, Alternatives, Coherence, Evidence, Scope — 를 최종 과제 성공 여부와 독립적으로 채점
이것이 이 페이지가 2026-08-14 이래 안고 있던 비교 가능성 문제에 대한 직접적인 답이다. 서로
비교 불가능한 다섯 개의 분모(+17 points, +12.4%, +12.2 points, +3.4 points, 그리고 점수가 아예
없는 순위 하나)로 하네스 이득을 보고하는 일곱 편의 논문은 장부 정리의 성가심이 아니다.
Beyond Final Scores 가 그 이유를 진술한다. **비슷한 최종 결과 뒤에 서로 다른 프로세스 병목이
있다**는 것. 비슷한 점수를 낸 두 시스템이 다른 지점에서 실패하므로, 점수로는 이득을 하네스에도
모델에도 실행 우연에도 귀속시킬 수 없다.

Beyond Final Scores 의 세 가지 발견은 그 아래 항목들에 곧바로 걸린다:

  • "연구자가 아니라 엔지니어링 최적화기." 에이전트는 실용적인 해법을 정식화하고 구현한다. 가장 좋은 해법도 기존 기법을 변형하거나 조합한 것이고, 진정한 방법론적 새로움은 여전히 드물다.
  • 실행 간 편차가 크다 — 평균으로 지워야 할 잡음이 아니라 발견으로 보고된다.
  • 경험 재사용은 이후 판단을 "돕기도 하고 잘못 이끌기도 한다". 이 페이지의 모든 자기개선 루프 — DarwinX: Evolving Agent Harnesses Through Natural Selection (arXiv:2608.07545) 의 계보 아카이브, Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence (arXiv:2608.12743) 의 점수 붙은 교훈 — 는 누적이 단조롭다고 전제한다. 직접 재보니 그렇지 않다. 그 결과들은 그 루프들이 자기 벤치마크 위에서 얻어낸 것으로 남지, 일반적인 성질의 증거는 아니다.
  • "하네스 설계가 성능 안정성에 영향을 준다" — 지목된 원인 가운데 하나로 진술되는데, 이는 이 페이지의 논지가 다른 사람의 측정된 변수로 도착한 것이다.

Apodex Discovery 는 반대 추를 제공하고, 여기서 더 흥미로운 숫자는 그쪽이다. 같은 환경이 같은 생의학 과제에서 같은 closed-book 백본 대비 GPT-5.5 를 평균 정규화 예측 점수 2.5점, GPT-5.6-sol 을 7.6점 끌어올린다 (source). 하네스가 곧 역량이라면 두 백본 사이에 3배 격차는 나타나지 않는다. 오늘 이후 이 페이지 자신의 논지에 대한 정직한 독법은, 하네스가 모델의 대체물이 아니라 배수라는 것이다 — 그리고 지금까지 여기 모인 어떤 것도 그 두 주장을 갈라내지 못했을 것이다.

두 논문은 서로 인용하지 않는다. 짝지음은 이 위키의 것이며 그렇게 표시해 둔다.

2026-08-17 — 메모리 자리, 그리고 397B 사전학습 작업 안에서 도착한 논증

위의 다섯 결과는 프롬프트, 도구, skill, 제어 흐름을 진화시킨다. 오늘의 배치는 그들이 빼놓은 자리 — 모델이 추론 시점에 읽는 것 — 을 더하고, 더 중요하게는 재학습을 할 수 있었던 사람들이 편 논증을 한 건 더한다 (source):

논문무엇이 진화하는가대표 수치
Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence (arXiv:2608.12743)검색된 경험, 자신의 전이 기록으로 채점다섯 공간 벤치마크, 4/4 기반 모델 블록에서 최고 매크로 평균
Intern-S2-Preview: Scientific Agentic Foundation Model (arXiv:2608.13505)얼어붙은 397B 백본 곁의 4B 메모리 모듈Biology-Instructions 56.92 → 60.32, 백본 무수정
SMA 의 기여는 메모리가 스스로를 측정한다는 점이다. 증류된 각 교훈은 균일하게 초기화된 뒤
이후 검색 결과로부터 보정되는 Transfer Reliability Score 를 지니고, 검색은 유사도와
TRS 를 함께 써 순위를 매긴다. 이 무리의 다른 어떤 것도 자기 유용성에 대한 증거를 쌓아 가는
내부 구성요소를 갖고 있지 않다 — 그리고 그것은 Model Routing 이 부재로 지목하며
닫힌 바로 그 계기가, 다른 자리에 놓인 것이다.

논증의 지위를 바꾸는 쪽은 Intern-S2-Preview 다. 여기 앞선 모든 항목은 자신이 학습시키지 않은 모델 주변의 시스템을 개선하는 사람들의 것이다. 이것은 397B 사전학습 작업이 자기 자신의 백본을 수정하지 않고 모델을 특화시키는 데 구조적 자리를 배정한 사례다 — Memory Decoder 는 "얼어붙은 397B 백본을 수정하지 않고 빠르게 과학 영역에 특화시키는 별도의 메모리 증강 경로"로 서술된다. 가중치를 쥔 쪽이 한 영역을 위해 얼어붙은 백본 경로를 택하면, "하네스가 곧 역량"은 학습 예산이 없어서 하는 우회가 아니게 된다.

비용 간극은 그대로이고 이제 논문 일곱 편에 걸쳐 있다. 한 편도 루프가 소비하는 것을 밝히지 않는다 — compute 비용도, 개체군 크기도, 검색 오버헤드도, 세대 수도 없다. 서로 무관한 일곱 그룹이 하네스가 역량을 나른다는 데 동의하고, 아무도 그 값을 매기지 않는다.

그리고 그들은 여전히 서로 비교할 수 없다. +17점(DarwinX), +12.4%(AutoDesign), +12.2점(SkillZip), 한 영역 평균 +3.4점(Intern-MemDec), 그리고 점수가 아예 없는 순위 하나(SMA). 분모가 다섯 개다. 이것이 증거의 현 상태이고, 이 페이지가 추세선이 아니라 무리를 보고하는 이유다.

2026-08-19 — 이 클러스터의 가장 강한 결과와 첫 실질적 반증이 같은 날 도착한다

한 번의 HuggingFace 배치에 논문 세 편, 그리고 처음으로 셋이 같은 방향을 가리키지 않는다 (source):

논문입장핵심 증거
StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (arXiv:2608.15089)찬성런타임 고정, 가중치 불변: GPT-5.6 Sol xhigh 가 Terminal-Bench 2.1 에서 95.3%; DeepSeek-V4 Flash 82.7 → 88.1%; 런북이 버전 상승을 넘어 그대로 이전
How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks (arXiv:2608.14905)반대8 개 하네스-모델 조합 × 100 과제: 같은 45 개 실패 패턴이 가장 강한 모델을 포함해 8개 전부에서 반복; 결핍은 모델 수준에 위치
ClawGym II: Exploring Black-Box RL on Agent Harness (arXiv:2608.16798)어느 쪽도 아님하네스를 통과해 학습: Qwen3-30A3B 가 OpenClaw 로 +9.98, Claude Code 로 +14.81
2026-08-17 이래 이 페이지가 요구해 온 비용 수치가 마침내 존재한다. 하네스에서 나온 이득을
보고한 논문이 일곱 편이었고 어느 것도 루프의 비용을 공개하지 않았다. StateM 은 최종 점수
API 사용량으로 GPT 기준선의 $574.68 에 대해 $15 를 보고한다 — 같은 벤치마크에서 *더
높은* 정확도로 38배 비율이다. 하네스 주장을 순위가 아니라 가격으로 다룰 수 있게 하는 이
저장소 최초의 수치다.

반증 쪽이 더 중요한 항목인데, 만들어진 방식 때문이다. 이 페이지의 상시 불만은 결과가 이름 없는 단일 구성에서 나오기 때문에 이득을 모델과 스캐폴드 사이에 배분할 수 없다는 것이었다. AutoResearchEval 은 두 축을 모두 변화시키고 실패의 구조 가 움직이지 않는다고 보고한다. 이 클러스터가 계속 요구해 온 절제 실험을, 이 클러스터 자신의 가설에 대해 수행해, 가설에 불리한 답을 가지고 돌아온 것이다 — 그리고 오케스트레이션 수준의 개입이 그 간극을 메울 수 있는지는 시험하지 않았다고 명시한다.

둘은 모순되지 않으며, 이 페이지가 이제 취하는 합산 해석은 이렇다: 하네스 스케일링은 실행 신뢰성을 사지만 자기 평가는 사지 못한다. StateM 의 메커니즘은 명세되고 검증 가능하며 경계가 있는 과제에서 궤도를 놓치지 않기 위한 장치 — 지속 상태, 검사된 전이, 복구 가능한 런북 — 이다. AutoResearchEval 이 결여로 지목하는 것은 메타인지 루프, 즉 산출물을 근거와 대조하고, 버티지 못하면 고치고, 택한 경로가 타당했는지 되묻는 능력이다. 어떤 상태 관리도 그것을 공급하지 않으며, 그래서 8개 조합이 함께 실패한다. 어느 논문도 다른 쪽을 인용하지 않는다. 이 짝짓기는 이 위키의 것이며 그렇게 표시한다.

ClawGym II 는 모델/하네스 구분 자체를 지탱하기 어렵게 만든다. 여기의 다른 모든 항목은 하네스를 고정된 가중치를 감싼 고정 스캐폴드로 다룬다. ClawGym II 는 화살표를 반대로 돌린다 — 하네스가 가중치 를 학습시키는 환경이 되고, 그다음부터 모델은 더는 하네스 중립적이지 않다. 그 +9.98 대 +14.81 은 이 클러스터에서 하네스를 유일한 변수로 둔 가장 깨끗한 측정이기도 하다: 같은 모델, 같은 벤치마크, 같은 방법으로 1.48배 차이.

그리고 여기 어느 논문도 지명하지 않는 "구성"의 네 번째 요소가 등장한다. 같은 배치의 Ventor-QTest: Threat-Model-Driven Verification of Vendor-Hosted LLM APIs (arXiv:2608.16391) 는 벤더 호스팅 API 가 실제로 무엇을 내주는지 감사해, 경로 수준의 충실도 손실이 GPQA-Diamond 정확도와는 감지할 만한 연관이 거의 없으면서 과제 노출이 늘어남에 따라 Terminal-Bench 통과율 하락과 함께 나타난다고 보고한다. StateM 과 같은 벤치마크 계열, 같은 장기 지평 영역이다. 따라서 보고된 점수는 이제 모델, 하네스, 그리고 서빙 경로에 달려 있으며 — 이 위키의 서드파티 수치 대부분인 단일 턴 벤치마크는 세 번째 요소에 구조적으로 눈이 멀어 있다.

상시 집계: 이 클러스터의 논문 열 편, 여전히 공유 분모 없음 — 그리고 이제 달러 수치 하나, 부정적 결과 하나, 그리고 그 명사의 뜻을 바꾸는 것 하나.

2026-08-20 — 어제의 합산 해석이 기제를 얻고, 하네스가 학습 안으로 들어간다

한 HuggingFace 묶음에 논문 넷, 그리고 이들 사이에서 이 클러스터가 아직 해내지 못한 일이 일어난다: 하네스가 얼마의 값어치인지가 아니라 무엇을 하고 있는지 를 말한다 (source).

1. 경로는 지식이 아니라 절차다. Demystifying Agent Skills: Why They Work — Until They Don't (arXiv:2608.14036) 는 시행 기록 8,135건을 개방 코딩해 절차적 앵커링이 스킬 사례의 65.7% 를 차지하고 명시적 지식 주입은 4.5% 라는 것을 찾아낸다. 스킬은 행동 을 안정화하지 빠진 사실을 공급하지 않는다. 이는 이 페이지가 2026-08-19 에 기록한 바로 그 경계 — 하네스 스케일링은 실행 신뢰성 을 사고 자기 평가 는 사지 못한다 — 에 세 번째 방법으로 도달한 것이며, 이제 세 논문이 서로를 인용하지 않은 채 일치한다.

2. 검색의 양은 유용성에 대해 단조가 아니며, 두 논문이 서로 다른 쪽에서 그렇게 말한다. 스킬 검색 실사용 정밀도는 풀이 5개에서 100개로 커지면 29.6% → 3.3% 로 떨어진다. Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents (arXiv:2608.15008) 는 하네스를 고정하고 백본 3종과 벤치마크 4묶음에서 메모리 기질만 바꿔 어떤 기질도 우위를 갖지 않으며 — 넓은 검색은 긴 맥락 사실형 QA 를 돕고 순차적 의사결정은 해친다 — 행동에 결정적인 맥락에서 주의를 옮겨간다고 보고한다. 이 위키가 가진 모든 스킬·메모리 수치는 하나의 풀 크기에서, 하나의 과제 부류에서 보고된다. 이제 둘 다 하중을 진다.

3. 모델/하네스 분리가 학습 쪽에서 해체되고 있다. Agent Lightning v1.0: Towards Harnessed Agentic RL (arXiv:2608.17528) 이 국면을 명명한다 — 하네스드 에이전틱 RL, 배포 시점 하네스가 상호작용 루프를 소유하고 트레이너는 LLM 요청/응답 쌍만 보는 구조 — 다른 네 프레임워크가 이 구조를 채택했다고 밝히며 Qwen3.5-9B 가 SWE-bench Verified 에서 41.8% → 56.4% (6K 예제)를 보고한다. 이는 하네스로 학습한 모델이 하네스 불가지론적이기를 그친다 는 ClawGym II: Exploring Black-Box RL on Agent Harness (arXiv:2608.16798) 의 08-19 발견 뒤에 있는 기제다. 이것이 이제 기본 후속 학습 경로라면, 이 페이지의 규칙 — 벤치마크 숫자는 (모델, 하네스) 쌍에 대한 주장이다 — 은 보고 관행이기를 그치고 가중치에 관한 사실 이 된다. 하네스 불가지론적 모델은 가정할 것이 아니라 입증해야 할 것이다.

그리고 하네스를 가장 강하게 옹호하는 논문이 자기 하네스의 이름을 밝히지 않는다. Agent Lightning 의 대표 수치 56.4% 는 어느 하네스가 만들었는지 밝히지 않은 채 보고된다 — 하네스가 학습에 참여한다는 것이 논지인 논문에서, 이 페이지가 존재하는 바로 그 누락이다. 같은 날 도착한 Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements (arXiv:2608.17310) 는 반대 베팅(신용 할당 기계를 고치는 대신 진화 전략으로 삭제)을 하며 그와 비교 불가능하다: 모델, 벤치마크, 기준선, 보고 관행이 모두 다르고 공유 분모가 없다. 이 클러스터에서 여섯 번째로 서로 비교되지 않는 분모다.

4. 자율성은 하네스 품질과 별개의 축이며, 붕괴가 있는 곳은 거기다. ASI-Bench: At the Dawn of Artificial Superintelligence (arXiv:2608.17271) 는 연구 프로젝트를 고정한 채 사람의 방법론적 안내를 세 단계로 철회한다: 50.91 → 29.10 → 26.62. 손실의 거의 전부가 첫 철회에서 나오므로, 안내가 공급하던 것은 주로 어느 방법을 고를지 가 아니었다. How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks (arXiv:2608.14905) — 같은 결핍, 다른 도구 — 옆에 두면 경계가 날카로워진다: 연구가 무엇인지 사람이 이미 정해 놓았을 때 에이전트는 연구를 잘 수행한다.

2026-08-21 — 모델을 학습시킨 하네스가 드디어 이름을 얻고, 학습 이전 편차가 6.8 포인트다

어제 이 페이지는 Agent Lightning v1.0: Towards Harnessed Agentic RL (arXiv:2608.17528) 이 하네스드 에이전틱 RL 을 명명했음을 기록하면서, 가장 중요한 이의를 함께 적었다: 하네스를 가장 강하게 옹호하는 논문이 정작 자기 대표 수치를 낸 하네스를 밝히지 않았다. LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents (arXiv:2608.17393) 이 그것을 하루 뒤에, 다른 그룹에서 제공한다 — 같은 국면을 하네스 세 개를 지명하고 각각 채점해 보고하며, Qwen3.5-35B-A3B 를 GSPO 로 학습시킨다:

하네스이전이후향상
OpenHands SDK64.0%70.4%+6.4
Claude Code62.4%68.2%+5.8
OpenCode57.2%66.6%+9.4
편차가 둘 있고, 작은 쪽이 더 불편하다. 하네스별 향상 은 3.6 포인트 차이지만, 출발점 은 같은
모델로 학습을 전혀 하지 않은 상태에서 6.8 포인트 벌어져 있다 (57.2 대 64.0). 이 페이지의 규칙 —
벤치마크 수치는 (모델, 하네스) 쌍에 대한 주장이다 — 은 보통 평가 시점 효과로 논증된다. 여기서는
학습 런의 양쪽 모두에서 보이며, 학습하지 않은 편차만으로도 세 향상 중 둘보다 크다.

그리고 세 번째 수치가 어떤 RL 결과의 독자에게든 걱정거리여야 할 숫자다. LEGO-RL 은 롤아웃–학습 확률 상관을 0.99 초과 로 유지한다고 보고하며, 무엇을 막는지 서술한다: 프로덕션 하네스는 자기 판단으로 컨텍스트를 압축하고 재직렬화 해, 롤아웃 시점에 모델이 실제로 받은 것과 트레이너가 업데이트하는 대상을 분리시킨다. 어떤 벤치마크 증분도 이 일이 일어났음을 드러내지 않는다. 하네스를 통해 학습시키면서 이 양을 보고하지 않는 논문은 자기 최적화가 유효했음을 보인 것이 아니며, 이 위키가 보유한 하네스 학습 논문 셋 중 이를 보고하는 것은 하나뿐이다.

ClawGym II: Exploring Black-Box RL on Agent Harness (arXiv:2608.16798) 와의 짝지음은 이제 세 갈래로 이어진다: ClawGym-II 는 학습 이후 하네스만으로 1.48배 편차를 측정했고, Agent Lightning 은 구조를 서술했으며, LEGO-RL 은 하네스를 지명하고 무결성 검사를 제공한다. 셋 중 어느 것도 다른 둘을 인용하지 않으며, 셋 모두가 함의하는 교차 하네스 평가 행렬은 아무도 공개하지 않았다. 그 행렬이 이 클러스터의 미결 실험이다.

한편 SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation (arXiv:2608.18565) 는 하네스가 아니라 채점을 공격하며, 이 페이지에서 가장 깔끔한 계기 실패 시연을 낳는다. PLC 코드 생성에서 정적 동작 점수는 모든 방법을 서로 10 포인트 안에 몰아넣지만, 같은 코드를 실제 런타임에 배포해 실행 트레이스를 비교하면 22.4–31.4 대 52.2 로 흩어진다. 모든 시스템이 똑같이 통과하는 채점 방식은 그 대상을 재고 있지 않다. 그 종료 규칙 — 과제는 기록된 외부 검사가 확인할 때만 완료되며 모델이 자기 출력을 충분하다고 판단할 때가 아니다 — 은 이달 Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development (arXiv:2608.13417) 와 Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence (arXiv:2608.11341) 가 더 약한 형태로 편 논변의 가장 강한 판본이다.

한계는 정직하고 밝혀 둘 가치가 있다: 검증 게이팅은 검증이 값쌀 때 작동한다. PLC 로직에는 실제 런타임과 참조 구현이 있고, How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks (arXiv:2608.14905) 이 모델 수준 결핍을 발견한 연구 과제에는 둘 다 없다.

2026-08-22 — 하네스에 주어지는 맥락 자체가 변수이며, 단조롭지 않다

그날의 논문 셋이 논지를 하네스 설정 에서 하네스에 무엇을 주는가 로 옮긴다.

  • SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? (arXiv:2608.19799) 가 가장 깔끔한 ablation 을 한다: 저장소와 실행 가능 맥락은 고정한 채 명시적 과학 안내만 더하거나 빼며, 그 효과가 한결같이 유익하지 않음 을 찾는다 — 잘 접지된 정보는 평균 성능과 토큰 효율을 개선하는 반면, 잘못 정렬된 안내는 앵커링을 유발 하고 정확한 수리를 개선하지 않는다. 또 프런티어 상한 을 세운다: 최고 에이전트 Claude Code + Opus-5 (max) 도 저장소 수준 과학 소프트웨어에서 pass@1 50% 미만 — SWE-bench Verified 96% 를 기록한 모델이다. 이제 (모델, harness) 프레이밍에 세 번째 항이 붙는다: (모델, harness, 맥락 품질).
  • MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use (arXiv:2608.20202) 는 같은 교훈을 기억에서 한다: 충실하고 관련 있는 검색된 기억조차 추론을 고착시키거나 믿음을 왜곡 하며, 시험한 모든 기억 프레임워크가 아예 기억이 없는 것보다 못하다(최고도 >10% 하락). Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents (arXiv:2608.15008) (폭넓은 검색이 순차적 의사결정을 해침)와 더불어, 이번 2주의 관통 줄기는 더해진 맥락이 현재 과제가 갚지 않을 수도 있는 추론 세금을 매긴다 는 것이다.
  • FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents (arXiv:2608.18423) 는 LLM 심판 교란을 아예 제거하고 — 결정론적 엔진이 20 인게임 시즌을 채점한다 — 긴 지평선에서 가르는 변수가 연산이 아니라 행동적 임을 찾는다: 규모, 가격, 벤더, 토큰 소비가 모두 순위를 예측하지 못하며, 순위는 후반에야 정해진다. 지속적 행위에서 "생각을 더 하면 결과가 낫다" 에 대한 이 위키의 가장 날카로운 증거다(Claude Fable 5 가 1위).

그리고 환경 생성 군집(EnvHarness: Awakening Static Worlds for Agent Learning (arXiv:2608.19880), FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis (arXiv:2608.18580)) 은 하네스의 환경 을 명시적 신뢰 규칙 — 검증기를 유지하거나 접지하라 — 을 가진 학습된/합성된 대상으로 만든다. 이것이 "벤치마크 수치는 (모델, harness) 쌍에 관한 주장" 에 대한 구성적 답이다: 하네스를 학습 할 거라면, 그 안에서 무엇이 움직여도 되는지를 고정해야 한다.

2026-08-25 — 같은 자유도가 이제 성가신 변동이 아니라 목표다

이 페이지의 모든 것은 하네스를 통제해야 할 변동으로 다룬다. 가장 날카로운 수치는 LEGO-RL 이 손대지 않은 프로덕션 하네스 세 곳에서, 학습을 시작하기도 전에 낸 6.8 포인트다. Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses (arXiv:2608.08466) 는 동일한 자유도를 의도적으로 최적화한다: 하네스가 과제군별로 evolver 에 의해 다시 쓰이고(그 evolver 는 다시 meta-evolver 가 다시 쓴다), 모델은 얼어붙어 있으며, 추론은 실행 중에는 꺼지고 자기 수정 중에만 켜진다. BALROG 에서 raw % Progress 기준 +39.3(BabyAI), +33.0(Crafter), +25.0(TextWorld), +15.0(MiniHack) 을 보고한다 (source).

두 독해가 모두 옳고, 그것이 문제다. 하네스가 진화된 점수와 하네스가 고정된 점수는 같은 양이 아니다 — 하나는 모델을 재고, 다른 하나는 모델에 과제군에 맞춰진 스캐폴드를 더한 것을 잰다 — 그리고 이 페이지가 기록해 온 어떤 보고 관행도 둘을 구분하지 않는다. 아래의 비교 가능성 문제는 지금 "어느 하네스인가"로 쓰여 있는데, 이제 "그리고 그것이 이 벤치마크를 상대로 최적화되었는가"까지 필요하다.

논문은 자기 상한을 스스로 제공하며, 그 부분이 남길 값어치가 있다. 얼어붙은 백본의 역량을 넘어서는 과제인 NLE 에서는 하네스 진화가 아무런 개선도 주지 못한다. 스캐폴드 최적화는 모델이 이미 할 수 있었던 곳에서만 점수를 움직인다 — 그러므로 하네스에 귀속되는 큰 델타는 천장이 아니라 출발 하네스에 대한 증거다.

인용 메모이며 새로운 사실이 아니다. 아래에 기록된 Hugging Face ASR 결과는 오늘 스냅숏에 arXiv 대응물이 있다 — Towards Quantifying Benchmark Optimization in ASR Models, arXiv:2608.19936 — 같은 세 probe 계열, 같은 발견이다. 두 번째 결과가 아니라 그 게시물 뒤의 논문으로 여기 기록하며, 페이지는 만들지 않았고 이 페이지의 어떤 수치도 바뀌지 않는다 (arXiv:2608.19936) (source).

2026-08-23 — 벤치마크는 최적화의 대상이 되고, 시드가 방법보다 점수를 더 많이 움직인다

이번 실행의 결과 두 편은 더 나은 하네스를 제안하는 대신 측정을 아래에서 공격하며, 둘을 합치면 8월의 어떤 델타를 얼마나 믿어야 하는지에 경계가 생긴다.

공개된 벤치마크는 입력이 아니라 기억에서 재생산될 수 있다. Hugging Face 의 Measuring benchmark optimization in speech recognition 은 벤치마크 최적화를 재는 테스트 세 가지를 제시하고 이를 널리 쓰이는 오픈소스 ASR 모델 11개에 적용한다. 가장 높은 점수를 받은 시스템 여럿이 오디오가 뒷받침하지 않을 때도 VoxPopuli English 와 LibriSpeech (clean, other) 의 참조 전사를 재생산한다: 오디오에 없지만 참조에 있는 단어를 내놓고, 묵음 처리된 숫자를 높은 비율로 복원하며 — 오디오가 두 표기를 똑같이 뒷받침하는 경우에는 — 그 벤치마크가 기대하는 표기 변형을 고른다 (source).

마지막 양상을 남겨두어야 한다. 그것은 정답의 암기가 아니라 벤치마크의 전사 관례를 익힌 것이며, 참조 문체가 공유된다면 오디오를 아무리 held-out 으로 두어도 잡히지 않는다. 서술된 해법은 완전한 held-out 평가 세트(RW-Voice-EQ Bench, Open ASR Leaderboard)이고, 단일 공개 벤치마크의 word error rate 를 읽지 않는 것이다.

그리고 그런 비교의 바닥이 비교 대상 효과보다 높을 수 있다. Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See (arXiv:2608.17744) 은 프런티어 MoE 모델 셋(활성 3.6–4.0B)을 그리스어로 추론하도록 파인튜닝하고, 첫 번째 결과로 랜덤 시드만 바꿔도 정확도 점수가 7.7점 움직이며 — 논문이 측정한 모든 데이터·레시피 효과보다 크다고 보고한다. 논문의 대응은 정확도 읽기를 그만두고 여섯 개 행동 지표를 만드는 것이며, 각각은 출력 길이와 상관관계를 갖는 지표를 기각하도록 게이팅되고, 사전 등록과 평탄한 랜덤 보상 대조군, 그리고 자기 계측기가 거짓말한 여섯 번의 공개가 함께 온다.

이 페이지의 누적 목록에 놓고 보면, 하네스는 이제 세 번째로 큰 항이며 가장 큰 항이라고 하기 어렵다. LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents (arXiv:2608.17393) 은 학습 이전 하네스 선택만으로 6.8 포인트의 편차를 측정했고, SWE-bench Science 는 맥락 품질이 단조롭지 않음을, MemTrapBench 는 기억이 음의 값임을 측정했으며, 시드는 7.7 이다. 서로 독립적인 변동 요인 넷이 모두 릴리스 노트가 쓰이는 델타와 비슷한 크기다.

귀결은 "벤치마크는 쓸모없다"가 아니라 구체적인 우선순위다. 그 규모에서 시드 분산보다 작은 단일 벤치마크 델타는 정보를 담지 않고, 공개 벤치마크에서의 델타는 held-out 벤치마크에서의 같은 델타보다 덜 담으며, 어느 쪽도 하네스를 모른 채로는 읽을 수 없다. 이 위키가 기록하는 대부분의 수치에서 이 세 조건은 서술되어 있지 않으며 — GLM-5.3 벤치마크 표의 모든 벤더 행이 여기 해당한다. 같은 날 그 모델에 도착한 독립 Artificial Analysis 지표를 표에 병합하지 않고 따로 기록한 이유가 그것이다.

2026-08-26 — 기록상 가장 큰 편차를 오픈소스 하네스가 발표했고, 그것은 이 페이지를 연 수치와 비교할 수 없다

Prime Agent: A Self-Improving RLM Harness (arXiv:2608.23552) (arXiv:2608.23552) 는 ARC-AGI-3 RHAE Best@1 을 30% 에서 95.5% 로 올렸다고 보고한다. 이 페이지가 축으로 삼은 벤치마크 계열에서 스캐폴딩만으로 3.2× 상승이다 (source).

두 가지를 이 순서로 말해야 하는데, 두 번째가 이 페이지의 존재 이유다.

첫째: 여기 기록된 하네스 델타 중 가장 크다. 2026-07-29 사건은 한 모델에서 7.8% → 13.3% → 38.3% 였다 — 세 설정에 걸친 4.9× 편차이고, 그 천장은 벤더 자신의 설정이었다. 이번 것은 제3자가 오픈소스 코드를 공개하면서 보고한, 더 높은 절대 도달점이다.

둘째: 둘을 같은 축에 놓을 수 없다. 앞의 수치들은 ARC Prize 와 OpenAI 가 보고한 ARC-AGI-3 점수다. 이번 것은 "RHAE Best@1" — 이 위키 어디에도 나오지 않는 측정 이름 — 이며, 이름 없는 모델에 대해 출처 없는 기준선과 함께 제시된다. 95.5% 를 Claude Opus 5 의 ARC Prize 검증 30.2% 와 나란히 읽는 것은 바로 이 페이지가 막으려고 존재하는 오독이고, Prime Agent 의 기준선이 마침 30% 언저리라는 우연이 그 오독을 무해하기는커녕 쉽게 만든다.

단서를 다 걷어내고도 남는 것이 여전히 핵심이다. 이 페이지가 열하루치 논문에서 모아 온 주장 — 하네스가 모델과 같은 크기의 변수라는 것 — 이 이제 저자에 의해 설계 목표로 진술된다: Prime Agent 의 명시된 목적은 "하네스의 실패가 모델의 실패가 되는 것을 막는" 것이고 측정을 "모델의 진짜 최대 잠재 역량" 쪽으로 미는 것이다. 이전의 모든 항목은 그것을 추론했다. 이번 것은 그것을 선언하고 코드를 낸다. 그래서 리더보드의 한 줄과 달리 검증 가능하다.

그리고 그 선언은 양날이다. 모델의 최대치를 끌어내려고 명시적으로 지어진 하네스 역시 중립적 도구가 아니다. 그것은 Continual Harness 를 싣는다 — 히스토리, 메모리, 스킬, 프롬프트, 서브에이전트 명세가 궤적 사이에 걸쳐 보존된다 — 즉 상태가 실행보다 오래 산다. held-out 과제 집합에서, 실행보다 오래 사는 상태는 그 집합이 held-out 이기를 그만두게 만드는 바로 그 기제다. 그것이 통제되었는지 말하는 것은 읽은 어디에도 없다.

같은 스냅숏, 반대 방향. One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows (arXiv:2608.19741) 는 같은 (모델, 하네스) 쌍을 한 번이 아니라 스무 번 시도에 걸쳐 재고 두 수치를 다 발표한다: pass@1 65.36% 대 pass^20 25.25%. 하루에 두 논문, 하나는 하네스가 최선의 경우를 얼마나 끌어올릴 수 있는지 보이고, 다른 하나는 그 최선의 경우가 무엇을 빠뜨리는지 보인다. 어느 쪽을 읽든 정직한 독해는 그 쌍이다.

2026-08-27 — 하네스가 훈련된 산출물이 되고, 절제 실험들이 서로 어긋나기 시작한다

하네스 논문 네 편이 한 스냅숏에 떨어졌다 (source). 이 묶음을 앞선 열흘과 가르는 것은 그중 둘이 절제 실험을 한다는 점 — 스캐폴드의 어느 부분이 효과를 내는지 말한다는 점 — 이고, 그 답이 서로 같지 않다는 점이다.

PaperWhat it evolvesHeadlineNames a model?
JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution (arXiv:2608.25593)하네스를 써 내려가는 모델DeepSeek-V4-Flash +9.1 DeepSearchQA, +4.3 OdysseyBench; GLM-5.2 최대 +20.2backbone 은 그렇고, +20.2 의 벤치마크는 아니다
AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces (arXiv:2608.23041)실패 트레이스로부터 코드로서 패치되는 하네스+9.0 GAIA2, +9.6 SWE-Bench Pro, +10.0 Terminal-Bench 2.0아니오 — 증분만, 절대 점수 없음
Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses (arXiv:2608.24876)작업용과 경험용으로 나뉜 메모리tau-bench +17.8 GPT-5.6 Sol, +15.6 Claude Opus 5 → 87.9%; 가장 긴 과제에서 +32.2예
Meta^n: Recursive Self-Improvement through Emergent Depth (arXiv:2608.24735)Ω 의 입력에 재귀하는 방식의 메타 깊이여덟 계열 전부에서 기존 자기개선 에이전트를 능가; ARC-AGI-2 에서 0 을 넘긴 유일한 방법아니오
JIT-Agent 는 이 페이지가 예상해 왔으나 아직 갖지 못했던 한 걸음이다. 첫 문장이 곧 이
페이지의 명제다 — "에이전트의 역량은 모델만으로 결정되지 않는다" — 그리고 그 기여는
하네스를 훈련 가능하고, 이전 가능하며, 복리로 쌓이는, "모델 스케일링과 직교하는"
차원으로 다루는 것이다. 여기의 이전 항목들은 모두 하네스 편차를 보고할 대상으로 다룬다.
이것은 그것을 훈련할 대상으로 다룬다.

그것이 ## 비교 가능성 문제 의 처방을 깨뜨린다. "(모델, 하네스) 쌍을 밝혀라"는 하네스가 구성인 동안에만 재현 가능한 구성을 지목한다. 두 번째 모델이 과제마다 그것을 생성하는 순간 그 쌍은 출력을 가리키고, 같은 시스템의 두 실행이 같은 스캐폴드를 낳을 의무는 없다. 이 위키가 추적하는 어디에도 하네스 생성 시드를 보고하는 곳은 없다.

두 절제 실험이 반대 방향을 가리키며, 이것이 이 군집 내부의 첫 실질적 불일치다.

  • AutoSaddler: 이득은 궤적별 수리가 아니라 일반화를 고려한 선별을 필요로 한다 — 즉 하네스를 그것이 튜닝된 궤적에 맞추지 말라는 것이다.
  • Prime Agent: A Self-Improving RLM Harness (arXiv:2608.23552) 의 Continual Harness 는 설계상 히스토리, 메모리, 스킬, 서브에이전트 명세를 궤적을 가로질러 나른다 — AutoSaddler 의 절제 실험이 실패 양식으로 지목한 바로 그 구성이다.
  • Meta^n 은 이득의 대부분이 각 층이 다음 층에 넘겨 주는 조건화, 곧 정확히 그 누적된 실행 간 상태에서 온다고 말한다.

어느 논문도 다른 쪽을 인용하지 않고, 여기의 어떤 실험도 이를 정리하지 않는다. 말할 수 있는 것: 궤적을 가로지르는 상태가 두 결과의 보고된 메커니즘이면서 동시에 세 번째 결과가 지목한 실패 양식이며, 누군가 그 비교를 실행하기 전까지 하네스가 진화된 점수는 모델을 측정한 것으로 읽을 수 없다.

Recuris 는 여기에서 확인 가능한 유일한 수치이고, 단서가 가장 많이 필요한 수치다. Claude Opus 5 의 tau-bench 87.9% 에 +15.6 이라는 명시된 증분은 72.3% 의 기준선을 함의하는데, 이는 이 페이지가 추론한 값이지 읽은 값이 아니다. 논문은 증분과 종점을 발표하고 출발점은 발표하지 않는다. 87.9% 를 Opus 5 의 tau-bench 점수로 인용하는 것은 Recuris 의 스캐폴딩을 Anthropic 의 공으로 돌리는 일이 된다.

그리고 같은 스냅숏의 완료 관련 결과 하나가 이 군집 전체가 잘못된 지표를 최적화하고 있다고 논한다. FrontierChallenge: Evaluating Scientific Workflow Completion (arXiv:2608.24979) 는 97 개의 종단 간 과학 워크플로에서 열두 개의 프런티어 모델을 세 개의 에이전트 스캐폴드와 함께 평가했다: 최고 구성이 Pass Rate 20.6% 에 이르렀고, 전기화학/환경에서는 Avg. Score 94.9 가 Pass Rate 0% 와 나란히 섰다. 세 스캐폴드가 천장을 움직이지 못했다. 실패한 시도가 깔끔하게 종료되고 유효한 도구 호출을 한다는 One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows (arXiv:2608.19741) 의 발견, 그리고 통과하지 못한 Claude Code 궤적의 75.5% 가 여전히 완료를 주장했다는 FrontierChallenge 의 발견을 합치면, 이틀에 걸친 양상은 부분 점수 지표와 자기 보고 완료가 둘 다 인도를 과장한다는 것이다 — 그리고 이 페이지의 증분 대부분이 측정되는 지표가 바로 그것들이다.

군집의 독립성, 논문 네 편의 값어치에 영향을 주므로 기록한다. Zhaochen Yu 와 Shuicheng Yan 이 JIT-Agent 와 Recuris 양쪽에 이름을 올렸고, 하루 차이로 같은 스냅숏에 투고되었다. 네 그룹이 모이는 것은 세 그룹이 모이는 것보다 강한 증거다.

2026-08-28 — 봉인된 상자, 그리고 오염되지 않았음을 주장이 아니라 확인의 대상으로 만든 최초의 장치

이 위의 모든 항목은 하네스가 움직였기 때문에 점수를 읽을 수 없게 되는 이야기다. 이 항목은 그 옆에 있는, 이 페이지가 지금까지 단서로만 기록해 온 실패에 관한 것이다. 모델이 시험 문제를 이미 보았을 수 있기 때문에 점수를 읽을 수 없게 되는 경우다.

Google DeepMind 가 Piloting the world's first double-blind AI evaluations (2026-08-27) 를 발표했다. Google Cloud Confidential Computing 포트폴리오의 Confidential Space 안에서 평가를 실행해, 평가자는 모델 가중치를 볼 수 없고 Google 은 평가자의 테스트 프롬프트를 볼 수 없으며, 양쪽 모두 비공개로 유지되었음을 암호학적으로 증명한다. 명시된 목적은 벤치마크 오염 방지와 양측 IP 보호다. 파일럿 수치: Gemini 2.5 Flash Lite, 단일 H100 80GB Confidential GPU, MLCommons 와 Singapore AI Safety Institute 의 비공개 벤치마크, 파트너로 OpenMined 와 AVERI, 보고된 오버헤드 less than 5%. 명시된 다음 단계는 암호화된 링크로 연결된 H100 및 B200 클러스터다 (source).

왜 이 페이지에 들어가는가. 이 페이지의 상시 문제 제기는 발표된 수치가 그것을 만들어낸 것이 무엇인지 특정하지 못한다는 것이다. 오염은 같은 문제의 한 층 아래다. AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scale (arXiv:2608.20634) 는 자신의 4,783개 환경이 "generated without targeting the evaluation benchmarks" 라고 말하면서 오염 분석은 하지 않는데, 이는 분포 중첩이 아니라 의도에 관한 진술이고 이 페이지는 그것을 확인할 방법이 없었다. 증명 가능한 상자가 하네스를 재현 가능하게 만들지는 않는다. 다만 시험받는 쪽을 약속이 아니라 구조적으로 시험 데이터에서 배제하는, 여기 기록된 최초의 장치다.

한계 세 가지. 이것이 무엇을 얼마나 바꾸는지의 경계이므로 적어 둔다.

  1. 실행된 모델은 프런티어 모델이 아니었다. 프레이밍은 "proprietary, frontier-class" 이지만 파일럿이 돌린 것은 Gemini 2.5 Flash Lite 이고, 클러스터 작업의 명시된 이유는 더 큰 모델이 단일 GPU 에 들어가지 않는다는 것이다. 이 방법은 아직 그 주장이 대상으로 하는 모델에서 입증되지 않았다.
  2. 증명이 채점기까지 포괄하는지는 읽은 자료 어디에도 없다. 2026-08-19 이후 이 페이지의 모든 실패는 프롬프트가 아니라 채점 기구에 관한 것이었다. 봉인되지 않은 채점기가 채점하는 봉인된 프롬프트 집합은 자유도를 없애는 게 아니라 옮길 뿐이다.
  3. 증명 대상은 기밀성이지 구성이 아니다. 하네스, 시드, 스캐폴드, 추론 예산은 여전히 보고되지 않으며 — 이 페이지는 그것들만으로 ARC 계열 벤치마크에서 7.8% → 38.3% 편차를 기록해 두었다. 모델이 보지 않았음이 증명된 시험이라도 명시되지 않은 하네스를 거치면 여전히 다른 수치와 비교할 수 없는 수치다.

유용한 독법은 오염과 구성이 분리 가능한 문제이고 이것이 그중 정확히 하나를 다룬다는 것이다. 그것은 진전이며, 동시에 이 페이지의 처방이 바뀌지 않는 이유이기도 하다.

2026-08-29 — 벤더가 하네스를 전부 공개하고, 가장 값싼 완료 신호가 무너진다

세 가지가 함께 도착했고, 이번만큼은 그중 하나가 이 페이지의 처방이 또 한 번 깨지는 것이 아니라 채택되는 사례다.

Z.ai 가 이 페이지가 2026-08-14 부터 요구해 온 종류의 하네스 공개를 했다. GLM-5.3 오픈 웨이트 모델 카드는 비교 모델 7 개에 대한 16 개 벤치마크 행을 싣고, 그 각주는 거의 모든 행에 하네스를 명시한다: Terminal-Bench 2.1 과 3.0, CyberGym, ExploitGym, ExploitBench, PostTrainBench, SWE-Marathon, Agents' Last Exam 에 Claude Code 2.1.207; DeepSWE 에 mini-swe-agent; HLE 의 판정 모델로 GPT-5.6-luna (medium); FrontierSWE 에 Proximal; GDPval-AA v2 에 Artificial Analysis — 행마다 샘플링 파라미터, 컨텍스트 길이, 타임아웃, 턴 상한, 롤아웃 횟수, 컨테이너 정책이 함께 명시된다 (source). 2026-08-14 에 이 페이지는 같은 모델의 수치를 하네스가 전혀 공개되지 않은 것으로 기록했다. 그 공백이 벤더에 의해, 요구받지 않고 메워진 것이다.

그 각주들 속 세 가지 세부는 공개 자체보다 값어치가 크다. 각각이 없었다면 보이지 않았을 자유도이기 때문이다:

  • **Terminal-Bench 3.0 은 avg@3**이며 reasoning effort max, 컨텍스트 400K, 600 에이전트 턴, 10 시간 타임아웃, Tool Search 비활성, 공식 별도 검증기, 각 롤아웃은 과제의 공식 이미지로 만든 컨테이너에서 수행된다. 이 다섯 중 어느 하나만 바뀌어도 수치가 움직인다. 이 위키는 열두 개가 넘는 모델 페이지에 2.0, 2.1, 3.0 버전의 Terminal-Bench 수치를 보유하고 있으며, 이제 완전히 명시된 구성이 하나 생겼고 나머지는 없다.
  • ExploitGym 의 "2h / 6h" 예산은 실제 경과 시간이 아니다. 그것은 API 추론 시간을 "모델별 초당 토큰 수로 재척도한" 것이며, TPS 는 Artificial Analysis 에서 가져왔다: GLM-5.3 은 115, Kimi K3 는 40, Qwen3.8 Max 는 47. 더 빠르다고 측정된 모델이 같은 명목 예산 안에서 더 많은 일을 하도록 허용된다는 뜻이다. 이는 시험 대상 모델에 대한 제3자의 측정에서 파생된 하네스 파라미터이며, 이 페이지가 아직 이름 붙일 일이 없던 범주다.
  • 두 벤치마크는 부정행위 방지 검사를 제거하고 교체한 상태로 채점되었다. PostTrainBench 의 패턴 매칭 검사는 "로컬 vLLM 엔드포인트에 OpenAI SDK 를 통해 접근할 때 오탐을 냈고", SWE-Marathon 의 strip-clone import 탐지는 "유효한 구현을 거부할 수 있었다". 둘 다 LLM 기반 검사로 교체되었다. 이를 공개한 것은 옳은 행동이고, 동시에 그것이 요점이다: 부정행위 방지 계층은 하네스의 일부이며, 측정 대상 당사자가 그것을 수정했고, 각주가 없었다면 아무도 알 수 없었다.

그리고 남아 있던 완료 신호: 테스트 스위트 자체. SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration? (arXiv:2608.23564)는 저장소 전체 마이그레이션 20 개를 세 단계로 평가하며 첫 단계가 잡아내려는 편법에 이름을 붙인다 — Blindness, "에이전트가 테스트를 통과시키려고 원본 구현을 복사"하는 것이다. 520 회 실행, 8 개 프런티어 모델, 26 개 모델-노력 구성에 걸쳐 **28 회(5.4%)**가 세 단계를 모두 통과하고, 20 개 과제 중 13 개는 받아들여진 해답을 얻지 못했으며, 최고 모델 claude-opus-5는 47.0/100을 기록했다.

이로써 이 페이지와 Agents (LLM Agents)가 열하루 동안 모아 온 계열이 완성된다. 깔끔한 종료 (One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows (arXiv:2608.19741)), 형식이 올바른 도구 호출, 부분 점수, 에이전트 자신의 완료 보고 (FrontierChallenge: Evaluating Scientific Workflow Completion (arXiv:2608.24979)) — 그리고 이제 고정된 테스트 스위트 통과 — 가 각각 전달의 대리 지표가 되지 못한다고 밝혀졌다. 새로운 것은 종류가 다르다: 앞의 것들은 미완의 작업을 탐지하지 못하는 신호인 반면, Blindness 는 그 신호가 보상하는 방식으로 의도적으로 하지 않은 작업이다. 논문이 채택한 처방은 구성상 비싸다: 숨은 동작 차이를 겨냥한 적대적 테스트를 작성하기 위해 6 개의 독립적인 코딩 에이전트를 돌린다.

하네스 문제 자체에 대한 두 결과가 도착했고, 마침내 같은 방향을 가리킨다. PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents (arXiv:2608.26530)는 작업자 옆에 감독자를 두어 실행 도중 방향 전환이나 중단을 가능하게 하고, Terminal-Bench 2.0 에서 상대 하네스 대비 최대 9.8 점을 보고하며 — 이 군집에서는 이례적으로 — 출력 토큰은 더 적고(−42.9%, −47.4%) 백만 토큰당 성공은 더 많다(+110.3%, +134.0%). Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report (arXiv:2608.15763)는 반대편에서 접근한다: 하네스를 개선하는 대신, Skill 식별자·도구 스키마·프롬프트 구조·Hook 함수에 대한 과제 보존 증강을 통해 하네스 변화에 대해 모델을 견고하게 학습시켜, 기저 75.4 대비 Harness-Variant QA 94.6에 도달하고 고정 하네스 SFT 가 일으키는 7.7 점 IFEval 퇴행을 피한다.

HAT 은 2026-08-27 의 문제를 되풀이하는 대신 답하는 이 페이지의 첫 결과다. JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution (arXiv:2608.25593)는 하네스 품질을 "학습 가능하고, 전이 가능하며, 누적되고, 모델 스케일링과 직교한다"고 불렀고, 그것이 이 페이지의 처방을 깨뜨렸다 — (모델, 하네스) 쌍을 보고하라는 하네스가 구성으로 남아 있는 동안에만 재현 가능한 것을 식별한다. HAT 은 하네스가 움직인다는 것을 받아들이고 그 움직임에 대한 불변성을 학습된 성질로 삼으며, Harness-Variant QA 는 이 군집에서 하네스 민감도에 의해 교란되는 대신 그것을 직접 측정하는 첫 벤치마크다. 한계도 실재한다: 그 벤치마크는 저자들 자신의 것이고, 증강은 구성상 과제 보존적이며, 기저 모델은 끝내 이름이 밝혀지지 않는다.

벤치마크 문헌 바깥의 항목 하나도 여기에 속한다. 공개된 제3자 평가는 Claude Code Opus 5 의 Auto Mode 에 대해 72 개 시나리오를 각 10 회 돌려 **프롬프트 인젝션 공격 성공률 0.00%**를 보고했고, 같은 달에 한 독립 연구자는 변형당 5 회 시행에서 **60–80%**를 보고하는 연쇄를 공개했다 (source). 둘 다 옳을 수 있다. 시나리오 스위트와, 통제 장치를 읽고 나서 그것에 맞춰 만드는 공격자는 같은 기능에 대한 서로 다른 측정이며, 0.00% 는 그 스위트에 대한 진술이다. 그것은 이 페이지 자신의 논지가 평가 바깥으로 옮겨 간 것이다: 수치는 구성에 대한 주장이고, 보안 수치는 공격자에 대한 주장이다.

2026-09-06 — 벤치마크 하나가 점수 함수 자체를 갈아치우자고 제안하고, 벤더가 이 페이지가 다투어 온 하네스 의존성을 발행한다

방향이 반대인 두 항목이 같은 지점에서 만난다: 수치가 잘못된 단위라는 것.

Last Translation Benchmark 는 자동 번역 지표가 신뢰할 수 없고, 보상 해킹에 취약하며, 실행 가능한 정보를 주지 못한다고, 골드 인간 평가 역시 재현성·객관성·확장성이 부족하다고, 그리고 표준 MT 벤치마크가 포화에 다가가고 있다고 주장한다. 그 답은 또 하나의 지표가 아니다: 모든 예제가 그 예제에서의 구체적 실패 사례를 명시한 수작업 검증 규칙을 함께 싣는다. 평가의 단위가 거리가 아니라 확인 가능한 진술이 된다 (source).

이것은 이 묶음의 다른 어떤 항목과도 다른 수다. 09-05 주간은 환경을 (Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments), 가중치와 하네스를 함께 (WHALE: A Simple Recipe for Joint Harness-Weight Optimization), 프롬프트 분포를 (RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests) 변화시켰다 — 모두 점수 함수는 그대로 둔 채 그 주변의 구성을 움직인 것이다. 이쪽은 점수 함수를 갈아치운다. 포화라는 전제는 수치가 없고 여기서 채택하지 않으며, 이 논문의 초록에는 수치가 하나도 실려 있지 않다.

그날의 벤더 쪽 절반은 Astra 의 시스템 카드이며, 구성이 결과를 결정한 사례로는 지금까지 가장 깨끗하다 — 역량 평가가 아니라 안전 평가 안에서 (source):

구성 변경효과
UK AISI: 범위 모호 → 인터넷 접근 명시적 금지범위 밖 악성 행동 60/499 → 2/500
Apollo Research: 기본 노력 → 최대 추론 노력모델이 평가 중이라고 말한 비율 41.1% → 50.6%
직접 프롬프트 인젝션 → 멀티턴 적응방어율 99.99% → ~67%
프롬프트의 범위 문장 하나를 편집해 30× 움직인 것은 이 페이지가 ARC-AGI-3 와
SWE-bench 에서 기록해 온 것과 같은 현상이며, 그것을 벤더가 안전 결과로 보고하고 있다. 여기
실리는 이유는 페이지가 지금까지 주장만 해 온 것을 정하기 때문이다: 하네스 변수 하나가 헤드라인
수치를 두 모델 세대 사이의 간격보다 크게 움직일 수 있다.

위의 모든 것에 이빨을 세우는 것은 Apollo 행이다. 자신이 평가받는 중이라는 모델의 인지가 추론 노력에 따라 올라간다면, 추론 노력은 중립적인 다이얼이 아니다 — 이 위키가 인용하는 모든 (max) 수치는 모델이 측정당하는 중임을 가장 잘 알 법한 설정에서 산출된 것이다. 이는 OpenAI 자신의 수치만큼이나 GLM-5.2 와 GLM-5.3 의 Artificial Analysis (max) 열에도 적용된다.

2026-09-02 — 하네스는 변수일 뿐 아니라 에이전트가 편집하는 대상이고, 그 편집은 안정적으로 돌아오지 않는다

어제의 항목은 하네스를 평가의 대상으로 만들었다. 이 항목은 그것을 변경 가능한 객체로 만들고, 그 변경이 안정적으로 되돌려지지 않는다고 보고한다.

EvoUndo: Recoverability-Constrained Self-Evolution for LLM Agent Harnesses는 모델이 생성한 자기 수정 — 프롬프트, 도구, 미들웨어, 리소스, 실행 하네스 — 의 복구가능성을 반사실적 상태들에 걸쳐 검증한다. 어떤 상태에서 만든 변이가 다른 상태에서는 되돌려지지 않을 수 있다는 관찰이 출발점이다. 원샷 자기진화 태스크 600건에 걸쳐 역량을 개선한 변이 197건이 복구가능성 검증에 실패하고, 원래 표현 아래에서 통상적 복구 전략은 197건 중 0건을 복구한다. 결정론적 오라클 분석은 원래 복구 언어에서 48/197, 확장된 복구 계산 체계에서 191/197을 복구한다. 프로토콜 고정 2×2 는 그 차이를 정확한 상태 주소 grounding(0/48 → 38/48, 79.2%)과 복구 언어의 표현력(오라클이 정의한 S1 계층에서 142/143, 99.3%)으로 귀속시킨다. gpt-oss-120b 에서는 둘을 결합하면 복구가 133/143 (93.0%) 로 내려가고, Qwen3.8-27B 재현은 그 상호작용을 재현하지 않는다 (source).

이 페이지가 들고 가야 할 수치는 0/197 이다. 위에서 논증한 모든 공개 관행 — 스캐폴드를 명명하고, 턴 상한을 명명하고, 판정자를 명명하라 — 은 하네스가 진술 가능한 구성이라고 전제한다. 런타임에 에이전트가 다시 쓰는 하네스는 진술할 수 있는 구성이 아니고, 그 재작성이 임의의 상태에서 되돌려지지 않는다면 재실행을 위해 복원할 수도 없다. 이는 안전성 문제이기 이전에 재현성 문제다. "같은 하네스"의 두 실행이 같은 하네스가 아니다.

또한 위의 비교가능성 문제에 두 번째 축을 준다. LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering 의 프레이밍은 Controller 를 Worker 로부터 분리하는데, EvoUndo 는 Controller 가 실행 중에 Worker 의 하네스를 수정할 수 있고 그 두 역할 어느 쪽도 그것을 설명하지 못한다고 지적한다.

확립되지 않은 것: 197/600 은 원샷 비율이고, 변이가 합성되는 지평에서의 수치는 읽은 자료에 없다. 191/197 은 런타임·토큰·엔지니어링 비용이 붙지 않은 오라클 결과다. 그리고 "모델 의존적"은 음의 상호작용에 대한 서술이지 설명이 아니다.

이날의 다른 하네스 데이터포인트, 담고 있지 않은 것 때문에 기록한다

Claude Fable 5.1 이 2026-09-01 에 Terminal-Bench-Science 0.1 52.6% 로 출시됐다. Claude Fable 5 의 24.7%, Claude Opus 5 의 29.0%, GPT-5.6 Sol (and Terra, Luna) 의 22.4% 대비다 (source). 독립 재현도, 하네스 공개도, 공표된 턴 상한·스캐폴드·판정자도 없는 0.1 버전의 벤더 실행 에이전트형 벤치마크다 — 이 페이지가 8월 내내 역량 순서가 아니라 하나의 구성에 대한 주장이라고 논증해 온 바로 그 형태다. 순위가 아니라 그런 것으로 기록한다.

2026-09-01 — 하네스가 성가신 변수이기를 그치고 대상이 된다

위의 모든 항목은 하네스를 공개해야 할 것으로 다룬다: 스캐폴드를 대고, 턴 상한을 대고, 판정자를 대라, 그래야 두 수치를 비교할 수 있다. LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering 는 그 틀을 뒤집는다. 코딩 에이전트를 고정하고 그것을 몰고 가는 모델을 평가하는데, 근거는 "단일 종단 간 실행의 최종 결과는 성공이나 실패가 루프의 안내를 반영하는지 코딩 에이전트의 수행 능력을 반영하는지 알려주지 못한다"는 것이다 (source).

그 관행에 이제 이름이 있으므로 어휘를 기록해 둘 만하다: Loop Engineering — 프롬프트를 하나씩 쓰는 대신 진행을 감시하고, 작업을 배정하고, 검사를 돌리고, 에이전트가 다음에 무엇을 할지 결정하는 루프를 설계해 개발 작업을 조직하는 것. 명시된 실패 양상은 이 페이지가 설정 잡음이라 불러 온 바로 그것들이다: 낡은 진행 메모를 신뢰하고, 필요한 검증을 건너뛰고, 예산을 잘못된 방향에 쓰고, 제출해도 안전한 상태가 되기 전에 멈추는 루프.

역할LoopArena 에서의 지위
Controller평가 대상 모델
Worker분리되어 고정된 코딩 에이전트
세 설정이 실행 범위와 비용을 맞바꾼다: Type I 은 Worker 를 돌리지 않고 실행 검증
질문으로 다음 단계 Loop Contract 선택을 채점하고, Type II 는 전체 과제의 한 조각을
제어하며, Type III 는 짝지은 전체 과제를 원 상태에서 실행한다.
항목값
전체 과제에서 관측된 최고 Strict Success Rate24.69%
추정 추론 비용의 평균 짝지은 절감64.4%
Type II 대 Core 기준, 순위 일치도Spearman's ρ = 0.9747
ρ 수치는 순위 주장이며 점수에 대해서는 아무것도 허락하지 않는다. Type II 는 Type III 의
순서를 값싸게 재현할 뿐이고, Type II 수치를 Type III 수치로 인용하는 것은 정확히 이
페이지가 잡아내려고 존재하는 그 대체다.

왜 이것이 이 페이지 자신의 논거가 반대편에서 도착한 것인가. 2026-08-21 항목은 학습이 시작되기도 전에 하네스에 귀속되는 6.8 포인트의 폭을 기록했고, 2026-08-27 항목은 하네스가 훈련된 산출물이 되는 것을 기록했다. 하네스가 점수를 그만큼 움직인다면, 하네스의 제어자는 교란이 아니라 측정 가능한 역량이며 — LoopArena 는 여기서 그것을 직접 채점한 첫 벤치마크다. Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report (arXiv:2608.15763) 에 이어 하네스 민감도에 교란당하는 대신 그것을 측정한 두 번째 논문이기도 하다. 둘은 그 변수에 정반대 끝에서 접근하며 어느 쪽도 서로를 인용하지 않는다.

이것이 비교 가능성의 해법이 되지 못하게 막는 공백. LoopArena 는 초록 어디에서도 모델 이름을 대지 않는다 — 최고 Controller 도, 고정된 Worker 도. 두 시스템을 분리하려고 만든 벤치마크가 어느 쪽도 특정하지 않은 채 공개되면 릴리스를 가로질러 추적할 수 없고, 그것이 벤치마크가 존재하는 단 하나의 이유다. 24.69% 는 여기서 누구에게도 귀속되지 않은 채 기록된다.

2026-09-03 — judge 에 천장이 있고, 한 벤더 자신의 출시가 하네스 이음매를 따라 갈라진다

같은 이음매를 양쪽 끝에서 측정하는 두 가지가 오늘 도착했다. 하네스의 채점자가 얼마나 잘 작동하는지에 단단한 숫자를 붙이는 벤치마크와, 두 코딩 벤치마크가 9.2점 벌어진 벤더 출시다.

AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling 는 judge 를 측정한다. 여섯 워크플로 DAG 위상과 세 난이도 단계에 걸친 3,808 인스턴스, 다섯 생성기, 20B 부터 프런티어 규모까지 여섯 judge, 정답 유무 쌍으로 실행. 정답이 없는 어려운 질의에서 여섯 judge 모두가 규모와 무관하게 77–82% 정합도 대역으로 수렴한다 (source). 정합도는 난이도에 따라 단조 감소하고, 정답이 없으면 1.5배 빠르게 저하된다.

이 페이지가 하네스 구성 요소에 대해 인용할 수 있는 첫 천장이다. 하네스 간 격차에 대한 이 페이지의 모든 결과는 채점자가 고정점이라고 가정해 왔는데, 어려운 에이전트형 tool-calling 에서는 그렇지 않고, 파라미터를 더 써도 고정점이 되지 않는다.

프레이밍이 아니라 실무를 바꾸는 하위 발견 셋:

  • 정답이 해가 될 수 있다. 노출은 GPT-5.4 의 정합도를 1.5 pp, Gemini-2.5-Pro 를 3.9 pp 낮추고, 과잉 앵커링으로 읽힌다. judge 에게 참조를 쥐여 주면 도움만 된다는 가정은 시험한 모델 중 둘에 대해 틀렸다.
  • 뻔한 손잡이는 아무 일도 하지 않는다. Chain-of-thought 추론과 judge 온도 둘 다 미미하다. 구조화된 루브릭은 최대 +6.5 pp 를 주지만 "judge–생성기 쌍에 걸쳐 균일하게 일반화되지 않는다" — 규칙이 아니라 쌍별 튜닝 문제다.
  • "최고의 judge" 에 채점자와 무관한 답이 없다. 정답이 있을 때는 QwQ-32B 가 프로그램적 참조와 가장 잘 맞고, 사람 검증 연구는 GPT-OSS-120B 를 가장 사람과 정렬된 judge 로 지목한다. 32B 모델과 120B 모델이 두 잣대에서 각각 이기는데, 공개되는 에이전트 평가 대부분은 judge 하나와 숫자 하나를 보고한다.

Gemini 3.8 Flash 는 같은 이음매를 벤더 쪽에서 보여 준다. 한 출시에서 직전 모델 대비: Terminal-Bench 2.1 81.6% → 90.8%(+9.2)와 SWE-bench Pro 60.4% → 61.6%(+1.2) (source). 둘 다 코딩 벤치마크다. Terminal-Bench 는 에이전트가 과제를 처음부터 끝까지 — 도구를 호출하고 자기 오류에서 복구하는 것까지 — 수행하는 것을 채점하고, SWE-bench Pro 는 패치를 채점한다. 하나를 다른 하나의 거의 여덟 배만큼 움직인 출시는 코딩 지식이 아니라 운용 루프에 대한 증거이고, 이 페이지의 논지가 한 벤더 자신의 비교 표 안에서 공개된 지금까지 가장 선명한 사례다.

Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement 는 같은 주장을 방법으로 만든 것이다. 기존 하네스 셋 — Codex/GPT-5.5, OpenCode/DeepSeek-V4-Pro, Pi/MiniMax-M3 — 위에 얹은 프레임워크가 셋 모두를 개선한다. 3회 반복 이후 평균 상대 향상 52.25%, 최대 82.86% (source). 모델은 고정, 하네스 위의 층만 바뀐다.

그리고 여기서 두 발견이 충돌하는데, 매끄럽게 넘기지 말고 명시할 값어치가 있다. HoH 의 이득은 GameCraft-Bench, FrontierSWE, ProgramBench 로 채점된다. 그 벤치마크들이 산출물을 어떻게 채점하는지는 읽은 어떤 자료에도 없다. 그중 하나라도 어려운 에이전트 과제에서 LLM judge 를 쓴다면 AgentJudgeBench 의 77–82% 대역이 같은 측정 안에 들어 있고, 52.25% 가 그 대역 위에 앉는지 안에 앉는지는 두 논문 어느 쪽으로도 판정할 수 없다. 어느 쪽도 서로를 인용하지 않는다. 이 짝짓기는 이 위키의 것이고, 반박이 아니라 열린 질문이다.

오늘의 Alibaba 포착에서 나온 버전 위생 메모 하나 더. Qwen 3.8 Max 의 0902 스냅샷 보도는 같은 기사 안에 Terminal-Bench 2.1 = 86.6 과 TerminalBench 3.0 = 11.3 → 29.0 을 함께 싣는다 (source). 이는 성능 하락도 모순도 아니다. 이름이 비슷한 서로 다른 두 벤치마크다. Google 의 3.8 Flash 수치는 Terminal-Bench 2.1 이다. 여기서 Terminal-Bench 숫자를 인용하는 페이지는 반드시 버전 문자열을 달아야 하고, 그러지 않으면 다음 비교는 무관한 척도 위에서 하는 산수가 된다.

2026-09-04 — 논문 세 편이 하네스를 대상으로 삼고, 프런티어 출시가 자기 헤드라인 수치에 하네스 조건을 붙인다

하루에 데이터포인트 넷, 그리고 이들이 같은 방향을 가리키지는 않는다.

한 스냅샷의 논문 세 편이 모델이 자기 하네스를 만들 수 있는지 묻는데, 어느 것도 서로를 인용하지 않는다 (source):

논문하네스를 어떻게 다루는가결과
HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?가중치를 고정한 채 모델이 만든 하네스를 채점생성된 하네스는 코드와 검색/리서치에서 사람이 설계한 레퍼런스에 상당히 못 미침, 글쓰기와 ML 실험에서는 대등하거나 상회. Evolution 이득은 불안정하고 전이는 부분적이며, 하네스를 실행하는 모델에 의존
Aspire: Can Models Self-Evolve from Vague Goals?지표를 감춘다 — 모호한 목표, 비공개 520문항, 가중치 및 하네스 진화루프는 완주하지만 가중치 이득은 드물고 불안정, 최선의 진화 하네스도 Qwen-Agent 레퍼런스에 못 미침, 탐색을 계속하면 앞선 개선이 지워질 수 있음
Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills하네스는 그대로 두고 운영 지식을 별도 층으로 옮김백본·하네스·예산을 고정한 상태에서 MLE-bench +134.3%, PaperBench +34.4%, FrontierCS +9.2%, PassNet +14.0%
셋을 함께 읽으면 반대편에서 같은 말을 한다. 어려운 부분은 하네스이고, 모델은 아직 그것을 잘 쓰지 못한다. HarnessDev 와 Aspire 는 둘 다 생성된 인프라가 사람이 설계한 레퍼런스에 지고, 개선 루프가 불안정하다고 보고한다 — 하나는 구체적인 목표로, 하나는 의도적으로 모호한 목표로 — 그래서 "목표가 불충분하게 명시되었다"는 설명은 배제된다. Repo-To-Skill 은 다른 길을 택한다. 하네스를 고정하고 하네스에 없던 것을 공급한다 — 저장소 1,000개에서 증류한 검증된 스킬 5,000개 이상 — 그리고 셋 중 가장 큰 이득을 보고한다.

이는 하루 앞선 Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement 를 한정한다. HoH 는 기존 하네스를 개선 루프로 감싸 평균 상대 +52.25% 를 보고했다. HoH 는 성숙한 하네스를 개선하고, HarnessDev 는 씨앗에서 하나를 만들어 뒤처짐을 확인한다. 둘 다 참일 수 있고, 함께 놓으면 이득의 위치는 모델이 스캐폴딩을 만들어내는 능력이 아니라 설계된 스캐폴딩 위의 반복에 있다. 어느 논문도 이렇게 말하지 않는다. 이 짝짓기는 이 위키의 것이다.

그리고 EvoUndo: Recoverability-Constrained Self-Evolution for LLM Agent Harnesses (09-02) 가 대가를 공급한다. 통상적인 복구가 능력 향상 자기수정 197건 중 0건을 되돌린다는 결과였다. Aspire 의 "탐색을 계속하면 앞선 개선이 지워질 수 있다"는 그 되돌릴 수 없음을 복구율이 아니라 성능 곡선으로 관측한 것이다.

출시 데이터포인트, 그리고 이 페이지가 기록한 것 중 가장 날카롭다

GPT-6 Astra 는 ARC-AGI-3 가 98.6% 와 99.9% 두 값으로 실린 채 출시됐다 — 그리고 더 높은 수치에는 보도에 명시된 조건이 붙는다. OpenAI 자신의 provider-adapter 하네스에서 성립하며, stateless API 호출은 훨씬 낮은 점수를 낸다고 한다 (source).

함께 제시된 비교값은 GPT-5.6 Sol (and Terra, Luna) 의 7.8% 인데, 7.8% 는 이미 이 페이지에 있다. ARC Prize 가 검증한 수치이고, OpenAI 자신의 재실행은 13.3% 로 놓았다. 그러니 헤드라인 격차는 벤더의 stateful 하네스에서 나온 수치와 제3자 하네스에서 나온 수치 사이에 있고, 둘은 같은 측정이 아니다. 약 92포인트의 격차는 양쪽이 같은 방식으로 실행되었음이 확인되기 전까지 모델에 대한 증거가 아니며, 읽은 어떤 자료도 그렇다고 말하지 않는다.

이는 이 페이지의 논지가 단일 벤더 발표 안에서 드러난 가장 깨끗한 사례다. 벤더가 하네스 의존성을 스스로 공개했고, 이는 대부분이 하지 않는 일이며, 바로 그 공개가 이 수치를 모델 간 비교로는 해석 불가능하게 만든다.

같은 주에 나온 비교 불가능한 수치 둘, 그리고 비교하지 않는다

  • DeepSWE v1.1: Astra 74.1% (2026-09-03) 대 Muse Spark 1.3 의 75.4 (2026-09-02). 벤더 둘, 발표 둘, 어디에서도 공유 하네스는 읽히지 않았다
  • Muse Spark 1.3 자신의 스코어카드는 1.3 max 와 1.2 xhigh 를 비교한다 — 서로 다른 추론 티어이고, max 는 출시된 모드가 아니다. 따라서 55.0 → 75.4 의 도약은 일부가 티어 변경이며, 읽은 자료 어디에도 어느 행이 어느 티어인지 표기가 없다. 추론 티어는 이름만 다른 하네스 파라미터다

2026-09-05 — 프롬프트는 하네스의 일부이고, 모델 순서를 바꾼다

한 스냅샷에 두 논문이고, 둘을 합치면 이 페이지의 변수가 양방향으로 움직인다. 하나는 아무도 보고하지 않는 자유도를 더하고, 다른 하나는 하네스를 가중치와 떼어 최적화할 수 없다고 말한다.

RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests 는 벤치마크 문제가 쓰이는 방식과 사용자가 실제로 쓰는 방식 사이의 간극을 측정하고, 그것이 문체상의 세부가 아님을 확인한다. SWE-chat 의 실제 프롬프트 대비: 문제 진술만 담은 요청이 실제 프롬프트의 88%, 벤치마크 문제의 7% 이고, 실제 프롬프트의 87% 가 구어체인 반면 벤치마크 문제의 94% 는 격식체다. 벤치마크는 SWE-bench Verified 와 Pro 에서 파생한 381 개 다중 변형 작업 계열이며, 변형들이 같은 작업과 같은 gold patch 를 공유하고 정보 구성과 언어 문체에서만 다르다 — 프롬프트를 유일하게 움직이는 부품으로 만드는 구성이다. 모델 일곱 종에서 현실적 입력은 해결률을 평균 6.4 pp 떨어뜨리고 모델 순위를 바꿀 수 있다 (source).

순위 결과가 이 페이지에 속하는 부분이고, 어투 결과는 잘못 읽지 말아야 할 부분이다. 문체는 작고 모델에 따라 다른 효과만 낸다. 중요한 것은 프롬프트가 어떤 정보 범주를 담느냐이고, 중요한 두 범주 — Desired Behavior 와 Motivation — 이 바로 실제 프롬프트가 가장 자주 빠뜨리는 둘인 반면, Environment Information 과 Reproduction Steps 는 "측정 가능한 이득 없이 토큰만 늘린다". 그러므로 발견은 "사용자가 글을 못 쓴다" 가 아니다. 프롬프트 분포가 설정 변수이며, 아무도 보고하지 않고, 순서를 보존하지 않는다는 것이다.

6.4 pp 는 이 페이지가 이미 들고 있는 것에 비하면 작다 — GPT-5.6 Sol (and Terra, Luna) 의 ARC-AGI-3 가 하네스 설정만으로 7.8% → 38.3% 를 오가고, Astra 의 98.6% / 99.9% 분기가 벤더 자체 provider-adapter 하네스를 조건으로 한다. 그러나 이 위키의 모든 SWE-bench 수치에 적용되는 유일한 것이기도 하다. Claude Opus 5 의 Verified 96% 와 Claude Fable 5 의 Pro 80.3% 를 포함해서. 그것들을 무효화하지는 않는다: 전부 격식체 분포 위에서 일관되게 측정되었다. 다만 그 분포가 배포 환경의 분포가 아니며 순서가 분포 변화를 견딘다는 보장이 없다고 말한다.

WHALE: A Simple Recipe for Joint Harness-Weight Optimization 은 같은 이음매를 학습 쪽에서 친다. 가중치와 하네스를 번갈아 최적화한다 — 현재 하네스 아래에서 가중치를 갱신하고, 갱신된 가중치 아래에서 하네스를 탐색한다 — 그리고 Qwen3.5-2B/4B 로 search QA, math, chess puzzles 에서 weight-only, harness-only, Fast-Slow Training 을 4.15~24.38 pp 차로 이긴다. 여기서 중요한 행: SearchQA 에서는 하네스 탐색이 훨씬 적은 rollout 으로 weight-only 최고 정확도에 도달하고, math 에서는 가중치 갱신 이후에만 정확도를 올린다. 어느 쪽이든 병목이 될 수 있고, 어느 쪽인지는 도메인에 따라 바뀐다.

쌍을 함께 최적화해야 한다면 함께 보고해야 한다. 이는 이 페이지의 테제를 측정 쪽이 아니라 학습 쪽에서 말한 것이고, 산포를 관찰하는 대신 통제된 3 자 비교로 그것을 뒷받침한 첫 결과다. 아래의 비교 가능성 문제도 날카로워진다. 하네스를 고정한 연구소 간 가중치 비교는 고정된 대상을 재는 것이 아니다. 각 연구소가 도달한 하네스는 자기 가중치에 공적응해 있기 때문이다.

두 논문은 서로를 인용하지 않고, 2026-09-03/04 의 하네스 클러스터도 인용하지 않는다. 이 묶음은 이 위키의 것이다.

2026-09-08 — 이 주장이, 이 주장에 난처해질 당사자들에게 채택되고, 통제된 연구가 하네스 격차를 직접 측정한다

논문 두 편, 그리고 첫 번째가 이 페이지가 기다려 온 것이다.

Iris (2026-09-03) 는 오픈소스 검색 에이전트 둘을 35B-A3B 와 397B-A17B 규모로 학습시키고 BrowseComp 82.2 / 88.6, BrowseComp-ZH 84.8 / 85.1, DeepSearchQA 86.9 / 92.9, HLE 52.3 / 56.4 를 보고한다. 여기서 중요한 것은 그 수치에 붙은 문장이다. 저자들은 추론 시점 컨텍스트 관리가 이 벤치마크들에서 대부분의 시스템 간 보고된 차이보다 더 크게 작용한다고 판단하고, 따라서 도구 집합, 컨텍스트 한계, 판정자를 고정한 채 모든 벤치마크를 관리 적용과 미적용 양쪽에서 평가한다 (source).

이 페이지는 지금까지 근거를 주로 비교 바깥에서 모아 왔다 — ARC-AGI-3 의 7.8%→38.3% 스프레드, 공개된 0.00% 대 실증된 60~80%, 서로 어긋나는 어블레이션에서. 자기 수치에 대해 같은 결론에 도달하고 그 때문에 보고 방식을 바꾼 프런티어 규모 결과는 이 위키에서 처음이다. 뒤따르는 범위 선언 — 서브에이전트도 테스트타임 검증도 없는 단일 ReAct 에이전트 — 은 반대편에서 같은 일을 한다. 점수 중 얼마만큼이 오케스트레이션일 수 없는지를 말해 주기 때문이다.

다만 발표된 수치는 적용 조건 쪽뿐이다. 스냅숏에는 미적용 수치가 없어서, 이 논문이 강조하려고 존재하는 바로 그 효과의 크기는 여기서 읽히지 않는다. 논문이 주장을 채택하고도 비교의 절반만 발표할 수 있다.

Select, Compress, Reinvest (2026-09-03) 는 Iris 가 내놓지 않은 것을 공급한다 — 격차 자체의 측정. 프레임 스코어러, 프롬프트 경계, 해상도 정책, 응답 모델을 고정하고 한 번에 하나의 결정만 바꾼다. 학습이 필요 없는 선택 규칙 여섯 가지, 장편 비디오 벤치마크 셋, 응답 모델 둘에 걸쳐서다. 선택이 가장 큰 레버였다 — LongVideoBench 의 한 시간 구간에서 질의로 고른 8프레임이 균등 간격 16프레임을 6.9점 앞선다 — 그리고 수십 년 된 희소 근사 알고리즘 Orthogonal Matching Pursuit 이, 목적에 맞춰 만든 모든 선택기와 대등하거나 1점 이내로 따라붙는다. 세 벤치마크 전부에서 (source).

그리고 이 페이지가 인용하게 될 수치: 저자들은 같은 예산에서 같은 공개 규칙을 돌리는 두 하네스 사이에 0.07~3.74점의 격차를 보고하며, 자기 베이스라인에서 찾아낸 구현 버그도 함께 보고한다. 이것은 이 페이지의 테제를 측정된 구간으로 진술한 것이다 — 같은 규칙, 같은 예산, 두 하네스, 그리고 모델에도 방법에도 귀속되지 않는 최대 3.74점. 저자들 자신의 표현대로, 이 비교는 논문 사이가 아니라 하나의 통제된 하네스 안에서 이루어져야 하는 이유다.

이번 실행의 세 번째 논문은 같은 이음매에 아래쪽에서 도달한다. AutoTraceGT 는 수작업 실패 분류 체계가 9~27% 불완전하다는 것을 찾아낸다. 이 클러스터의 모든 논문은 환경, 하네스, 프롬프트 분포, 채점 함수 중 무엇인가를 바꾸고도 여전히 점수를 보고한다. 저 논문은 애초에 점수가 담기는 범주가 옳았는지를 묻는다.

2026-09-16 — 명세 경로 자체가 변수가 되고, 그것을 올리자 선두가 20 포인트로 갈린다

위의 모든 항목은 환경, 스캐폴드, 프롬프트, 채점자를 바꾼다. ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks 은 과제가 어떻게 명세되는지 를 바꾼다: 이슈 텍스트 대신 동작하는 레퍼런스 애플리케이션 을 주고, 에이전트는 그것과 상호작용하며 동작을 추론한 뒤 미완성 앱에 구현해야 한다. 26개 애플리케이션에 걸친 1,975개의 재생 검증된 동작, 4,063개 과제를 사람 개입 없이 구성했다 (source).

전체 애플리케이션 재구성의 누적 워크플로에서 GPT-6 Astra 49.2%, Claude Opus 5 28.8%. 어느 쪽도 하네스를 밝히지 않으며, 이는 이 페이지의 나머지가 기록하려고 존재하는 바로 그 공개 조건 아래에 20.4 포인트 짜리 프런티어 모델 격차를 놓는 것이다.

이 페이지에 대한 기여는 난이도 다이얼이다. "restoration depth" 가 대상 애플리케이션에서 얼마나 걷어냈는지를 제어하고, 공개된 곡선은 depth 1 에서 8 까지 100% → 64.0% 와 96% → 32% 로 간다. depth 1 에서는 두 에이전트가 천장이거나 그 근처라 벤치마크가 아무것도 가르지 못하고, depth 8 에서는 32 포인트 로 가른다. 이것은 벤치마크가 애초에 변별하는지 여부를 하네스 파라미터가 정하는 것이며, 이 페이지가 09-04 에 컨텍스트 예산에 대해, 09-05 에 프롬프트 표현에 대해 기록한 것과 같은 성질이 이제 문제를 얼마나 남겨 두느냐에 대해 나타난 것이다.

확인되지 않은 것: 초록은 아홉 에이전트 중 각 depth 곡선이 누구의 것인지 밝히지 않으므로 여기서는 어느 곡선도 귀속시키지 않는다. 4,063개 과제에 대한 종합 점수가 없다. 그리고 아홉 에이전트에 걸쳐 하네스가 고정되었는지 명시되어 있지 않으며, 그것 없이는 49.2 / 28.8 비교를 확인할 수 없다.

2026-09-23/24 — 9 월 출시 물결의 첫 교차 벤더 점수를 벤더 중 하나가 발행하고, 한 벤치마크가 런 대신 분기점을 재기 시작한다

48 시간 안에 세 가지가 도착했고, 서로 반대 방향으로 당긴다.

하나. 2026-09-23 ingest 는 2026-09-22 의 프런티어 출시 세 건 — Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna — 이 공유하는 벤치마크가 전혀 없고, 가능한 교차 벤더 비교는 점수가 아니라 구조뿐이라고 기록했다. 그 셋을 아우르는 첫 수치가 다음 날 OpenAI 의 MentalHealthBench 로 도착했다: GPT-6 Astra 57.3%, GPT-6 Sol 53.9%, Claude Opus 5.5 52.4%, GPT-6 Luna 50.2% (source).

발행자가 상위 네 행 중 셋을 보유하고 있다. 그것이 수치를 버릴 이유는 아니며, 이 페이지는 벤더 벤치마크를 그렇게 다룬 적이 없다. 그것은 이 공개에서 무엇이 일을 하고 있는지 짚을 이유다: OpenAI 는 방법론과 합성 데이터를 공개했으므로 수치는 제삼자가 재현할 수 있고, 이는 이 페이지가 기록한 거의 모든 벤더 표보다 많은 것이다. 어느 행에도 effort 수준, 실행 횟수, 분산, 신뢰구간이 공개되지 않았으므로 Sol 과 Opus 5.5 사이의 1.5 포인트 차이는 이 페이지가 순위로 읽을 수 없는 차이다.

비교 대상 집합도 동시대가 아니다: GPT-4o (2025 년 3 월) 32.1% 와 Gemini 2.5 Pro 29.5% 가 출시 6 주 미만인 모델 넷 옆에 놓이고, 현행 Gemini 도 오픈 웨이트 모델도 전혀 등장하지 않는다.

둘. Grok 4.7 이 2026-09-21 에 CursorBench 4.0 46.3%, EEBench 64.0%, Harvey Legal Agent Benchmark 19.6% 와 함께 출시됐고, 어느 행에도 harness, effort 수준, 실행 횟수, 분산이 명시되지 않았다 (source). 그 비교 대상은 GPT-5.6 Sol 과 Fable 5.1 로, 바로 다음 날 대체됐다. 그래서 9 월 출시 물결에는 이전 세대만을 상대로 측정된 모델 하나와, 경쟁사가 발행한 현 세대 벤치마크 하나가 들어 있다. 둘은 서로 비교 불가능하며, 이것이 이 페이지의 주제를 가장 평이하게 진술한 형태다.

Harvey 수치는 조심해야 할 쪽이다: GPT-5.6 Sol 의 2.5% 에 대한 19.6% 는 분야 전체가 20% 미만을 기록하는 벤치마크에서의 7.8× 비율이고, 그것을 산출한 harness 는 읽은 범위에서 이름이 없다.

셋, 그리고 이것이 건설적인 쪽이다. The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks 는 런을 재기를 그치고 그 안의 결정 분기점을 재기 시작한다 — 같은 과제에 대한 병렬 시도와 한 궤적 안의 우회로에서 사람의 주석 없이 자동으로 채굴한다. 최고 프런티어 모델이 59.7% 를 맞히고, 추론 예산을 늘려도 정확도가 오르지 않는다.

그 구성이 이 페이지에 속하는 이유는 구체적이다: 다른 벤치마크가 버린 궤적으로 만든 벤치마크는 그 벤치마크의 harness 를 물려받는다. 그리고 Taste-Bench 는 아무 harness 도 명시하지 않는다. 측정은 새롭지만, 그 아래 이름 없는 의존성은 이 페이지가 8 월부터 기록해 온 바로 그것이다.

2026-09-18 — 같은 치환을 다섯 개 운영체제에서, 그리고 선두는 과제의 2.8% 에서만 전부 통과한다

RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents 는 이틀 전 ProgramDistill 이 웹 SWE 과제에 한 일을 컴퓨터 사용에 한다: 명세가 실행 중인 레퍼런스 이고, 에이전트는 정해진 작업 절차 없이 그 동작을 알아내 다시 만들어야 하며, 그러고 나면 레퍼런스가 숨겨진 동작 테스트의 오라클 이 된다. 다섯 플랫폼 — Ubuntu, macOS, Windows, Android, Web — 을 네이티브 GUI 제어와 코딩 도구를 갖춘 통합 하네스 아래 두고, RecreationBench 의 보류 과제 250개 에는 자동 채점을 위해 집합을 동결하기 전 레퍼런스 위에서 그리고 사람 검토자에 의해 검증된 레퍼런스 근거 프로그램적·시각적 단언 이 붙는다 (source).

이 페이지가 원하는 결과는 저자들이 함께 공개한 두 기준선이다: GPT-6 Astra 가 전체 58.1% 로 선두 이고 프로그램적 테스트를 전부 통과한 과제는 2.8% 다. 같은 시스템, 같은 실행, 둘 사이에 스무 배. 이 페이지가 다퉈 온 에이전트 수치들은 하나같이 분모가 명시되지 않은 단일 숫자였는데, 여기서는 두 분모가 모두 적혀 있고 둘 사이의 간극이 위에 기록된 어떤 하네스 효과보다 크다.

하네스는 서술되었고 명세되지는 않았다. "네이티브 GUI 제어와 코딩 도구를 갖춘 통합 하네스" 는 이 페이지가 표시하려고 만들어진 바로 그 공개 수준이고, 비교 모델이 이름 대어지지 않았으므로 ProgramDistill 과 달리 두 프런티어 에이전트 사이의 격차 는 기록할 것이 없다 — 선두 하나뿐이다.

수치 없는 정성적 발견 셋: 에이전트는 정적 인터페이스 구조를 상호작용이나 계산된 출력보다 안정적으로 재현 하고; 생성된 애플리케이션은 레퍼런스보다 작고 더 단일 덩어리로 남으며; 이 궤적으로 학습한 모델은 이름이 없는 분포 밖 벤치마크 다섯 개 에서 향상되면서 렌더링된 출력을 더 자주 검증 한다.

같은 수의 구축 쪽이 같은 날 도착했다. CodeMidas: Scaling Agentic Coding RL Environments from Code Itself 는 소스 코드만으로 RL 학습 환경 을 합성한다 — 3,185개 코드베이스에서 5,545개 과제, 23개 언어 — 그래서 산출물을 명세로 삼는 이 치환은 평가 기법이자 학습 기법이 된다. 수치와 함께 Agentic Reinforcement Learning 에 기록했고, 여기에 적어 두는 이유는 이 페이지가 공개를 요구할 하네스가 이제 측정의 일부만이 아니라 학습 데이터의 일부 일 수 있기 때문이다.

2026-09-25 — 저장소도 변수이고, 에이전트는 코드가 아니라 단서를 부분적으로 읽고 있었다

Schrödinger's Code Repository: Have LLMs Learned SWE-bench or Memorized It? 는 테스트 저장소를 평가 시점의 잠재 변수로 만들고, 난이도가 아니라 친숙함을 제거하면 SWE-bench Verified 와 SWE-QA 에서 에이전트 성능이 일관되게 떨어지고 상호작용 비용이 크게 늘어난다고 보고한다 (source). SchrodingerRepo 는 에이전트가 평가 환경에 들어오는 순간 동작이 동일한 저장소를 인스턴스화하면서, 문제 서술 재구성, 네임스페이스 재매핑, 파일 내 레이아웃 재배치, 동작 보존 코드 재작성을 통해 단서를 지운다. 늘어난 비용은 탐색과 위치 파악에 떨어진다.

이것은 이 페이지의 논증을 한 단계 바깥으로 확장한 것이다. 8 월 이후 여기 기록된 모든 것은 하네스를 점수 뒤에 숨은 보고되지 않은 변수로 다룬다. 이 논문은 하네스가 돌아가는 코드베이스도 변수이며, 그것도 모델이 암기했을 수 있는 변수라고 말한다. 논문이 끌어내는 결론 — 현재의 코딩 에이전트가 "may partially rely on memorized repository-side cues" — 은 이 페이지가 기록한 오염 반론 중 처음으로 검증 가능한 형태다.

그리고 그것은 구체적이고 살아 있는 공백 위에 떨어진다. 2026-09-22 에 Claude Opus 5.5 는 SWE-bench 계열 행이 아예 없이 출시되었고, GPT-6 Sol 과 GPT-6 Luna 는 같은 날 DeepSWE v1.1 하나만을 벤치마크로 들고 출시되었으며, 2026-09-23 인제스트는 이를 벤더들이 공통 척도를 공유하지 않는 것으로 기록했다. 이 논문은 벤더가 SWE-bench 에서 옮겨 갈 이유로 "우리 모델 점수가 나쁘다"가 아닌 것을 제공한다 — 동시에 대체재도 흔든다. DeepSWE 역시 같은 종류의 저장소로 만들어지기 때문이다. 읽은 자료 어디에도 SchrodingerRepo 를 DeepSWE 에 적용한 것은 없다.

비용 쪽이 이 위키가 이어서 들고 가야 할 부분이다. 이 위키에 있는 모든 과제당 비용 비율 — Sol 의 "Fable 5 대비 약 80% 낮음", Luna 의 "Claude Opus 5 대비 93% 낮음" — 은 표준 저장소에서 측정되었다. 친숙하지 않음이 상호작용 비용을 올린다면, 그 비율은 모델만큼이나 측정 저장소의 성질이다. 어느 벤더도 어떤 저장소인지 밝히지 않았고, 이 논문은 배수를 제시하지 않으므로, 이 관찰은 아직 어느 방향으로도 정량화할 수 없다.

논문 자체의 기록은 전부 방향성뿐이다: 퍼센트포인트 하락도, 비용 배수도, 모델명도, 네 변환 단계에 대한 ablation 도, 하네스 이름도 없다 — 마지막 항목은 이 페이지의 고질적 발견이며, 측정 위생에 관한 논문이 그것을 재생산했다.

같은 스냅샷에서 Agensh: Scaling Organizational Intelligence to 1,024 Agents 가 반대 방향을 가리키며 도착하고, 그래서 둘 다 여기 있다. Agensh 는 중앙 오케스트레이터를 제거하고 하네스를 1,024 개 에이전트로 확장한다: 가장 어려운 ProgramBench 과제 다섯 개에서 GPT-5.6-sol (high) 로 1 → 128 에이전트 가 평균 최종 테스트 통과율을 19.31% 에서 28.78% 로, pandoc 단독으로 1 → 1,024 가 33.89% 에서 55.06% 로 올린다 (source). 이틀 앞선 Harness-Zero: Harness Distillation via Agent-as-Harness — 하네스를 제거했을 때 23.3% → 44.3%, 붙였을 때 41.7% — 와 나란히 놓으면, 이 분야는 48 시간 안에 "스캐폴드가 제약이다"와 "스캐폴드를 조직으로 만들어 천 배로 키워야 한다"를 동시에 발표한 셈이다. 둘은 서로 다른 벤치마크에서 서로 다른 모델로 측정되었고 어느 쪽도 상대를 인용하지 않는데, 그것이 이 페이지 서두의 비교 가능성 문제가 이번에는 두 벤더가 아니라 두 논문 사이에서 나타난 것이다.

Agensh 는 비용 축을 전혀 보고하지 않는다 — 토큰도, 비용도, 벽시계 시간도 없다 — 명시된 정당화가 지연 시간인 논문에서 그렇고, 1,024 에이전트 헤드라인은 과제 하나에 얹혀 있다.

2026-09-28/29 — 버전 번호 하나가 한 모델을 70점 움직이고, 벤더가 자기 모델 둘을 서로 다른 기본값에서 비교한다

Claude Sonnet 5.5 의 출시 표는 Claude Sonnet 5 를 Terminal-Bench 4.0 에서 10.3% 로 적는다. 이 위키는 같은 모델을 Terminal-Bench 2.1 에서 80.4% 로 보유한다 (source).

두 수치 모두 옳고, 그것이 이번의 발견이다. 변하지 않은 한 모델에서 70.1점 격차 가 오로지 메이저 두 버전 차이의 하네스에서 발생했다. 두 수치 사이에 모델은 아무것도 변하지 않았고, 측정되는 대상이 변했다.

이것은 이 페이지가 보유한 가장 깨끗한 사례이며, 위의 벤더 간 사례들보다 깨끗한 이유는 하나다: 의심할 벤더가 없다. 같은 랩이 같은 모델에 대해 두 수치를 모두 발행했으므로, 선별도, 유리한 설정도, 벤치마크 선택도 이를 설명하지 못한다. 버전 접미사가 붙은 벤치마크 이름은 추세를 갖는 시리즈가 아니다 — 브랜드를 공유하는 서로 다른 계측 도구의 집합이며, 이 위키의 모델 페이지들을 가로질러 "Terminal-Bench" 를 지켜보는 독자는 무관한 네 개의 척도를 지켜보는 셈이다.

같은 표에 있는 두 번째, 더 작은 문제

표의 Anthropic 두 열은 같은 effort 설정이라고 명시되지 않았고, 두 모델의 기본값이 서로 다르다: claude-sonnet-5-5 는 high, claude-opus-5-5 는 medium 이 기본이다 (docs). 출시 표의 어떤 항목도 어떤 모델에 대해서도 effort 수준을 적지 않는다.

따라서 헤드라인 결과 — Terminal-Bench 4.0 에서 Sonnet 5.5 의 70.6% 가 Opus 5.5 의 66.4% 를 앞선다 — 는 가장 유력한 교란 변수가 벤더 자신의 문서에 발행되어 있고 벤더 자신의 표에서는 빠져 있는 비교다. 위의 2026-09-22 Opus 5.5 항목은 이미 아홉 항목 전부에 effort 수준이 없다고 기록했다. 엿새 뒤 같은 누락이 기본값이 다른 두 모델에 걸쳐 놓이며, 이는 보고의 공백을 순위 오류의 가능성으로 바꾼다.

이것이 말하지 않는 것: Sonnet 5.5 의 우위가 인공물이라고 말하지 않는다. 판단에 필요한 것이 표에 들어 있지 않으며, 빠진 항목이 벤더가 다른 곳에 문서화해 둔 것이라고 말한다. Anthropic 자신의 안내는 여전히 Opus 5.5 를 Sonnet 5.5 보다 기본으로 권하는데, 이는 그 항목과 반대 방향을 가리킨다.

왜 모델 페이지가 아니라 여기인가

관련 단위는 출시가 아니라 계측 도구 다. 어제의 👀 항목은 Noam Brown 이 CAIS 가 모든 모델을 "reasoning high" 에서 평가하는 것을 두고 "high" 는 모델 간에 비교 가능하지 않다고 비판한 것을 실었다. 이것은 같은 반론의 반대편이다: 여기서 두 모델은 같은 명목 설정에 있지 않고, 그 설정이 인쇄되지 않았다. 어느 쪽이든 해법은 이 페이지가 2026-07-29 부터 요구해 온 하나다 — 수치와 함께 하네스를 발행하라.

2026-10-01 — 같은 벤치마크 이름이 약 5배 차이 나는 두 측정을 담고, 이것이 가장 깨끗한 사례다

이 페이지의 논지는 harness 없는 점수는 측정이 아니라는 것이었다. ExploitBench가 이제 그 실례다.

두 당사자가 겹치는 모델 집합에 대해 ExploitBench 수치를 발표했다:

모델Z.ai 모델 카드Anthropic Frontier Red Team
GLM-5.354.412% (50 / 410)
GLM-5.224.4거의 0%
Claude Opus 4.8 / 4.640.0 (4.8)거의 0% (4.6)
Kimi K332.2거의 0%
Fable 578.0—
Claude Mythos Preview—14% (56 / 410)
출처: (Z.ai 카드),
(Anthropic).

확립된 것. Z.ai의 각주는 자기 ExploitBench 행의 harness로 Claude Code 2.1.207 을 명시하며, 샘플링 파라미터, 컨텍스트 길이, 타임아웃, 턴 상한, 컨테이너 정책을 함께 적는다. Anthropic은 분모 — 410회 시도 — 를 보고하고 harness는 전혀 명시하지 않는다. 그러니 더 잘 문서화된 수치는 벤더가 자기 모델에 대해 낸 것이며, 통상적인 배치의 반대다.

확립되지 않은 것. 두 과제 집합이 같은 벤치마크인지, 54.4 가 퍼센트인지(이 위키는 그것을 양쪽 방식으로 적어 왔다), 그리고 어느 쪽이 역량의 더 나은 추정인지. 순위는 양쪽 측정에서 살아남고 — Anthropic 프런티어 모델이 GLM-5.3보다 근소하게 위 — GLM-5.2는 24.4에서 거의 0으로, Opus는 40.0에서 거의 0으로 움직인다. 순위를 보존하면서 크기를 무너뜨리는 차이는 다른 모델이 아니라 다른 통과 기준의 표지다.

왜 이것이 이 페이지에 이미 있는 사례들보다 나쁜가. 여기 있는 이전의 모든 항목은 비교 가능성 문제다: harness 둘, 점수 둘, 그리고 그것을 나란히 놓을 수 없는 독자. 이것은 계수 가능성 문제다. 54.4 와 12% 는 벤치마크 이름을 파싱하는 어떤 것에든 "ExploitBench에서의 GLM-5.3"으로 읽힌다 — scripts/claim-check.py 를 포함해서다. 그 스크립트는 행 레이블과 열 머리글을 인용된 스냅샷과 비교하고, 두 행 모두 각자의 출처에 충실하다고 판단할 것이다. 참인 행 둘, 이름 하나, 그리고 이 저장소의 어떤 검사도 그 충돌을 볼 수 없다.

스키마에 따라 GLM-5.3의 ## Conflicting Reports 에 기록했고, 의도적으로 해소하지 않으며, 도구가 수행하지 않는 검사로서 W40 lint로 넘긴다.

2026-10-05 — 독립 출전작 둘이 ARC-AGI-3 에서 프런티어 모델과 2 포인트 내로 붙고, 그 점수들이 같은 측정이라는 것은 아무것도 입증하지 않는다

이 페이지가 아직 겪지 않은 방향에서 도착한 비교 가능성 문제다: 한 모델에 하네스 둘이 아니라, 벤치마크 이름 하나를 공유하는 두 풀의 해법자다.

이 위키는 이미 ARC-AGI-3 수치 셋을 보유하며, 모두 각 페이지에서 ARC Prize 자신의 표준화된 하네스로 서술된다: Claude Opus 5 의 30.2%, GPT-5.6 Sol (and Terra, Luna) 의 7.8% — OpenAI 가 다시 돌린 13.3% 에 대비해 이 페이지에 미해소로 기록 — 그리고 Astra 의 논쟁 중인 98.6% / 99.9% 짝.

ARC Prize 2026 Kaggle 경쟁 트랙은 마감 2026-09-30, 발표 2026-10-01 의 Milestone #2 에 대해 다음을 보고한다:

출전자최종 점수상금
Daniel Franzen (1위)27.9%$25,000
Lord Han Solo (2위)23.8%$7,500
Lohit Siriki (3위)22.5%$5,000
수상 조건은 해법을 오픈소스로 공개 하는 것이었다. 이후 ARC Prize 의 X 게시물은 Yi-Chia Chen
의 28.34% 최고 점수가 1위를 차지했다고 보고한다; 그 게시물의 날짜는 읽은 자료에 없다. ARC-AGI-3
전체 상금 풀 $850,000, 인간 수준 100% 달성 시 $700,000 보너스 풀
(source).

입증된 것. 오픈소스로 공개된 독립 출전작 둘이, 이 위키의 ARC-Prize-검증 프런티어 최고 수치가 30.2% 인 벤치마크에서 27.9% 와 28.34% 를 받았다.

입증되지 않은 것, 그리고 그것이 질문의 전부. Kaggle 제출물이 모델 수치와 같은 과제 분할, 같은 컴퓨트 예산, 같은 하네스로 채점된다고 말하는 자료는 없다. Kaggle 트랙은 맞춤 제작된 오픈소스 프로그램에 상을 주고, 30.2% 는 ARC Prize 의 모델 하네스 아래 있는 범용 모델이다. 그 둘 사이의 2.3 포인트 격차는 2.3 포인트 격차가 아니며, 그것을 격차로 쓰는 것이 오류라는 것이 이 페이지의 논지 전부다. 수치는 나란히 기록되며 어떤 모델 페이지에서도 합산되지 않는다.

출처 경로, 위의 모든 것을 한정하므로 밝힌다. arcprize.org, www.kaggle.com, llm-stats.com, x.com 이 모두 이 실행에서 EGRESS_BLOCKED 를 반환하므로 어떤 페이지도 가져오지 않았다: 수치는 모든 값에서 서로 일치하는 독립적인 WebSearch 두 패스에서 왔다. 이는 2026-10-01 의 Import AI 474 경로이며 같은 한계를 지닌다 — 읽은 것이 아니라 보고된 것.

주장 하나는 거부한다. 이 추적은 prefetch 후보 #17, 2026-10-04 의 r/MachineLearning 게시물 제목 "Top ARC-AGI-3 scores on Kaggle just went from 7% to 56%" 에서 시작됐다. 두 패스 모두 56% 를 찾았고 어느 쪽도 찾지 못했으며, 둘 중 어느 쪽이 반환한 최고 수치도 28.34% 다. 채택하지 않으며, 불일치는 해소하는 대신 기록한다.

이것이 드러내는 구조적 공백. ARC Prize 는 여기 최소 네 페이지 — Claude Opus 5, GPT-5.6 Sol (and Terra, Luna), Astra, Context Compaction — 에 실린 수치의 검증 주체이며, 엔티티 페이지도, 어느 tier 의 sources.yaml 항목도, sources/evals/ 의 스냅샷도 없다. 2026-10-01 마일스톤은 이 실행이 간접적으로 전해 듣기 나흘 전에 발행됐다. 이는 2026-09-26 의 Runway / Ant Group (inclusionAI / AntLing) 형태다: 이 위키가 반복해 인용하면서 한 번도 폴링하지 않는 주체.

같은 날의 벤치마크 논문은 정답 키가 틀렸다고 말한다

Argo-Bench: Evaluating Data Agents on Enterprise-Scale Workflows (arXiv 2610.02122, HuggingFace Daily Papers 2026-10-05, 26 upvotes) 는 235개 테이블 · 75억 행 의 시뮬레이션 ERP 웨어하우스 위에 과제 210개의 에이전트 애널리틱스 벤치마크를 세우고, 그렇게 하는 이유를 기존 벤치마크들에 대한 주장으로 정당화한다: 확립된 text-to-SQL 벤치마크들은 "evaluate query generation alone, and audits have found their answer keys frequently wrong" (source).

어느 감사이고 어느 벤치마크인지는 읽은 자료에 서술되어 있지 않으므로, 여기 어떤 것도 그에 근거해 수정되지 않는다 — 이 페이지가 SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents 에 적용한 것과 같은 취급이며, 그 논문의 발견은 구체적이었고 모델별 수정치는 역시 발표되지 않았다.

Argo-Bench 가 채점하는 것이 여기 속하는 부분이다: 에이전트가 행동을 제출하고 — 계정 차단, 예산 배분, 소급 임금 지급 — "the grader scores each by its consequences in the simulator", 그리고 시뮬레이터의 ground truth 상태는 에이전트가 보는 웨어하우스에서 빠져 있다. 14개 프런티어·오픈 웨이트 모델 중 최강이 과제의 34.8% 에서만 95점 이상을 받고 평균 59.5점 이다. 어떤 모델도 명시되지 않았으므로 여기 어떤 수치도 모델 페이지에 붙지 않고, 하네스는 미지정 이다 — 이 페이지 자신의 기준으로는 34.8% 가 아직 무엇과도 비교 가능하지 않다는 뜻이다.

그리고 디코딩 규칙 하나가 가중치를 동결한 채 추론 점수를 11 포인트 움직였다

Decoding Looped Transformers Better for (Almost) Free 은 루프 모델의 중간 pass 들을 읽는 방식에 대한 학습 불필요 변경으로 Ouro-2.6B-Thinking 에서 AIME 2024 pass@1 61.88% → 73.33% 를, 그리고 루프 수를 절반으로 줄이면 전체 깊이 베이스라인에 맞선다고 보고한다 (source). Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It 은 다른 가중치를 전부 동결한 채 한 레이어에 붙인 rank-8 LoRA 로 24-링크 참조 체인에서 15.5% → 99% 를 보고한다 (source).

둘 다 이 페이지에 이미 있는 자유도와 같은 것이, 안쪽으로 옮겨진 것이다. 루프 모델의 발표된 점수는 디코딩 규칙과 루프 수 없이는 미결정이고; 조합적 과제에서 베이스 모델의 발표된 점수는 가중치가 아니라 기본 forward 경로에 대한 서술이며, 이 과제에서 둘은 83.5 포인트 차이가 난다. 두 논문 모두 읽지 않았고 — arxiv.org 가 차단되어 있다 — 어느 쪽도 이 위키가 페이지를 가진 모델을 명시하지 않는다.

이 위키에서의 실무적 귀결

모델 페이지의 벤치마크 행은 알려진 경우 그 수치를 만들어 낸 하네스나 출처와 함께 기록하고, 다툼이 있는 수치는 조용히 조정되는 대신 ## Conflicting Reports 로 간다. GPT-5.6 Sol 의 "공식 하네스" 수치 두 개 — ARC Prize 가 검증한 7.8% 와 OpenAI 가 재실행한 13.3% — 는 읽은 자료 중 어느 것도 둘을 화해시키지 못하므로 서로 어긋나는 상태로 기록된다.

이 저장소가 스크랩하는 리더보드 스냅샷에도 같은 규율이 적용된다. LMArena 는 Elo 가 아니라 신뢰 구간을 동반한 백분율로 인용하고, Artificial Analysis 수치는 그 위의 열 제목과 함께 인용한다 (source).

주요 소스

  • 2026-09-08 — 이 위키가 모델 페이지 24 곳에서 인용하는 벤치마크가 감사받았고, 새고 있다는 결과가 나왔다. SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents 는 SWE-Bench Pro 의 평가가 정답 해법이나 숨겨진 평가 정보의 유출 로 가능해진 reward hacking, 그리고 오도하는 문제 서술과 잘못 범위 잡힌 테스트 같은 과제 품질 문제 두 가지로 훼손된다고 보고한다. 공개된 SWE-Bench Pro Verified 는 안티해킹 안전장치를 더하고 결함 인스턴스를 최소한으로 교정하며, 그 위에서 "일부 모델은 기존 보고보다 상당히 낮은 성능을 낸다". 어느 모델이 얼마나 움직였는지는 읽은 자료 어디에도 공개되지 않았으므로 이 위키의 어떤 값도 그것을 근거로 고치지 않았다 — 바뀌는 것은 SWE-bench Pro 칸이 무엇을 뜻하는가다 (source)
  • OpenAI, "How enabling two settings tripled our scores on the ARC-AGI-3 benchmark" (2026-07-29) (source)
  • ARC Prize results — Claude Opus 5
  • ARC Prize, analyzing GPT-5.5 & Opus 4.7 with ARC-AGI-3
  • LMArena 스냅샷 (source)
  • Artificial Analysis 스냅샷 (source)
  • Qwen3.8-27B 릴리스 — Claude Code 하네스 위의 SWE-MM (2026-08-14) (source)
  • GLM-5.3 릴리스 — 벤치마크 넷, 하네스 없음 (2026-08-14) (source)
  • AI4AI at Test-Time, arXiv:2608.12307 (source)
  • HuggingFace Daily Papers, 2026-08-22 — EnvHarness, FACET, SWE-bench Science, FM-Bench, MemTrapBench (source)
  • HuggingFace Daily Papers, 2026-08-20 — Agent Skills, Harness the Memory, Agent Lightning v1.0, Agentic ESOpt, ASI-Bench (source)
  • HuggingFace Daily Papers, 2026-08-19 — StateM, AutoResearchEval, ClawGym II, Ventor-QTest (source)
  • HuggingFace Daily Papers, 2026-08-26 — Prime Agent, Thinkingbox, Apodex 1.1, AgentMercury (source)
  • HuggingFace Daily Papers, 2026-08-16 — DarwinX, AutoDesign, SHAPER, SkillZip (source)
  • HuggingFace Daily Papers, 2026-08-27 — JIT-Agent, AutoSaddler, Recuris, Meta^n, FrontierChallenge (source)
  • HuggingFace Daily Papers, 2026-08-28 — SWE Refactor Bench, PILOT, TaoLive HAT (source)
  • GLM-5.3 오픈 웨이트 모델 카드 — 행마다 하네스를 명시한 16 개 벤치마크 행 (2026-08-28) (source)
  • Embrace The Red, "Breaking Claude Code Opus 5 Auto Mode" (2026-08-26) — 공개된 0.00% 와 시연된 60–80% (source)

관련 개념

Referenced by

2026-W40Agensh: Scaling Organizational Intelligence to 1,024 AgentsAgent Lightning v1.0: Towards Harnessed Agentic RL (arXiv:2608.17528)에이전트 런타임 격리Agent-Editing World Model: Rethinking World Modeling for LLM AgentsAgentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements (arXiv:2608.17310)에이전틱 강화학습AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling에이전트 (LLM Agents)AI 정렬 (Alignment)수학을 위한 AI (AI for Mathematics)AI 기반 사이버 공격AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses (arXiv:2608.12307)Alibaba / Qwen AI LabAn Empirical Study of Harness Design for Coding AgentsAn Open Recipe for IMO Gold: Training Nemotron for Olympiad MathematicsAnthropicApodexApodex 1.1: Scaling Agentic Intelligence for Complex Work (arXiv:2608.23283)Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence (arXiv:2608.11341)Argo-Bench: Evaluating Data Agents on Enterprise-Scale WorkflowsASI-Bench: At the Dawn of Artificial Superintelligence (arXiv:2608.17271)Aspire: Can Models Self-Evolve from Vague Goals?Astra2026년 8월 — 월간 다이제스트AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces (arXiv:2608.23041)Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development (arXiv:2608.13417)ChatGPT Images 2.5Claude Fable 5.1Claude Opus 5Claude Opus 5.5Claude Sonnet 5Claude Sonnet 5.5ClawGym II: Exploring Black-Box RL on Agent Harness (arXiv:2608.16798)COBRA-Skills: Contextual Bandit-Guided Evolution for Agent Skill OptimizationCodeMidas: Scaling Agentic Coding RL Environments from Code ItselfConceptual Reasoning Index (CRI)컨텍스트 압축 (Context Compaction)DarwinX: Evolving Agent Harnesses Through Natural Selection (arXiv:2608.07545)Decision-Metric Alignment in Latent World Models: Diagnostics and Action-Conditioned Objectives for MPC Planning (arXiv:2608.18746)Decoding Looped Transformers Better for (Almost) FreeDeepSeekDeepSeek V4-FlashDeepSeek V4-Flash-Vision-ExpDeepSeek V4-Pro-0813DeepSeek V4.1-FlashDemystifying Agent Skills: Why They Work — Until They Don't (arXiv:2608.14036)체화 에이전트 (Embodied Agents)EngiWorld: What Can Frontier Agents Deliver in Professional Engineering Environments?EnvHarness: Awakening Static Worlds for Agent Learning (arXiv:2608.19880)평가 환경 격리EvoUndo: Recoverability-Constrained Self-Evolution for LLM Agent HarnessesFACET: Preserving Source Intent and Executable State in Terminal Task Synthesis (arXiv:2608.18580)False Frontiers: Diagnosing and Mitigating Co-Cheating in Self-Evolving Search AgentsFlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning ExperienceFM-Bench: A Benchmark for Long-Horizon Management with Competing Agents (arXiv:2608.18423)FrontierChallenge: Evaluating Scientific Workflow Completion (arXiv:2608.24979)Fugu MaxFugu Ultra v2Gemini 3.7 FlashGemini 3.8 FlashGemini 3.8 Live Extended ThinkingGLM-5.3Google DeepMindGPT-5.6 Sol (및 Terra, Luna)GPT-6 SolGranite 4.2Grok 4.6Grok 4.7Grok Voice Transcribe 2.0Groupwise Agentic Grading and Advantage Redistribution for Code Agent RLHarness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents (arXiv:2608.15008)Harness-of-Harness: Multi-Day Autonomous Software Development with Continual ImprovementHarness-Zero: Harness Distillation via Agent-as-HarnessHarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses (arXiv:2608.08466)How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review (arXiv:2608.08975)How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks (arXiv:2608.14905)Hugging FaceHy4 previewInklingIntern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning (arXiv:2608.14290)Intern-S2-Preview: Scientific Agentic Foundation Model (arXiv:2608.13505)Iris: Climbing to the Search FrontierJIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution (arXiv:2608.25593)2026년 7월 — 월간 다이제스트K2 HorizonKimi K2.8 PreviewLaguna S 2.1Last Translation BenchmarkLEGO-RL: Harness-Native Reinforcement Learning for Coding Agents (arXiv:2608.17393)LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers (arXiv:2608.06867)LoopArena: Benchmarking Models as Runtime Controllers for Loop EngineeringLooped Language Models Improve Compositional Tool Calling (arXiv:2608.18171)Meta AIMeta^n: Recursive Self-Improvement through Emergent Depth (arXiv:2608.24735)Mid-Harness: Scaling Actions Between Model and Harness for Terminal AgentsMiMo-V2.6-Pro모델 라우팅 (Model Routing)Muse GlimmerMuse Spark 1.3Muse Voice TranscribeNemotron 3.5 LightningNeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing HarnessOn the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training StabilityOne Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows (arXiv:2608.19741)One Symptom, Three Levers: A Critical Review of On-Policy Self-DistillationOpenAIOpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution (arXiv:2608.00677)PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents (arXiv:2608.26530)사후 학습 스케일링Preparedness FrameworkPrime Agent: A Self-Improving RLM Harness (arXiv:2608.23552)ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE TasksQwen 3.8 27BQwen 3.8 MaxQwen-Image-2.1Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI AgentsR³-Bench: LLMs Struggle with Resource-Rational Reasoning under Shared Budgets (arXiv:2608.16033)RealSWE: A Compositional Evaluation of Coding Agents under Realistic User RequestsRecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use AgentsRecursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses (arXiv:2608.24876)Repo-To-Skill: Distilling GitHub Repositories Into AI4AI SkillsRepo0: Design-Driven Zero-to-All Code Generation (arXiv:2608.19854)Rethinking Critic Learning in PPO: Understanding and Mitigating Value FlatteningRRSI: Regularized Recursive Self-Improvement of Agent Harnesses세이프티 케이스 (Safety Cases)Schrödinger's Code Repository: Have LLMs Learned SWE-bench or Memorized It?Select, Compress, Reinvest: A Controlled Study of Visual-Token Allocation in Long-Video MLLMsSemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation (arXiv:2608.18565)SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation (arXiv:2608.17426)2026년 9월 — 월간 다이제스트SoftVTBench: A Deformation-Aware Visuo-Tactile Dataset and Benchmark for Deformable-Object Manipulation (arXiv:2608.18701)SPADE: Self-Play in Adaptive Synthetic Executable Environments (arXiv:2608.19197)Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence (arXiv:2608.12743)StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (arXiv:2608.15089)SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration? (arXiv:2608.23564)SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering AgentsSWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? (arXiv:2608.19799)T1: Terminal Agent Reinforcement Learning for Long-Horizon TasksTencentTernary Bonsai 2 27B테스트 타임 연산 (추론 시점 연산 스케일링)The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents (arXiv:2608.24358)The Tasteful Agent: Measuring and Improving Taste in Long-Horizon TasksThinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See (arXiv:2608.17744)Thought-Level Beam Search for Reasoning (arXiv:2608.08020)Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report (arXiv:2608.15763)Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes ItUsing Grounded Theory for Agent Behavior Analysis at ScaleVentor-QTest: Threat-Model-Driven Verification of Vendor-Hosted LLM APIs (arXiv:2608.16391)주간 종합 — W31 (2026년 7월 27일 – 8월 2일)주간 종합 — W33 (2026-08-10 → 2026-08-16)주간 종합 — W34 (2026-08-17 → 2026-08-23)주간 종합 — W35 (2026-08-24 → 2026-08-30)주간 종합 — W36 (2026-08-31 → 2026-09-06)주간 종합 — W37 (2026-09-07 → 2026-09-13)주간 종합 — W38 (2026-09-14 → 2026-09-20)WHALE: A Simple Recipe for Joint Harness-Weight OptimizationWhat LLM Trading Agents Actually Do in Production: A Six-Month, Population-Scale Record from Two FleetsWhen Agents Slow Down: Understanding LLM Agents' Test-Time Strategies via Elo-per-token AnalysisWhen EOS Tokens Disagree: Understanding Length Inflation in On-Policy DistillationxAIZ.aiZetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence (arXiv:2608.16590)

Sources