$ cat wiki/concepts/eval-harness-configuration.md
평가 하네스 설정
정의
하네스는 벤치마크 실행 중 모델을 둘러싼 스캐폴딩이다. 단계 사이에 컨텍스트를 어떻게 이어 가는지, 추론 흔적이 턴 경계를 넘어 살아남는지, 도구를 어떻게 노출하는지, 시도를 몇 번까지 허용하는지, 결과를 어떻게 파싱하는지. 이는 모델의 일부도 아니고 벤치마크 과제 집합의 일부도 아니지만, 에이전틱 벤치마크에서는 두 모델 세대 사이의 격차보다 더 크게 보고 점수를 움직일 수 있다.
따라서 벤치마크 수치는 언제나 (모델, 하네스) 쌍에 대한 주장이지, 모델 하나에 대한 주장이 아니다.
왜 중요한가
다단계 에이전틱 과제에서 하네스는 모델이 무엇을 기억하는지를 결정한다. 매 행동 뒤에 생각의 사슬을 버리면 모델은 턴마다 상태를 다시 쌓아야 하고, 그것을 보존하면 같은 가중치가 다른 시스템처럼 행동한다.
2026-07-29 의 ARC-AGI-3 사례가 그 깔끔한 실증이다 (source):
| Configuration | GPT-5.6 Sol |
|---|---|
| ARC Prize 공식 하네스 (ARC Prize 검증) | 7.8% |
| 공식 하네스, OpenAI 가 자체 재실행해 보고한 값 | 13.3% |
| Responses API + retained reasoning + compaction | 38.3% |
| 같은 모델, 같은 과제 집합, 하네스 설정만으로 4.9× 편차. 비교하자면 2026-07-27 에 | |
| Claude Opus 5 가 세운 검증된 SOTA 는 30.2% 였고, 인간 테스터 평균은 48% 다. |
- Retained reasoning 은 단계 사이에 생각의 사슬을 보존한다.
- Compaction 은 이전 컨텍스트를 잘라내는 대신 요약한다.
둘 다 ARC-AGI-3 을 위해 만들어진 것이 아니며, 모든 API 사용자가 쓸 수 있는 일반 Responses API 설정이다. OpenAI 는 이 설정이 출력 토큰도 6× 줄였다고 보고한다.
비교 가능성 문제
두 가지가 동시에 참이고, 그 사이의 긴장이 이 주제의 전부다:
- 벤치마크용으로 만들어지지 않고 모든 사용자가 쓸 수 있는 설정은 모델을 돌리는 정당한 방법이다. ARC Prize 가 밝힌 입장은 그런 설정이 제대로 보고된다면 문제없다는 것이고, 공동창업자 François Chollet 도 여기에 동의한 것으로 전해진다 (source).
- 공식 리더보드 점수는 서로 다른 랩의 수치가 동등한 조건으로 남도록, 공급자별 설정 없이 하나의 표준화된 하네스를 쓴다.
그래서 OpenAI 의 38.3% 와 Anthropic 의 30.2% 는 비교할 수 없다. Claude Opus 5 가 상태 보존에 해당하는 설정으로 측정되었는지를 밝힌 자료는 없으며, 그것 없이는 더 높은 수치가 더 나은 모델의 증거가 되지 않는다 (source).
열린 문제
- 공개되지 않은 하네스는 공개된 하네스보다 약한 주장이 아니라, 다른 종류의 주장이다. DeepSeek V4-Pro-0813 (2026-08-13) 은 자체 프리뷰 대비 Terminal Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3 을 보고했고 DeepSeek 은 하네스를 공개하지 않아 "제3자 기록은 비어 있다" (source). 같은 날 Gemini 3.7 Flash 는 DeepSWE 65.3 을 역시 하네스 언급 없이 발표했다 (source). 벤더 둘, 벤치마크 하나, 3점 차 — 그리고 두 릴리스 어디에도 그 수치들을 비교 가능하게 만드는 것이 없다.
- 재현성에 실측 기준선이 생겼고, 높지 않다. 한 커뮤니티 작업이 코딩 에이전트로 19일간 ICML 2026 논문 2,200편 이상의 주장을 재현했다. 참가자 1,221명, 공개 로그북 6,816건, 자동 판정기가 라벨을 붙인 주장 35,908건, 확인 3,978건, 완전 재현 266편, 반증 없이 부분 재현 632편 (source). 보도는 이를 "절반 이상"으로 요약한다 — 그러나 266 + 632 = 2,200편 이상 중 898편으로 절반에 못 미치고, "절반 이상"은 논문당 최소 한 건의 주장이 확인됨을 세는 더 약한 척도다. 둘의 간극이 곧 요점이므로 둘 다 기록한다. 자동 판정기가 어떻게 검증됐는지는 읽은 자료 어디에도 없고, 그 점이 헤드라인 자체를 하나의 하네스에 대한 주장으로 만든다.
- 하네스 설정을 보고하는 관행이 없다. 점수는 스칼라로 발표되고, 그것을 만들어 낸 설정은 대개 발표되지 않는다.
- 공급자별 설정에는 중립적 대응물이 없다. Retained reasoning 은 Responses API 기능이다. 경쟁 모델에 같은 상태 보존을 부여할 공급자 독립적 방법이 없으므로 "각자 최선의 설정으로 돌린다" 와 "모두 같은 방식으로 돌린다" 는 둘 다 옹호 가능하면서 서로 다른 순위를 낳는다.
- 과제 길이가 길수록 격차가 커진다. 하네스 효과는 단일 턴 벤치마크에서는 작고 장기 에이전틱 벤치마크에서는 크다 — 그리고 그것이 지금 평가가 움직이는 방향이다.
- 자체 보고된 실행은 기본적으로 검증되지 않는다. ARC Prize 검증은 별도 단계이며, 발표되는 에이전틱 수치 대부분은 그 과정을 거치지 않는다.
2026-08-14/15 — 한 벤더가 하네스를 공개했고, 한 논문이 그 값어치를 쟀다
같은 24시간 안에서 나온 두 항목이고, 둘은 함께 놓여야 한다.
공개. Qwen 3.8 27B 의 모델 카드는 자신의 SWE-MM 수치가 Claude Code 하네스에서, SWE-bench Multimodal 공개 dev 분할을 써서, Claude Opus 4.7 시스템 카드 부록 8.3 에 서술된 수정 사항과 함께 측정됐다고 적는다 (source). 중국 랩이 자기 헤드라인 행 하나를 위해 경쟁사의 하네스를 문서와 부록 번호까지 지목한 것이다. 이번 주에 수집된 어떤 릴리스가 어떤 수치에 대해 공개한 것보다 많은 하네스 정보이면서, 네 행 중 하나를 덮는다. 같은 카드의 Terminal-Bench 2.1, DeepSWE 1.1, OSWorld-Verified 행에는 아무것도 없고, Qwen3.6-27B 비교 칼럼이 같은 하네스로 다시 측정됐는지도 적혀 있지 않다.
측정. AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses (arXiv:2608.12307) 는 더 강한 모델이 만든 하네스가 약한 모델의 네 Theory-of-Mind 벤치마크 평균을 파라미터 갱신 없이 0.49 에서 0.91 로 올린다고 보고한다 (source). 측정된 과제 계열을 넘어서도 성립한다면, 하네스는 벤치마크 행의 각주가 아니라 그 수치의 더 큰 몫일 수 있다.
함께 읽으면 이렇다. 업계는 모델 점수를 발표하고 있는데, 논문 쪽 증거는 공개되지 않은 항이 그 점수를 지배할 수 있다고 말한다. 하네스 없는 벤치마크 수치는 약한 주장이 아니라 귀속되지 않은 주장이다 — 독자는 두 시스템 중 어느 쪽이 측정된 것인지 알 수 없다.
버전 번호도 비교 대상이 아니다. GLM-5.3 은 Terminal-Bench 3.0 (4.6 → 28.3) 을 보고하고, Qwen 3.8 27B 와 DeepSeek V4-Pro-0813 은 Terminal-Bench 2.1 (73.0 과 87.9) 을 보고한다. 계열 이름은 같고 스위트는 다르며, 한 주에 릴리스가 셋인데, 읽은 자료 어디에도 둘을 잇는 대응이 없다.
2026-08-16 — 이틀 사이 다섯 편의 논문이 하네스가 곧 역량이라고 말한다
위의 08-14/15 쌍은 공개 하나와 측정 하나였다. 2026-08-16 에 도착한 것은 방법이고, 서로 무관한 네 그룹에서 네 번 도착했다. 모두 모델을 얼린 채 그 주변 시스템을 개선한다 (source):
| 논문 | 무엇을 진화시키는가 | 대표 수치 |
|---|---|---|
| DarwinX: Evolving Agent Harnesses Through Natural Selection (arXiv:2608.07545) | 선택압 아래의 하네스 집단 | 평균 약 +17점, Terminal-Bench 2.1 84.7% |
| AutoDesign (arXiv:2608.13560) | 코드 에이전트의 하네스를 다듬는 메타 하네스 | 일곱 설정에 걸쳐 PosterBench 54.99 → 67.39 |
| SHAPER (arXiv:2608.11350) | 스킬 + context-code 하네스, 체화, 학습 없음 | 얼린 모델이 planner 와 optimizer 를 겸한다 |
| SkillZip (arXiv:2608.05604) | 스킬 라이브러리 자체의 압축 | 3.46배 압축에서 최강 기준선 대비 +12.2점 |
| 하루 전의 AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses (arXiv:2608.12307) 까지 더하면 이틀에 다섯 건이고, | ||
| 코딩 에이전트·문서 생성·체화 제어·스킬 검색이라는 네 방향에서 같은 구조적 주장을 한다. | ||
| DarwinX 는 그 논지를 그대로 적는다: *"얼린 모델이라고 해서 고정된 에이전트일 필요는 없다. | ||
| 하네스 선택은 평가 연산을 지속되는 역량으로 바꾼다."* |
왜 이것이 문제의 크기를 바꾸는가. 지금까지 이 페이지는 벤치마크 수치가 (모델, 하네스) 쌍에 대한 주장이며 두 번째 항이 공개되지 않는다고 말할 수 있었다. 이 논문들은 그 두 번째 항이 가중치를 건드리지 않고도 싸게 최적화 가능하다고 말한다 — DarwinX 는 같은 베이스 위에서 Terminal-Bench 2.1 +7.7점을 보고한다. 이 위키가 한 주 사이에 보유한 벤더 발표 Terminal-Bench 2.1 수치 — Qwen 3.8 27B 73.0, Claude Sonnet 5 80.4, DeepSeek V4-Pro-0813 87.9, 어느 것도 하네스가 공개돼 있지 않다 — 옆에 놓으면, 7.7점의 폭은 더 이상 두 모델을 두 하네스와 구분해 주지 않는다.
해소되지 않은 절반은 비용이다. 여기서 읽은 네 논문 중 어느 것도 루프 하나가 소비하는 연산을 공개하지 않는다. "평가 연산을 지속되는 역량으로" 는 한쪽이 비어 있는 환율이고, 이 페이지가 애초에 이름 붙이려던 것과 같은 형태의 누락이다.
2026-08-18 — 두 논문이 또 하나의 하네스를 제안하는 대신 측정을 공격한다
이 아래의 모든 것은 하네스를 제안하고 이득을 보고한다. 오늘의 배치에는 측정 자체를 결함으로 다루는 첫 두 항목이 들어 있다 (source):
| Paper | What it measures | Instrument |
|---|---|---|
| Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development (arXiv:2608.13417) | 장기 호흡 AI-R&D 과제 36개 위의 프런티어 모델 7종 | 규칙 기반 실행 내 지표 — Solution Framing, Execution, Feedback Control — 및 통제된 경험 재사용 비교 |
| Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence (arXiv:2608.11341) | "실행 가능하거나 검증 가능한 형태로 도착하는 일이 드문" 문제들 | HDS6 — Tools, Repair, Alternatives, Coherence, Evidence, Scope — 를 최종 과제 성공 여부와 독립적으로 채점 |
| 이것이 이 페이지가 2026-08-14 이래 안고 있던 비교 가능성 문제에 대한 직접적인 답이다. 서로 | ||
| 비교 불가능한 다섯 개의 분모(+17 points, +12.4%, +12.2 points, +3.4 points, 그리고 점수가 아예 | ||
| 없는 순위 하나)로 하네스 이득을 보고하는 일곱 편의 논문은 장부 정리의 성가심이 아니다. | ||
| Beyond Final Scores 가 그 이유를 진술한다. **비슷한 최종 결과 뒤에 서로 다른 프로세스 병목이 | ||
| 있다**는 것. 비슷한 점수를 낸 두 시스템이 다른 지점에서 실패하므로, 점수로는 이득을 하네스에도 | ||
| 모델에도 실행 우연에도 귀속시킬 수 없다. |
Beyond Final Scores 의 세 가지 발견은 그 아래 항목들에 곧바로 걸린다:
- "연구자가 아니라 엔지니어링 최적화기." 에이전트는 실용적인 해법을 정식화하고 구현한다. 가장 좋은 해법도 기존 기법을 변형하거나 조합한 것이고, 진정한 방법론적 새로움은 여전히 드물다.
- 실행 간 편차가 크다 — 평균으로 지워야 할 잡음이 아니라 발견으로 보고된다.
- 경험 재사용은 이후 판단을 "돕기도 하고 잘못 이끌기도 한다". 이 페이지의 모든 자기개선 루프 — DarwinX: Evolving Agent Harnesses Through Natural Selection (arXiv:2608.07545) 의 계보 아카이브, Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence (arXiv:2608.12743) 의 점수 붙은 교훈 — 는 누적이 단조롭다고 전제한다. 직접 재보니 그렇지 않다. 그 결과들은 그 루프들이 자기 벤치마크 위에서 얻어낸 것으로 남지, 일반적인 성질의 증거는 아니다.
- "하네스 설계가 성능 안정성에 영향을 준다" — 지목된 원인 가운데 하나로 진술되는데, 이는 이 페이지의 논지가 다른 사람의 측정된 변수로 도착한 것이다.
Apodex Discovery 는 반대 추를 제공하고, 여기서 더 흥미로운 숫자는 그쪽이다. 같은 환경이 같은 생의학 과제에서 같은 closed-book 백본 대비 GPT-5.5 를 평균 정규화 예측 점수 2.5점, GPT-5.6-sol 을 7.6점 끌어올린다 (source). 하네스가 곧 역량이라면 두 백본 사이에 3배 격차는 나타나지 않는다. 오늘 이후 이 페이지 자신의 논지에 대한 정직한 독법은, 하네스가 모델의 대체물이 아니라 배수라는 것이다 — 그리고 지금까지 여기 모인 어떤 것도 그 두 주장을 갈라내지 못했을 것이다.
두 논문은 서로 인용하지 않는다. 짝지음은 이 위키의 것이며 그렇게 표시해 둔다.
2026-08-17 — 메모리 자리, 그리고 397B 사전학습 작업 안에서 도착한 논증
위의 다섯 결과는 프롬프트, 도구, skill, 제어 흐름을 진화시킨다. 오늘의 배치는 그들이 빼놓은 자리 — 모델이 추론 시점에 읽는 것 — 을 더하고, 더 중요하게는 재학습을 할 수 있었던 사람들이 편 논증을 한 건 더한다 (source):
| 논문 | 무엇이 진화하는가 | 대표 수치 |
|---|---|---|
| Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence (arXiv:2608.12743) | 검색된 경험, 자신의 전이 기록으로 채점 | 다섯 공간 벤치마크, 4/4 기반 모델 블록에서 최고 매크로 평균 |
| Intern-S2-Preview: Scientific Agentic Foundation Model (arXiv:2608.13505) | 얼어붙은 397B 백본 곁의 4B 메모리 모듈 | Biology-Instructions 56.92 → 60.32, 백본 무수정 |
| SMA 의 기여는 메모리가 스스로를 측정한다는 점이다. 증류된 각 교훈은 균일하게 초기화된 뒤 | ||
| 이후 검색 결과로부터 보정되는 Transfer Reliability Score 를 지니고, 검색은 유사도와 | ||
| TRS 를 함께 써 순위를 매긴다. 이 무리의 다른 어떤 것도 자기 유용성에 대한 증거를 쌓아 가는 | ||
| 내부 구성요소를 갖고 있지 않다 — 그리고 그것은 Model Routing 이 부재로 지목하며 | ||
| 닫힌 바로 그 계기가, 다른 자리에 놓인 것이다. |
논증의 지위를 바꾸는 쪽은 Intern-S2-Preview 다. 여기 앞선 모든 항목은 자신이 학습시키지 않은 모델 주변의 시스템을 개선하는 사람들의 것이다. 이것은 397B 사전학습 작업이 자기 자신의 백본을 수정하지 않고 모델을 특화시키는 데 구조적 자리를 배정한 사례다 — Memory Decoder 는 "얼어붙은 397B 백본을 수정하지 않고 빠르게 과학 영역에 특화시키는 별도의 메모리 증강 경로"로 서술된다. 가중치를 쥔 쪽이 한 영역을 위해 얼어붙은 백본 경로를 택하면, "하네스가 곧 역량"은 학습 예산이 없어서 하는 우회가 아니게 된다.
비용 간극은 그대로이고 이제 논문 일곱 편에 걸쳐 있다. 한 편도 루프가 소비하는 것을 밝히지 않는다 — compute 비용도, 개체군 크기도, 검색 오버헤드도, 세대 수도 없다. 서로 무관한 일곱 그룹이 하네스가 역량을 나른다는 데 동의하고, 아무도 그 값을 매기지 않는다.
그리고 그들은 여전히 서로 비교할 수 없다. +17점(DarwinX), +12.4%(AutoDesign), +12.2점(SkillZip), 한 영역 평균 +3.4점(Intern-MemDec), 그리고 점수가 아예 없는 순위 하나(SMA). 분모가 다섯 개다. 이것이 증거의 현 상태이고, 이 페이지가 추세선이 아니라 무리를 보고하는 이유다.
2026-08-19 — 이 클러스터의 가장 강한 결과와 첫 실질적 반증이 같은 날 도착한다
한 번의 HuggingFace 배치에 논문 세 편, 그리고 처음으로 셋이 같은 방향을 가리키지 않는다 (source):
| 논문 | 입장 | 핵심 증거 |
|---|---|---|
| StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (arXiv:2608.15089) | 찬성 | 런타임 고정, 가중치 불변: GPT-5.6 Sol xhigh 가 Terminal-Bench 2.1 에서 95.3%; DeepSeek-V4 Flash 82.7 → 88.1%; 런북이 버전 상승을 넘어 그대로 이전 |
| How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks (arXiv:2608.14905) | 반대 | 8 개 하네스-모델 조합 × 100 과제: 같은 45 개 실패 패턴이 가장 강한 모델을 포함해 8개 전부에서 반복; 결핍은 모델 수준에 위치 |
| ClawGym II: Exploring Black-Box RL on Agent Harness (arXiv:2608.16798) | 어느 쪽도 아님 | 하네스를 통과해 학습: Qwen3-30A3B 가 OpenClaw 로 +9.98, Claude Code 로 +14.81 |
| 2026-08-17 이래 이 페이지가 요구해 온 비용 수치가 마침내 존재한다. 하네스에서 나온 이득을 | ||
| 보고한 논문이 일곱 편이었고 어느 것도 루프의 비용을 공개하지 않았다. StateM 은 최종 점수 | ||
| API 사용량으로 GPT 기준선의 $574.68 에 대해 $15 를 보고한다 — 같은 벤치마크에서 *더 | ||
| 높은* 정확도로 38배 비율이다. 하네스 주장을 순위가 아니라 가격으로 다룰 수 있게 하는 이 | ||
| 저장소 최초의 수치다. |
반증 쪽이 더 중요한 항목인데, 만들어진 방식 때문이다. 이 페이지의 상시 불만은 결과가 이름 없는 단일 구성에서 나오기 때문에 이득을 모델과 스캐폴드 사이에 배분할 수 없다는 것이었다. AutoResearchEval 은 두 축을 모두 변화시키고 실패의 구조 가 움직이지 않는다고 보고한다. 이 클러스터가 계속 요구해 온 절제 실험을, 이 클러스터 자신의 가설에 대해 수행해, 가설에 불리한 답을 가지고 돌아온 것이다 — 그리고 오케스트레이션 수준의 개입이 그 간극을 메울 수 있는지는 시험하지 않았다고 명시한다.
둘은 모순되지 않으며, 이 페이지가 이제 취하는 합산 해석은 이렇다: 하네스 스케일링은 실행 신뢰성을 사지만 자기 평가는 사지 못한다. StateM 의 메커니즘은 명세되고 검증 가능하며 경계가 있는 과제에서 궤도를 놓치지 않기 위한 장치 — 지속 상태, 검사된 전이, 복구 가능한 런북 — 이다. AutoResearchEval 이 결여로 지목하는 것은 메타인지 루프, 즉 산출물을 근거와 대조하고, 버티지 못하면 고치고, 택한 경로가 타당했는지 되묻는 능력이다. 어떤 상태 관리도 그것을 공급하지 않으며, 그래서 8개 조합이 함께 실패한다. 어느 논문도 다른 쪽을 인용하지 않는다. 이 짝짓기는 이 위키의 것이며 그렇게 표시한다.
ClawGym II 는 모델/하네스 구분 자체를 지탱하기 어렵게 만든다. 여기의 다른 모든 항목은 하네스를 고정된 가중치를 감싼 고정 스캐폴드로 다룬다. ClawGym II 는 화살표를 반대로 돌린다 — 하네스가 가중치 를 학습시키는 환경이 되고, 그다음부터 모델은 더는 하네스 중립적이지 않다. 그 +9.98 대 +14.81 은 이 클러스터에서 하네스를 유일한 변수로 둔 가장 깨끗한 측정이기도 하다: 같은 모델, 같은 벤치마크, 같은 방법으로 1.48배 차이.
그리고 여기 어느 논문도 지명하지 않는 "구성"의 네 번째 요소가 등장한다. 같은 배치의 Ventor-QTest: Threat-Model-Driven Verification of Vendor-Hosted LLM APIs (arXiv:2608.16391) 는 벤더 호스팅 API 가 실제로 무엇을 내주는지 감사해, 경로 수준의 충실도 손실이 GPQA-Diamond 정확도와는 감지할 만한 연관이 거의 없으면서 과제 노출이 늘어남에 따라 Terminal-Bench 통과율 하락과 함께 나타난다고 보고한다. StateM 과 같은 벤치마크 계열, 같은 장기 지평 영역이다. 따라서 보고된 점수는 이제 모델, 하네스, 그리고 서빙 경로에 달려 있으며 — 이 위키의 서드파티 수치 대부분인 단일 턴 벤치마크는 세 번째 요소에 구조적으로 눈이 멀어 있다.
상시 집계: 이 클러스터의 논문 열 편, 여전히 공유 분모 없음 — 그리고 이제 달러 수치 하나, 부정적 결과 하나, 그리고 그 명사의 뜻을 바꾸는 것 하나.
2026-08-20 — 어제의 합산 해석이 기제를 얻고, 하네스가 학습 안으로 들어간다
한 HuggingFace 묶음에 논문 넷, 그리고 이들 사이에서 이 클러스터가 아직 해내지 못한 일이 일어난다: 하네스가 얼마의 값어치인지가 아니라 무엇을 하고 있는지 를 말한다 (source).
1. 경로는 지식이 아니라 절차다. Demystifying Agent Skills: Why They Work — Until They Don't (arXiv:2608.14036) 는 시행 기록 8,135건을 개방 코딩해 절차적 앵커링이 스킬 사례의 65.7% 를 차지하고 명시적 지식 주입은 4.5% 라는 것을 찾아낸다. 스킬은 행동 을 안정화하지 빠진 사실을 공급하지 않는다. 이는 이 페이지가 2026-08-19 에 기록한 바로 그 경계 — 하네스 스케일링은 실행 신뢰성 을 사고 자기 평가 는 사지 못한다 — 에 세 번째 방법으로 도달한 것이며, 이제 세 논문이 서로를 인용하지 않은 채 일치한다.
2. 검색의 양은 유용성에 대해 단조가 아니며, 두 논문이 서로 다른 쪽에서 그렇게 말한다. 스킬 검색 실사용 정밀도는 풀이 5개에서 100개로 커지면 29.6% → 3.3% 로 떨어진다. Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents (arXiv:2608.15008) 는 하네스를 고정하고 백본 3종과 벤치마크 4묶음에서 메모리 기질만 바꿔 어떤 기질도 우위를 갖지 않으며 — 넓은 검색은 긴 맥락 사실형 QA 를 돕고 순차적 의사결정은 해친다 — 행동에 결정적인 맥락에서 주의를 옮겨간다고 보고한다. 이 위키가 가진 모든 스킬·메모리 수치는 하나의 풀 크기에서, 하나의 과제 부류에서 보고된다. 이제 둘 다 하중을 진다.
3. 모델/하네스 분리가 학습 쪽에서 해체되고 있다. Agent Lightning v1.0: Towards Harnessed Agentic RL (arXiv:2608.17528) 이 국면을 명명한다 — 하네스드 에이전틱 RL, 배포 시점 하네스가 상호작용 루프를 소유하고 트레이너는 LLM 요청/응답 쌍만 보는 구조 — 다른 네 프레임워크가 이 구조를 채택했다고 밝히며 Qwen3.5-9B 가 SWE-bench Verified 에서 41.8% → 56.4% (6K 예제)를 보고한다. 이는 하네스로 학습한 모델이 하네스 불가지론적이기를 그친다 는 ClawGym II: Exploring Black-Box RL on Agent Harness (arXiv:2608.16798) 의 08-19 발견 뒤에 있는 기제다. 이것이 이제 기본 후속 학습 경로라면, 이 페이지의 규칙 — 벤치마크 숫자는 (모델, 하네스) 쌍에 대한 주장이다 — 은 보고 관행이기를 그치고 가중치에 관한 사실 이 된다. 하네스 불가지론적 모델은 가정할 것이 아니라 입증해야 할 것이다.
그리고 하네스를 가장 강하게 옹호하는 논문이 자기 하네스의 이름을 밝히지 않는다. Agent Lightning 의 대표 수치 56.4% 는 어느 하네스가 만들었는지 밝히지 않은 채 보고된다 — 하네스가 학습에 참여한다는 것이 논지인 논문에서, 이 페이지가 존재하는 바로 그 누락이다. 같은 날 도착한 Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements (arXiv:2608.17310) 는 반대 베팅(신용 할당 기계를 고치는 대신 진화 전략으로 삭제)을 하며 그와 비교 불가능하다: 모델, 벤치마크, 기준선, 보고 관행이 모두 다르고 공유 분모가 없다. 이 클러스터에서 여섯 번째로 서로 비교되지 않는 분모다.
4. 자율성은 하네스 품질과 별개의 축이며, 붕괴가 있는 곳은 거기다. ASI-Bench: At the Dawn of Artificial Superintelligence (arXiv:2608.17271) 는 연구 프로젝트를 고정한 채 사람의 방법론적 안내를 세 단계로 철회한다: 50.91 → 29.10 → 26.62. 손실의 거의 전부가 첫 철회에서 나오므로, 안내가 공급하던 것은 주로 어느 방법을 고를지 가 아니었다. How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks (arXiv:2608.14905) — 같은 결핍, 다른 도구 — 옆에 두면 경계가 날카로워진다: 연구가 무엇인지 사람이 이미 정해 놓았을 때 에이전트는 연구를 잘 수행한다.
2026-08-21 — 모델을 학습시킨 하네스가 드디어 이름을 얻고, 학습 이전 편차가 6.8 포인트다
어제 이 페이지는 Agent Lightning v1.0: Towards Harnessed Agentic RL (arXiv:2608.17528) 이 하네스드 에이전틱 RL 을 명명했음을 기록하면서, 가장 중요한 이의를 함께 적었다: 하네스를 가장 강하게 옹호하는 논문이 정작 자기 대표 수치를 낸 하네스를 밝히지 않았다. LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents (arXiv:2608.17393) 이 그것을 하루 뒤에, 다른 그룹에서 제공한다 — 같은 국면을 하네스 세 개를 지명하고 각각 채점해 보고하며, Qwen3.5-35B-A3B 를 GSPO 로 학습시킨다:
| 하네스 | 이전 | 이후 | 향상 |
|---|---|---|---|
| OpenHands SDK | 64.0% | 70.4% | +6.4 |
| Claude Code | 62.4% | 68.2% | +5.8 |
| OpenCode | 57.2% | 66.6% | +9.4 |
| 편차가 둘 있고, 작은 쪽이 더 불편하다. 하네스별 향상 은 3.6 포인트 차이지만, 출발점 은 같은 | |||
| 모델로 학습을 전혀 하지 않은 상태에서 6.8 포인트 벌어져 있다 (57.2 대 64.0). 이 페이지의 규칙 — | |||
| 벤치마크 수치는 (모델, 하네스) 쌍에 대한 주장이다 — 은 보통 평가 시점 효과로 논증된다. 여기서는 | |||
| 학습 런의 양쪽 모두에서 보이며, 학습하지 않은 편차만으로도 세 향상 중 둘보다 크다. |
그리고 세 번째 수치가 어떤 RL 결과의 독자에게든 걱정거리여야 할 숫자다. LEGO-RL 은 롤아웃–학습 확률 상관을 0.99 초과 로 유지한다고 보고하며, 무엇을 막는지 서술한다: 프로덕션 하네스는 자기 판단으로 컨텍스트를 압축하고 재직렬화 해, 롤아웃 시점에 모델이 실제로 받은 것과 트레이너가 업데이트하는 대상을 분리시킨다. 어떤 벤치마크 증분도 이 일이 일어났음을 드러내지 않는다. 하네스를 통해 학습시키면서 이 양을 보고하지 않는 논문은 자기 최적화가 유효했음을 보인 것이 아니며, 이 위키가 보유한 하네스 학습 논문 셋 중 이를 보고하는 것은 하나뿐이다.
ClawGym II: Exploring Black-Box RL on Agent Harness (arXiv:2608.16798) 와의 짝지음은 이제 세 갈래로 이어진다: ClawGym-II 는 학습 이후 하네스만으로 1.48배 편차를 측정했고, Agent Lightning 은 구조를 서술했으며, LEGO-RL 은 하네스를 지명하고 무결성 검사를 제공한다. 셋 중 어느 것도 다른 둘을 인용하지 않으며, 셋 모두가 함의하는 교차 하네스 평가 행렬은 아무도 공개하지 않았다. 그 행렬이 이 클러스터의 미결 실험이다.
한편 SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation (arXiv:2608.18565) 는 하네스가 아니라 채점을 공격하며, 이 페이지에서 가장 깔끔한 계기 실패 시연을 낳는다. PLC 코드 생성에서 정적 동작 점수는 모든 방법을 서로 10 포인트 안에 몰아넣지만, 같은 코드를 실제 런타임에 배포해 실행 트레이스를 비교하면 22.4–31.4 대 52.2 로 흩어진다. 모든 시스템이 똑같이 통과하는 채점 방식은 그 대상을 재고 있지 않다. 그 종료 규칙 — 과제는 기록된 외부 검사가 확인할 때만 완료되며 모델이 자기 출력을 충분하다고 판단할 때가 아니다 — 은 이달 Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development (arXiv:2608.13417) 와 Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence (arXiv:2608.11341) 가 더 약한 형태로 편 논변의 가장 강한 판본이다.
한계는 정직하고 밝혀 둘 가치가 있다: 검증 게이팅은 검증이 값쌀 때 작동한다. PLC 로직에는 실제 런타임과 참조 구현이 있고, How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks (arXiv:2608.14905) 이 모델 수준 결핍을 발견한 연구 과제에는 둘 다 없다.
이 위키에서의 실무적 귀결
모델 페이지의 벤치마크 행은 알려진 경우 그 수치를 만들어 낸 하네스나 출처와 함께 기록하고,
다툼이 있는 수치는 조용히 조정되는 대신 ## Conflicting Reports 로 간다. GPT-5.6 Sol 의 "공식
하네스" 수치 두 개 — ARC Prize 가 검증한 7.8% 와 OpenAI 가 재실행한 13.3% — 는 읽은 자료 중
어느 것도 둘을 화해시키지 못하므로 서로 어긋나는 상태로 기록된다.
이 저장소가 스크랩하는 리더보드 스냅샷에도 같은 규율이 적용된다. LMArena 는 Elo 가 아니라 신뢰 구간을 동반한 백분율로 인용하고, Artificial Analysis 수치는 그 위의 열 제목과 함께 인용한다 (source).
주요 소스
- OpenAI, "How enabling two settings tripled our scores on the ARC-AGI-3 benchmark" (2026-07-29) (source)
- ARC Prize results — Claude Opus 5
- ARC Prize, analyzing GPT-5.5 & Opus 4.7 with ARC-AGI-3
- LMArena 스냅샷 (source)
- Artificial Analysis 스냅샷 (source)
- Qwen3.8-27B 릴리스 — Claude Code 하네스 위의 SWE-MM (2026-08-14) (source)
- GLM-5.3 릴리스 — 벤치마크 넷, 하네스 없음 (2026-08-14) (source)
- AI4AI at Test-Time, arXiv:2608.12307 (source)
- HuggingFace Daily Papers, 2026-08-20 — Agent Skills, Harness the Memory, Agent Lightning v1.0, Agentic ESOpt, ASI-Bench (source)
- HuggingFace Daily Papers, 2026-08-19 — StateM, AutoResearchEval, ClawGym II, Ventor-QTest (source)
- HuggingFace Daily Papers, 2026-08-16 — DarwinX, AutoDesign, SHAPER, SkillZip (source)
관련 개념
- Reasoning Models
- Test-Time Compute (Inference-Time Compute Scaling)
- Agents (LLM Agents)
- Conceptual Reasoning Index (CRI)
- Model Routing
- GPT-5.6 Sol (and Terra, Luna)
- Claude Opus 5
- DarwinX: Evolving Agent Harnesses Through Natural Selection (arXiv:2608.07545)
- StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (arXiv:2608.15089)
- How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks (arXiv:2608.14905)
- ClawGym II: Exploring Black-Box RL on Agent Harness (arXiv:2608.16798)
- Ventor-QTest: Threat-Model-Driven Verification of Vendor-Hosted LLM APIs (arXiv:2608.16391)
Referenced by
Sources
- sources/papers-daily/hf-daily-2026-08-20.md
- sources/papers-daily/hf-daily-2026-08-19.md
- sources/papers-daily/hf-daily-2026-08-18.md
- sources/papers-daily/hf-daily-2026-08-17.md
- sources/blogs/alibaba-2026-08-14-qwen-3-8-27b-released.md
- sources/blogs/zai-2026-08-14-glm-5-3.md
- sources/arxiv/2026-08-15/2608.12307-ai4ai-test-time.md
- sources/blogs/openai-2026-07-29-arc-agi-3-two-settings.md
- sources/evals/lmarena-2026-07-29.md
- sources/evals/artificial-analysis-2026-07-30.md