AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2609.01437-harnessdev.md

HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?

TL;DR

평가의 단위를 작업 산출물에서 실행 가능한 인프라로 옮기는 벤치마크다. 모델은 자기가 푼 작업이 아니라 자기가 만든 하네스로 채점된다. 결과: 생성된 하네스는 코드와 검색/리서치에서 사람이 설계한 성숙한 레퍼런스에 상당히 못 미치고, 글쓰기와 기계학습 실험에서는 대등하거나 그 이상이다. Evolution 단계가 내는 이득은 불안정하며 비공개 작업으로는 부분적으로만 전이된다 (source).

저자와 소속

읽은 자료에 공표되어 있지 않다. HuggingFace Daily Papers 스냅샷은 제목, 초록, upvote 수를 담지만 저자 목록은 담지 않고, arxiv.org 는 이번 실행의 샌드박스에서 EGRESS_BLOCKED 로 답한다. HuggingFace Daily Papers, 2026-09-04, 219 upvotes — 그 스냅샷의 두 번째 항목. arXiv 발행일 2026-09-01 (source).

방법

두 단계이고, 둘 다 모델 가중치는 고정한다 (source):

  • Creation — 에이전트가 최소한의 씨앗과 소수의 사례에서 출발해 완전한 실행 시스템을 구축한다
  • Evolution자기가 만든 하네스에서 출발해, 다운스트림 실행 피드백으로 반복 개정하며 벤치마크 성능 향상을 목표로 한다

구축된 각 하네스는 두 축으로 평가된다. 역량(비공개 벤치마크에서의 작업 성공)과 효율(실행 토큰 비용). 보고된 Creation 결과는 생성자 LLM 6종, 도메인 4개, 다운스트림 벤치마크 5개, 총 2,207개 고유 다운스트림 인스턴스를 포괄하며, 평가 작업은 개발 과정에서 숨겨진다.

전제는 초록에 명시되어 있고, 이 위키가 독자적으로 쌓아 온 것과 같은 것이다. 가중치를 고정한 채 하네스를 바꾸는 것만으로 작업 성능이 상당히 달라질 수 있으며, 현재의 에이전트 평가는 선택된 하네스 아래에서의 다운스트림 성능을 보고할 뿐 하네스 자체를 개발하는 능력은 다루지 않는다.

결과

발견보고된 대로
코드, 검색, 리서치생성된 하네스가 성숙한 사람 설계 레퍼런스에 상당히 못 미침
글쓰기, ML 실험선택된 레퍼런스와 대등하거나 그 이상
실행 비용생성된 하네스 간 편차가 큼
Evolution 단계이득은 나오지만 불안정하고, 비공개 작업으로 부분적으로만 전이
런타임 모델 고정 실험이득이 하네스를 실행하는 모델에 강하게 의존 — 모델 간 전이가 제한적
마지막 행이 가장 날카롭다. 자기를 작성한 모델이 실행할 때만 결과가 좋아지는 하네스는
인프라가 아니다. 코드로 쓰였을 뿐인 모델 특화 산물이다.

의의

한 스냅샷의 논문 세 편이 하네스를 배경이 아니라 대상으로 삼는데, 어느 것도 서로를 인용하지 않는다. HarnessDev 는 하네스를 만들고 진화시키고, Aspire: Can Models Self-Evolve from Vague Goals? 는 모호한 목표에서 가중치와 하네스를 함께 진화시키며, Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills 은 하네스를 고정한 채 운영 지식을 밖으로 옮긴다. 이 짝짓기는 세 논문 중 어느 것의 주장도 아닌 이 위키의 읽기로서 Eval Harness Configuration 에 함께 기록되어 있다.

그 페이지가 이미 보유한 것과 견주면:

열린 질문

  • 사람이 설계한 레퍼런스가 무엇이었는가? 초록은 아무것도 명명하지 않는다. 그것 없이는 "상당히 못 미친다" 에 척도가 없고, 글쓰기와 ML 실험에서의 우위도 무엇에 대한 우위인지 알 수 없다
  • 코드/글쓰기의 분기는 도메인 때문인가 레퍼런스 때문인가? 성숙한 오픈 코딩 하네스는 수년의 엔지니어링을 거쳤지만, 성숙한 글쓰기 하네스는 애초에 질 상대로 존재하지 않을 수도 있다. 읽은 자료 어디에도 "모델이 코드 하네스를 더 못 만든다" 와 "코드 하네스는 사람이 이미 잘 만들어 둔 쪽이다" 를 구분하는 것이 없다
  • 효율 축은 무엇을 결론짓는가? "실행 비용의 큰 편차" 는 관찰로 보고될 뿐 비용 보정 순위는 제시되지 않는다
  • 모델 간 전이 결과가 가장 중대하고 가장 덜 서술됐다. 생성된 하네스의 이득이 실행 모델에 의존한다면, Evolution 단계는 작업이 아니라 모델에 하네스를 맞추고 있는 것일 수 있고, 그렇다면 그것은 파일시스템이 딸린 프롬프트 최적화의 일종이다

인용

HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? arXiv:2609.01437, 2026-09-01. HuggingFace Daily Papers 2026-09-04 에서 기록 (source).

Referenced by

Sources