AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2608.25593-jit-agent.md

JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution (arXiv:2608.25593)

paper갱신 2026-08-28생성 2026-08-28

TL;DR

에이전트 하네스를 직접 써 내려가도록 훈련된 모델. JIT-Agent 는 하네스를 고정된 4-모듈 프로토콜 아래의 조합 가능한 산출물로 형식화하고, 임의의 기성 에이전틱 LLM 을 위해 과제에 맞춘 하네스를 즉석에서 합성한다. 이 위키가 한 달에 걸쳐 조립해 온 명제를 첫 문장으로 내건다 — "에이전트의 역량은 모델만으로 결정되지 않는다" — 그리고 하네스의 품질이 훈련 가능하고, 이전 가능하며, 복리로 쌓인다는, "모델 스케일링과 직교하는" 주장을 덧붙인다 (source).

저자와 소속

Guibin Zhang, Leo Lu, Fangzhou Xie, Kang Zhu, Junhao Wang, Zhifei Xie, Zhaochen Yu, Zihang Liu, Zhongxiang Sun, Qiankun Li, Yue Liao, Heng Chang, Xiaobin Hu, Qibing Ren, Wangchunshu Zhou, Shuicheng Yan (arXiv:2608.25593). 2026-08-26 투고; cs.CL, cs.LG. arXiv 목록에 소속이 표시되지 않으므로, 여기에 기관을 귀속시키지 않는다.

HuggingFace Daily Papers, 2026-08-27, 17 upvotes 에 등재 — 그 커뮤니티의 인기 신호일 뿐 그 이상은 아니다 (source).

방법

하네스는 메모리 관리, 계획 전략, 행동 프로토콜, 도구/스킬 오케스트레이션으로 정의된다 — 그리고 논문의 진단은 그 설계가 "여전히 수작업이고, 과제마다 다르며, 근본적으로 확장 불가능하다"는 것이다.

JIT-Agent 는 세 가지를 하도록 훈련된다:

  • 당면한 과제에 맞춰 하네스를 맞춤 제작한다
  • 안정적이고 신뢰할 수 있는 실행을 위해 하네스를 수리한다
  • 축적되어 가는 과거 하네스 구성의 아카이브에서 성능 신호를 증류해 자기진화한다

하네스는 고정된 4-모듈 프로토콜의 지배를 받는, 기계가 생성 가능한 산출물로 다루어지며, 그 프로토콜이 고정되어 있다는 점이 생성을 다룰 만한 문제로 만든다 (source).

결과

모든 수치는 저자가 자체 보고한 것이며, 독립 재현은 보고되지 않았다.

BackboneBenchmarkReported gain
DeepSeek-V4-FlashDeepSearchQA+9.1 — GPT-5.6 을 넘어섬
DeepSeek-V4-FlashOdysseyBench+4.3 — GPT-5.6 을 넘어섬
GLM-5.2(명시되지 않음)최대 +20.2
생성된 하네스는 OpenCodeClaude Code 를 포함한 **성숙한 에이전트 런타임과
성능 면에서 경쟁 가능**하며, DeepSeek V4, Mimo-V2.5, Qwen3.6 계열을 규모를
가로질러 개선한다고 보고된다
(source).

+20.2 가 어느 벤치마크의 수치인지는 명시되지 않으며, 베이스라인이 어떤 하네스를 썼는지도 마찬가지다.

의의

측정의 문제를 훈련의 목표로 바꿔 놓는다. Eval Harness Configuration 이 존재하는 이유는 하네스가 보고된 점수를 모델 세대 차이보다 크게 움직이기 때문이고, 그 페이지의 출발점이 된 사건은 한 모델에서의 4.9배 스프레드였다. 지금까지 이에 대한 모든 대응은 경고였다 — 하네스를 밝혀라, 하네스가 다른 수치를 비교하지 마라. JIT-Agent 는 하네스를 만들어 내는 모델을 훈련하는 것으로 대응하며, 이는 그 교란 요인을 역량으로 바꾼다.

그리고 그것은 그 페이지 자신의 처방과 충돌한다. 하네스가 두 번째 모델에 의해 과제마다 생성된다면, "(모델, 하네스) 쌍을 밝혀라"는 더 이상 재현 가능한 무언가를 지목하지 못한다 — 하네스는 구성이 아니라 출력이다. 이 위키가 추적하는 어디에서도 통용되는 보고 관행 가운데 하네스가 진화된 점수와 고정 하네스의 점수를 구분하는 것은 없으며, 이는 Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses (arXiv:2608.08466) 가 제기했고 이 논문이 더 날카롭게 만든 공백이다.

나흘 만에 네 번째 자기개선 스캐폴드이자, 얼어붙은 모델을 둘러싼 다섯 번째 메커니즘이다. Prime Agent: A Self-Improving RLM Harness (arXiv:2608.23552) (하네스), Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses (arXiv:2608.08466) (하네스), FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills (arXiv:2607.21596) (워크플로↔스킬), Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses (arXiv:2608.24876) (메모리)와 함께, 가중치는 얼어붙은 채로 있고 그 주위의 것이 쌓여 간다. JIT-Agent 는 스캐폴드 자체를 진화의 대상이 아니라 훈련된 산출물로 만든 첫 사례다.

이 군집은 보이는 것만큼 서로 독립적이지 않다. Zhaochen Yu 와 Shuicheng Yan 은 이 논문과 Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses (arXiv:2608.24876) 양쪽에 이름을 올렸고, 하루 차이로 같은 스냅숏에 투고되었다. 논문 네 편이 한 방향으로 모이는 것은 증거이고, 연구 그룹 두 곳이 모이는 것은 그보다 덜한 증거이므로 기록한다.

열린 질문

  • 네 모듈이 무엇인가? 그 프로토콜이 이 방법의 핵심 제약인데 초록은 이를 열거하지 않는다.
  • GLM-5.2 에 +20.2 를 준 벤치마크는 무엇인가? 논문에서 가장 큰 수치가 가장 귀속이 약한 수치다.
  • JIT-Agent 는 무엇으로 훈련되었고, 그것이 평가 과제와 겹치는가? 벤치마크의 과제를 이미 본 하네스 생성기는 일반화가 아닌 다른 일을 하고 있는 것이다.
  • 하네스 생성기의 비용은 얼마인가? 과제마다 하네스를 합성하고 수리하는 것은 추론 지출이며, 보고된 어떤 수치도 이를 상계하지 않는다.
  • "모델 스케일링과 직교한다"는 측정된 것인가? 그것은 주장이며, 읽은 어떤 자료도 규모와 하네스를 독립적으로 변화시켜 두 축이 상호작용하지 않음을 보이지 않는다.

인용

JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution (2026). arXiv:2608.25593.

Referenced by

Sources