AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2608.15763-taolive-hat.md

Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report (arXiv:2608.15763)

paper갱신 2026-08-29생성 2026-08-29

TL;DR

하네스 군집의 거울상이다. JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution (arXiv:2608.25593)하네스를 작성하는 모델을 학습시킨다면, 이 논문은 컴팩트 모델이 자기 밑에서 하네스가 바뀌어도 버티도록 학습시킨다. **Harness-Aware Training (HAT)**은 학습 중에 Skill 식별자, 도구 스키마, 프롬프트 구조, Hook 함수를 증강한다. 그 결과는 Live-Stream QA 94.8(기저 80.3, 최강 범용 LLM 93.0), Harness-Variant QA 94.6(기저 75.4)이며, Fixed-Harness SFT 가 일으키는 7.7 점 IFEval 퇴행을 피한다. Taobao Live의 디지털 아바타 서비스에 배포되어 있다 (source).

저자와 소속

TaoLive AIGC LLM Team: Yuhan Sun, Wenhao Lin, Yongdong Luo, Yibo Hu, Meiguang Jin, Junfeng Ma, Weihang Pan, Jiaxin Zhao, Zulong Chen (arXiv:2608.15763). 2026-08-16 제출, v3 는 2026-08-26 개정; cs.CL. 팀 이름과 명시된 배포처는 이 작업을 Alibaba / Qwen AI Lab의 라이브 커머스 플랫폼 Taobao Live에 위치시킨다. arXiv 목록에는 소속 줄이 없으며, 논문 자신의 제목과 배포 주장이 말하는 것 이상은 주장하지 않는다.

HuggingFace Daily Papers, 2026-08-28, 33 upvotes에 실렸다 — 그 커뮤니티의 인기 신호일 뿐 그 이상이 아니다 (source).

방법

배경은 실제 운영 환경이고 제약도 실제다: AI 디지털 아바타 스트리머는 "제품 문의에 답하고, 시청자와 소통하며, 마케팅 전략을 실시간으로 실행해야 하고, 이는 낮은 지연, 잦은 전략 갱신, 그리고 정확하면서도 효과적인 응답을 요구한다."

이로부터 생기는, 논문이 말하는 절충:

Evolvable HarnessesSkills, Hooks, 프롬프트, 도구모델 가중치와 독립적으로 갱신할 수 있어 빠른 반복을 가능하게 하지만 절충을 드러낸다: 큰 모델은 제로샷으로 적응하지만 너무 느리고, 컴팩트 모델은 지연 목표를 맞추지만 고정된 Harness 구성에 과적합한다.

**Harness-Aware Training (HAT)**의 핵심 구성요소는 Harness-State Augmentation (HSA) — "Skill 식별자와 내용, 도구 스키마, 프롬프트 구조, Hook 함수에 대한 과제 보존 변환"이다.

학습 3 단계:

  1. HSA-SFT — "다양한 환경에 걸친 강한 모델의 궤적으로부터 추론과 도구 사용을 학습한다."
  2. General On-Policy Distillation — "SFT 중 잃어버린 일반화를 회복한다."
  3. HSA-RL — "증강된 환경에서의 강화학습을 통해 변화하는 Harness 에 대한 견고성을 개선한다" (source).

결과

네 개의 평가 세트에 걸쳐:

측정기저HAT그 밖
Live-Stream QA80.394.8최강 범용 LLM 93.0
Harness-Variant QA75.494.6
IFEval83.5Fixed-Harness SFT: 기저 모델보다 7.7 점 아래
지연 시간, NVIDIA H20 GPU 한 장에서: P50 3.4 s, P95 8.1 s.

배포: "Taobao Live 의 디지털 아바타 서비스에 배포되어 GMV 와 상품 페이지 조회에 대한 긍정적인 온라인 A/B 테스트 결과도 얻었다." A/B 수치는 공개되지 않았다 — 방향만 명시되고 크기는 명시되지 않는다.

기저 모델은 읽은 어떤 자료에도 이름이 없어서, "컴팩트"에는 파라미터 수가 붙지 않고 80.3 → 94.8 이라는 이동에도 규모가 붙지 않는다.

의의

이것은 Eval Harness Configuration이 2026-08-28 에 기록하고 해소하지 못한 긴장에 대한 직접적인 답이다.

JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution (arXiv:2608.25593)는 하네스 품질을 "학습 가능하고, 전이 가능하며, 누적되고, 모델 스케일링과 직교한다"고 불렀는데, 이는 그 페이지 자신의 처방인 (모델, 하네스) 쌍을 보고하라를 깨뜨렸다. 쌍이 재현 가능한 구성을 식별하는 것은 하네스가 움직이는 표적이 아니라 구성으로 남아 있는 동안뿐이기 때문이다.

HAT 은 같은 전제를 받아들이고 반대의 공학적 결론을 끌어낸다: 하네스가 움직일 것이라면 그것이 움직이는 방식들에 대해 모델을 불변으로 만들라. Harness-Variant QA 결과 — 75.4 → 94.6 — 은 바로 그 불변성의 측정이며, 이 군집에서 하네스 민감도에 의해 교란된 것이 아니라 그것을 대상으로 삼은 첫 수치다.

또한 이 군집의 첫 운영 데이터포인트를 제공한다. 여기 있는 다른 모든 결과는 벤치마크지만, 이것은 지연 예산과 GPU 와 배포를 동반한다. Fixed-Harness SFT 로 인한 7.7 점 IFEval 퇴행은 특히 남길 만한 세부다: 컴팩트 모델을 하나의 고정된 하네스에 맞춰 학습시키면 지시 수행 전반이 나빠진다. 이는 군집의 나머지가 암묵적으로 가정하는 관행에 붙는 구체적인 비용이다.

여기까지의 한계는 둘이다. Harness-Variant QA 는 저자들 자신의 평가이므로, 불변성을 측정하는 벤치마크를 그것을 주장하는 당사자가 만들었다. 그리고 증강은 구성상 과제 보존적이다 — Skill 의 이름을 바꾸고 스키마의 형태를 바꾸되 하네스가 할 수 있는 일은 바꾸지 않으므로, JIT-Agent 의 하네스 진화보다 좁은 종류의 변화다.

열린 질문

  • 기저 모델은 무엇인가? 읽은 자료에 이름이 없고, "컴팩트"는 정량화되지 않는다.
  • 93.0 을 기록한 최강 범용 LLM 은 무엇인가? 이름이 없으므로 94.8 은 익명의 기준선을 이긴 것이다.
  • A/B 테스트는 방향만 보고한다. GMV 와 상품 페이지 조회가 긍정적으로 움직였으나 크기는 미공개이며, 이는 상업적 배포가 공개할 유인이 가장 적고 측정할 능력은 가장 큰 수치다.
  • HAT 의 불변성은 증강이 모델하지 않은 하네스 변화에도 유지되는가? 세 단계는 변환 계열에 대해 학습하고, 읽은 자료는 그 바깥의 변화를 시험하지 않는다 — 그리고 그것이 운영에서 문제가 되는 경우다.
  • On-policy distillation 과의 상호작용. 2 단계가 General On-Policy Distillation 이므로, 이는 SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation (arXiv:2608.21500) 및 지난 한 주 동안 Agentic Reinforcement Learning에 기록된 다른 네 개의 on-policy distillation 결과와 같은 계열에 속한다. 서로를 인용하는 것은 하나도 없다.

인용

TaoLive AIGC LLM Team (Sun, Lin, Luo, Hu, Jin, Ma, Pan, Zhao, Chen). Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report. arXiv:2608.15763, 2026. https://arxiv.org/abs/2608.15763

Referenced by

Sources