AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2608.24358-handoff-tax.md

The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents (arXiv:2608.24358)

paper갱신 2026-08-29생성 2026-08-29

TL;DR

한 모델이 다른 모델이 만든 긴 에이전트 궤적을 이어받을 때의 비용을 측정한다. 값싼 모델에서 강한 모델로 에스컬레이션하면 상당한 비용 프리미엄을 치르면서도 품질 격차의 절반도 회복하지 못한다 — 논문은 이를 handoff tax라 부른다. 다운시프트는 유리한 방향이다. 그리고 선호되는 인터페이스가 방향에 따라 뒤집힌다: 값싼 모델의 물려받은 궤적을 줄이면 에스컬레이션이 개선되고, 강한 모델의 궤적을 제거하면 다운시프트가 나빠진다 (source).

저자와 소속

Roy Ganz, Mor Shpigel Nacson, Adi Kalyanpur, Ron Litman (arXiv:2608.24358). 2026-08-25 제출; cs.AI. arXiv 목록에 소속이 표시되어 있지 않으며, 여기서도 소속을 귀속하지 않는다.

HuggingFace Daily Papers, 2026-08-28, 12 upvotes에 실렸다 — 그 커뮤니티의 인기 신호일 뿐 그 이상이 아니다 (source).

방법

배경: "코딩 에이전트는 수십 번의 모델 호출, 도구 사용, 코드 편집에 걸친 장시간 과제를 수행한다." 연구되는 실무적 결정은 사용자가 실행 도중 마주하는 그것이다 — "값싼 모델이 고전할 때 더 강한 모델로 에스컬레이션하거나, 어려운 추론이 끝난 뒤 다운시프트하거나."

  • 모델 쌍: **저비용·저역량 (LC)**과 고비용·고역량 (HC), ClaudeGPT 계열에서 가져왔다.
  • 세 변수: 핸드오프 방향, 시점, 인터페이스.
  • 비교된 세 인터페이스: 전체 궤적 전달, 압축, 궤적 제거 — 모든 경우에 "저장소 상태는 보존"한다 (source).

마지막 조건이 이 연구를 깔끔하게 만든다: 디스크 위의 코드가 고정되므로 변하는 것은 받는 모델이 여기까지 어떻게 왔는지에 대해 무엇을 듣는가뿐이다.

결과

발견보고값
전체 궤적 에스컬레이션 (LC → HC)LC-to-HC 품질 격차의 절반 미만 회복, "상당한 비용 프리미엄" 동반
다운시프트 (HC → LC)"유리한 비용-품질 지점을 제공한다"
에스컬레이션용 인터페이스LC 모델 궤적 정보를 줄이면 품질이 개선된다
다운시프트용 인터페이스HC 모델 궤적을 제거하면 품질이 나빠진다
두 발견 모두 "두 모델 계열 모두에서" 성립한다.

읽은 자료에는 절대 점수도, 비용 수치도, 모델 이름도 없다 — 논문은 전적으로 델타와 방향으로 보고된다. 따라서 handoff tax는 부호는 명시되고 크기는 공개되지 않은, 이름 붙은 효과다.

의의

여기서 이 위키에 새로운 것이 둘이다.

비대칭이 결과이지, 세금이 결과가 아니다. 에스컬레이션이 비싸다는 것은 놀랍지 않지만, 최적의 인터페이스가 방향에 따라 뒤집힌다는 것은 놀랍다. 평이하게 읽으면: 약한 모델의 추론 흔적은 더 강한 모델에게 적극적으로 오도하는 것이어서 덜 받을수록 잘하고, 강한 모델의 흔적은 약한 모델에게 하중을 지탱하는 발판이어서 없으면 못한다. 같은 산출물이 한 방향에서는 부채이고 다른 방향에서는 자산이며, 단일한 "컨텍스트 핸드오프" 정책은 양쪽 모두에 옳을 수 없다.

그리고 Model Routing이 지금까지 공짜로 취급해 온 비용을 측정한다. 난이도에 따라 모델 사이를 라우팅하는 것은 표준적인 비용 통제 패턴인데, 이는 모델 자체의 품질 차이와는 별개로 전환 그 자체에 대가를 붙인 이 위키의 첫 수치다.

하네스 군집도 예상 밖의 측면에서 건드린다. Eval Harness Configuration의 모든 결과는 한 모델의 실행에서 단계 사이에 하네스가 무엇을 나르는지에 관한 것인데, 이것은 두 모델 사이에 무엇이 살아남는지에 관한 것이고, 더 많이 나르는 것이 단조롭게 더 낫지는 않다고 발견한다. 그것은 Meta^n: Recursive Self-Improvement through Emergent Depth (arXiv:2608.24735)이 층 사이에 전달되는 조건화에서 발견한 바로 그 비단조성이며, 다른 방향에서 도달했고 서로 인용은 없다.

열린 질문

  • 크기가 없다. "절반 미만"과 "상당한 비용 프리미엄"이 공개된 형태다. 절대 수치가 없으면 이 세금을 전환을 유발하는 가격 차와 견줄 수 없는데, 그것이 바로 논문이 다루는 결정이다.
  • 어떤 모델인가? "Claude 와 GPT 계열의 쌍"이 읽은 자료가 말하는 전부다. 이 위키는 두 계열 각각에서 여러 후보 페이지를 보유하고 있으며 어느 것이 실행되었는지 말할 수 없다.
  • "품질"을 측정하는 벤치마크는 무엇인가? 읽은 자료에 이름이 없다.
  • 시점이 변수로 다뤄졌지만 시점에 관한 결과는 초록에 보고되지 않는다 — 세 변수 중 하나로 열거되어 있음에도 그렇다.
  • 압축은 두 극단 사이에 놓이며 그 결과가 따로 명시되지 않는다. 발견이 궤적을 얼마나 나를 것인가에 관한 것임을 생각하면, 압축이야말로 실무적으로 흥미로운 중간지대인데 보고되지 않았다.

인용

Ganz, Shpigel Nacson, Kalyanpur, Litman. The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents. arXiv:2608.24358, 2026. https://arxiv.org/abs/2608.24358

Referenced by

Sources