AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2609.25804-taste-bench.md

The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks

TL;DR

Taste-Bench 를 구축해, 에이전트가 긴 호흡의 과제를 끝냈는지가 아니라 도중의 갈림길에서 잘 골랐는지를 잰다. 최고 프런티어 모델이 질문의 59.7% 를 맞히고, 추론 예산을 늘려도 도움이 되지 않으며, 그 역량은 결과를 본 교사로부터 보지 못한 학생에게 증류될 수 있다 — held-out SWE-bench Pro 과제의 종단 성공률을 높이면서 (source).

저자와 소속

스냅샷에 명시되지 않았다 — 저자 목록도 소속도 없다. arxiv.org 는 이 런의 샌드박스에서 EGRESS_BLOCKED 를 반환한다. 추측하는 대신 미상으로 기록한다.

방법

명시된 틀: 긴 호흡의 과제에서 에이전트가 도중에 내리는 결정 — 어떤 가설을 시험할지, 어떤 구현 위에 쌓을지 — 이 실행 전체의 결과를 결정한다. 논문은 그런 결정을 잘 내리는 능력을 에이전트의 taste 라 부르고, 기존 벤치마크들은 종단 성공을 재며 그중 어느 것도 taste 를 재지 않는다고 관찰한다.

구성, 그리고 이 부분이 일반화된다:

  • 각 질문은 결정 분기점을 제시한다 — 실제 에이전트 궤적에서 여러 방향이 열려 있고 그중 하나가 더 나은 결과로 이어지는 지점.
  • 평가받는 모델은 분기점 이후에 무슨 일이 일어나는지 보지 못한 채 방향을 고른다.
  • 분기점은 같은 과제에 대한 병렬 시도한 궤적 안의 우회로에서, 사람의 주석 없이 자동으로 채굴된다.
  • 궤적은 실제 엔지니어링과 연구 과제를 수행하는 에이전트에서 나온다.

학습: 결과를 본 교사의 판단을 학생에게 증류한다. 학생은 보지 못한 과제에서 더 나은 결정을 내리고, held-out SWE-bench Pro 과제의 종단 성공률을 높인다.

결과

주장보고된 값
Taste-Bench 최고 프런티어 모델59.7% 정답
결정 근거가 궤적 뒤쪽에 나타나는 분기점모든 모델에서 훨씬 어려움
추론 예산 증가의 효과정확도를 높이지 않음
결과를 본 교사로부터의 증류보지 못한 과제에서 더 나은 결정; held-out SWE-bench Pro 종단 성공률 향상
이 가운데 둘은 헤드라인보다 값어치가 있다.

"추론 예산을 늘려도 정확도가 오르지 않는다" 는 이 위키가 근 일 년 동안 어려운 추론 실패의 해답으로 추적해 온 Test-Time Compute (Inference-Time Compute Scaling) 의 방향에 대한 부정 결과다. taste 가 더 오래 생각하는 데 반응하지 않는다면 그것은 test-time compute 가 움직이는 축과 다른 축이고, 독자가 먼저 확인해야 할 주장이 그것이다.

뒤쪽 근거에 관한 발견은 조심해야 할 측정 산물이다. 결정 근거가 궤적 뒤쪽에 나타나는 분기점은 구성상 모델이 본 것으로부터 정답을 도출할 수 없는 분기점이다. 그것이 나쁜 taste 를 재는지 답할 수 없는 질문을 재는지는 읽은 범위에서 다뤄지지 않으며, 논문 자신의 규정 ("모든 모델에서 훨씬 어렵다") 도 둘을 구분하지 않는다.

증류 결과에는 절대 수치가 붙지 않는다 — "더 나은 결정" 과 "종단 성공률 향상" 은 스냅샷 안에서 수치를 갖지 않으므로, 학습된 taste 주장은 방향성뿐이다.

의의

이것은 계측 결과이고, 논문 선택을 이끈 계측 결과가 이제 4 주 연속이다. ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks 는 명세 채널을 옮겼고, Confidence Comes from Experience: Experiential Confidence Estimation from Reasoning to Agents 는 에이전트가 성공했음을 아는지 쟀으며, Harness-Zero: Harness Distillation via Agent-as-HarnessRRSI: Regularized Recursive Self-Improvement of Agent Harnesses 는 harness 를 해체했다. Taste-Bench 는 궤적을 해체한다: 측정 단위가 실행이기를 그치고 그 안의 분기점이 된다.

그 구성이 옮겨갈 수 있는 부분이다. 같은 과제에 대한 병렬 시도에서 결정 분기점을 채굴하는 데는 사람의 주석도 새 과제 작성도 필요 없다 — 에이전트 벤치마크가 이미 생성하고 버리는 평가 데이터를 읽을 뿐이다. 그래서 이것은 2026-09-18 부터 2026-09-22 까지 사람이 쓴 과제 서술을 제거한 네 논문과 같은 계열에 놓이고, 그 계열이 추적되는 곳은 Eval Harness Configuration 이다: 다른 벤치마크가 버린 궤적으로 만든 벤치마크는 그 벤치마크의 harness 를 물려받으며, 여기서도 harness 는 이름이 없다.

증류 쪽 절반은 반대 방향, Agentic Reinforcement Learning 를 가리킨다. 결과를 본 교사가 결과를 볼 수 없는 학생을 지도하는 것은 사후 지도(hindsight supervision) 이고, 그것이 held-out SWE-bench Pro 로 전이된다는 주장이 이 논문의 유일한 종단 증거다.

열린 질문

  • 어느 모델이 59.7% 인가, 그리고 나머지는 몇 점인가? "최고 모델" 이 식별의 전부이며, 벤치마크의 난이도는 수치 하나로 읽히지 않는다.
  • 뒤쪽 근거 결과는 역량 발견인가 답할 수 없는 질문 발견인가?
  • 증류는 얼마를 사는가? 어느 쪽에도 수치가 주어지지 않는다.
  • 자동 분기점 채굴은 더 나은 방향을 알아보기 쉬운 분기점을 선별하지 않는가? 분기점은 한쪽 가지가 더 나은 곳으로 이어졌기 때문에 남는데, 이는 결정 공간이 아니라 실제로 실행된 궤적의 속성이다.
  • 원본 궤적을 만든 harness 는 무엇인가? 늘 그렇듯 이름이 없다.

인용

arXiv 2609.25804, The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks, HuggingFace Daily Papers 2026-09-24, 업보트 111 (snapshot).

Referenced by

Sources