AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2608.16747-chive.md

Would this change your answer? Evaluating Explanations of LLM Behavior In The Wild with Counterfactual Experiments

paper갱신 2026-08-27생성 2026-08-27

TL;DR

Anthropic 은 모델 행동에 대한 설명을 판정하는 기준으로 반사실 시뮬레이션 가능성을 제안한다 — 그 설명이 편집된 관련 입력에서 모델이 무엇을 할지 예측하게 해 주는가 — 그리고 그런 설명을 대규모로 생성하는 CHIVE 를 만든다. 연구된 모든 해석가능성 기법이 아무런 이득을 주지 않았다: 활성값을 읽는 도구를 쥔 에이전트가 트랜스크립트만 읽은 에이전트보다 나은 예측을 하지 못했다.

저자와 소속

Adam Karvonen, Euan Ong, Subhash Kantamneni, Samuel Marks — Anthropic Alignment Science. arXiv 2608.16747, 2026-08-17 제출; Alignment Science 블로그에 "Would This Change Your Answer?" 로 게시 (source).

방법

CHIVECounterfactual Hypothesis Investigation Via Edits — 는 두 단계로 움직이는 에이전트 파이프라인이다: 실제 사용 환경에서 예상 밖의 모델 행동을 찾고, 각각에 대해 프롬프트를 편집해 제시된 설명이 무엇이 바뀌는지를 예측하는지 본다. 기준은 새로 만든 것이 아니라 빌려 온 것이다: 설명은 기계적으로 만족스러운지가 아니라 관련된 반사실 입력에서의 행동을 예측하는 데 쓸모 있는지로 판정된다. 산출물은 "자연 발생 모델 행동에 대한 수천 건의 고품질 설명과 그것을 뒷받침하는 반사실 증거"로 보고된다 (source).

이 프레이밍에서 짚어 둘 것이 둘이다. in the wild 는 행동이 구성된 것이 아니라 발견된 것이라는 뜻이며, 이는 56개 모델을 알려진 목표 행동을 숨기도록 파인튜닝하는 Anthropic 자신의 AuditBench 설계와 정반대다. 그리고 척도가 예측적이므로, 설명은 우아하면서도 실패할 수 있다.

결과

  1. 연구된 어떤 해석가능성 기법도 이득을 주지 않았다. 활성값을 읽는 도구를 받은 에이전트가 트랜스크립트만 받은 에이전트보다 반사실 실험 결과를 더 잘 예측하지 못했다.
  2. CHIVE 산출물로 학습하면 일반화한다. CHIVE 가 생성한 반사실 실험의 결과를 예측하도록 학습된 모델은 빠진 설정, 분포 밖 설정으로 전이한다.

읽은 어떤 자료에도 수치 결과가 없다 — 정확도도, 효과 크기도, 비교에 들어간 해석가능성 기법의 목록도 없다. 위의 발견은 저자들이 말하는 방향이지 측정된 크기가 아니며, 그 공백이 이 페이지가 표를 싣지 않는 이유다.

의의

이는 일주일 사이 Anthropic 이 자사 정렬 도구에 대해 내놓은 두 번째 부정적 결과다. 첫 번째는 Fine-Tuned Lie Detectors Failed to Generalize (2026-08-21) 로, on-policy 거짓말로 학습한 탐지기가 분포 밖에서 AUROC ~0.70–0.75 로 떨어지고 더 큰 모델의 zero-shot 프롬프팅에 자주 그대로 밀렸다. 둘을 함께 읽으면 모양이 같다: 목적 설계된 도구가 범용 도구를 이기지 못하고, 두 경우 모두 모델 자신의 출력을 읽는 쪽이 내부를 읽는 쪽과 경쟁이 되었다.

AuditBench (2026-03-10) 와도 같은 편에 선다. 그 벤치마크는 스캐폴딩된 블랙박스 도구가 전반적으로 가장 효과적이고 화이트박스 해석가능성 도구는 "주로 쉬운 대상에서" 도움이 된다고 보고했다. 이제 Anthropic 의 독립적인 측정 셋이 같은 방향을 가리키며, 이는 그중 어느 하나보다 강한 주장이다. 이 위키는 Mechanistic Interpretability 를 "정렬 검증의 일차적 경험 도구"라고 서술하는데, 과제 — 반사실 행동 예측 — 에서는 그 주인 랩 자신의 보고에 따라 아직 그 서술을 벌지 못하고 있다.

건설적인 절반도 그만큼 중요하다. 설명을 대규모로 생성하고 예측적으로 채점할 수 있다면, 설명의 품질은 취향의 문제가 아니라 학습 가능한 목표가 된다 — 그리고 일반화 결과는 그 목표가 전이한다고 말한다.

열린 질문

  • 어떤 해석가능성 기법들을, 어떤 규모에서 비교했는가? "연구된 어떤 것도 이득이 없었다"는 그 목록만큼만 강한 주장이고, 목록은 읽지 못했다.
  • 절대 예측 정확도는 얼마인가? 도구를 쥔 쪽과 아닌 쪽의 동점은 90% 에서와 55% 에서 서로 다른 발견이다.
  • "이 과제에서 이득이 없다"가 일반화되는가, 아니면 프롬프트 편집 하의 반사실 예측이 애초에 활성값이 맞는 도구가 아니었던 과제인가? 이 논문 자신의 긍정적 결과 — 행동 예측이 학습 가능하다는 것 — 은 해석가능성이 다른 곳에서 중요하다는 것과 양립한다.
  • 이 부정적 결과는 사전 등록되었는가? 읽은 자료에는 언급이 없다.

인용

Karvonen, A., Ong, E., Kantamneni, S., Marks, S. Would this change your answer? Evaluating Explanations of LLM Behavior In The Wild with Counterfactual Experiments. arXiv:2608.16747, 2026-08-17. abs · Alignment Science blog · capture

Referenced by

Sources