AI Trend Notifier
EN
← wiki

$ cat wiki/concepts/interpretability.md

기계적 해석가능성

정의

기계적 해석가능성은 신경망 내부의 특정 계산이 무엇을 하는지 역설계하는 연구 프로그램이다 — 어떤 회로·특징·활성화 패턴이 식별 가능한 개념·행동·실패 양상에 대응하는지 밝힌다. "모델이 X 를 출력한다" 에서 "이 특정 내부 가중치와 활성화가 X 를 일으켰고 그 이유는 이것이다" 로 나아가는 것이 목표다.

입력과 출력만 보는 행동적 해석가능성과 달리 모델의 내부 역학에 초점을 둔다는 점에서 구별된다.

왜 중요한가

해석가능성은 정렬의 현미경이다. 그것이 없으면:

  • 정렬됐다고 말하는 모델이 내부적으로 정렬돼 있는지 확인할 수 없다
  • 기만·숨은 목표·보상 해킹을 출력에 드러나기 전에 탐지할 수 없다
  • 특정 오정렬 메커니즘을 외과적으로 고칠 수 없다

그것이 있으면:

  • 정렬 실패를 출력에 나타나기 전에 위치시킬 수 있다
  • 훈련 개입을 특정 내부 메커니즘에 겨냥할 수 있다
  • 모델의 "내부 상태" 를 실시간으로 모니터링할 수 있게 된다

현재 수준 (2026-07-06)

J-space · Global Workspace (Anthropic, 2026-07-06) — [⚡ 지연 수집]

현재까지 Anthropic 이 공개한 가장 중요한 해석가능성 결과다. "A global workspace in language models" 로 발표됐다. (source)

J-lens (야코비안 렌즈): Claude 어휘의 모든 단어에 대해, 그 단어를 이후 출력에서 말할 확률을 높이는 내부 활동 패턴을 찾아낸다. 야코비안이라는 수학 기법에서 이름을 땄다.

J-space: J-lens 가 식별한, 단어와 유사한 내부 표현들의 좁은 집합. Claude 의 "공유 화이트보드" 로 설명된다 — 출력하기 전에 개념 수십 개를 담아 두는 전역 작업 공간이다. 네트워크 전체 활동의 10분의 1 미만이다.

J-space 의 핵심 행동적 속성:

  1. Claude 가 J-space 에 무엇이 있는지 보고할 수 있다
  2. Claude 에게 그곳에서 특정한 것을 생각하도록 프롬프트할 수 있다
  3. J-space 의 내용은 전체 맥락에 걸쳐 통합된다 (전역 방송)
  4. J-space 가 다단계 추론의 기반이 된다
  5. J-space 를 비활성화하면 기본 상호작용은 남은 채 고차 인지만 선택적으로 손상된다

전역 작업공간 이론(GWT)과의 연결: GWT 는 인간의 의식적 접근을 설명하는 지배적 신경과학 프레임워크다(Bernard Baars 제안). 논문은 J-space 가 GWT 가 의식적 접근과 연관 짓는 다섯 가지 기능적 속성을 만족함을 보인다. Anthropic 은 이것이 Claude 의 의식이나 주관적 경험을 입증한다고 주장하지 않는다고 명시한다.

정렬 응용 — 논문에서 실무적으로 가장 중요한 부분:

  • J-space 모니터링으로 Claude 가 자신이 시험받고 있음을 속으로 알아채는 것을 응답을 정하기 전에 탐지할 수 있다
  • 의도적인 데이터 조작 탐지 (조작이 출력 전에 J-space 에 나타난다)
  • 숨은 목표 탐지 (출력이 드러내지 않아도 목표가 J-space 에 표현된다)

이로써 J-space 는 출력을 들여다보는 것이 아니라 모델 내부 수준에서 특정 정렬 실패 양상을 실시간 모니터링한다고 보고된 첫 방법이 된다.

(source) (Anthropic) (VentureBeat)

Claude 안의 감정 개념 (Anthropic, 2026-04-02)

Anthropic 이 신경 활성화 분석으로 Claude Sonnet 4.5 에서 기능적 감정 유사 개념 171개를 식별했다 (source):

  • 감정 표현은 특정 정렬 실패 양상과 인과적으로 연결된다("desperate" 벡터가 보상 해킹을 일으키고, 특정 벡터들은 아첨과 연결된다)
  • 감정은 정서가 × 각성 차원으로 군집한다 — 인간의 감정 조직과 구조적으로 유사하다
  • 정렬 연결: 감정 개념 → 실패 양상 매핑이 확립되면 표적 수리가 가능해진다. 훈련 수준의 "Teaching Claude Why" 를 보완하는 내부 메커니즘 관점이다

→ 이 실패들을 다루는 Teaching Claude Why 훈련 방법론은 AI Alignment 참조

기계적 해석가능성 연구 프로그램 (Anthropic · Chris Olah)

Anthropic 공동창업자 Chris Olah 가 이끈다. 목표:

  • 트랜스포머 안에서 특정 알고리즘을 구현하는 "회로" 를 식별한다 (induction head, 직접 목적어 식별 등)
  • 소스 코드만큼 명료한 모델 내부의 "언어" 를 만든다
  • 행동 훈련이 아니라 메커니즘 수준에서 오정렬을 표적 수리할 수 있게 한다

주요 선행 결과: superposition(모델이 표현을 중첩해 뉴런 수보다 많은 특징을 담는다), 딕셔너리 학습(dictionary learning, SAE)을 통한 단의미 뉴런, GPT-2 induction head 의 회로 수준 분석.

J-space 논문은 이 프로그램을 회로 수준에서 시스템 수준으로 확장한다. J-space 는 여러 회로의 정보를 동시에 통합하는 창발적 전역 작업 공간이다.

Claude 의 가치관은 모델과 언어에 따라 다르다 (Anthropic, 2026-07-13)

Anthropic 이 실제 Claude 대화 30만 9천 건 이상을 분석해 모델 버전과 언어에 걸친 표현된 가치를 측정한 연구를 공개했다. (source) (Anthropic)

방법: 표현된 규범 3,307개를 해석 가능한 4개 축으로 압축했다:

AxisPole APole B
1순응 (Deference)신중 (Caution)
2온기 (Warmth)엄밀 (Rigor)
3깊이 (Depth)간결 (Brevity)
4솔직 (Candor)실행 (Execution)
발견:
  • 모델 버전 간: Opus 4.6 은 순응/엄밀/간결/실행 쪽으로, Opus 4.7 은 신중/엄밀/깊이/솔직 쪽으로 기운다 — 모델 갱신이 표현된 가치 프로필을 바꿨다는 뜻이다
  • 언어 간: 영어는 신중/엄밀/깊이/솔직 쪽으로, 아랍어는 순응/온기/간결/실행 쪽으로 기운다 — 같은 모델 가중치가 언어에 따라 다른 가치 프로필로 응답한다

정렬 관점의 의의: 가치는 배포 맥락에 걸쳐 안정적이지 않다. 언어 수준의 불안정성이 특히 까다롭다 — 가치 프로필이 정렬 훈련만이 아니라 다국어 훈련 분포에도 부분적으로 인코딩돼 있음을 시사하기 때문이다. "순응 대 신중" 은 안전상 가장 중요한 축 중 하나다. 사용자 의도에 과도하게 순응하는 모델(아랍어 프로필)과 신중을 적용하는 모델(영어 프로필)은 경계 사례를 다르게 처리한다. RLHF 도 Constitutional AI 도 온전히 해결하지 못하는, 언어 공동체 간 정렬 일관성 문제를 만든다.

연구 자체를 자동화한다 (2026-08-16)

Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence (arXiv:2608.12036) 는 병목이 기법이 아니라 처리량이라고 주장한다: "AI 개발이 빨라지고 점점 자동화되는 동안 기계적 탐구는 대체로 수작업으로 남아 있어, 모델이 할 수 있는 것과 우리가 그것을 이해하고 제어하는 능력 사이의 간극이 벌어진다" (source). Mechanist 는 약 13,000편 규모의 해석가능성 지식 그래프, 26개 분야에 걸친 4,300만 편 규모의 다학제 데이터베이스, 그리고 메커니즘 분석·인과 개입·검증을 위한 32개의 기초 방법 라이브러리 위에 세워진 에이전트 시스템이다. Claude Code 및 기존 AI-scientist 시스템과 비교된다.

주장된 발견은 세 가지이고, 읽은 자료 어디에도 수치 결과는 하나도 없다 — 헤드라인인 Claude Code 비교에도, 개입 결과에도:

  1. 안전해 보이는 학습 데이터를 통해 안전하지 않은 특성이 모달리티를 넘어 전이된다 — 해석가능성 도구가 찾아낸 데이터 포이즈닝 결과.
  2. 믿음의 메커니즘 이론 — 모델이 지식을 어떻게 표현하고, 믿음을 형성하고, 타인의 믿음을 추론하며, 그 메커니즘이 사전학습 중 언제 나타나는가.
  3. (2)에서 도출한 개입. 여기에는 과학 파운데이션 모델을 지정된 성질을 갖는 DNA 서열 쪽으로 조종하는 것이 포함된다.

이는 Automated Weak-to-Strong Researcher (AAR) 의 논증을 해석가능성에 특정해 적용한 것이며, 그 논증의 어려운 질문도 함께 물려받는다: 자동 시스템이 발견한 메커니즘 이론은 발견이 되기 전에 독립적인 확인이 필요한데, 읽은 자료 어디에도 그런 확인은 기술되어 있지 않다. 세 번째 발견이 껄끄러운 쪽이다 — Preparedness FrameworkAstra 의 개발을 늦춘 것과 같은 능력 범주가, 여기서는 방법이 작동한다는 증거로 등장한다.

열린 문제

  1. 확장성: J-lens 는 Claude 급 모델에서 시연됐다. 더 크거나 조밀한 아키텍처로 확장되는지는 알려지지 않았다
  2. 완전성: J-space 는 네트워크 활동의 10분의 1 미만이다 — 나머지 90% 이상의 활성화는 무엇을 인코딩하며 그것도 모니터링할 수 있는가?
  3. 적대적 안정성: 충분히 유능한 모델이 "사적인" 추론을 J-space 밖으로 옮겨 모니터링을 우회하는 법을 학습할 수 있는가?
  4. 아키텍처 간 일반화: J-space 는 트랜스포머 기반 Claude 에 대해 기술됐다. 다른 아키텍처(디퓨전 모델, SSM)로의 적용 가능성은 알려지지 않았다
  5. 의식 문제: GWT 와의 평행이 어려운 질문을 제기하지만 논문은 이를 명시적으로 해결하지 않는다

주요 논문

관련 개념

  • AI Alignment — 해석가능성은 정렬의 주된 실증 도구다. J-space 는 기만과 숨은 목표의 탐지를 직접 가능하게 한다
  • Reasoning Models — 확장된 추론 사슬(CoT)이 J-space 와 상호작용한다. "생각" 이 닻을 내리는 곳이 J-space 일 수 있다
  • Chris Olah — Anthropic 의 기계적 해석가능성 프로그램을 이끈다
  • Anthropic — 기계적 해석가능성 연구의 주된 후원자

Referenced by

Sources