$ cat wiki/people/chris-olah.md
Chris Olah
최신
- 2026-07-28
"Pacing the Frontier"
- 2026-05-25
교황 레오 14세의 초청으로 회칙 "Magnifica humanitas: 인공지능 시대의 인간 존엄 수호에 관하여" 의 바티칸 발표 자리에서 연설했다. 추기경·신학자들과 함께 발언했다. AI 거버넌스를 위한 교회와 기술 산업 간 기관 협력을 촉구했다. 업계의 …
- 2026-07-06
Anthropic 이 A global workspace in language models 를 공개했다. 이 랩이 지금까지 내놓은 가장 중요한 공개 해석가능성 결과로, 내부의 단어 같은 표현들이 이루는 좁은 집합을 J-space 라 부르며 Claude 의 공…
개요
Anthropic 공동창업자. 기계적 해석가능성(mechanistic interpretability) 의 개척자로, 회로와 특징을 들여다봄으로써 신경망이 무엇을 계산하는지 역설계하는 연구 프로그램을 이끈다. AI 안전·해석가능성 분야에서 가장 많이 인용되는 연구자 중 한 명이다.
소속: Anthropic (공동창업자, 연구자); 이전 Google Brain / OpenAI.
왜 중요한가
- 기계적 해석가능성의 핵심 어휘를 만들거나 함께 발전시켰다: superposition, features as directions, circuits, polysemanticity
- 2020년 공동 저자들과 낸 "Circuits" 연재가 해석가능성을 엄밀한 하위 분야로 출범시켰다
- 정렬 연구에 깊이 집중하는 Anthropic 공동창업자로서, 랩 내부의 안전 우선 문화를 대표한다
- 2026년 5월, 프런티어 랩이 옳은 일을 하는 것과 충돌할 수 있는 인센티브 안에서 움직인다고 공개적으로 인정했다 — 랩 내부자로서는 드문 솔직함이다
주요 기여
- Circuits 연재 (2020–2024): 비전 모델의 어텐션 헤드, 곡선 검출기, 멀티모달 뉴런을 역설계했다. 해석가능성의 토대가 된 작업이다.
- Superposition Hypothesis: 모델이 뉴런 수보다 많은 특징을 압축된 중첩 표현으로 담아낸다는 것을 보였다.
- Features as linear directions: 개념이 모델 가중치에 인코딩되는 기하 구조.
- Anthropic 해석가능성 팀: Claude 모델에서 대규모 기계적 해석가능성 연구를 수행하는 팀을 만들고 이끈다.
최근 활동
-
2026-07-28: "Pacing the Frontier" 성명에 Dario Amodei, Jared Kaplan 과 함께 이름이 알려진 서명자로 참여했다. 자동화된 AI 개발을 의도적으로 늦추는 데 필요한 도구를 개발하는 국제적 노력을 미국 정부가 지원해 달라는 요구다. Anthropic 은 다음 날 이 성명을 기관으로서 지지했다. → Frontier Pacing (source)
-
2026-05-25: 교황 레오 14세의 초청으로 회칙 "Magnifica humanitas: 인공지능 시대의 인간 존엄 수호에 관하여" 의 바티칸 발표 자리에서 연설했다. 추기경·신학자들과 함께 발언했다. AI 거버넌스를 위한 교회와 기술 산업 간 기관 협력을 촉구했다. 업계의 인센티브 충돌을 공개적으로 인정했다. (source)
-
2026-07-06 — Anthropic 이 A global workspace in language models 를 공개했다. 이 랩이 지금까지 내놓은 가장 중요한 공개 해석가능성 결과로, 내부의 단어 같은 표현들이 이루는 좁은 집합을 J-space 라 부르며 Claude 의 공유 화이트보드로 설명한다. 이 페이지가 서술하는 연구 프로그램이 이름 붙은 메커니즘으로 도착한 것이다 → Mechanistic Interpretability
-
2026-07-13 — Claude Values Vary by Model and Language. 같은 프로그램을 메커니즘에서 행동으로 확장한다 → Mechanistic Interpretability
소속
- Anthropic — 공동창업자, 해석가능성 연구
- 이전: Google Brain, OpenAI (초기)
외부 링크
- Distill.pub (해석가능성 아티클)
- Anthropic Interpretability Research