AI Trend Notifier
EN
← wiki

$ cat wiki/people/chris-olah.md

Chris Olah

최신

  • 2026-07-28

    "Pacing the Frontier"

  • 2026-05-25

    교황 레오 14세의 초청으로 회칙 "Magnifica humanitas: 인공지능 시대의 인간 존엄 수호에 관하여" 의 바티칸 발표 자리에서 연설했다. 추기경·신학자들과 함께 발언했다. AI 거버넌스를 위한 교회와 기술 산업 간 기관 협력을 촉구했다. 업계의 …

  • 2026-07-06

    Anthropic 이 A global workspace in language models 를 공개했다. 이 랩이 지금까지 내놓은 가장 중요한 공개 해석가능성 결과로, 내부의 단어 같은 표현들이 이루는 좁은 집합을 J-space 라 부르며 Claude 의 공…

개요

Anthropic 공동창업자. 기계적 해석가능성(mechanistic interpretability) 의 개척자로, 회로와 특징을 들여다봄으로써 신경망이 무엇을 계산하는지 역설계하는 연구 프로그램을 이끈다. AI 안전·해석가능성 분야에서 가장 많이 인용되는 연구자 중 한 명이다.

소속: Anthropic (공동창업자, 연구자); 이전 Google Brain / OpenAI.

왜 중요한가

  • 기계적 해석가능성의 핵심 어휘를 만들거나 함께 발전시켰다: superposition, features as directions, circuits, polysemanticity
  • 2020년 공동 저자들과 낸 "Circuits" 연재가 해석가능성을 엄밀한 하위 분야로 출범시켰다
  • 정렬 연구에 깊이 집중하는 Anthropic 공동창업자로서, 랩 내부의 안전 우선 문화를 대표한다
  • 2026년 5월, 프런티어 랩이 옳은 일을 하는 것과 충돌할 수 있는 인센티브 안에서 움직인다고 공개적으로 인정했다 — 랩 내부자로서는 드문 솔직함이다

주요 기여

  • Circuits 연재 (2020–2024): 비전 모델의 어텐션 헤드, 곡선 검출기, 멀티모달 뉴런을 역설계했다. 해석가능성의 토대가 된 작업이다.
  • Superposition Hypothesis: 모델이 뉴런 수보다 많은 특징을 압축된 중첩 표현으로 담아낸다는 것을 보였다.
  • Features as linear directions: 개념이 모델 가중치에 인코딩되는 기하 구조.
  • Anthropic 해석가능성 팀: Claude 모델에서 대규모 기계적 해석가능성 연구를 수행하는 팀을 만들고 이끈다.

최근 활동

  • 2026-07-28: "Pacing the Frontier" 성명에 Dario Amodei, Jared Kaplan 과 함께 이름이 알려진 서명자로 참여했다. 자동화된 AI 개발을 의도적으로 늦추는 데 필요한 도구를 개발하는 국제적 노력을 미국 정부가 지원해 달라는 요구다. Anthropic 은 다음 날 이 성명을 기관으로서 지지했다. → Frontier Pacing (source)

  • 2026-05-25: 교황 레오 14세의 초청으로 회칙 "Magnifica humanitas: 인공지능 시대의 인간 존엄 수호에 관하여" 의 바티칸 발표 자리에서 연설했다. 추기경·신학자들과 함께 발언했다. AI 거버넌스를 위한 교회와 기술 산업 간 기관 협력을 촉구했다. 업계의 인센티브 충돌을 공개적으로 인정했다. (source)

  • 2026-07-06 — Anthropic 이 A global workspace in language models 를 공개했다. 이 랩이 지금까지 내놓은 가장 중요한 공개 해석가능성 결과로, 내부의 단어 같은 표현들이 이루는 좁은 집합을 J-space 라 부르며 Claude 의 공유 화이트보드로 설명한다. 이 페이지가 서술하는 연구 프로그램이 이름 붙은 메커니즘으로 도착한 것이다 → Mechanistic Interpretability

  • 2026-07-13Claude Values Vary by Model and Language. 같은 프로그램을 메커니즘에서 행동으로 확장한다 → Mechanistic Interpretability

소속

  • Anthropic — 공동창업자, 해석가능성 연구
  • 이전: Google Brain, OpenAI (초기)

외부 링크

Referenced by

Sources