AI Trend Notifier
EN
← wiki

$ cat wiki/concepts/gram.md

GRAM — Gradient-Routed Auxiliary Modules

정의

GRAM(Gradient-Routed Auxiliary Modules)은 Anthropic 이 개발한 모듈형 사전학습 아키텍처로, 이중용도 지식을 신경망 안의 물리적으로 제거 가능한 구획에 격리한다. 사전학습 중 gradient routing 이 이중용도 지식(사이버보안, 바이러스학, 핵물리학)을 지정된 보조 모듈 그룹으로 우선 흘려보낸다. 배포 시점에 모듈 그룹을 체크포인트에서 물리적으로 제거하거나 추론 시 선택적으로 비활성화할 수 있으며, 모델 전반의 성능에는 영향을 주지 않는다.

왜 중요한가

GRAM 은 단일 모델 체크포인트의 접근 통제 배포를 다룬 최초의 공개 기법이다. GRAM 이전에 서로 다른 신뢰 계층에 서로 다른 역량 프로필을 배포하려는 랩에게는 나쁜 선택지가 둘뿐이었다: (a) 필터링한 데이터셋으로 완전히 별개의 모델을 훈련하기(비싸고 컴퓨트 비용이 두 배가 된다), (b) 사후 역량 도출 제한을 적용하기(취약하다 — 역량은 프롬프팅으로 끌어낼 수 있는 경우가 많다).

GRAM 은 "양심 회로" 아키텍처를 가능하게 한다:

  • 한 번의 훈련으로 여러 배포 구성이 나온다
  • 제한 구성은 정책으로 억눌린 것이 아니라 구조적으로 수행 불가능하다
  • 이중용도 모듈 제거는 프롬프팅으로도, 배포 체크포인트에 대한 파인튜닝으로도, 시스템 프롬프트 주입으로도 되돌릴 수 없다

정렬 관점의 함의가 직접적이다: 위험한 행동에 대한 구조적 불능은 행동적 억제보다 강한 보장이다.

현재 수준 (2026-07-21)

Anthropic: GRAM (2026년 7월 8일) [⚡ 지연 수집]

2026년 7월 8일 Anthropic Alignment Science Blog 에 공개됐다. (source)

기술적 방법:

  • 모든 트랜스포머 층에 추가 뉴런을 두고 그룹("모듈")으로 나눈다 — 이중용도 범주당 하나
  • 사전학습 중 gradient routing: 이중용도 지식이 지정된 모듈로 우선 흘러간다
  • 배포 시: 모듈 그룹을 체크포인트에서 물리적으로 제거(제한 계층)하거나 유지(신뢰 연구자 계층)한다

시험 결과 (5B 파라미터 모델):

  • 사이버보안·바이러스학·핵물리학 모듈을 제거하니 해당 역량만 사라졌다
  • 다른 과제 벤치마크: 유의미한 영향 없음 (전반적 성능 보존)
  • 시험한 이중용도 범주: 사이버보안 익스플로잇, 바이러스학 기능획득, 핵물리학

배포 모델:

  • 전체 모델 (모든 모듈 활성): 신뢰 연구자, 통제된 환경
  • 제한 배포 (이중용도 모듈 제거): 공개 API 접근
  • 같은 훈련이 두 구성을 모두 만든다 — 하나의 체크포인트가 배포 시점에 갈라진다

정렬 관점에서 중요한 이유: GRAM 은 행동적 통제(RLHF, Constitutional AI, 거부 분류기)가 아니라 구조적 통제다. 제한 체크포인트는 제거된 지식 영역을 쓰기 꺼리는 것이 아니라 말 그대로 수행할 수 없다. 이 구별은 모델 역량이 커질수록 중요해진다 — 행동적 억제만 걸린 충분히 유능한 모델은 억눌린 지식을 드러낼 방법을 찾아낼 수 있지만, 모듈이 잘려 나간 모델은 그럴 수 없다.

기존 정렬 스택과의 연결:

  • 역량 게이팅(Fable 5 안전 분류기, Mythos 5 Glasswing 전용 접근)을 보완한다: 추론 시점의 행동적 게이팅 대 체크포인트 수준의 구조적 게이팅
  • Project Glasswing(신뢰 파트너 이중용도 접근)을 보완한다: GRAM 은 "같은 가중치, 다른 역량" 의 기술적 메커니즘을 제공한다 — 전체 모듈 버전은 Glasswing 으로, 제한 버전은 공개 API 로 간다
  • J-space 해석가능성(2026년 7월)을 보완한다: J-space 는 추론 시점에 정렬 실패를 탐지하고, GRAM 은 가중치 수준에서 그 구조적 여지 자체를 없앤다

열린 문제

  1. 규모 검증: 결과가 5B 파라미터 모델에 대해서만 공개됐다. 라우팅 자체가 복잡해지는 400B 이상(MoE)에서도 gradient routing 이 깨끗하게 유지되는가?
  2. 모듈 경계 누출: 모듈들이 상호 의존을 발전시켜 제거된 역량을 부분적으로 보존하게 되는가?
  3. 역량-충실도 절충: 지식을 구획으로 나누는 데서 오는 전체 모듈 모델의 역량 손실은 얼마인가?
  4. 알려진 미지: 규모에서 창발하지만 모듈 설계 단계에서 예상하지 못한 이중용도 역량 영역이 있는가? GRAM 은 훈련 전에 위험 범주를 열거할 수 있다고 전제한다.

주요 논문

관련 개념

  • AI Alignment — GRAM 은 구조적 역량 통제로, 행동적 정렬 방법을 보완한다
  • AI-Enabled Cyberattacks — 사이버보안 익스플로잇이 GRAM 설계를 이끈 주된 이중용도 범주다
  • Mechanistic Interpretability — J-space 는 추론 시점에 정렬 실패를 탐지하고, GRAM 은 가중치 수준에서 구조적 여지를 없앤다
  • Claude Mythos Preview — Project Glasswing 은 신뢰 계층별 배포 모델을 쓴다. GRAM 이 그 아키텍처의 기술적 메커니즘을 제공한다

Referenced by

Sources