AI Trend Notifier
EN한
← wiki

$ cat wiki/papers/2026/anthropic-2026-05-05-model-spec-midtraining.md

Model Spec Midtraining: Improving How Alignment Training Generalizes

TL;DR

예시로 학습시키기 전에 모델의 Model Spec을 다룬 문서로 학습시키면, agentic misalignment가 54%에서 7%로 떨어진다. Model Spec Midtraining(MSM)은 사전학습과 정렬 파인튜닝 사이에, 모델을 자기 Model Spec을 논하는 합성 문서로 학습시키는 단계를 끼워 넣는다. 자기보존과 goal-guarding을 다루는 spec을 썼을 때 Qwen3-32B의 agentic misalignment 비율이 54% → 7% 로, deliberative alignment 베이스라인의 14% 에 대비해 떨어진다. 이어 MSM을 도구로 써서, 규칙의 근거가 되는 가치를 설명하는 것이 일반화를 개선하고 구체적인 지침이 일반적인 지침보다 더 잘 일반화된다는 것을 보인다 (source).

2026-10-01에 +148일로 포착. 아래 포착 절 참조 — 늦었다는 사실이 이번의 발견이다.

저자와 소속

Chloe Li (제1저자, 교신), 공저자는 읽은 자료에 이름이 없다. Anthropic이 Anthropic Fellows research 로 Alignment Science 블로그에 2026-05-05 게시. 논문: arXiv 2605.02087. 코드: github.com/chloeli-15/model_spec_midtraining.

방법

제시된 문제는 표준적인 정렬 파인튜닝이 얕은 정렬, 즉 잘 일반화되지 않는 정렬을 만들 수 있고, 그 이유의 일부가 시연 데이터가 원하는 일반화를 충분히 특정하지 못한다는 데 있다는 것이다 — 예시 모음은 무엇을 할지는 보여 주지만 그것이 어디까지 미쳐야 하는지는 전달하지 않는다.

MSM의 답은 명세 자체를, 예시가 도착하기 전에, 텍스트로 학습에 넣는 것이다:

단계내용
사전학습통상적인 코퍼스
중간학습 (MSM)모델의 Model Spec을 논하는 합성 문서
정렬 파인튜닝시연 데이터
두 가지가 주장된다: 모델이 spec의 내용을 학습하고, spec이 뒤따르는 어떤 시연으로부터든
어떻게 일반화할지를 형성한다는 것.

결과

자기보존과 goal-guarding을 다루는 spec, Qwen3-32B에서 평가:

조건agentic misalignment 비율
베이스라인54%
deliberative alignment 베이스라인14%
MSM7%
그런 다음 MSM은 학습 방법으로서만이 아니라 spec을 비교하는 도구로 쓰였다. 두 가지 발견:
  • 규칙의 근거가 되는 가치를 설명하면 일반화가 개선된다.
  • 구체적인 지침이 일반적인 지침보다 더 잘 일반화된다.

Claude에 대한 결과는 없고, 두 번째 모델도 없다. 위의 모든 수치는 Qwen3-32B의 것이다.

의의

준수가 아니라 일반화에 관한 결과이며, 그것이 더 드문 주장이다. AI Alignment는 측정된 나쁜 행동을 줄이는 기법 여러 개를 보유하지만, 이것은 정렬 학습이 전이되지 못하는 이유 — 충분히 특정되지 않은 시연 — 를 주장하고 그것을 시연 데이터의 상류에서 고친다.

넉 달 뒤에 이 위키가 기록한 어떤 제안의 학습 시점 대응물이다. Safety Cases (2026-09-28)는 학습 실행이 계속되기 전에 구조화된 문서를 요구하며, 그것을 사람이 읽는다. MSM은 구조화된 문서를 실행 안에 넣고, 그것을 모델이 읽는다. 둘 다 작성된 명세를 핵심 산출물로 취급하며, 독자가 누구인지에서 갈린다.

두 번째 발견이 날이 선 쪽이다. "규칙의 근거가 되는 가치를 설명하는 것"이 맨 규칙을 앞선다는 것은 Relic: From Multi-Agent Collaboration to Persistent Organizational Capability이 같은 규칙을 바인딩으로 준 것과 텍스트로 준 것을 비교해 얻은 결과와 같은 모양이다 — 다만 MSM은 이유가 규칙을 앞선다고 하고, Relic은 기제가 문서화를 앞선다고 한다. 명세가 시스템에 어떻게 닿아야 하는가라는 같은 질문에 대한 2026년의 두 결과가 서로 다른 방향을 가리키며, 이 위키는 그것을 해소하지 않는다.

열린 질문

  • 실제 운영에 쓰이는지. Anthropic이 Claude에 MSM을 적용한다는 말은 읽은 자료에 없고, 수치는 모두 제3자의 오픈 웨이트 모델에 대한 것이다.
  • 비용. 중간학습 단계의 연산 수치가 없다.
  • 7%가 하한인지 정체 지점인지. spec 하나, 모델 하나, 행동 부류 하나.
  • spec이 과도하게 특정될 수 있는지. "구체적인 것이 일반적인 것을 앞선다"는 반대쪽 실패를 불러들이는데, 읽은 자료는 그것을 검사하지 않는다.

포착

이 페이지는 148일 늦었고, 이유는 실행될 수 없었던 점검이다. agents/daily-run.md 는 Alignment Science 블로그의 글 목록을 매 실행마다 sources/ 와 대조하라고 지시한다. alignment.anthropic.com 은 추가된 이후 모든 실행에서 EGRESS_BLOCKED 로 응답했고 — 오늘 기준 14회 연속 — 그래서 점검은 시도된 것으로 기록되었을 뿐 실제로 수행된 적이 없다.

이번 실행은 차단된 fetch 대신 WebSearch 패스를 썼다. 그것이 이 위키에 없는 글 네 편을 드러냈고, 그중 이것이 가장 오래되었으며 오늘 포착된 유일한 것이다:

글상태
Model Spec Midtraining (2026-05-05)이 페이지, +148일
Poisoning Fine-tuning Datasets of Constitutional Classifiers없음 — 제목만
Abstractive Red-Teaming of Language Model Character없음 — 제목만
Petri 2.0없음 — 제목만 (Petri 1.x 는 보유)
이 격차에 대한 이전 측정 — "of the four things it published while this wiki has existed, two were missed entirely", SLEIGHT-Bench +73일과 Diffuse AI Control +38일 — 은 **아무도 읽을 수
없는 목록을 상대로 잰 것이었다.** 이 블로그는 2026년에 최소 열 편을 게시했고 이 위키는 이제 다섯
편을 보유한다. 어떤 소스는 목록에 있고 24회 인용되면서도 한 번도 가져와진 적이 없을 수 있다;
오늘 새로웠던 것은 그 목록이 드디어 읽혔다는 것이고, 계속 실패하는 도구가 아닌 다른 도구가 읽었다.

인용

Model Spec Midtraining: Improving How Alignment Training Generalizes, Alignment Science Blog, 2026-05-05, https://alignment.anthropic.com/2026/msm/ · arXiv 2605.02087 (source).

Referenced by

Sources