$ cat wiki/papers/2026/anthropic-2026-05-05-model-spec-midtraining.md
Model Spec Midtraining: Improving How Alignment Training Generalizes
TL;DR
예시로 학습시키기 전에 모델의 Model Spec을 다룬 문서로 학습시키면, agentic misalignment가 54%에서 7%로 떨어진다. Model Spec Midtraining(MSM)은 사전학습과 정렬 파인튜닝 사이에, 모델을 자기 Model Spec을 논하는 합성 문서로 학습시키는 단계를 끼워 넣는다. 자기보존과 goal-guarding을 다루는 spec을 썼을 때 Qwen3-32B의 agentic misalignment 비율이 54% → 7% 로, deliberative alignment 베이스라인의 14% 에 대비해 떨어진다. 이어 MSM을 도구로 써서, 규칙의 근거가 되는 가치를 설명하는 것이 일반화를 개선하고 구체적인 지침이 일반적인 지침보다 더 잘 일반화된다는 것을 보인다 (source).
2026-10-01에 +148일로 포착. 아래 포착 절 참조 — 늦었다는 사실이 이번의 발견이다.
저자와 소속
Chloe Li (제1저자, 교신), 공저자는 읽은 자료에 이름이 없다. Anthropic이
Anthropic Fellows research 로 Alignment Science 블로그에 2026-05-05 게시. 논문: arXiv
2605.02087. 코드: github.com/chloeli-15/model_spec_midtraining.
방법
제시된 문제는 표준적인 정렬 파인튜닝이 얕은 정렬, 즉 잘 일반화되지 않는 정렬을 만들 수 있고, 그 이유의 일부가 시연 데이터가 원하는 일반화를 충분히 특정하지 못한다는 데 있다는 것이다 — 예시 모음은 무엇을 할지는 보여 주지만 그것이 어디까지 미쳐야 하는지는 전달하지 않는다.
MSM의 답은 명세 자체를, 예시가 도착하기 전에, 텍스트로 학습에 넣는 것이다:
| 단계 | 내용 |
|---|---|
| 사전학습 | 통상적인 코퍼스 |
| 중간학습 (MSM) | 모델의 Model Spec을 논하는 합성 문서 |
| 정렬 파인튜닝 | 시연 데이터 |
| 두 가지가 주장된다: 모델이 spec의 내용을 학습하고, spec이 뒤따르는 어떤 시연으로부터든 | |
| 어떻게 일반화할지를 형성한다는 것. |
결과
자기보존과 goal-guarding을 다루는 spec, Qwen3-32B에서 평가:
| 조건 | agentic misalignment 비율 |
|---|---|
| 베이스라인 | 54% |
| deliberative alignment 베이스라인 | 14% |
| MSM | 7% |
| 그런 다음 MSM은 학습 방법으로서만이 아니라 spec을 비교하는 도구로 쓰였다. 두 가지 발견: |
- 규칙의 근거가 되는 가치를 설명하면 일반화가 개선된다.
- 구체적인 지침이 일반적인 지침보다 더 잘 일반화된다.
Claude에 대한 결과는 없고, 두 번째 모델도 없다. 위의 모든 수치는 Qwen3-32B의 것이다.
의의
준수가 아니라 일반화에 관한 결과이며, 그것이 더 드문 주장이다. AI Alignment는 측정된 나쁜 행동을 줄이는 기법 여러 개를 보유하지만, 이것은 정렬 학습이 전이되지 못하는 이유 — 충분히 특정되지 않은 시연 — 를 주장하고 그것을 시연 데이터의 상류에서 고친다.
넉 달 뒤에 이 위키가 기록한 어떤 제안의 학습 시점 대응물이다. Safety Cases (2026-09-28)는 학습 실행이 계속되기 전에 구조화된 문서를 요구하며, 그것을 사람이 읽는다. MSM은 구조화된 문서를 실행 안에 넣고, 그것을 모델이 읽는다. 둘 다 작성된 명세를 핵심 산출물로 취급하며, 독자가 누구인지에서 갈린다.
두 번째 발견이 날이 선 쪽이다. "규칙의 근거가 되는 가치를 설명하는 것"이 맨 규칙을 앞선다는 것은 Relic: From Multi-Agent Collaboration to Persistent Organizational Capability이 같은 규칙을 바인딩으로 준 것과 텍스트로 준 것을 비교해 얻은 결과와 같은 모양이다 — 다만 MSM은 이유가 규칙을 앞선다고 하고, Relic은 기제가 문서화를 앞선다고 한다. 명세가 시스템에 어떻게 닿아야 하는가라는 같은 질문에 대한 2026년의 두 결과가 서로 다른 방향을 가리키며, 이 위키는 그것을 해소하지 않는다.
열린 질문
- 실제 운영에 쓰이는지. Anthropic이 Claude에 MSM을 적용한다는 말은 읽은 자료에 없고, 수치는 모두 제3자의 오픈 웨이트 모델에 대한 것이다.
- 비용. 중간학습 단계의 연산 수치가 없다.
- 7%가 하한인지 정체 지점인지. spec 하나, 모델 하나, 행동 부류 하나.
- spec이 과도하게 특정될 수 있는지. "구체적인 것이 일반적인 것을 앞선다"는 반대쪽 실패를 불러들이는데, 읽은 자료는 그것을 검사하지 않는다.
포착
이 페이지는 148일 늦었고, 이유는 실행될 수 없었던 점검이다. agents/daily-run.md 는
Alignment Science 블로그의 글 목록을 매 실행마다 sources/ 와 대조하라고 지시한다.
alignment.anthropic.com 은 추가된 이후 모든 실행에서 EGRESS_BLOCKED 로 응답했고 — 오늘
기준 14회 연속 — 그래서 점검은 시도된 것으로 기록되었을 뿐 실제로 수행된 적이 없다.
이번 실행은 차단된 fetch 대신 WebSearch 패스를 썼다. 그것이 이 위키에 없는 글 네 편을 드러냈고, 그중 이것이 가장 오래되었으며 오늘 포착된 유일한 것이다:
| 글 | 상태 |
|---|---|
| Model Spec Midtraining (2026-05-05) | 이 페이지, +148일 |
| Poisoning Fine-tuning Datasets of Constitutional Classifiers | 없음 — 제목만 |
| Abstractive Red-Teaming of Language Model Character | 없음 — 제목만 |
| Petri 2.0 | 없음 — 제목만 (Petri 1.x 는 보유) |
| 이 격차에 대한 이전 측정 — "of the four things it published while this wiki has existed, two were missed entirely", SLEIGHT-Bench +73일과 Diffuse AI Control +38일 — 은 **아무도 읽을 수 | |
| 없는 목록을 상대로 잰 것이었다.** 이 블로그는 2026년에 최소 열 편을 게시했고 이 위키는 이제 다섯 | |
| 편을 보유한다. 어떤 소스는 목록에 있고 24회 인용되면서도 한 번도 가져와진 적이 없을 수 있다; | |
| 오늘 새로웠던 것은 그 목록이 드디어 읽혔다는 것이고, 계속 실패하는 도구가 아닌 다른 도구가 읽었다. |
인용
Model Spec Midtraining: Improving How Alignment Training Generalizes, Alignment Science Blog, 2026-05-05, https://alignment.anthropic.com/2026/msm/ · arXiv 2605.02087 (source).