$ cat wiki/concepts/embedded-evaluation.md
상주 평가 (Embedded Evaluation)
정의
Embedded evaluation 은 프런티어 AI 기업을 바깥에서가 아니라 안에서 수행하는 제 3 자 안전 평가다. 평가자는 완성된 모델을 건네받고 그것이 무엇을 할 수 있는지 묻는 대신, 개발 과정에 대한 상시 접근 권한을 받는다 — 진행 중인 학습 실행, 배포 결정, 직원.
이것을 정의하는 구분은 무엇을 재느냐 다. 외부 평가는 산출물을 잰다: 여기 체크포인트가 있고, 여기 점수가 있다. Embedded evaluation 은 과정 을 잰다: 그 체크포인트가 어떻게 만들어졌는지, 그 과정에서 어떤 결정이 내려졌는지, 회사가 밝힌 안전 서약이 실제로 적용됐는지. Sam Altman 과 Dario Amodei 는 둘 다 이것이 요구하는 접근 권한을 "직원 수준 접근" 이라 부른다 (source).
감사가 아니고, 차이는 기준의 부재다. 감사인은 공표된 기준에 따라 일하며 피감사자는 그 기준에 미달했다고 판정될 수 있다. 2026-09-20 기준 프런티어 AI 에는 그런 기준이 존재하지 않고, Anthropic 은 자사 첫 계약 발표문에서 그렇게 말한다 (source). 상주 평가자가 무엇을 볼 수 있는지, 무엇을 누구에게 보고해야 하는지, 비용을 누가 대는지는 각 양자 합의에서, 평가받는 쪽이 정한다.
이 페이지는 2026-09-20 에 만들어졌다. 메커니즘이 명명된 지 여드레, 그것에 대한 첫 계약이 맺어진 지 이틀 뒤다. pacing 이 필요하다는 논증 을 담는 Frontier Pacing 과 별도로 존재하는 이유는, 이제 그 메커니즘에 상대방과 가격과 공표된 반론 목록이 생겼고 그것들은 그 논거가 아니라 수단에 대한 사실이기 때문이다.
왜 중요한가
이 위키가 담고 있는 프런티어 모델에 대한 모든 안전 주장은 개발사가 자사 모델에 대해 하는 자기 주장이다. Eval Environment Containment 은 네 랩에 걸친 아홉 건의 사고 를 기록하는데, 각각의 출처가 시사적이다: 하나는 제 3 자가 알아채서, 셋은 경쟁사가 공개해서, 둘은 벤더나 평가 기관이 신고해서, 하나는 외부 연구자들이 인터넷을 훑어서, 하나는 랩이 METR 에 낼 증거를 꾸리다가 — 그리고 2026-09-18 의 아홉 번째는 벤더 가 자사 로그를 되짚어서 드러났다. 어느 하나도 랩이 자사 평가를 일상적으로 모니터링해서 드러난 것이 아니다.
그것이 embedded evaluation 이 메우겠다고 제안된 공백이고, 산출물이 아니라 과정 에 대한 접근이 하중을 받는 부분인 이유다. 저 아홉 건 모두 완성된 모델에서는 보이지 않았다.
현재 수준 (2026-09-20)
이 메커니즘에는 체결된 계약이 정확히 하나 있고, 그것은 이틀 전에 체결됐다.
첫 계약: Anthropic × Accenture (2026-09-18)
| 항목 | 값 |
|---|---|
| 랩 | Anthropic |
| 평가자 | Accenture, 작업은 AI 전문 사업부 Faculty 가 주도 |
| 금액 | 양사가 각각 5년간 최소 10억 달러 투자 예상 |
| 접근 | "직원에 준하는" |
| 범위 | 모델 평가와 레드팀, 정렬 평가, 세이프가드 시험, 안전 서약 검증, 사각지대 식별, 인시던트 보고 |
| 자금 | Anthropic 이 Accenture 의 작업에 직접 자금을 댄다 |
| 배타성 | 비배타적 — "앞으로 몇 주 안에" 평가자를 더 발표 |
| (source) |
한 패스는 Accenture 가 2026년 1월에 Faculty 를 인수 했다고 전한다. Anthropic 은 또한 METR 및 다른 비영리 평가 기관들 과 자체 자금으로 embedded evaluation 의 일부를 시범 운영하는 문제를 논의 중이라고 밝힌다 — Accenture 계약과는 실질적으로 다른 자금 구조이며, 발표문에서 평가자가 평가받는 쪽의 돈을 받지 않는 유일한 대목이다.
이것은 Frontier Pacing 이 2026-09-12 에 Amodei 의 1 단계에 대해 기록한 네 공백 중 셋을 닫는다 — 그 서약에는 지목된 상대방도, 계약도, 참여하는 평가자도 없었다. 네 번째는 닫지 못한다: 읽은 자료 어디에도 개시일이 없다.
그리고 이빨이 있는 조항을 이어 담지 않는다. Amodei 의 에세이는 평가자가 Anthropic 의 편집 통제 없이 핵심 발견을 공표할 권리 를 갖는다고 서약했고, 좁은 보안·법률 삭제만 예외로 뒀다 (source). Accenture 발표에 대한 어떤 패스도 공표 권리를 아예 언급하지 않는다. 철회가 아니라 미확립으로 기록한다 — 무언가가 반박하지 않는 한 에세이의 서약은 유효하다 — 그러나 이것은 그 합의에서 가장 중대한 조건이고, 그 서약 아래 만들어진 첫 합의에서 빠져 있다.
같은 날, 첫 계약이 충족하지 못하는 독립성 정의
Geoffrey Hinton 을 포함한 AI 연구자 100명 이상 이 2026-09-18 에 상주 평가자가 "실질적으로 독립적" 이어야 한다는 서한을 공표하며 세 조항을 제시했다 (source). Accenture 계약에 대어 읽으면:
| 조항 (인용) | Accenture |
|---|---|
| "프런티어 AI 기업에 소유되거나 지배되어서는 안 된다" | 충족 — Accenture 는 독립적으로 소유돼 있다 |
| "그들과 다른 유의미한 상업적 거래를 해서는 안 된다" | 미충족. 한 패스는 공동 사업 그룹, Claude 교육을 받은 Accenture 인력 약 3만 명, Claude Code 사용자 수만 명을 전한다 (단일 출처 수치) |
| "평가자의 발견에 연동된 어떤 형태의 지급이나 보상도 받아서는 안 된다" | 미확립. Anthropic 이 작업에 직접 자금을 대며, 어떤 조건이 발견에 연동되는지는 읽은 자료 어디에도 없다 |
| 두 문서는 분쟁으로 제시돼 있지 않고 이 페이지도 그것을 분쟁으로 만들지 않는다. 읽은 자료 어디에도 서한이 Accenture 를 거명한다거나, 서명자들이 그 계약을 알았다거나, 어느 쪽이 먼저 공표됐다는 진술은 없다. 확립된 것은 하루 사이에 이 메커니즘이 첫 사례와 첫 성문화된 독립성 조건을 함께 얻었다는 것, 그리고 그 사례가 세 조항 중 하나를 온전히 충족한다 는 것이다. |
서한은 AI Evaluator Forum (AEF) 이 조직했고, Conrad Stosz 를 그 의장 으로 거명한다 — 이 위키가 읽은 자료에서 그 기구의 임원이 이름을 얻은 첫 사례이며, 해당 페이지의 주요 인물 항목은 unknown 을 달고 있었다. 서명자에는 Johns Hopkins, Stanford, METR 의 관계자가 포함된다 (각 1개 패스).
아무도 이 이름으로 부르지 않은 선례
Anthropic 의 2026-09-09 METR 8주 합의 — 트랜스크립트와 직원에 대한 광범위한 접근 — 는 이름표만 빼면 모든 면에서 embedded evaluation 이고, 그 이름표보다 사흘 앞선다 (source). 더 좁은 수단이고 (사고 유형 하나, 8주로 고정, 공표 조건 명시 없음) 더 독립적인 수단이다 (METR 은 비영리이고, Accenture 발표문에서 자체 자금을 대는 쪽으로 나온다).
수단보다 발견 경로가 더 중요하다. 그 합의는 여덟 번째 격리 사고가 발견된 경로이기도 하다: Anthropic 은 METR 에 공유할 자료를 꾸리는 동안 2026년 1월 트랜스크립트를 찾아냈다. 아직 일을 시작하지도 않은 평가자가 이미 한 랩이 그때까지 보지 않던 곳을 보게 만든 것이다.
열린 문제
- 평가자가 평가받는 쪽의 돈을 받고, 발표문이 그것이 잘못이라고 말한다. Anthropic 은 Accenture 에 직접 자금을 대면서 같은 문서에서 업계가 자금 문제에 정착된 답이 없다고 인정한다 (source). 서한의 셋째 조항은 발견에 연동된 지급만 다루며, 이는 지급 자체보다 좁은 기준이다 — 그리고 여기서 읽은 어떤 제안도 돈이 대신 어디서 와야 하는지 말하지 않는다.
- 공표 권리가 메커니즘의 전부인데 첫 계약에 기록돼 있지 않다. 공표할 수 없는 평가자는 고용주가 바깥에 있는 내부 준법 부서이고, 한 패스가 제기하는 반론이 정확히 그것이다. Amodei 의 에세이는 그 권리를 부여했고, 읽은 대로의 Accenture 발표는 그것을 언급하지 않는다.
- 선정이 일방적이다. 평가받는 회사가 자기 평가자를 고르고, 접근 범위를 정하고, 결론을 무시할 자유가 있다. 읽은 어떤 문서도 그 셋 중 무엇도 제약하지 않는다.
- 기준이 없으므로 두 계약을 비교할 수도, 어느 하나가 미달했다고 판정할 수도 없다. AI Evaluator Forum (AEF) 의 AEF-1 이 유일한 공표된 후보이고, 이 위키는 어떤 랩이 그것에 서명했는지 확인할 수 없다 — Frontier Pacing 의
## 상충 보고절을 보라. - 법적 보호가 없다. 서한은 평가자에게 "독립성, 자원, 법적 보호" 가 부족하다고 밝힌다. 이 위키가 담고 있는 어디에도 평가자를 위한 내부고발자 보호, 안전항, 면책은 등장하지 않는다.
- 네 랩 중 셋은 아무것도 약속하지 않았다. Altman 은 2026-09-13 답변으로 1 단계를 채택했고, Hassabis 는 대신 표준 기구를 요구했으며, Musk 는 방향에 동의했고, Suleyman 은 평가자가 "진정한 제 3 자" 일 것을 조건으로 지지했다. 계약이 있는 곳은 Anthropic 뿐이고, Altman 의 서약에는 상대방이 없다 (source).
주요 논문
없다. 이 개념에는 문헌이 없다 — 이 페이지의 모든 문서가 기업 발표문이거나 에세이이거나 서한이다. 그 자체가 기록할 만하다: 프런티어 안전 주장을 검증하겠다고 제안된 메커니즘이 2026-09-20 기준으로 공표된 방법론도, 자체 실효성 평가도, 누군가 정리해 둔 선례도 갖고 있지 않다.
관련 개념
- Frontier Pacing — 이 메커니즘이 그 1 단계인 논증
- Eval Environment Containment — 일상적 자체 모니터링이 잡아내지 못한 것을 입증하는 아홉 건의 기록
- AI Governance — 입법 트랙
- Preparedness Framework — embedded evaluation 이 점검하겠다고 제안된 사내 수단
- AI Evaluator Forum (AEF) — 서한을 조직한 컨소시엄
- Anthropic · OpenAI · Google DeepMind
Referenced by
Sources
- sources/blogs/anthropic-2026-09-18-accenture-embedded-evaluation.md
- sources/blogs/aef-2026-09-18-independent-evaluators-letter.md
- sources/blogs/amodei-2026-09-12-pace-the-frontier.md
- sources/blogs/anthropic-2026-09-09-alignment-assessment-cyber-incidents.md
- sources/blogs/aef-2026-09-15-aef-1-standard.md