$ cat wiki/concepts/safety-monitoring-retention.md
안전 모니터링과 데이터 보관
정의
프런티어 랩이 가장 강력한 모델의 오남용을 탐지하기 위해 고객의 프롬프트와 출력을 보관해야 하는가 — 그리고 보관해야 한다면, 얼마나 오래, 어떤 접근 통제 아래, 고객에게 어떤 거부권을 주고 보관하는가.
이 질문은 탐지가 요청 단위 에서 요청 간 으로 옮겨간 뒤에야 실질적이 됐다. 프롬프트 하나를 채점하는 분류기는 요청이 끝난 뒤 아무것도 필요로 하지 않는다. 연관된 상호작용들에 걸친 패턴을 탐지하는 것 — 두 랩이 이제 프런티어에서 가장 중요하다고 말하는 오남용 형태 — 은 한 요청을 다른 요청들과 대조하는 일이고, 그러려면 그것들을 갖고 있어야 한다 (source).
Zero Data Retention(ZDR) 은 요청 처리 후 제공자가 아무것도 보관하지 않는다는 엔터프라이즈 약정이다. 이 문제보다 앞서 존재했고 2026년까지는 평범한 조달 체크박스였다. 프런티어 모델의 안전 논거가 그것을 다투는 첫 사례다.
왜 중요한가
두 프런티어 랩이 열 주 간격으로 같은 문제에 정반대의 구조적 입장 을 취했고, 각자 자기 입장이 안전을 위해 필요하다고 말한다:
| Anthropic | OpenAI | |
|---|---|---|
| 입장 | 보관이 안전에 필요하다 | 보관은 안전에 필요하지 않다 |
| 기제 | 모든 Mythos-class 트래픽 30일 보관 | Private Safety Processing — 좁은 신호, 콘텐츠 비노출 |
| 고객의 기존 ZDR 계약에 대한 효과 | 해당 트래픽에 대해 무효화, 거부권 없음 | 유지; ZDR 은 사전 승인으로 부여 |
| 범위 | 1자·3자 표면 모두, 모든 트래픽 | 적격 엔터프라이즈/API 엔드포인트만 |
| 상태 | 2026-06-09 부터 시행 중; 2026-08-20 보도된 변경은 아직 출시 전 | 초기 고객 대상 프리뷰; 롤아웃과 백서는 2026년 9월 예정 |
| 소비자 플랜 | 영향 없음 — 이미 보관 중 | 대상 아님 |
| 소스: | ||
| (Anthropic), | ||
| (OpenAI), | ||
| (Anthropic 변경, 보도). |
각자가 실제로 내놓은 것의 비대칭은 이 페이지가 쓰인 지 스물네 시간 만에 움직였고, 그 방향이 뉴스다. 2026-08-20 Bloomberg 는 Anthropic 이 엔터프라이즈 고객이 보관된 데이터를 자사 클라우드 인프라에 보유 할 수 있게 할 계획이며 30일 요건 자체는 그대로라고 보도했다 (source). 따라서 Anthropic 쪽도 이제 계획 이고, OpenAI 가 하루 전 프리뷰한 기제 — 고객이 통제하는 인프라 — 로 수렴한다.
수렴을 넘어 살아남는 것은 전제이며, 그것이 추적할 대상이다. 두 랩 모두 프런티어 위험이 단일 프롬프트–응답 쌍이 아니라 상호작용 전반에 드러난다고 여전히 주장하고, 둘 다 이제 고객이 콘텐츠를 보유할 수 있다고 제안한다. 불일치는 "콘텐츠를 보관해야 하는가" 에서 "누가 보유하며 랩은 무엇을 받는가" 로 좁아지고 — 랩이 무엇을 받는지는 어느 쪽도 말하지 않았다. 이 페이지가 만들어진 계기였던 질문보다 작고, 더 날카로운 질문이다.
그리고 이 불일치는 단순히 상업적인 것이 아니라 기술적이다. 두 랩은 같은 전제 — 프런티어 모델의 위험은 단일 프롬프트–응답 쌍이 아니라 상호작용에 걸쳐 드러난다 — 를 받아들이면서, 그 전제가 콘텐츠 보관을 강제하는지에 대해 갈린다. 둘 중 하나만 옳을 수 있고, 그 답이 "제로 보관" 이 프런티어 모델에 대해 범주로 살아남는지를 결정한다.
현재 수준 (2026-08-21 기준)
Anthropic — 변경이 보도됐고, 이 위키가 받아들이는 가장 약한 출처 등급이다. 2026-08-20 Bloomberg 가 — 익명 소식통을 인용해 — Anthropic 이 6월 정책을 수정할 계획이라고 보도했다. 보도된 조건: 엔터프라이즈 고객은 여전히 30일 보관 의무 를 지되 자사 클라우드 인프라에 보유할 선택지 를 얻으며, 출시는 올해 안, Salesforce 를 포함한 100곳 이상의 고객 및 고규제 산업 고객과 몇 달에 걸쳐 개발됐다. 여러 매체가 엔터프라이즈 반발 에 대한 대응으로 틀 짓는다 (source).
타깃 검색으로 Anthropic 의 1차 발표는 확보되지 않았다. 이 위키의 상충 처리 규칙은 공식 발표를 제3자 보도보다 위에 두며, 이것은 의도에 대한 제3자 보도다. 보도된 계획 으로 기록하고, 아래 정책이 여전히 시행 중인 것 이다.
읽은 어떤 자료도 답하지 않으며 무게를 지는 지점: 고객이 통제하는 인프라 위에서 30일 보관 의무를 충족하면서 이 정책이 존재하는 이유인 요청 간 탐지를 어떻게 산출하는가 — 즉 Anthropic 이 무엇을 받는가. 또한 그 선택지가 무효화된 ZDR 계약을 되살리는지 아니면 다른 계약적 대상으로 대체하는지, Fable 5 의 ZDR 미지원이 영향을 받는지도 명시되지 않았다.
Anthropic — 보관 필수 (시행 중인 정책). 2026-06-09 부터 Mythos-class 모델(Claude Fable 5, Claude Mythos 5)에 제출된 프롬프트와 그 출력은 신뢰·안전을 위해 30일 보관되며, 모델이 제공되는 모든 표면에 적용된다. 협상된 제로 보관 계약을 무효화하고 거부권이 없으며, Fable 5 는 ZDR 을 아예 지원하지 않는다. 명시된 안전장치: 학습에 쓰지 않음, 모든 사람의 접근을 로깅, "거의 모든 경우" 30일 후 삭제, 자동 플래그 이후 통제된 경로를 통해서만 사람이 검토. 명시된 목적: 탈옥 연구와 완화 — 새로운 공격, 다중 요청 오남용 — 그리고 안전장치 계층의 오탐 감소 (source).
OpenAI — 보관은 불필요하다는 주장. 2026-08-19 OpenAI 는 적격 API 고객에 대한 ZDR 을 다시 밝히고(처리 후 보관 없음, 인력 검토 없음, 옵트인 없이는 학습 사용 없음, 고객 보유 암호화 키 또는 고객 통제 인프라) Private Safety Processing 을 프리뷰했다: 연관된 상호작용들에 걸친 오남용 패턴 을 식별하면서 기저 프롬프트나 응답을 노출하지 않고 좁게 정의된 안전 신호 만 OpenAI 에 보내는 기제다. Head of Product Policy 인 Aleah Houze 가 근거를 밝힌다 — 프런티어에서 위험은 단일 쌍이 아니라 "여러 상호작용을 시간에 걸쳐 볼 때" 드러난다. 엔터프라이즈와 API 한정이며, 더 넓은 롤아웃과 기술 백서는 2026년 9월 (source).
어느 쪽도 공개하지 않은 것: 각 정책이 가능하게 하려는 탐지의 정확도나 오탐률. Anthropic 은 안전장치 오탐 감소가 보관의 목적이라고 하면서 비율을 주지 않고, OpenAI 는 신호가 무엇을 담고 얼마나 자주 발화하는지 말하지 않고 신호를 서술한다. 이 위키에서 안전 관련 분류기가 오류율 없이 발표된 것은 두 주 사이에 이번이 세 번째다 — 나머지 둘은 Anthropic 의 Claude Code auto-mode 분류기(재현율 89%, 오탐률 없음)와 ChatGPT for Teens 의 나이 예측 시스템이다.
열린 문제
- "좁게 정의된 안전 신호" 를 보관 없이 요청 간에 도출할 수 있는가? 떠오르는 구현 — 해시, 임베딩, 누적 요약, 모델 측 상태 — 은 모두 콘텐츠에서 파생되고 모두 무언가 를 지속시킨다. 그 결과물이 고객이 이해하는 의미의 ZDR 을 여전히 만족하는지가 9월 백서가 답해야 할 질문이며, 지금 읽은 자료는 답하지 않는다.
- 불일치는 역량의 문제인가 만들 여력의 문제인가? Anthropic 의 정책은 그 비공개 기법이 작동하지 않는다는 판단을 반영한 것일 수도, 단지 6월까지 만들지 못했다는 것일 수도 있다. 읽은 어떤 문서도 어느 쪽인지 말하지 않는다.
- 고객은 어떻게 해야 하는가? Anthropic 의 요건은 계약을 덮어쓰고 거부권이 없어서, 규제 산업 구매자의 선택지는 "30일 보관을 받아들인다" 아니면 "그 모델을 쓰지 않는다" 뿐이다. 공개된 지침이 없는 조달상의 사실이다. 2026-08-20 부분적으로 답해졌다 — 세 번째 선택지 "직접 보관한다" 가 온다고 보도됐고 — 그 답이 정책 페이지도 고객의 계약서도 아닌 Bloomberg 를 통해 도착했다 는 것 자체가 조달상의 사실이다.
- 고객이 보유하는 보관은 안전 문제를 실제로 바꾸는가, 아니면 보관 주체 문제만 바꾸는가? 랩이 요청 간 패턴을 탐지하려고 여전히 콘텐츠 위에서 연산해야 한다면, 저장 위치를 옮기는 것은 책임과 데이터 소재지를 옮길 뿐 역량은 옮기지 않는다. 그렇지 않다면 콘텐츠 보관은 애초에 요건이 아니었고 6월의 OpenAI 입장이 옳았던 것이다. 읽은 자료 중 어느 쪽인지 말하는 것은 없으며, 이제 이 페이지에서 가장 결과가 큰 미지수다.
- 포화는 반대 방향으로도 작용하는가? Anthropic 은 2026-08-14 에 자기 과제 기반 평가가 포화 해 역량 향상을 더 이상 등록하지 못한다고 보고했다 (source). 배포 전 평가가 해상도를 잃고 있다면 배포 후 모니터링이 보증의 더 큰 몫을 지게 되고 — 이는 보관 쪽 논거를 강화하며 비공개 대안이 실제로 작동하는지에 걸린 판돈을 키운다.
- 아무도 비교를 발표하지 않았다. 콘텐츠가 있을 때의 탐지 품질과 신호만 있을 때의 탐지 품질을 잰 제3자가 없어서, 두 랩 사이의 핵심 사실 쟁점은 현재 시험되지 않은 상태다.
주요 논문
- HarmProfile: Characterizing Harmful Distributions in Frontier LLMs (arXiv:2608.14577) — 모델을 통과/실패 비율이 아니라 유해 출력의 분포 로 특징짓자고 제안한다. 보관에 기반한 모니터링 코퍼스가 가능하게 하는 도구 부류이며, 포화한 문턱을 견디는 부류다.
- 읽은 어떤 논문도 LLM API 에 대한 프라이버시 보존 요청 간 오남용 탐지를 평가하지 않는다. 9월 백서가 메울 공백이고, 나오면 읽을 값이 있는 이유다.
Referenced by
Sources
- sources/blogs/openai-2026-08-19-zero-data-retention.md
- sources/blogs/anthropic-2026-06-09-mythos-class-data-retention.md
- sources/blogs/anthropic-2026-08-14-risk-report-august-2026.md
- sources/blogs/anthropic-2026-08-20-retention-policy-change.md
- https://www.axios.com/2026/08/19/openai-previews-zero-retention-safety-system-as-anthropic-requires-data-logs