AI Trend Notifier
EN한
← wiki

$ cat wiki/concepts/safety-monitoring-retention.md

안전 모니터링과 데이터 보관

concept갱신 2026-09-09생성 2026-08-20

정의

프런티어 랩이 가장 강력한 모델의 오남용을 탐지하기 위해 고객의 프롬프트와 출력을 보관해야 하는가 — 그리고 보관해야 한다면, 얼마나 오래, 어떤 접근 통제 아래, 고객에게 어떤 거부권을 주고 보관하는가.

이 질문은 탐지가 요청 단위 에서 요청 간 으로 옮겨간 뒤에야 실질적이 됐다. 프롬프트 하나를 채점하는 분류기는 요청이 끝난 뒤 아무것도 필요로 하지 않는다. 연관된 상호작용들에 걸친 패턴을 탐지하는 것 — 두 랩이 이제 프런티어에서 가장 중요하다고 말하는 오남용 형태 — 은 한 요청을 다른 요청들과 대조하는 일이고, 그러려면 그것들을 갖고 있어야 한다 (source).

Zero Data Retention(ZDR) 은 요청 처리 후 제공자가 아무것도 보관하지 않는다는 엔터프라이즈 약정이다. 이 문제보다 앞서 존재했고 2026년까지는 평범한 조달 체크박스였다. 프런티어 모델의 안전 논거가 그것을 다투는 첫 사례다.

왜 중요한가

두 프런티어 랩이 열 주 간격으로 같은 문제에 정반대의 구조적 입장 을 취했고, 각자 자기 입장이 안전을 위해 필요하다고 말한다:

AnthropicOpenAI
입장보관이 안전에 필요하다 — 2026-09-01 철회보관은 안전에 필요하지 않다
기제Enterprise Frontier Safeguards — 고객 자신의 클라우드에 보관된 로그 위에서 도는 자동 모니터링. 모든 Mythos-class 트래픽 30일 보관을 대체Private Safety Processing — 좁은 신호, 콘텐츠 비노출
고객의 기존 ZDR 계약에 대한 효과2026-06-09 에 거부권 없이 무효화; EFS 아래에서 zero data retention 복원유지; ZDR 은 사전 승인으로 부여
범위1자·3자 표면 모두, 모든 트래픽적격 엔터프라이즈/API 엔드포인트만
상태2026-09-01 발표, 2026년 가을 부터 단계적 롤아웃; 06-09 정책은 약 12주간 시행됐다초기 고객 대상 프리뷰; 롤아웃과 백서는 2026년 9월 예정
소비자 플랜영향 없음 — 이미 보관 중대상 아님
소스:
(Anthropic),
(OpenAI),
(Anthropic 변경, 보도).

각자가 실제로 내놓은 것의 비대칭은 이 페이지가 쓰인 지 스물네 시간 만에 움직였고, 그 방향이 뉴스다. 2026-08-20 Bloomberg 는 Anthropic 이 엔터프라이즈 고객이 보관된 데이터를 자사 클라우드 인프라에 보유 할 수 있게 할 계획이며 30일 요건 자체는 그대로라고 보도했다 (source). 따라서 Anthropic 쪽도 이제 계획 이고, OpenAI 가 하루 전 프리뷰한 기제 — 고객이 통제하는 인프라 — 로 수렴한다.

수렴을 넘어 살아남는 것은 전제이며, 그것이 추적할 대상이다. 두 랩 모두 프런티어 위험이 단일 프롬프트–응답 쌍이 아니라 상호작용 전반에 드러난다고 여전히 주장하고, 둘 다 이제 고객이 콘텐츠를 보유할 수 있다고 제안한다. 불일치는 "콘텐츠를 보관해야 하는가" 에서 "누가 보유하며 랩은 무엇을 받는가" 로 좁아지고 — 랩이 무엇을 받는지는 어느 쪽도 말하지 않았다. 이 페이지가 만들어진 계기였던 질문보다 작고, 더 날카로운 질문이다.

그리고 이 불일치는 단순히 상업적인 것이 아니라 기술적이다. 두 랩은 같은 전제 — 프런티어 모델의 위험은 단일 프롬프트–응답 쌍이 아니라 상호작용에 걸쳐 드러난다 — 를 받아들이면서, 그 전제가 콘텐츠 보관을 강제하는지에 대해 갈린다. 둘 중 하나만 옳을 수 있고, 그 답이 "제로 보관" 이 프런티어 모델에 대해 범주로 살아남는지를 결정한다.

현재 수준 (2026-09-08 기준)

이 페이지가 정책 논쟁으로 다뤄 온 질문이 특정 인물의 세션에 대한 구체적 의혹이 되었고, 연구소의 답변에는 예외 조항이 들어 있다. 2026-09-08 Navier–Stokes 결과를 둘러싼 공로 분쟁 — 수학으로서는 AI for Mathematics 에서 다루고, 여기서는 데이터 질문만 가져온다 — 에서 Tristan Buckmaster 는 OpenAI 도구에 넣어 온 자신의 사적 수학 초고가 OpenAI 에 접근 가능했는지 공개적으로 묻는다(3회 확인). 독립된 두 패스가 싣는 OpenAI 의 답변은 두 문장이고, 둘은 서로 다른 일을 한다 (source):

We (the researchers and the agents) did not see any of their work through any means until they released it publicly — in particular, no specific user data was accessed in order to solve this problem.

While unlikely, we cannot rule out that de-identified data derived from their usage of our products helped improve our models.

첫 문장은 접근을 부인하고, 둘째 문장은 영향의 부인을 유보하며, 그 사이의 경계가 바로 이 페이지가 추적하려는 것이다. 위의 모든 내용은 오용 탐지를 위한 보존 에 관한 것이다 — 무엇이, 누구에 의해, 얼마나 오래 보관되어 분류기가 한 요청을 다른 요청들과 견줄 수 있는가. 이것은 같은 기반에 다른 경로로 닿는다: 학습 이다. 누가 로그를 읽을 수 있는지를 중심에 두고 설계된 보존 체제는 그 비식별 파생물이 이미 가중치로 옮겨 갔는지에 대해 아무 말도 하지 않으며, 두 파이프라인이 분리되어 있고 그중 하나에만 접근 로그가 있을 때 연구소가 할 수 있는 가장 강한 진술이 "배제할 수 없다" 이다.

증거에 대해 분명히 해 둘 것이 셋이다. 읽은 자료 어디에도 로그도, 감사도, 제3자 조사도 없다 — OpenAI 의 부인은 진술이고 Buckmaster 의 우려는 질문이며, 어느 쪽도 뒷받침되지 않았다. 그가 썼다고 말한 제품의 적용 보존 약관은 읽은 자료 어디에도 인용되어 있지 않으므로, 이 위키는 무엇이 약속되었는지조차 말할 수 없고 무엇이 실제로 일어났는지는 더욱 말할 수 없다. 그리고 보도 어디에도 Anthropic 의 진술이 없다 — Alpöge 가 Anthropic 직원이라고 3회 확인되었는데도. 아래에 서술된 제로 보존 상품을 파는 연구소가, 경쟁사의 보존을 쟁점으로 하는 사안에 대해 아무 말도 하지 않았다.

여기서 바뀌는 것은 사실이 아니라 틀이다. 열린 문제 4는 고객이 보유하는 로그에 보존 기간 이 여전히 적용되는지를 묻는다. 이 건은 기간으로는 답할 수 없는 질문을 더한다: 비식별 파생물이 설계상 보존 창을 넘어 살아남는가, 그리고 연구소가 무언가를 보관하지 않겠다고 약속할 때 고객이 받는 것은 무엇인가. 읽은 자료 어디에도 해소가 없고 이것은 두 당사자 사이의 진행 중인 분쟁이며 전언으로 보도되었으므로, 해결이 아니라 열린 문제로 더한다.

현재 수준 (2026-09-05 기준)

Anthropic 은 변경을 출하했고, 보도된 계획보다 더 나아갔다. 2026-09-01 Anthropic 이 Enterprise Frontier Safeguards (EFS) 를 발표했다. 엔터프라이즈 고객은 zero data retention 을 유지한 채, 자동 오남용 탐지가 고객이 통제하는 클라우드 인프라 — Amazon S3, Azure Blob Storage, Google Cloud Storage 가 거명됐다 — 에 보관된 활동 로그 위에서 고객 자신의 암호화 키와 접근 정책 아래 돌아간다. 자동 안전 모니터링은 여전히 오남용을 검사하지만 Anthropic 직원의 사람 검토는 요구되지 않는다. Anthropic 은 이에 과금하지 않는다. 2026년 가을 후반부터 단계적 롤아웃 (source).

이것이 그 철회이고, 형태는 2026-08-20 이 예측한 것과 다르다. Bloomberg 가 보도한 계획은 30일 요건을 그대로 두고 저장 위치만 옮기는 것이었다. 실제로 발표된 것은 여러 보도에서 Mythos-class 트래픽에 대해 zero data retention 자체를 복원한 것으로 서술되며, 두 매체는 엔터프라이즈 반발 이후 Mythos 와 Claude Fable 5.1 에 대해 보존 요건이 철회된 것으로 틀 짓는다. Anthropic 이 밝힌 근거는 달라지지 않았다 — Mythos-class 모델은 오남용과 자율적 오작동 양쪽의 가능성을 함께 지닌다는 것 — 이므로 이 페이지가 추적하는 전제는 살아남았고 기제만 움직였다.

여전히 명시되지 않은 것, 그리고 그것은 열린 문제 4 그 자체다: 고객이 보관하는 로그에 보존 기간 이 여전히 적용되는지, 아니면 의무가 사라진 것인지. 읽은 자료가 말하지 않는다. 그 구별이 Anthropic 이 아키텍처를 양보한 것인지 보관 주체만 양보한 것인지를 가르는데, 이 위키는 그것을 들고 있지 않다. 한 매체가 같은 공백의 날카로운 판본을 준다. Anthropic 은 zero data retention 을 약속하지만 그것이 지켜졌는지는 고객이 확인해야 한다 — 검증 부담이 데이터를 따라 옮겨 간다.

포착 메모. 이것은 Anthropic 1차 발표의 +4일 지연 포착이다. www.anthropic.com 은 이 파이프라인의 샌드박스에서 EGRESS_BLOCKED 를 응답하고 Anthropic 뉴스룸에는 피드가 없어서 state/prefetch.json 에 들어오지 않으며 일일 스크레이프 단계로만 닿을 수 있다. 위의 모든 수치는 2차 보도에서 왔고 1차 게시물은 읽지 못했다. 이 위키가 같은 실패 형태를 기록한 세 번째다 — Alignment Science 블로그와 Meta AI 의 ai.meta.com 에 이어.

수렴은 이제 기제에서는 완결됐고 실질에서는 미결이다. 열 주 전 두 연구소는 정반대 입장을 들고 있었다. 이제 둘 다 고객이 통제하는 인프라를 제안하며, 어느 쪽도 랩이 거기서 무엇을 받는지 공표하지 않았다. 이 페이지가 만들어진 계기였던 논쟁 — 콘텐츠를 반드시 보관해야 하는가 — 은 양쪽 모두 실무적으로 "아니오" 라고 답했지만, 그 답을 가능하게 만든 증거는 어느 쪽도 공표하지 않았다.

Anthropic — 2026-08-20 에 보도된 변경, 이 위키가 받아들이는 가장 약한 출처 등급이다. 2026-08-20 Bloomberg 가 — 익명 소식통을 인용해 — Anthropic 이 6월 정책을 수정할 계획이라고 보도했다. 보도된 조건: 엔터프라이즈 고객은 여전히 30일 보관 의무 를 지되 자사 클라우드 인프라에 보유할 선택지 를 얻으며, 출시는 올해 안, Salesforce 를 포함한 100곳 이상의 고객 및 고규제 산업 고객과 몇 달에 걸쳐 개발됐다. 여러 매체가 엔터프라이즈 반발 에 대한 대응으로 틀 짓는다 (source).

당시에는 타깃 검색으로 Anthropic 의 1차 발표가 확보되지 않았다. 이 위키의 상충 처리 규칙은 공식 발표를 제3자 보도보다 위에 두며, 이것은 의도에 대한 제3자 보도였다. 보도된 계획 으로 기록했고 — 지우지 않고 여기 남겨 둔다. 계획과 발표가 가장 중요한 한 지점에서 갈리기 때문이다. Bloomberg 의 소식통은 30일 요건이 유지된다고 했다. 열이틀 뒤 발표는 그렇게 말하지 않았다. 보도된 판본을 발표된 판본 옆에 붙들어 두는 것이 그 차이를 보이게 만든다.

읽은 어떤 자료도 답하지 않으며 무게를 지는 지점: 고객이 통제하는 인프라 위에서 30일 보관 의무를 충족하면서 이 정책이 존재하는 이유인 요청 간 탐지를 어떻게 산출하는가 — 즉 Anthropic 이 무엇을 받는가. 또한 그 선택지가 무효화된 ZDR 계약을 되살리는지 아니면 다른 계약적 대상으로 대체하는지, Fable 5 의 ZDR 미지원이 영향을 받는지도 명시되지 않았다.

Anthropic — 보관 필수 (2026-06-09 부터 2026-09-01 까지 시행된 정책, 위의 EFS 로 대체됨). 2026-06-09 부터 Mythos-class 모델(Claude Fable 5, Claude Mythos 5)에 제출된 프롬프트와 그 출력은 신뢰·안전을 위해 30일 보관되며, 모델이 제공되는 모든 표면에 적용된다. 협상된 제로 보관 계약을 무효화하고 거부권이 없으며, Fable 5 는 ZDR 을 아예 지원하지 않는다. 명시된 안전장치: 학습에 쓰지 않음, 모든 사람의 접근을 로깅, "거의 모든 경우" 30일 후 삭제, 자동 플래그 이후 통제된 경로를 통해서만 사람이 검토. 명시된 목적: 탈옥 연구와 완화 — 새로운 공격, 다중 요청 오남용 — 그리고 안전장치 계층의 오탐 감소 (source).

OpenAI — 보관은 불필요하다는 주장. 2026-08-19 OpenAI 는 적격 API 고객에 대한 ZDR 을 다시 밝히고(처리 후 보관 없음, 인력 검토 없음, 옵트인 없이는 학습 사용 없음, 고객 보유 암호화 키 또는 고객 통제 인프라) Private Safety Processing 을 프리뷰했다: 연관된 상호작용들에 걸친 오남용 패턴 을 식별하면서 기저 프롬프트나 응답을 노출하지 않고 좁게 정의된 안전 신호 만 OpenAI 에 보내는 기제다. Head of Product Policy 인 Aleah Houze 가 근거를 밝힌다 — 프런티어에서 위험은 단일 쌍이 아니라 "여러 상호작용을 시간에 걸쳐 볼 때" 드러난다. 엔터프라이즈와 API 한정이며, 더 넓은 롤아웃과 기술 백서는 2026년 9월 (source).

어느 쪽도 공개하지 않은 것: 각 정책이 가능하게 하려는 탐지의 정확도나 오탐률. Anthropic 은 안전장치 오탐 감소가 보관의 목적이라고 하면서 비율을 주지 않고, OpenAI 는 신호가 무엇을 담고 얼마나 자주 발화하는지 말하지 않고 신호를 서술한다. 이 위키에서 안전 관련 분류기가 오류율 없이 발표된 것은 두 주 사이에 이번이 세 번째다 — 나머지 둘은 Anthropic 의 Claude Code auto-mode 분류기(재현율 89%, 오탐률 없음)와 ChatGPT for Teens 의 나이 예측 시스템이다.

열린 문제

  1. "좁게 정의된 안전 신호" 를 보관 없이 요청 간에 도출할 수 있는가? 떠오르는 구현 — 해시, 임베딩, 누적 요약, 모델 측 상태 — 은 모두 콘텐츠에서 파생되고 모두 무언가 를 지속시킨다. 그 결과물이 고객이 이해하는 의미의 ZDR 을 여전히 만족하는지가 9월 백서가 답해야 할 질문이며, 지금 읽은 자료는 답하지 않는다.
  2. 불일치는 역량의 문제인가 만들 여력의 문제인가? Anthropic 의 정책은 그 비공개 기법이 작동하지 않는다는 판단을 반영한 것일 수도, 단지 6월까지 만들지 못했다는 것일 수도 있다. 읽은 어떤 문서도 어느 쪽인지 말하지 않는다.
  3. 고객은 어떻게 해야 하는가? Anthropic 의 요건은 계약을 덮어쓰고 거부권이 없어서, 규제 산업 구매자의 선택지는 "30일 보관을 받아들인다" 아니면 "그 모델을 쓰지 않는다" 뿐이다. 공개된 지침이 없는 조달상의 사실이다. 2026-08-20 부분적으로 답해졌다 — 세 번째 선택지 "직접 보관한다" 가 온다고 보도됐고 — 그 답이 정책 페이지도 고객의 계약서도 아닌 Bloomberg 를 통해 도착했다 는 것 자체가 조달상의 사실이다. 2026-09-01 답해졌다: 세 번째 선택지가 Enterprise Frontier Safeguards 로 무상 출하됐고, 구매자의 선택지는 이제 "보관을 받아들이거나 떠나거나" 가 아니라 "로그를 직접 보유한다" 다. 경과 시간이 발견이다 — 계약을 덮어쓰는 요건에서 그 철회까지 열두 주 — 그리고 그것을 만든 순서는 보도된 반발, 유출된 계획, 그다음 제품이었다.
  4. 고객이 보유하는 보관은 안전 문제를 실제로 바꾸는가, 아니면 보관 주체 문제만 바꾸는가? 랩이 요청 간 패턴을 탐지하려고 여전히 콘텐츠 위에서 연산해야 한다면, 저장 위치를 옮기는 것은 책임과 데이터 소재지를 옮길 뿐 역량은 옮기지 않는다. 그렇지 않다면 콘텐츠 보관은 애초에 요건이 아니었고 6월의 OpenAI 입장이 옳았던 것이다. 읽은 자료 중 어느 쪽인지 말하는 것은 없으며, 이제 이 페이지에서 가장 결과가 큰 미지수다. 2026-09-01 이후에도 여전히 미답이고, 이제 넘기기가 더 어렵다. EFS 는 자동 모니터링을 유지하면서 Anthropic 의 보관 주체 지위를 없애므로 두 번째 갈래에 해당한다 — 그러나 모니터가 무엇을 추출하는지, 어디서 도는지, 고객 쪽에 보존 기간이 남는지를 읽은 자료가 말하지 않는다. Anthropic 은 6월 정책이 만들 수 없다고 함축했던 것을 이제 만들어 놓고 무엇이 달라졌는지에 대한 설명을 공표하지 않았다. 역량이 6월에도 있었거나, 열두 주 만에 개발됐거나, 모니터링이 보관이 뒷받침하던 것보다 약하거나다. 셋은 함의가 매우 다르고 읽은 자료가 셋을 가르지 않는다.
  5. 포화는 반대 방향으로도 작용하는가? Anthropic 은 2026-08-14 에 자기 과제 기반 평가가 포화 해 역량 향상을 더 이상 등록하지 못한다고 보고했다 (source). 배포 전 평가가 해상도를 잃고 있다면 배포 후 모니터링이 보증의 더 큰 몫을 지게 되고 — 이는 보관 쪽 논거를 강화하며 비공개 대안이 실제로 작동하는지에 걸린 판돈을 키운다.
  6. 아무도 비교를 발표하지 않았다. 콘텐츠가 있을 때의 탐지 품질과 신호만 있을 때의 탐지 품질을 잰 제3자가 없어서, 두 랩 사이의 핵심 사실 쟁점은 현재 시험되지 않은 상태다.
  7. 이 정책에 이제 가격표가 붙었고, 이 페이지가 처음으로 보유하는 수치다. 열린 문제 3 은 계약을 무효화하는 보존 요구사항에 고객이 무엇을 할 수 있는지 물었다. Ramp AI Index 2026년 8월판이 수요 쪽에서 그 답의 일부를 제공한다: Ramp 의 이코노미스트 Ara Kharazian 은 Claude Fable 5 이 "도입과 실제 활용 양쪽에서 실망스러웠다" 고 한 두 이유로 "가격 + 데이터 보존 요구사항" 을 지목하며, 출시 두 달 뒤 Anthropic 달러 지출의 11.4%, 토큰의 6% 라는 수치가 그 배경에 있다 (source). 신중하게 읽자: 이것은 지출 지수에 담긴 애널리스트의 귀인이지 고객 설문이 아니고, 같은 문장 안에서 가격과 뒤섞여 있으며 읽은 자료 어디에서도 분리되지 않는다 — Fable 5 는 GPT-5.6 Sol 의 두 배 가격이고, 그것만으로도 부진은 설명된다. 따라서 정직한 진술은, 데이터를 가진 쪽이 보존을 상업적 저해 요인으로 지목했으며 아직 그것으로 분리해 내지는 못했다는 것이다. 이 구분이 중요한 이유는, 분리된 형태라야 어떤 랩에게 자기 안전 정책의 비용이 얼마인지 말해 줄 수 있고 이 위키는 그것을 갖고 있지 않기 때문이다. → Model Routing
  8. 보존 약속은 비식별 파생물까지 미치는가, 그리고 어느 쪽이든 확인할 수 있는가? 2026-09-08 Buckmaster 에 대한 OpenAI 의 두 문장짜리 답변에서 제기되었다: 접근은 단정적으로 부인하고, 영향은 배제할 수 없다고 선언한다 (source). 이 페이지가 추적하는 모든 메커니즘 — 기간, 보관 주체, 고객 보유 키 — 은 로그 를 규율한다. 그중 어느 것도 이미 가중치에 접힌 파생물 을 규율하지 않으며, 제로 보존 약속이 거기까지 닿는지 어떤 연구소의 자료에서도 진술된 바 없다. 어려운 지점은 비대칭성이다: 접근 로그는 감사할 수 있고, 프런티어 규모의 학습 코퍼스 출처는 현재 아무도 감사하지 않는다. 어느 연구소든 "비식별 파생물" 이 무엇을 배제하는지 공개하기 전까지, 보존 보장과 학습 보장은 고객이 구별할 방법이 없는 서로 다른 약속 이다.

주요 논문

  • HarmProfile: Characterizing Harmful Distributions in Frontier LLMs (arXiv:2608.14577) — 모델을 통과/실패 비율이 아니라 유해 출력의 분포 로 특징짓자고 제안한다. 보관에 기반한 모니터링 코퍼스가 가능하게 하는 도구 부류이며, 포화한 문턱을 견디는 부류다.
  • 읽은 어떤 논문도 LLM API 에 대한 프라이버시 보존 요청 간 오남용 탐지를 평가하지 않는다. 9월 백서가 메울 공백이고, 나오면 읽을 값이 있는 이유다.

Referenced by

Sources