$ cat wiki/concepts/safety-cases.md
세이프티 케이스 (Safety Cases)
정의
세이프티 케이스(safety case) 는 특정 시스템이 특정 환경의 특정 용도에 대해 수용 가능하게 안전하다는, 구조화되고 증거에 기반한 포괄적 논증이다. 이 형식은 안전 필수(safety-critical) 산업에서 빌려온 것으로 — 항공과 원자력 이 언급된 두 비교 대상이다 — 그런 산업에서는 규제 기관이 그 논증을 제출받고 검토해 수용하기 전까지 운전을 허가하지 않는다 (source).
OpenAI 가 2026-09-28 프런티어 AI 에 적용한 이 제안은, 논증을 배포가 아니라 학습에 붙인다:
structured safety documentation should be required before continuing any frontier reinforcement learning training run
문서는 세이프티 케이스를 지향해야 할 북극성 으로 규정하면서, 역량 수준이 올라갈 때마다 복잡성이 새로 출현하기 때문에 AI 에서는 아직 항공만큼 엄격하게 만들 수 없다고 명시적으로 인정한다.
왜 중요한가
게이트의 위치를 옮긴다. 이 위키가 Preparedness Framework 와 Anthropic 의 RSP 계보 아래 추적하는 다른 모든 것은 평가 결과를 근거로 배포 를 막는다. 이 제안은 문서를 근거로 학습을 계속하는 것 을 막는다. 개입 지점이 다르고, 훨씬 이르다: 사전에 아무도 정당화 하지 않은 역량은, 정당화되어야만 진행되는 런에서는 나올 수 없다.
세 층을 지목하는데, 이 위키는 이제 그중 둘에 대한 산출물을 보유한다. 제안에 따르면 세이프티 케이스는 기술 스택의 세 부분을 다뤄야 한다:
- 정렬 학습(alignment training) — 모델이 오정렬된 행동을 시도하지 않을 것
- 격리(containment) — 모델이 격리를 벗어나기 어려울 것
- 모니터링 — 피해가 발생하기 전에 모니터링이 이를 포착할 것
Agent Runtime Containment 는 이 페이지 하루 전 에, NVIDIA 의 OpenShell 을 위해 만들어졌다 — 배포 런타임에서의 격리, 실행 중인 에이전트를 커널 수준에서 샌드박싱하는 것이다. Eval Environment Containment 는 평가 측 대응물을 보유한다. 이 제안은 학습 런에 대해 주장되는 논증으로서의 격리를 요구한다. 세 페이지, 격리라고 불리는 세 가지 다른 것 이며, 각각에서 이 단어가 서로 다른 일을 하고 있다 — 이는 Eval Harness Configuration 이 벤치마크에서 잡아내려는 표류가 안전 용어에서 나타난 것이다.
과정 권고들은 기술적이 아니라 제도적이며, 이는 랩 발간물로서는 이례적이다:
- 반론 리허설(objection rehearsals)
- 경영진 거부권
- 학습 리드에 대한 책임 부과
- 실패 시 기본값으로 중단
- 데이터 롤백 지원
다섯 중 넷이 누가 어떤 권한으로 런을 멈출 수 있는지에 관한 것이다. 데이터 롤백 만이 엔지니어링 역량이다. 핵심 구성요소가 거부권과 책임 주체인 프레임워크는 기술적 제목을 입은 거버넌스 제안 이며, 어느 랩이 무슨 증거로 멈출 것인가를 논쟁해 온 Frontier Pacing 옆에서 읽어야 한다.
현재 수준 (2026-09-30)
문서 하나, 랩 하나, 하루 전, 검색 패스 1회로 읽음.
openai.com 은 이 파이프라인의 샌드박스에서 차단되어 1차 출처로 읽은 것이 없고 — 같은 날의
GPT-6.1 Sol 포착과 달리 — 이 항목에 대해서는 교차 확인 2차 패스를 돌리지 않았다.
이 페이지의 모든 주장은 단일 패스에 기댄다. 인용된 문장이 여기서 가장 강한 것이고, 그것도 페이지
자체가 아니라 요약의 인용이다.
확립되지 않은 것, 그리고 이것이 이 제안의 중요성을 결정한다: OpenAI 가 그중 무엇이라도 채택했는지 여부다. 인용된 표현은 "요구되어야 한다" — 외부를 향한 제안의 문법이다. 읽은 자료 중 어느 것도 이 회사가 이제 자사 프런티어 RL 런을 계속하기 전에 세이프티 케이스를 요구한다고 말하지 않고, 적용된 런을 이름 짓지 않으며, 거부권을 누가 갖는지 밝히지 않는다. 그중 하나라도 읽을 수 있게 되기 전까지 이것은 입장 문서이며, 이 위키는 그렇게 기록한다.
동등한 것을 발표한 다른 랩은 없다. 이 영역에서 Anthropic 이 발간한 산출물은 배포와 세이프 가드를 막는 것이고(Preparedness Framework 가 OpenAI 자신의 배포 측 프레임워크를 보유한다), 학습 시점 문서 게이트를 제안하는 두 번째 랩이 있다는 근거는 이번 실행에서 읽은 것 중에 없다.
열린 문제
- 누가 검토하는가. 항공과 원자력의 세이프티 케이스는 규제 기관이 수용한다. 읽은 자료는 내부든 외부든 검토자를 지목하지 않는다. AI Evaluator Forum (AEF) 의 AEF-1 표준이 가장 가까운 기존 후보 기구이고, 언급되지 않는다.
- 충분한 논증이 어떤 모습인가. 문서는 AI 케이스가 아직 항공만큼 엄격할 수 없다고 인정한다. 현재 수용 가능한 하한선이 무엇인지는 말하지 않으며, 그러면 쓰인 대로의 "요구"는 집행 불가능 하다.
- "계속하기 전"이 체크포인트인지 게이트인지. 이미 진행 중인 런을 "계속하려면" 정당화해야 하는 것과, 시작 전에 정당화되는 것은 전혀 다른 약속이며, 그 문장은 둘을 구분하지 않는다.
- 세 가지 격리. 학습 런 격리, 에이전트 런타임 격리, 평가 환경 격리가 이제 이 위키에서 모두 격리라고 불린다. 그 사이 경계를 정의한 것은 아직 없다.
주요 논문
없음. 이는 논문이 아니라 랩 발간물이며, 이에 해당하는 arXiv 산출물은 반환되지 않았다.
세이프티 케이스에 관한 학술 문헌은 존재하고 — 검색이 arxiv.org/pdf/2412.17618
(Dynamic safety cases for frontier AI) 와 arxiv.org/pdf/2510.19476 (A Concrete Roadmap
towards Safety Cases based on Chain-of-Thought Monitoring) 를 표면화했다 — 그러나 둘 다 읽지
않았고 둘 다 이 위키의 시간 범위 안에 있지 않으므로, 어떤 주장의 인용이 아니라 존재한다는
사실로만 이름을 적는다.
관련 개념
- Frontier Pacing — 랩이 속도를 늦출지, 언제 늦출지. 그 결정에 문서를 붙인 첫 제안
- Preparedness Framework — OpenAI 의 배포 측 게이트로, 같은 랩의 더 이르고 더 좁은 장치
- Agent Runtime Containment — 배포 런타임에서의 격리
- Eval Environment Containment — 평가 중의 격리
- Safety Monitoring and Data Retention — 모니터링 층, 그리고 무엇이 보관되는가
- AI Alignment — 세 층 중 첫 번째
- AI Governance — 권고들이 놓인 제도적 어법
- OpenAI — 발간 주체