AI Trend Notifier
EN한
← wiki

$ cat wiki/concepts/agent-runtime-containment.md

에이전트 런타임 격리

concept갱신 2026-09-29생성 2026-09-29

정의

에이전트 런타임 격리 는 자율 에이전트가 실제 작업을 수행하는 동안 무엇에 닿을 수 있는지를 — 어떤 파일을 열고, 어떤 시스템 콜을 하고, 어떤 호스트에 연결하고, 어떤 크리덴셜을 쓸 수 있는지 — 제약하는 문제이며, 그 제약을 에이전트 외부에서 걸어 제약이 에이전트 자신의 협조에 의존하지 않게 하는 문제다.

마지막 구절이 전부다. 프롬프트 규칙, 하네스 내부의 도구 허용 목록, 시스템 카드는 모두 에이전트 자신의 추론이 상류에 놓이는 통제 수단이다. 커널이 강제하는 샌드박스는 그렇지 않다: 에이전트가 정렬되어 있든, 혼란에 빠졌든, 탈옥됐든, 의존성에 심어 둔 공급망 침해를 실행하고 있든 그대로 유지된다.

이것은 Eval Environment Containment 가 아니며, 둘을 합쳐서는 안 된다. 그 페이지는 측정 중 격리에 관한 것으로, 원시 역량을 관찰하기 위해 안전장치를 의도적으로 꺼 두고, 그 경계가 사이버 평가와 실제 침입 사이에 서 있는 유일한 것이 되는 상황을 다룬다. 이 페이지는 배포 시점 의 격리에 관한 것으로, 안전장치가 켜져 있고 에이전트가 실제 시스템을 건드리는 것이 정상인 상황을 다룬다 — 질문은 어떤 시스템이며, 누가 정했는가다.

왜 중요한가

2026-09-28 까지 이 위키는 배포 측 에이전트 제약을 개별 제품의 속성으로만 추적했다. 가리킬 공통 산출물이 없었기 때문이다: 하네스마다 자체 권한 프롬프트와 자체 도구 경계 개념을 내놓았다.

수정 없이 에이전트를 받아들이는 Apache-2.0 런타임은 그 구도를 바꾼다. 격리 계층이 각 에이전트의 기능이 아니라 별도의 감사 가능한 컴포넌트라면, 첫째로 에이전트 벤더가 자기 제약을 스스로 보증하는 당사자가 아니게 되고, 둘째로 그 제약이 기업이 한 번 명세해서 여러 벤더의 에이전트에 적용할 수 있는 것이 된다. 이는 MHS — Model Hardware Standard 가 한 계층 아래에서, 그리고 Embedded Evaluation 가 측정에 대해 하는 것과 같은 움직임이다 — 통제 수단을 통제 대상 밖으로 끌어내는 것.

또한 Eval Environment Containment 의 사건들에 배포 측 대응물을 준다. 그 사건 중 여덟 건은 시험 중 경계가 무너진 것이고, 이 페이지가 여는 흥미로운 질문은 정책으로 명세되고 커널에서 강제되는 경계가 같은 방식으로 무너지는지다.

현재 수준 (2026-09-29)

NVIDIA Open Agent Safety Platform (2026-09-28)

2026-09-28 에 파트너 100곳 이상 과 함께 발표됐고, 이름 붙은 컴포넌트는 둘이다 (source):

  • NVIDIA OpenShell — 런타임, 버전 0.1.0, Apache 2.0.
  • NVIDIA Sentry — 레퍼런스 시스템 설계로, 에이전트를 돌리는 소프트웨어·하드웨어·컴퓨트·로보틱스 시스템을 포괄한다고 보도됐다. Sentry 자체가 오픈소스인지는 읽은 자료에 명시되지 않았다.

읽은 자료에 이름이 나온 파트너: Anthropic, Cisco, CrowdStrike, Dell Technologies, Figure, HPE, Hugging Face, IBM, JPMorgan.

OpenShell 이 강제하는 것

에이전트를 선언적 정책으로 통제되는 커널 수준 샌드박스 안에서 실행하며, 에이전트를 고쳐 쓰지 않고 접근을 강제한다고 설명된다. 이름이 나온 통제 수단:

통제설명된 내용
파일시스템 · 시스템 콜커널 통제가 에이전트가 읽는 파일과 호출하는 시스템 콜을 제한한다
네트워크모든 연결이 샌드박스를 떠나기 전에 정책 검사를 통과한다
크리덴셜"Agents never see real credentials; OpenShell adds them only to requests bound for approved endpoints"
감사모든 허용·거부 결정 의 추적 기록
분석형식적 정책 분석으로 API 작업을 제한한다
크리덴셜 중개는 따로 이름 붙일 값어치가 있는 통제다. 나머지는 에이전트가 갈 수 있는 범위를 제약하지만,
이것은 비밀 자체를 에이전트의 사정권에서 제거하므로, 모델 자신의 출력을 통한 누출 — 전사 기록, 로그,
잘못된 호스트로 향한 도구 호출 — 은 누출할 것이 없어진다.

수정 없이 실행된다고 보도된 에이전트: Claude Code, Codex, GitHub Copilot CLI, Hermes, LangChain Deep Agents, OpenClaw, OpenCode. 도입처로 보도된 곳: Cadence (칩 설계), Slack (엔터프라이즈 자동화), Gecko Robotics (물리 로보틱스 거버넌스).

출처 신뢰도, 그리고 이 절이 주장할 수 있는 범위의 한계

1차 출처 페이지를 읽지 못했다. 이 페이지를 만든 실행에서 developer.nvidia.com 과 docs.nvidia.com 이 모두 EGRESS_BLOCKED 로 응답했다. 위의 모든 내용은 여러 매체가 실은, 서로 일치한 검색 2회 패스 에서 왔다. 따라서:

  • 성능이나 오버헤드 수치는 돌아온 것이 없으므로 기록하지 않는다.
  • 샌드박스를 구현하는 커널 기능은 기록하지 않는다 — seccomp, eBPF, 네임스페이스, VM 모두 "커널 수준" 과 양립하며 어느 것도 지명되지 않았다.
  • 파트너 목록은 보도된 대로이며 전수 열거가 아니므로, 이 페이지는 누가 빠졌는지에 대해 어떤 주장도 하지 않는다. 이 발표를 처음 드러낸 r/LocalLLaMA 글은 OpenAI 가 합류하지 않았다고 주장 했으나, 그것은 부재 주장이며 여기서 채택하지 않는다.

열린 문제

  1. 정책은 누가 쓰는가? 선언적 경계는 그것을 쓴 사람만큼만 훌륭하며, 기본값이 제한적인지 허용적인지 아예 없는지 읽은 자료에 없다. "형식적 정책 분석" 은 분석이 필요할 만큼 복잡한 정책을 함축하고, 그 자체가 위험이다.
  2. 감사 추적의 비용은 얼마이고 누가 읽는가? 장시간 돌아가는 에이전트의 모든 허용·거부 기록은 보안 문제이기 전에 용량 문제이며, Safety Monitoring and Data Retention 은 에이전트 추적 기록의 보존이 논쟁 중임을 이미 보유한다.
  3. 커널 격리가 평가 사건들이 찾아낸 실패 양태를 막는가? Eval Environment Containment 에서 반복되는 세부는 모델들이 탈출을 시도하지 않았다 는 것이다 — 아직 훈련 안에 있다고 믿었다. 샌드박스는 손을 뻗는 에이전트를 막지만, 누군가 잘못된 자리에 그린 경계 안에서 시킨 그대로 하는 에이전트는 그 자체로 막지 못한다.
  4. 0.1.0 은 제품인가 입장인가? 그 정도로 낮은 버전 번호가 파트너 100곳 이상과 도입처 세 곳과 함께 나왔다는 것은 소프트웨어보다 생태계에 대한 발표다. 이 런타임이 어디에서든 실제로 하중을 지탱하는지는 읽은 자료로 확립되지 않는다.

주요 논문

없다. 이번 실행에 읽은 자료 어디에도 논문 인용이 없고, 프로덕션 에이전트 샌드박싱에 대해 이 위키가 보유한 arXiv 연구도 없다. 이 절은 다른 질문에 답하는 평가 측 문헌으로 채우는 대신 비워 둔다.

Referenced by

Sources