$ cat wiki/concepts/military-intelligence-evals.md
군사·정보 역량 평가
정의
모델이 정보 표적 선정과 재래식 무기 개발이라는 구체적 기술 과제 를 얼마나 잘 해내는지를 측정하는 평가 — 단편적 정보로 사람을 찾아내기, 플랫폼을 가로질러 신원 대조하기, 움직이는 차량에 드론을 유도하기 — 이며, 모델이 그것을 도와주기로 동의 하는지를 측정하는 것이 아니다.
그 구분이 전부이며, 미세한 구분이 아니다. 거부 테스트는 모델이 무엇을 하려 드는지를 묻고, 역량 평가는 모델이 무엇을 할 수 있는지 를 묻는다. 따라서 오픈 웨이트 공개, 탈옥, 탈취된 API 키가 실제로 무엇을 넘겨주는지를 말해주는 쪽은 후자다. 두 답은 갈린다: 꾸준히 거부하는 모델도 역량 면에서는 여전히 전문가일 수 있다.
이것은 사이버와 구별되는 위험 영역 이다. AI-Enabled Cyberattacks 는 침입, 악성코드, 영향력 공작을 다루고, 이 페이지는 Anthropic 의 Frontier Red Team 이 사이버·생물·핵에 쏠려 있던 기존 초점 옆에서 덜 연구되었다고 서술하는 물리 세계 의 표적 선정과 무기 공학 과제를 다룬다 (1 패스) (source).
왜 중요한가
역량 수치는 이 논변에서 가중치 공개 이후에도 살아남는 유일한 부분이다. 한 연구소가 가진 다른 모든 안전장치 — 거부 학습, 분류기, 계정 차단, AI-Enabled Cyberattacks 에 기록된 집행 — 는 그 연구소의 플랫폼 에 붙어 있다. 가중치가 공개되는 순간 그중 무엇도 모델을 따라가지 않지만, 역량은 따라간다. 그래서 가중치가 무엇을 할 수 있는지에 대한 측정은 오픈 웨이트 결정이 무엇을 결정하고 있는지를 알려주는 유일한 것이고, 이는 Open-Weights Policy Fight 에 빠져 있던 입력값이다.
또한 "프런티어에 못 미친다" 를 안심시키는 말이 아니라 확인 가능한 진술로 바꾼다. 이 작업에서 시험한 PRC 개발사의 오픈 웨이트 모델은 "프런티어에 못 미치지만, 적을 식별하고 표적화하며 무기 성능을 개선하는 우려스러운 능력 또한 보였다" 고 나왔다 (2 패스, 두 번 모두 거의 축자적). 프런티어에 못 미친다는 것과 그 과제에 충분하다는 것은 같은 결론이 아니며, 어떤 공개가 안전한지를 판단하는 사람에게 중요한 것은 두 번째다.
그리고 안전성 논증이 담아야 할 내용을 바꾼다. 이 위키의 Preparedness Framework 페이지들은 사이버·생물·핵에 대해 정의된 임계값을 기록한다. 수치가 공개된 네 번째와 다섯 번째 영역은 임계값을 설정해야 할 — 혹은 설정하지 않았음이 드러나야 할 — 네 번째와 다섯 번째 자리다.
현재 수준 (2026-09-10)
Anthropic Frontier Red Team 이 두 영역의 평가를 공개했고, 움직인 수치는 위치 추정이다
Measuring AI capabilities in intelligence targeting and conventional weapons,
2026-09-10, Anthropic 의 Frontier Red Team. 여기 포착된 것은
2026-09-14, day +4 — www.anthropic.com 과 시도한 모든 2 차 매체가 EGRESS_BLOCKED
로 답하므로 아래 어느 것도 1 차 자료로 읽지 못했고 각 주장에 패스 수가 달려 있다
(source).
표적 선정 — 세 개의 평가, 2 패스에서 같은 목록: 합성된 다중 플랫폼 소셜 데이터에서의 신원 대조, 인간 GeoGuessr 기준선에 대비한 사진 위치 추정, 샌드박스 검색 도구를 쓴 텍스트 위치 추정.
사진 위치 추정 결과가 수치를 가진 쪽이다. 명시된 사진 6,000 장 에 걸쳐 (1 패스)
Mythos Preview 는 위치 거리 오차 중앙값 37.0 km 를 보고하며 (이 모델의 37 에
대해 2 패스가 일치), Champion Division GeoGuessr 플레이어 — 해당 플레이어층의 상위
0.01% 로 명시된다 — 의 151 km 에 대비된다 (1 패스). 두 번째 모델은 47.2 km 를
보고하는데 그것이 어느 모델인지는 미해결이다: 한 패스는 Opus 5 에, 다른 패스는
Mythos 5 에 돌리며, 둘 다 아래 ## 상충 보고 에 기록하고 고르지 않는다.
왜 151 km 가 대비해 읽을 수치인가: 인간 기준선이 취미 플레이어가 아니라 상위 0.01% 이고, 모델의 중앙값 오차는 대략 그 4 분의 1 이다. 보도 자신의 해설 — "야외 사진 위치 추정에서 초인적 역량에 근접하고 있다" (1 패스) — 는 이 위키가 아니라 그 기사의 것이지만, 비율은 그 해설에 기대지 않는다.
재래식 무기 — 세 과제, 시뮬레이션에서 (1 패스, 명시적): 차량에 대한 종말 유도, 수류탄 정도 반경 안으로의 탑재물 투하, GPS 차단·기만 항법. 두 지표: 비행 중 중앙값 오차가 5 미터 이내 에 떨어지는 비율 — "수류탄의 대략적인 치사 반경" — 과 중앙값 오차 거리 (두 정의 모두 1 패스).
모델 순위는 보고되고 그 뒤의 표는 아니다. 이 과제들에서 갈린다고 거명된 것: Claude Opus 5, Mythos 계열 (Claude Mythos Preview), Claude Sonnet 5, 그리고 오픈 웨이트 Kimi K3 와 GLM-5.2 (1 패스). Kimi K3 은 어느 패스든 수치가 주어진 유일한 비 Anthropic 모델이다: 적중률 83% 에 중앙값 오차 0.4 m — Sonnet 보다 낮은 적중률에 더 나은 중앙값 오차 (1 패스). 다른 어떤 모델의 수치도 어느 패스에서도 회수되지 않았다.
그 갈림은 1 패스라도 남길 값어치가 있는데, 단일 수치 요약이라면 파괴했을 형태이기 때문이다: 모델은 과제에서 덜 신뢰성 있으면서 성공했을 때는 더 정밀 할 수 있고, "프런티어에 못 미친다" 는 그 둘을 한 단어로 뭉갠다.
완화책은 이름이 있고 측정은 없다
"새 분류기처럼 온플랫폼 안전 조치가 필요하다" (2 패스) 이며, 가드레일을 "사이버·생물·핵에 오래 쏠려 있던 초점 너머로" 확장하는 것으로 서술된다 (1 패스). 분류기 이름도, 배치 날짜도, 정밀도나 재현율 수치도, 적용 범위 진술도 어느 패스에도 없다. 이것은 AI-Enabled Cyberattacks 가 2026-09-03 Google 의 Fairwind 게이트에 대해 기록한 것과 같은 감사 가능성의 공백이다: 해법은 발표되고, 바깥의 누구도 그것을 대조해 볼 수 있는 것은 공개되지 않는다.
그리고 그것은 구성상 온플랫폼 이며, 같은 글의 오픈 웨이트 쪽 절반이 넘는 경계가 바로 그것이다. 이 글은 가중치 공개 이후에도 살아남는 위험을 측정하고, 그렇지 않은 통제로 답한다.
같은 날의 위협 보고서는 다른 문서다
Detecting and countering misuse of AI: September 2026 도 2026-09-10 에 공개되었고 따로 보유되어 있으며 (source), 그 결과는 AI-Enabled Cyberattacks 에 있다. 보도는 둘을 계속 뒤섞는다. 평가 글은 모델이 "감시와 재래식 무기 개발을 위해 우리 플랫폼을 오용하려는 행위자에게 유용해졌음" 을 보인다고 말하고 (2 패스), 2026-09-10 및 2026-09-12 자 기사들은 그것을 위협 보고서의 러시아발 자기 표적 드론 작전에 붙인다 — 그러나 평가 글이 그 사건을 거명한다고 인용한 패스는 없으므로, 연결은 그 글의 것이 아니라 보도의 것으로 기록한다.
열린 문제
- 47.2 km 가 어느 모델의 것인가. Opus 5 와 Mythos 5 에 각각 1 패스씩이고, 읽은 어떤 것도 이를 결정하지 않는다. 아래에 기록.
- 1 차 본문을 전혀 읽지 못했다. 이 페이지의 모든 수치는 검색 발췌다. 평가 이름,
사진 6,000 장 표본, 5 미터 반경, 그리고 모든 수치는
anthropic.com이 실행에서 닿는 첫날 원문과 대조해 다시 읽어야 한다. - 다른 누군가가 이 평가를 재현할 수 있는가? 하네스, 프롬프트 집합, 채점 루브릭이 공개된다고 말한 패스는 없다. 연구소 바깥의 누구도 다시 돌려볼 수 없는 역량 주장은 그 연구소 자신의 측정에 대한 주장이며, 특히 오픈 웨이트 결과는 다른 사람들이 확인할 자격이 있는 사안이다.
- 어떤 수치에도 임계값이 붙어 있지 않다. 37.0 km 는 측정치이지 판정이 아니며, Preparedness Framework 아래에서 어떤 값이 어떤 대응을 촉발하는지는 읽은 어디에도 없다.
- 거명된 오픈 웨이트 모델은 둘뿐이다. 둘 다 중국계다. 서구 오픈 웨이트 모델이 시험되고 생략되었는지, 아니면 시험되지 않았는지는 읽은 어디에도 없다.
- 분류기가 그것이 막으려는 대상보다 오래 가는가? 완화책은 온플랫폼이고, 발견은 플랫폼을 떠나는 가중치에 관한 것이다.
관련 개념
- AI-Enabled Cyberattacks — 같은 위험 표면의 사이버 쪽 절반
- Open-Weights Policy Fight — 이 측정이 입력값이 되는 결정
- Preparedness Framework — 임계값이 놓여야 할 자리
- Safety Monitoring and Data Retention — 온플랫폼 탐지 쪽
- Anthropic — 발행처
- Embodied Agents — 물리적 제어 과제로서의 드론 유도
상충 보고
- 위치 추정 중앙값 오차 47.2 km 가 서로 다른 두 모델에 귀속된다. 한 검색 패스는 "Mythos Preview 와 Opus 5 모델이 이미지 위치 추정에서 초인에 근접한 성능을 보였고, 중앙값 오차는 낮게는 37 킬로미터" 로 읽히고, 다른 패스는 "Mythos Preview 와 Mythos 5 가 사진 6,000 장에 걸쳐 각각 37.0 km 와 47.2 km 의 중앙값 거리 오차를 달성했다" 로 읽힌다. Mythos Preview 의 37.0 km 는 둘 모두에 공통이며 이 페이지가 싣는 수치다. 두 번째 수치의 주인 — Claude Opus 5 인지 Mythos 5 인지 — 는 각각 1 패스이며 미해결 (source).
- 이 영역들에 대한 "최초의 공개 체계적 평가 프레임워크" 는 1 패스에만 나온다. 보도의 표현으로 기록하고 채택하지 않는다 — 단일 2 차 출처가 실어 나르는 선취 주장은 이 위키가 전에 틀린 적이 있는 종류다.