$ cat briefs/daily/2026-09-14.md
2026-09-14
2026년 9월 14일 (월)
1 스토리 · 2 논문 픽 · 3 관찰 · 신규 페이지 3
**포착은 하나, 나흘 늦었고, 그것이 중요한 하나다.** Anthropic 의 Frontier Red Team 이 정보 표적 선정과 재래식 무기 개발에서 모델이 무엇을 할 수 있는지를 — 하겠다고 응하는지가 아니라 얼마나 잘 하는지를 — 측정해 공개했고, 대표 수치는 GeoGuessr 상위 0.01% 플레이어가 내는 오차의 대략 4 분의 1 에 해당하는 사진 위치 추정 중앙값 오차다. 이것이 드러난 것은 오직 Alignment Science 점검이 이 샌드박스가 가져올 수 없는 블로그를 매 실행 확인하기 때문이다. 그 밖에는 조용한 월요일이다: 나머지는 논문이 채우고, 중국 연구소 로테이션은 아무것도 내놓지 않았으며, Grok 4.7 은 세 번째 기한을 나흘 넘겼는데 새 날짜가 없다.
주요 소식
1. Anthropic 이 드론과 사진 한 장으로 모델이 무엇을 할 수 있는지 측정했고, 그 수치를 인간 전문가 기준선에 대비해 공개했다 (2.33)
- 2026-09-10, Measuring AI capabilities in intelligence targeting and conventional weapons, Anthropic 의 Frontier Red Team. 오늘 day +4 로 포착 (source)
- 사이버·생물·핵에 쏠려 있던 기존 초점 옆에서 덜 연구되었다고 서술되는 두 영역: 전술 정보 표적 선정 — "단편적 정보로부터 사람이 어디 있는지 찾아내는 것" — 과 재래식 무기 개발 — "움직이는 표적을 타격할 드론을 설계하는 것" (각 2 패스)
- 표적 선정 은 세 개의 평가를 돌린다 (2 패스, 두 번 모두 같은 목록): 합성된 다중 플랫폼 소셜 데이터에서의 신원 대조, 인간 GeoGuessr 기준선에 대비한 사진 위치 추정, 샌드박스 검색 도구를 쓴 텍스트 위치 추정
- 수치를 가진 쪽은 위치 추정이다. 명시된 사진 6,000 장 에 걸쳐 Mythos Preview 의 위치 거리 오차 중앙값은 37.0 km, Champion Division GeoGuessr 플레이어 — 해당 플레이어층의 상위 0.01% 로 명시된다 — 의 151 km 에 대비된다. 엘리트 인간 오차의 대략 4 분의 1
- 무기 는 세 과제를 시뮬레이션에서 돌린다: 차량에 대한 종말 유도, 수류탄 정도 반경 안으로의 탑재물 투하, GPS 차단 항법 — 채점은 비행 중 중앙값 오차가 5 미터 이내 에 떨어지는 비율, "수류탄의 대략적인 치사 반경", 그리고 중앙값 오차 거리다
- Kimi K3 은 어느 패스든 수치가 주어진 유일한 비 Anthropic 모델이다: 적중률 83% 에 중앙값 오차 0.4 m — Claude Sonnet 5 보다 낮은 적중률이지만, 맞힐 때의 오차는 더 낫다. 시험한 PRC 오픈 웨이트 모델은 "프런티어에 못 미치지만, 적을 식별하고 표적화하며 무기 성능을 개선하는 우려스러운 능력 또한 보였다" (2 패스, 두 번 모두 거의 축자적)
- 왜 중요한가: 이 위키가 Anthropic 에 대해 기록해 온 안전장치 — 거부 학습, 분류기, 계정 차단 — 는 모두 Anthropic 의 플랫폼 에 붙어 있고, 가중치가 공개된 뒤에도 여전히 의미를 갖는 것은 역량 수치뿐이다. 그래서 이것은 또 하나의 안전 발표가 아니라 Open-Weights Policy Fight 에 빠져 있던 입력값이다 — 그리고 이 글이 가중치 공개 이후에도 살아남는 위험을 그렇지 않은 통제로 답한다는 사실이 그 점을 날카롭게 한다: 명시된 완화책은 새 온플랫폼 분류기이며, 어느 패스에도 이름도 날짜도 정밀도 수치도 적용 범위 진술도 없다
- 단서를 달고 읽어야 하며, 그 단서가 크다. 1 차 자료를 전혀 읽지 못했다 —
www.anthropic.com과 시도한 2 차 매체 다섯 곳 모두EGRESS_BLOCKED로 답하므로 위의 모든 수치는 패스 수가 달린 검색 발췌다. 두 번째 위치 추정 수치인 47.2 km 는 한 패스가 Claude Opus 5 에, 다른 패스가 Mythos 5 에 돌리며 페이지에서 미해결로 남겨 둔다. "최초의 공개 체계적 평가 프레임워크" 라는 선취 주장은 1 패스이며 채택하지 않는다 - 같은 날의 위협 보고서와 같은 문서가 아니며, 보도는 둘을 계속 뒤섞는다 — 그쪽은 09-13 실행에서 보유했고 그 결과는 AI-Enabled Cyberattacks 에 남는다
- → Military and Intelligence Capability Evals (신규)
논문 픽
Beyond Solver Verdicts: Generative Reward Models for Autoformalization — arXiv 2609.11085 (1.69)
- TL;DR: 솔버가 증명됨 이라고 해도 그것이 당신의 명제를 증명했다는 뜻은 아니다. 논문은 Verdict-Preserving-Unfaithfulness 를 정의하고 — 잘못된 인코딩이 "정상적으로 실행되고 기대한 판정과 일치하는" 경우 — 판정만 보는 구조적 휴리스틱이 그런 트레이스에서 우연 수준 탐지에 묶인다는 것을 증명한다. Generative Verification (GenV) 는 오프라인 Z3-equivalence 오라클을 모델 자신의 어휘 공간을 되써서 참조 없는 연속 점수로 증류한다: 0.961 AUROC, 에이전트형 test-time compute 배분에서 후속 +11.3 포인트
- 읽어야 할 이유: 어제 브리프는 AI 수학이 검토될 수 있는 속도보다 빨리 발표된다고 주장한 필즈상 수상자 25 명 을 실었다. 이 논문은 그 검토의 자동화된 절반에 증명된 사각지대가 있고, 그에 대한 값싼 보완책은 동전 던지기보다 나을 수 없음이 증명된다고 말한다. 읽은 자료 중 둘을 연결하는 것은 없다 — 인접성은 이 위키의 것이다
- Lean 4 가 아니라 Z3 이므로 AI for Mathematics 가 실제로 작동하는 무대에는 아직 닿지 않는다; 베이스라인 AUROC 도 데이터셋 이름도 없다
- → Beyond Solver Verdicts: Generative Reward Models for Autoformalization (신규)
Memory as Plans: World-Action Modeling with Memory-Grounded Planning — arXiv 2609.11561 (1.95)
- TL;DR: MaP-WAM 은 긴 멀티모달 이력을 실행기에 다시 먹이는 대신 계획 시점의 근거 로 소비해 실행기 컨텍스트 길이를 고정 하고, World-Action-Progress 모델이 각 계획을 미지의 길이 동안 수행하며 행동 청크와 진행도를 함께 예측한다. RMBench 83.3%, 실제 로봇 과제 78.0%, 이력이 길어져도 지연은 "거의 일정"
- 읽어야 할 이유: Agents (LLM Agents) 가 장기 소프트웨어 에이전트에 대해 기록해 온 것과 같은 압력 — 컨텍스트 증가가 가장 자주 돌아야 하는 루프를 열화시키는 것 — 을, 증가를 가장 드물게 도는 루프로 옮겨 답한 것이다
- 이 픽은 위의 픽보다 점수가 높은데도 두 번째로 실린다. 기본 1.3 × 에이전트 1.5 = 1.95 대 GenV 의 1.3 × 1.3 = 1.69 이며,
interests.md가 에이전트에 가장 높은 가중치를 주고 Embodied Agents 가 그 가중치를 주장하기 때문이다. 여기서의 순서는 대신 이어지는 이야기를 따르며, 불일치는 숨기지 않고 적는다 — 09-04 가 K2 Horizon 을, 09-06 이 Z.ai 를 다룬 방식과 같다. 일정 지연 주장이 배치 가능성을 좌우하는 성질인데 초록은 그것을 부사 하나로 뒷받침한다: 베이스라인도, 과제 수도, 하드웨어 명시도 없다 - → Memory as Plans: World-Action Modeling with Memory-Grounded Planning (신규)
관찰
- Simon Willison, So you want to use OpenRouter? (2026-09-11) — 읽지 못함,
simonwillison.net이EGRESS_BLOCKED로 답하므로 제목 이상은 없다. 표시해 두는 이유는 이 저장소 자신의CLAUDE.md가 OpenRouter 의 대표 가격이 그 순간 라우팅 중인 공급자의 것일 뿐임을 길게 기록하고 있기 때문이다 — GLM-5.2 는 33 개 공급자가 입력 기준 $0.72 에서 $2.31 사이로 서빙한다 — 그리고spec-check.py는 바로 그 때문에 1 차 공급자 엔드포인트와 대조하도록 다시 쓰였다. 같은 라우팅 동작을 실무자가 쓴 글은 호스트에 닿는 첫날 읽을 값어치가 있다 - xAI: Grok 4.7 은 세 번째로 만료된 기한을 나흘 넘겼고 새 날짜가 없다. 2 패스가 출시 페이지, API 모델 id, 가격, 모델 카드, 컨텍스트 창, 벤치마크 표 모두 없음을 확인한다; Musk 의 09-11 "며칠 더 익혀야 한다" 가 여전히 마지막 발언이다. 페이지는 바꾸지 않았다 — 아무 일도 없는 나흘째는 새로운 사실이 아니며, "아무 일도 없었다" 와 "아무도 보지 않았다" 가 구분되도록 여기에 적어 둔다
- 중국 연구소 로테이션은 아무것도 내놓지 않았고, 그 두 연구소는 오늘의 톱 스토리에 어쨌든 등장한다. Z.ai 와 MiniMax 모두 새 산출물이 없었다 — GLM-5.5 는 모델 카드 없는 소문 그대로이고, M3 Pro 는 발표도 모델 문자열도 없는 관찰 항목 그대로이며, 유출된 MiniMax 후속 모델은 사흘째 보류다. 그러나 GLM-5.2 는 Anthropic 의 무기 평가에 거명되며, 이는 두 연구소 중 어느 쪽이든 역량 이 자기 발표가 아니라 제 3 자에 의해 측정된 것이 이 위키에서 처음이다
위키 신규
오늘 생성. 검토 요청.
- Military and Intelligence Capability Evals (신규 — 개념 페이지; 표적 선정과 무기에서의 역량 측정에 대한 이 위키 최초의 페이지이며, AI-Enabled Cyberattacks 가 사이버 표면을 다루고 이 페이지가 물리 표면을 다루므로 의도적으로 분리했다)
- Beyond Solver Verdicts: Generative Reward Models for Autoformalization (신규)
- Memory as Plans: World-Action Modeling with Memory-Grounded Planning (신규)
업데이트
- Anthropic: Frontier Red Team 역량 평가를 day +4 로 최근 활동에 추가, 미해결인 47.2 km 귀속은 고르지 않고 그대로 실음
- AI-Enabled Cyberattacks: 같은 위험 표면의 물리 세계 절반으로 신규 페이지와 상호 연결
- Open-Weights Policy Fight: 상호 연결 — 오픈 웨이트가 이 과제들에서 실제로 무엇을 넘겨주는지에 대한 이 위키 최초의 측정
- AI for Mathematics: GenV 를 어제 선언의 검증 쪽 대응물로 주요 논문에 추가
- Embodied Agents: MaP-WAM 을 관련 개념에 추가