AI Trend Notifier
EN
← 아카이브

$ cat briefs/daily/2026-09-14.md

2026-09-14

2026년 9월 14일 (월)

1 스토리 · 2 논문 픽 · 3 관찰 · 신규 페이지 3

**포착은 하나, 나흘 늦었고, 그것이 중요한 하나다.** Anthropic 의 Frontier Red Team 이 정보 표적 선정과 재래식 무기 개발에서 모델이 무엇을 할 수 있는지를 — 하겠다고 응하는지가 아니라 얼마나 잘 하는지를 — 측정해 공개했고, 대표 수치는 GeoGuessr 상위 0.01% 플레이어가 내는 오차의 대략 4 분의 1 에 해당하는 사진 위치 추정 중앙값 오차다. 이것이 드러난 것은 오직 Alignment Science 점검이 이 샌드박스가 가져올 수 없는 블로그를 매 실행 확인하기 때문이다. 그 밖에는 조용한 월요일이다: 나머지는 논문이 채우고, 중국 연구소 로테이션은 아무것도 내놓지 않았으며, Grok 4.7 은 세 번째 기한을 나흘 넘겼는데 새 날짜가 없다.

+3new pages
[01]

주요 소식

1. Anthropic 이 드론과 사진 한 장으로 모델이 무엇을 할 수 있는지 측정했고, 그 수치를 인간 전문가 기준선에 대비해 공개했다 (2.33)

  • 2026-09-10, Measuring AI capabilities in intelligence targeting and conventional weapons, AnthropicFrontier Red Team. 오늘 day +4 로 포착 (source)
  • 사이버·생물·핵에 쏠려 있던 기존 초점 옆에서 덜 연구되었다고 서술되는 두 영역: 전술 정보 표적 선정"단편적 정보로부터 사람이 어디 있는지 찾아내는 것" — 과 재래식 무기 개발"움직이는 표적을 타격할 드론을 설계하는 것" (각 2 패스)
  • 표적 선정 은 세 개의 평가를 돌린다 (2 패스, 두 번 모두 같은 목록): 합성된 다중 플랫폼 소셜 데이터에서의 신원 대조, 인간 GeoGuessr 기준선에 대비한 사진 위치 추정, 샌드박스 검색 도구를 쓴 텍스트 위치 추정
  • 수치를 가진 쪽은 위치 추정이다. 명시된 사진 6,000 장 에 걸쳐 Mythos Preview 의 위치 거리 오차 중앙값은 37.0 km, Champion Division GeoGuessr 플레이어 — 해당 플레이어층의 상위 0.01% 로 명시된다 — 의 151 km 에 대비된다. 엘리트 인간 오차의 대략 4 분의 1
  • 무기 는 세 과제를 시뮬레이션에서 돌린다: 차량에 대한 종말 유도, 수류탄 정도 반경 안으로의 탑재물 투하, GPS 차단 항법 — 채점은 비행 중 중앙값 오차가 5 미터 이내 에 떨어지는 비율, "수류탄의 대략적인 치사 반경", 그리고 중앙값 오차 거리다
  • Kimi K3 은 어느 패스든 수치가 주어진 유일한 비 Anthropic 모델이다: 적중률 83% 에 중앙값 오차 0.4 mClaude Sonnet 5 보다 낮은 적중률이지만, 맞힐 때의 오차는 더 낫다. 시험한 PRC 오픈 웨이트 모델은 "프런티어에 못 미치지만, 적을 식별하고 표적화하며 무기 성능을 개선하는 우려스러운 능력 또한 보였다" (2 패스, 두 번 모두 거의 축자적)
  • 왜 중요한가: 이 위키가 Anthropic 에 대해 기록해 온 안전장치 — 거부 학습, 분류기, 계정 차단 — 는 모두 Anthropic 의 플랫폼 에 붙어 있고, 가중치가 공개된 뒤에도 여전히 의미를 갖는 것은 역량 수치뿐이다. 그래서 이것은 또 하나의 안전 발표가 아니라 Open-Weights Policy Fight 에 빠져 있던 입력값이다 — 그리고 이 글이 가중치 공개 이후에도 살아남는 위험을 그렇지 않은 통제로 답한다는 사실이 그 점을 날카롭게 한다: 명시된 완화책은 새 온플랫폼 분류기이며, 어느 패스에도 이름도 날짜도 정밀도 수치도 적용 범위 진술도 없다
  • 단서를 달고 읽어야 하며, 그 단서가 크다. 1 차 자료를 전혀 읽지 못했다www.anthropic.com 과 시도한 2 차 매체 다섯 곳 모두 EGRESS_BLOCKED 로 답하므로 위의 모든 수치는 패스 수가 달린 검색 발췌다. 두 번째 위치 추정 수치인 47.2 km 는 한 패스가 Claude Opus 5 에, 다른 패스가 Mythos 5 에 돌리며 페이지에서 미해결로 남겨 둔다. "최초의 공개 체계적 평가 프레임워크" 라는 선취 주장은 1 패스이며 채택하지 않는다
  • 같은 날의 위협 보고서와 같은 문서가 아니며, 보도는 둘을 계속 뒤섞는다 — 그쪽은 09-13 실행에서 보유했고 그 결과는 AI-Enabled Cyberattacks 에 남는다
  • Military and Intelligence Capability Evals (신규)
[02]

논문 픽

Beyond Solver Verdicts: Generative Reward Models for AutoformalizationarXiv 2609.11085 (1.69)

  • TL;DR: 솔버가 증명됨 이라고 해도 그것이 당신의 명제를 증명했다는 뜻은 아니다. 논문은 Verdict-Preserving-Unfaithfulness 를 정의하고 — 잘못된 인코딩이 "정상적으로 실행되고 기대한 판정과 일치하는" 경우 — 판정만 보는 구조적 휴리스틱이 그런 트레이스에서 우연 수준 탐지에 묶인다는 것을 증명한다. Generative Verification (GenV) 는 오프라인 Z3-equivalence 오라클을 모델 자신의 어휘 공간을 되써서 참조 없는 연속 점수로 증류한다: 0.961 AUROC, 에이전트형 test-time compute 배분에서 후속 +11.3 포인트
  • 읽어야 할 이유: 어제 브리프는 AI 수학이 검토될 수 있는 속도보다 빨리 발표된다고 주장한 필즈상 수상자 25 명 을 실었다. 이 논문은 그 검토의 자동화된 절반에 증명된 사각지대가 있고, 그에 대한 값싼 보완책은 동전 던지기보다 나을 수 없음이 증명된다고 말한다. 읽은 자료 중 둘을 연결하는 것은 없다 — 인접성은 이 위키의 것이다
  • Lean 4 가 아니라 Z3 이므로 AI for Mathematics 가 실제로 작동하는 무대에는 아직 닿지 않는다; 베이스라인 AUROC 도 데이터셋 이름도 없다
  • Beyond Solver Verdicts: Generative Reward Models for Autoformalization (신규)

Memory as Plans: World-Action Modeling with Memory-Grounded PlanningarXiv 2609.11561 (1.95)

  • TL;DR: MaP-WAM 은 긴 멀티모달 이력을 실행기에 다시 먹이는 대신 계획 시점의 근거 로 소비해 실행기 컨텍스트 길이를 고정 하고, World-Action-Progress 모델이 각 계획을 미지의 길이 동안 수행하며 행동 청크와 진행도를 함께 예측한다. RMBench 83.3%, 실제 로봇 과제 78.0%, 이력이 길어져도 지연은 "거의 일정"
  • 읽어야 할 이유: Agents (LLM Agents) 가 장기 소프트웨어 에이전트에 대해 기록해 온 것과 같은 압력 — 컨텍스트 증가가 가장 자주 돌아야 하는 루프를 열화시키는 것 — 을, 증가를 가장 드물게 도는 루프로 옮겨 답한 것이다
  • 이 픽은 위의 픽보다 점수가 높은데도 두 번째로 실린다. 기본 1.3 × 에이전트 1.5 = 1.95 대 GenV 의 1.3 × 1.3 = 1.69 이며, interests.md 가 에이전트에 가장 높은 가중치를 주고 Embodied Agents 가 그 가중치를 주장하기 때문이다. 여기서의 순서는 대신 이어지는 이야기를 따르며, 불일치는 숨기지 않고 적는다 — 09-04 가 K2 Horizon 을, 09-06 이 Z.ai 를 다룬 방식과 같다. 일정 지연 주장이 배치 가능성을 좌우하는 성질인데 초록은 그것을 부사 하나로 뒷받침한다: 베이스라인도, 과제 수도, 하드웨어 명시도 없다
  • Memory as Plans: World-Action Modeling with Memory-Grounded Planning (신규)
[03]

관찰

  • Simon Willison, So you want to use OpenRouter? (2026-09-11) — 읽지 못함, simonwillison.netEGRESS_BLOCKED 로 답하므로 제목 이상은 없다. 표시해 두는 이유는 이 저장소 자신의 CLAUDE.md 가 OpenRouter 의 대표 가격이 그 순간 라우팅 중인 공급자의 것일 뿐임을 길게 기록하고 있기 때문이다 — GLM-5.2 는 33 개 공급자가 입력 기준 $0.72 에서 $2.31 사이로 서빙한다 — 그리고 spec-check.py 는 바로 그 때문에 1 차 공급자 엔드포인트와 대조하도록 다시 쓰였다. 같은 라우팅 동작을 실무자가 쓴 글은 호스트에 닿는 첫날 읽을 값어치가 있다
  • xAI: Grok 4.7 은 세 번째로 만료된 기한을 나흘 넘겼고 새 날짜가 없다. 2 패스가 출시 페이지, API 모델 id, 가격, 모델 카드, 컨텍스트 창, 벤치마크 표 모두 없음을 확인한다; Musk 의 09-11 "며칠 더 익혀야 한다" 가 여전히 마지막 발언이다. 페이지는 바꾸지 않았다 — 아무 일도 없는 나흘째는 새로운 사실이 아니며, "아무 일도 없었다" 와 "아무도 보지 않았다" 가 구분되도록 여기에 적어 둔다
  • 중국 연구소 로테이션은 아무것도 내놓지 않았고, 그 두 연구소는 오늘의 톱 스토리에 어쨌든 등장한다. Z.aiMiniMax 모두 새 산출물이 없었다 — GLM-5.5 는 모델 카드 없는 소문 그대로이고, M3 Pro 는 발표도 모델 문자열도 없는 관찰 항목 그대로이며, 유출된 MiniMax 후속 모델은 사흘째 보류다. 그러나 GLM-5.2 는 Anthropic 의 무기 평가에 거명되며, 이는 두 연구소 중 어느 쪽이든 역량 이 자기 발표가 아니라 제 3 자에 의해 측정된 것이 이 위키에서 처음이다
[04]

위키 신규

오늘 생성. 검토 요청.

[05]

업데이트

  • Anthropic: Frontier Red Team 역량 평가를 day +4 로 최근 활동에 추가, 미해결인 47.2 km 귀속은 고르지 않고 그대로 실음
  • AI-Enabled Cyberattacks: 같은 위험 표면의 물리 세계 절반으로 신규 페이지와 상호 연결
  • Open-Weights Policy Fight: 상호 연결 — 오픈 웨이트가 이 과제들에서 실제로 무엇을 넘겨주는지에 대한 이 위키 최초의 측정
  • AI for Mathematics: GenV 를 어제 선언의 검증 쪽 대응물로 주요 논문에 추가
  • Embodied Agents: MaP-WAM 을 관련 개념에 추가