$ cat briefs/daily/2026-08-19.md
2026-08-19
2026년 8월 19일 (수)
소식 5건 · 논문 2편 · 관찰 4건 · 신규 페이지 6건
세 주 전, 천 명의 랩 직원이 자국 정부에 AI 를 늦출 장치를 만들어 달라고 요청했고 두 랩이 기관 차원에서 이를 지지했다. 이 위키는 그때 열린 질문 하나를 적어 두었다 — 기관 차원의 지지가 무엇인가를 구속하는가? 오늘 두 랩 모두 무언가를 멈춘 것으로 드러난다. 각자 따로, 이미 갖고 있던 장치 아래에서, 그리고 어느 쪽도 그 성명을 언급하지 않은 채로. 더 불편한 쪽은 Anthropic 이 밝힌 이유다. 실패한 테스트가 아니라, 아무것도 말해 주지 않게 된 평가다.
주요 소식
1. "Pacing the Frontier" 를 지지한 두 랩 모두 3주 안에 스스로 속도를 늦췄다 — 그리고 어느 쪽도 그렇게 부르지 않았다
- Anthropic, 2026-08-14: Risk Report: August 2026 이 고위험 상황에서의 파국적 정렬 실패 리스크를 "매우 낮음" 에서 "낮음" 으로 올린다 (Responsible Scaling Policy v3.4, 2026-02-24 → 2026-07-15 커버). 그리고 사내에 보유한 프런티어 또는 준프런티어 미공개 모델 세 개를 밝힌다 — 그중 하나인 Model 2 에 대해 "이 모델을 외부에 공개할 계획은 현재 없다" (source).
- OpenAI, 2026-08-18: 08-07 에 "명시적으로 무기한" 이던 Astra 감속은 알고 보니 2주 남짓 이어졌고, 끝났다 (source).
- 어느 조치도 성명을 인용하지 않는다. 둘 다 성명보다 앞선 프레임워크 — Preparedness Framework 와 Responsible Scaling Policy — 아래에서 취해졌고, 어느 쪽도 성명이 요구한 것이 아니다. 요구는 미국이 지원하는 국제적 도구 개발 노력 이었다. 두 건의 일방적 기업 결정은 성명이 대체 대상으로 지목한 즉흥적 대응 그 자체다.
- 의의: 멈출 선택지가 존재하고 실제로 쓰인다는 것은 일주일 전에는 이 위키가 할 수 없던 말이다 — 다만 그것을 행사하는 것은 성명이 불충분하다고 함축한 바로 그 사적 장치이며, 서명자들이 원했을 방식으로 질문에 답한 것은 아닐 수 있다.
- → Frontier Pacing, Anthropic, Astra
2. Anthropic 의 등급이 움직인 이유는 평가가 작동을 멈췄기 때문이다
- 변경의 원인은 실패한 테스트가 아니라 커진 불확실성이다. 가장 구체적인 과제 기반 평가가 "포화" 되어 더는 역량 증가를 기록하지 않고, "가속의 초기 징후" 를 보고하며, "이전 리스크 보고서들에서보다 이 평가에 대한 확신이 덜하다" 고 말한다 (source).
- Model 2 는 다수 내부 과제에서 Mythos 5 보다 눈에 띄게 나아진 것으로 서술되며 — Anthropic 자신의 요약은 더 유보적이다: "어떤 영역에서는 더 강하고 어떤 영역에서는 더 약하며 전체적으로는 약간 더 유능할 뿐". 두 독법 모두 페이지에 실었다. 앞의 것만 남기면 더 그럴듯한 주장이 된다.
- 의의: 이 위키의 다른 모든 정렬 결과는 측정이다. 이것은 랩이 자사 계측기가 변별을 멈췄다고 공개하는 것이고 — 포화된 평가는 안전한 모델과 측정되지 않은 모델을 구분하지 못하므로, 하류의 모든 보증이 그중 무엇도 반박되지 않은 채로 약해진다.
- → AI Alignment, Conceptual Reasoning Index (CRI)
3. 하네스 논지가 최선의 증거와 첫 실질적 반증을 한 배치에서 얻는다
- StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (arXiv:2608.15089) — 가중치를 건드리지 않고: GPT-5.6 Sol xhigh 가 Terminal-Bench 2.1 에서 445회 시행 동안 95.3% raw accuracy, DeepSeek-V4 Flash 는 $38 미만의 적응으로 82.7 → 88.1%, 런북은 버전 상승을 넘어 그대로 이전된다. 최종 점수 API 사용량: $15 대 $574.68.
- How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks (arXiv:2608.14905) — 8 개 하네스-모델 조합 × 100 개 연구 과제: 같은 45 개 실패 패턴이 가장 강한 모델을 포함해 8개 전부에서 반복되며, 결핍을 어느 스캐폴드가 아니라 모델 수준에 위치시킨다.
- 38배 비용 비율은 하네스 주장을 값 매길 수 있게 하는 첫 수치다. 08-17 이래 여기의 상시 불만은 일곱 편이 이득을 보고했는데 어느 것도 루프의 비용을 공개하지 않았다는 것이다.
- 의의: 둘은 모순이 아니며, 합산 해석이 이제 이 위키의 입장이다 — 하네스 스케일링은 실행 신뢰성을 사지만 자기 평가는 사지 못한다. StateM 은 경계가 있고 검증 가능한 과제에 지속 상태를 공급한다. AutoResearchEval 이 결여로 지목하는 것은 메타인지 루프이고, 어떤 상태 관리도 그것을 제공하지 않는다.
- → Eval Harness Configuration
4. Qwen3.8-27B 의 벤치마크 수치가 도착했다 — 그리고 서빙 경로가 그런 수치를 눈에 띄지 않게 움직일 수 있다는 논문도 함께
- Simon Willison 이 Artificial Analysis Intelligence Index 에서 Qwen3.8-27B 52 를 게시했다 — GPT-5.6 Luna (max) 와 동점, GLM-5.2 (max) 및 DeepSeek V4 Pro 0813 (max) 의 53 에 1점 뒤 (source). 이는 어제 이 위키가 확인 불가로 기록한 r/LocalLLaMA 주장의 방향을, 리더보드 페이지를 링크하는 이름 있는 저자로부터 정리해 준다.
- 같은 날 Ventor-QTest: Threat-Model-Driven Verification of Vendor-Hosted LLM APIs (arXiv:2608.16391) 는 벤더 호스팅 API 를 블랙박스로 감사해 경로 수준의 충실도 손실을 찾아내는데, 그것은 GPQA-Diamond 정확도와는 감지할 만한 연관이 거의 없으면서 두드러진 손실이 과제 노출이 늘어남에 따른 Terminal-Bench 통과율 하락과 함께 나타난다.
- 의의: 단일 턴 벤치마크는 그 결함에 구조적으로 눈이 멀어 있고, 이 위키의 서드파티 수치 대부분은 단일 턴 모양의 숫자다. 어떤 서빙 경로가 이 52 를 냈는지는 아무 데도 적혀 있지 않으며 — 상태는 보유된 측정이 아니라 이름 있는 저자의 서드파티 수치 로 옮겨간다. 다음 리더보드 캡처는 2026-08-23 이다.
- → Qwen 3.8 27B, Model Routing
5. Z.ai 가 Project Glasswing 에 답하는데, 그 게이트가 가중치 공개를 견딜지는 분명치 않다
- GLM-5.3 과 함께 발표된 "Shield of Open Source": 무료 보안 감사, ZCode 를 통한 자동 코드 감사, 무료 커뮤니티 사용 쿼터, 그리고 모델의 가장 민감한 공격적 역량을 검증된 사용자에게만 남겨 두는 제한 계층 "Cybersecurity Trusted Access". SCMP 가 인용한 연구자의 말로는 "중국식 Project Glasswing" 이며, 개방성을 결점이 아니라 자산으로 다룬다 (source).
- Anthropic 의 Glasswing 은 비공개 모델을 약 100–150개 검증 조직에 게이팅한다. Z.ai 는 가중치를 공개하면서 공격적 역량을 게이팅하겠다고 제안한다.
- 의의: 누구나 내려받을 수 있는 모델에 검증 접근 계층을 어떻게 강제하는지, 그것이 호스팅 API 에만 적용되는지, GLM-5.3 의 가중치 — 2026-08-28 무렵 예정 — 가 이 프로그램 아래 나오는지 아니면 이 프로그램에 묶여 있는지, 읽은 자료 어디에도 설명이 없다. 이 건은 랩 로테이션이 Z.ai 를 확인하고 아무것도 얻지 못한 다음 날, Trivium China 프리페치를 통해 도착했다.
- → Z.ai, AI-Enabled Cyberattacks
논문 선정
R³-Bench: LLMs Struggle with Resource-Rational Reasoning under Shared Budgets — arXiv:2608.16033
- TL;DR: 여섯 문제, 하나의 공유 예산, 그리고 같은 모델의 측정된 단일 문제 곡선으로 만든 오프라인 오라클을 기준으로 한 채점. 오라클이 72개 셀 전부에서 콘테스트 성능과 같거나 그 이상이고 71개에서 엄격히 더 높다.
- 읽을 이유: 가장 날카로운 행이 공짜인 쪽이다 — 균등 배분이 여섯 모델 중 네 모델에서 모델 자신의 선택을 이긴다. 추론 없이 예산을 여섯으로 나누는 편이 어떻게 나눌지 추론한 결과보다 낫다는 것은, 같은 페이지의 어떤 방법 논문보다 깨끗한 고발이다. 그것이 이기는 기준선이 아무 비용도 들지 않기 때문이다.
- → R³-Bench: LLMs Struggle with Resource-Rational Reasoning under Shared Budgets (arXiv:2608.16033), Test-Time Compute (Inference-Time Compute Scaling)
Improving the matrix multiplication exponent with modern optimization and AlphaEvolve — arXiv:2608.16884
- TL;DR: ω < 2.371177, 이전 최선 2.371339 에서 — combination loss analysis 핵심의 최적화를 재정식화하고, 그에 맞는 새 알고리즘을 설계한 뒤, 그 알고리즘을 AlphaEvolve 로 다듬어서.
- 읽을 이유: 흔한 서사의 역상이다. AI 는 아무것도 증명하지 않는다. 사람이 설계한 탐색 절차를, 사람이 정의한 공간 위에서 다듬는다. 그리고 나란히 놓인 Lean 인증서 결과들과 달리 이 주장에는 검증 기계장치가 필요 없다 — 두 기록 모두 공개된 숫자다. 상계는 0.000162 만큼 움직이고, 논문은 스스로를 note 라 부른다.
- → Improving the matrix multiplication exponent with modern optimization and AlphaEvolve (arXiv:2608.16884), AI for Mathematics
관찰
- 하네스는 어느 하네스냐에 따라 1.48배 값어치가 달라진다. ClawGym II: Exploring Black-Box RL on Agent Harness (arXiv:2608.16798) 는 불투명한 하네스를 통과해 학습시켜 OpenClaw 로 +9.98, Claude Code 로 +14.81 Pass@1 을 얻는다 — 같은 모델, 같은 벤치마크, 같은 방법. 또한 모델/하네스 구분 자체를 지탱하기 어렵게 만든다: 학습이 끝나면 모델은 더는 하네스 중립적이지 않다 (source).
- GLM-5.3 의 가중치는 2026-08-28 무렵 예정 — 안전성 평가를 거친 2주짜리 단계적 공개이며, 이제 설명되지 않은 검증 접근 계층이 그 옆에 놓였다. → GLM-5.3
- Mojo 가 오픈소스가 됐다 — 컴파일러와 툴체인이 Apache 2.0 with LLVM exceptions 로 (Modular, 2026-08-18), Mojo 1.0 이 컴파일러 없이 소스 안정성 보장을 낸 지 일주일 만이다. 벤치마크나 채택 수치는 공개되지 않았다 (source).
- Alignment Science 게시물 세 건이 엿새째 미수집 — AuditBench (2026-03-10), Introspection Adapters (2026-04-28), The Hot Mess of AI. W34 lint 로 넘긴다. 오늘의 Anthropic 헤드라인 역시 뉴스 페이지가 아니라 표적 검색으로 도착했고, 연속 네 번째 다.
위키 신규
여섯 건 모두 논문 페이지다. 이번 실행에서 사용자 검토가 필요한 것은 없다 — 엔티티·개념·인물 페이지가 생성되지 않았고, 연속 나흘째다.
- StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (arXiv:2608.15089)
- How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks (arXiv:2608.14905)
- ClawGym II: Exploring Black-Box RL on Agent Harness (arXiv:2608.16798)
- R³-Bench: LLMs Struggle with Resource-Rational Reasoning under Shared Budgets (arXiv:2608.16033)
- Ventor-QTest: Threat-Model-Driven Verification of Vendor-Hosted LLM APIs (arXiv:2608.16391)
- Improving the matrix multiplication exponent with modern optimization and AlphaEvolve (arXiv:2608.16884)
업데이트
- Frontier Pacing — 이번 실행의 최대 편집이며, 그 전까지 20일 묵어 있었다. 열린 문제 4번이 부분적으로 답을 얻었다.
- Anthropic · AI Alignment — Risk Report, +5일 지연 수집.
- Astra · OpenAI · AI-Enabled Cyberattacks — 중단 기간, 그리고 여전히 일정이 없는 것. 중단의 범위는 엇갈리며 해소하지 않고 기록했다.
- Eval Harness Configuration — 논문 세 편, 첫 비용 수치, 그리고 이 클러스터의 첫 부정적 결과.
- Test-Time Compute (Inference-Time Compute Scaling) — 방법을 제안하지 않는 네 번째 기제.
- Model Routing — 라우팅 계층 을 재는 첫 도구.
- Qwen 3.8 27B — 미결 주장 해소, 그리고 올바른 등급 하향.
- Z.ai · GLM-5.3 — Shield of Open Source.
- AI for Mathematics — ω 상계.
- OpenAI — ChatGPT for Teens: 연령 예측 시스템에 의한 자동 배정인데 정확도도 오탐률도 공개되지 않았고, Anthropic 의 auto-mode 분류기에서 기록한 것과 같은 공백이다.