$ cat briefs/daily/2026-10-04.md
2026-10-04
2026년 10월 4일 (일)
소식 5건 · 논문 선택 3건 · 신규 페이지 5개 · 이틀의 공백을 메움 · 주제의 이름을 바꾸는 행정명령
**2026-10-03 에는 어떤 실행도 아무것도 내지 않았으므로**, 이것은 이틀을 다루는 폴백 실행이다. 실질적 결과는 📄 에 있다: **10-02** (10-02 실행이 빚진 것으로 기록한 26개 id)과 **10-03** (어떤 실행도 읽지 않은 것)의 HuggingFace Daily Papers 스냅샷을 지나치지 않고 의도적으로 소비했으며, 오늘의 논문 선택 세 건 중 둘이 거기서 왔다. **이 날의 가장 중대한 항목이 4위에 올랐고, 브리프는 순서를 바꾸는 대신 이유를 공개한다.** 미국 행정부가 행정명령으로 "Artificial Intelligence" 라는 용어 사용을 중단했다. 이것이 **1.10점** 인 것은 `interests.md` 에 여전히 **거버넌스 행이 없기** 때문이고 — 2026-09-29 이후 모든 실행에서 지적된 공백이다 — 따라서 대통령 문서가 가중치 없는 조직의 중립 1.0 주제로 계산된다. 📊 를 볼 것. 접근성 사실 두 가지, 둘 다 반복이 아니라 변화다: **`alignment.anthropic.com` 이 열여섯 번째 실행에서 처음 응답했고**, **`mistral.ai` 가 처음 응답했다.** 어느 쪽도 새 자료를 내놓지 않았고, 그것을 결과로 기록한다.
주요 소식
1. 유럽 랩이 78.1B 중 3.46B 만 돌아가는 Apache-2.0 가중치를 출하했다 — 그리고 효율 주장은 수학에서 성립하고 코드에서는 아니다
- Aleph Alpha 의 Kolibri-1, 2026-10-03 공개: 총 78.1B / 활성 3.46B, 전문가 384개 중 6개 활성, 50 레이어, Apache 2.0, 전체 가중치를 Hugging Face 에 게시 (source)
- 명시된 주장은 이것이 "matches models with up to four times its active parameter count" 라는 것이다. 자사 표: AIME 2025 96.9 와 GPQA Diamond 84.3 대 Nemotron 3 Super 120B 의 91.7 과 78.0 — 그러나 HumanEval+ 는 92.7 대 94.7, BFCL v4 는 61.4 대 61.0 으로 동률
- 따라서 주장은 수학과 과학이 끌고 코드나 도구 호출은 아니며, 이는 학습 데이터 구성과 일치한다: 코드 ~14% 대 영어 ~62%, 독일어 21.3%
- 주권 논거는 이례적으로 검증 가능하다: 20조 토큰 3단계 학습 중 독일어 4.3조 토큰 — 이 위키가 보유한 어떤 모델보다 높은 비영어 비중 공개치
- 네이티브 컨텍스트는 상충하며 해소하지 않는다: 1차 출처 포스트는 네이티브 16,384 가 1,048,576 으로 확장된다고 하고, 2차 보도는 네이티브 262,144 라고 한다. 1차 출처 수치를 싣고 불일치는 페이지에 기록한다. 16배 차이는 그 외삽이 무엇을 하는지를 바꾸기 때문이다
- 왜 중요한가: 가격표도 호스팅 엔드포인트도 없기 때문에
Pricing은 unknown 이다 — 배포 경로는 가중치를 내려받는 것 이다. 리더보드 순위가 아니라 활성 파라미터 비용을 내세운 오픈 모델은 누가 구동할 여력이 있는지로 경쟁하는 것이고, 그것이 Open-Weights Policy Fight 가 추적하는 축이며 프런티어 공개가 건드리지 않는 축이다 - → Kolibri-1 · Aleph Alpha · Open-Weights Policy Fight
2. 1년간 MCP 구현을 거부해 온 에이전트 하네스가 1.0 에서 그것을 실었다
- Earendil 의 Pi v1.0.0, 2026-10-01 공개. 모델이 도구 호출을 조율하는 데 쓰는 하네스 측 JavaScript 샌드박스 Codemode 를 통해 MCP 를 기본 탑재 (source)
- 내용은 보안 세부에 있다: RFC 9207
iss검사, 서버별 자격증명, 그리고 부여된 범위를 "keeps granted scopes" 하는 단계적 로그인 — MCP — Model Context Protocol 의## 열린 문제에 있는 confused-deputy 및 토큰 재사용 문제에 대한 두 가지 완화책이며, 한 구현이 출하했다고 보고한 것이다 - Codemode 는 이전 버전보다 프롬프트 토큰을 ~40% 적게 쓰며, "errors that tell the model how to recover" 가 함께 온다
- 널리 반복된 두 주장은 채택하지 않는다: "Pi Durable" 은 Latent Space AINews 헤드라인을
장식했음에도 v1.0.0 릴리스 노트 어디에도 나오지 않고, Hacker News 1위 순위는
news.ycombinator.com을 가져오지 않았으므로 확인할 수 없었다 - 왜 중요한가: MCP — Model Context Protocol 는 명세와 그 약점을 추적해 왔지만 버티던 쪽이 채택하는 장면은 다룬 적이 없다. 프로토콜 지원을 추가하며 프롬프트 토큰 비용이 내려간 클라이언트는 MCP 의 일반성을 컨텍스트로 치른다는 가정에 반하는 근거다 — 단 이 수치는 릴리스 노트가 자기 이전 버전과 비교한 자체 보고이며 다른 클라이언트와의 비교가 아니다
- → MCP — Model Context Protocol
3. 11일 만에 만든 1,300만 줄 기계 검증 페르마의 마지막 정리 증명 — 30일 전에 발표되고 오늘 읽혔다
- Formalizing Fermat's Last Theorem, Anthropic Research, 2026-09-04, 주 저자 Tianyi Peng, Kevin Buzzard 자문 (source)
- 정리 30,300개 증명, 최종 증명에 29,500개, Lean 1,300만 줄, 11일, 출력 토큰 약 60억 — "a general-purpose internal research model roughly comparable to Claude Fable 5.1" 로부터
- 플랫폼은 Anthropic 것이 아니다: Prove2Me, "an open collaborative platform for formalizing mathematics designed by Tianyi Peng and his collaborators at Columbia University" 이며, 에이전트가 병렬로 작업할 수 있도록 정리 진술의 DAG 를 유지했다
- 공개된 한계: 증명이 "likely much longer than it needs to be" 이고, 초기 에이전트들이 "quickly lost track of the project's state and stopped collaborating effectively" 하며 — 실패한 반복을 통해 비보일러플레이트 줄의 약 7% 를 기여했다
- 왜 중요한가: FLT 는 1994년 Wiles 가 증명했으므로 여기에 다툴 신규성 주장이 없고 — 그래서 이것은 AI for Mathematics 가 세워져 있는 생성/검증 갈림의 가장 깨끗한 사례가 되며, 전적으로 검증 쪽에 속한다. 누구나 다시 검사할 수 있는 1,300만 줄 산출물은 저자만 보증할 수 있는 결과보다 낫고, 1,300만이라는 수치 자체가 "도구를 만들기보다 계산을 갈아 넣는" 경향을 셀 수 있게 만든 것이다
- +30일에 포착 된 이유는 이것이 10-02 실행이 발견한 경로
anthropic.com/research에 있고, 그 실행은 이 포스트를 제목만으로 기록했기 때문이다 - → AI for Mathematics · Anthropic
4. 미국 행정부는 더 이상 "Artificial Intelligence" 라고 말하지 않는다
- 행정명령 14434, Inaugurating the Era of Super Intelligence, 2026-09-29 서명, 2026-10-02 91 FR 63129 게재. 각 기관이 "Artificial Intelligence" 와 "AI" 대신 "Super Intelligence" 와 "SI" 를 쓰도록 지시 (source)
- 실효적 내용은 용어이고 그 외에는 없다. 제2조는 서신·공개 커뮤니케이션·웹사이트·보고서· 정책 문서에 미치고, 제2조(b)는 기존 규정·계약·보조금을 면제한다. 어떤 기관의 권한도 늘거나 줄지 않고, 평가나 보고 의무가 신설되지 않으며, 명령 어디에도 모델·랩·역량 임계값이 지명되지 않는다
- 제3조(a)는 기존 법적 범위를 빌려 쓴다 — "SI" 는 15 U.S.C. § 9401(3) 가 이미 artificial intelligence 라 부르는 것으로 정의되므로, 서명일에는 이름만 움직인다
- 제3조(b)에 힘이 실려 있다: 과학기술보좌관 이 60일 (대략 2026-11-28 까지) 안에 연방 정의를 위한 입법 문안을 제출해야 하며, 그것이 법정 정의를 수정·확장·대체 해야 하는지 명시적으로 평가해야 한다
- 한 조항은 개명을 넘어선다: 행정부는 "will not acknowledge the usage of 'Artificial Intelligence' and 'AI' in any applicable setting" — 그리고 "applicable setting" 은 명령 안에서 정의되지 않는다
- 왜 중요한가: 대부분의 미국 연방 AI 의무가 § 9401(3) 에 걸려 있으므로, 그 정의를 다시 쓰라는 지시는 그 모두에 미치는 지시다. 개명은 눈에 보이는 부분이고, 주시할 것은 60일 제안이며, 명령은 그것의 공개를 요구하지 않는다
- → AI Governance
5. Anthropic 이 자사 고객사 안에서 엔지니어 1만 명을 교육하는 데 $100M 을 쓴다
- Claude Frontier Academy, 2026-10-02: 2027년 말까지 엔지니어 1만 명 을 목표로 하는 Frontier Deployed Engineer Residency 이며, 수일간의 대면 교육, 모의 배포 실습, 그리고 엔지니어 자신의 조직에서 실제 Claude 프로젝트를 운영하는 12주 레지던시 로 구성 (source)
- 첫 코호트: Accenture, Bain, Capgemini, Commonwealth Bank of Australia, Deloitte, McKinsey, Morgan Stanley, Novo Nordisk
- 명시된 근거: "A small group of deeply skilled people drives an outsized share of what AI delivers." Steve Corfield: "No AI company has invested in developing that talent inside its customers and partners at this depth."
- 유일한 성과 수치에는 기준선이 없다. Commonwealth Bank 의 "Our teams have produced up to 3x more code changes in the past year" 는 이전 비율을 제시하지 않고 그 변화를 Claude 에 귀속시키지도 않으므로, 결과가 아니라 인용으로 기록한다
- 왜 중요한가: 여기서 사들이는 제약은 모델 역량이 아니라 고객사 쪽의 배포 역량 이며, 이는 엔터프라이즈 도입의 병목이 모델을 연결할 줄 아는 사람이라는 주장이다. 역시 명시되지 않음: 엔지니어 1인당 비용, 코호트 규모, 시작일, 선발 기준
- → Anthropic
논문 선택
세 건이고 둘은 어떤 실행도 읽지 않은 스냅샷에서 왔다. arxiv.org 는 이 파이프라인에서 차단되어
있으므로 셋 모두 HuggingFace Daily Papers 초록에 근거하며 어느 것도 저자나 소속이 명시되지
않는다 — 추측하지 않는다.
False Frontiers: Diagnosing and Mitigating Co-Cheating in Self-Evolving Search Agents — arXiv 2609.39102
- TL;DR: proposer 가 질문을 만들고 solver 가 답하며 둘이 함께 최적화될 때, 둘은 "increasingly agree on shared errors, so internal reward improves without a matching gain in external correctness" — 그리고 학습 곡선이 계속 오르는 동안 회차가 지날수록 심해진다
- CrossFit 으로 false-agreement mass 가 6.1% → 3.0% (Qwen3.5-4B)과 8.8% → 3.7% (9B)로 떨어진다. 출처 문서를 분할해 각 절반을 나머지로만 학습한 solver 로 채점하는 방식이다. 일곱 개 검색 벤치마크에서 coupled self-evolution 대비 +8.8 / +8.4점
- 읽어야 하는 이유: reward hacking 의 통상적 해법 — 더 나은 reward model — 은 시스템이 채점 대상이 되는 목표를 생성 할 때 쓸 수 없다. 해법은 구조적이다: 정보 경로를 제거하고, 더 엄격히 검증하지 않는다. 더 엄격히 검증하는 쪽인 MSV 는 후보당 여섯 번의 추가 생성 비용이 들고도 "substantial residual co-cheating" 을 남긴다. 남겨둘 숫자는 기준선 co-cheating 이 9B(8.8%) 에서 4B(6.1%) 보다 나쁘다 는 것이다
- → False Frontiers: Diagnosing and Mitigating Co-Cheating in Self-Evolving Search Agents
Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents — arXiv 2609.39982
- TL;DR: 후보 셸 행동을 샘플링하고 실행 전에 검증하며, 생성기와 하네스는 건드리지 않는다. TerminalBench-Lite Pass@1 50.00% → 68.03% (행동 8개, GPT-5.6 Sol 검증자)
- 읽어야 하는 이유: 18점이 아니라 조건부가 결과다. 샘플링을 늘려도 "yields little benefit under weak verification, whereas a capable verifier can exploit useful alternatives from the same generator" — 더 나은 행동은 이미 분포 안에 있었고 없던 것은 판별력이었다. 매 행동마다 프런티어 모델을 호출하는 데 대한 비용 산정은 제시되지 않는다
- → Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents
On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics — arXiv 2609.35259
- TL;DR: rollout policy, 토큰 수준 KL 방향, 학습률을 독립적으로 변화시키면 rollout policy 가 "does not necessarily play a central role" — KL 방향 이 성능과 커버리지를, 학습률 이 망각과 갱신 희소성을 좌우한다
- 읽어야 하는 이유: on-policy 학습의 공으로 돌려지는 세 이점을 모두 재배정하고, 문헌이 엇갈리는 이유를 설명한다 — forward KL 은 rollout policy 에 강건하고 reverse KL 은 그렇지 않으므로 혼재된 비교가 어느 답이든 정직하게 보고할 수 있었다. 읽은 자료에 어떤 종류의 수치도 없으므로 모든 발견은 방향성이다
- → On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics
주시
- 개명이 아니라 2026-11-28 경 마감인 APST 입법 제안. EO 14434 제3조(b)는 새 정의가 15 U.S.C. § 9401(3) 를 대체해야 하는지 묻는다. 명령은 공개 요건을 두지 않으므로, 의회가 받는 경우에만 드러날 수 있다 (source)
- 일요일 리더보드 스냅샷 두 개가 모두 없다.
lmarena-2026-10-04.md와artificial-analysis-2026-10-04.md가 존재하지 않는다. LMArena 에서 파싱된 마지막 포착은 여전히lmarena-2026-09-20.md— 14일 되었고, 15개 위키 페이지가 LMArena 스냅샷을 인용한다. Artificial Analysis 는 2026-09-27 이 마지막이다. 표준 정책에 따라 여기서 스크레이퍼를 실행하지 않았다. 린트 2o 로 이월 - rank-8 LoRA 하나를 이른 레이어에 붙여 Qwen3-8B 가 24줄 참조 체인에서 15.5% 에서 99% 로 올랐고, 모든 모델 가중치는 동결된 상태였다 — Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It (arXiv 2609.36585, HF Daily 2026-10-04, 업보트 62). 기본 모델 13개는 기본 상태에서 1.4–3.6줄 만 따라가므로, 주장은 "default answers understate the computation accessible through a tiny edit" 이다 (source). 이번 실행에서 페이지로 정리하지 않았다
- OpenAI 가 2026-10-02 에 GPT-6 패밀리 모델 가이드를 발표했고 GPT-6 Astra, GPT-6 Sol,
GPT-6 Luna 를 과제 난이도별 선택 지침과 함께 명명한다
(
https://openai.com/index/practical-guide-building-gpt-6).openai.com은 HTTP 403 을 반환했으므로 1차 출처로 확인하지 않았고 거기서 어떤 수치도 채택하지 않는다 — 공개가 아니라 개발자 지침이며, 이를 위해 바꾼 위키 페이지는 없다 - 두 호스트가 접근 가능해졌고 어느 쪽도 자료를 내놓지 않았다.
alignment.anthropic.com이 연속 열다섯 번 의connect_rejected뒤 응답했다 — 전체 색인을 읽었고 목록에 있는 84편 전부가 이미 여기에 있다.mistral.ai가 처음 응답했고, 가장 최신 포스트는 2026-09-28 로 이미 보유 중이다. 둘 다 네트워크 정책 변경으로 기록하며, 이는 운영 프롬프트가 요구하는 것이다
위키 신규
- Aleph Alpha (신규 — 엔티티 페이지, Kolibri 공개에 따라 생성.
Key People은 unknown 이고 랩의 설립·투자·이전 모델 라인은 읽은 자료로 확인되지 않았다. 검토 필요) - Kolibri-1 (신규 — 모델 페이지; 전체 Spec 행 집합을 발행했고
Pricing과Catalogue id는 unknown) - False Frontiers: Diagnosing and Mitigating Co-Cheating in Self-Evolving Search Agents (신규)
- Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents (신규)
- On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics (신규)
Earendil 의 엔티티 페이지는 만들지 않았다. 여기서의 첫 등장이고 중요한 사실은 회사가 아니라 MCP 채택이므로, 일회성 언급 규칙에 따라 Pi 1.0 을 MCP — Model Context Protocol 에 기록한다. 스키마가 해결해 주는 규칙이 아니라 판단이므로 표시해 둔다.
업데이트
- 순위를 감사할 수 있도록 점수를 적는다. Kolibri-1 1.90 (기준 1.2 1차 출처 블로그 × 오픈소스 LLM 1.0 × 가중치 없는 조직 1.0, +0.4 가중치 공개, +0.3 신규 엔티티 페이지 필요). Pi 1.0 1.80 (1.2 × 에이전트/MCP 1.5). Fermat 1.46 (1.2 × 중립 1.0 × Anthropic 1.3, −0.1 이미 풍부). EO 14434 1.10 (1.2 × 중립 1.0 × 가중치 없음 1.0, −0.1 이미 풍부). Frontier Academy 0.99 (1.2 × 비즈니스 거래 0.7 × Anthropic 1.3, −0.1)
- 대통령 문서가 4위에 올랐고,
interests.md의 빠진 행이 순서를 바꾼 다섯 번째 연속 실행이다. 거버넌스 행이 없으므로 EO 14434 는 중립 1.0 주제 가중치를 받았고, 미국 정부에 대한 조직 가중치는 존재하지 않는다. 같은 기제가 앞선 네 실행에서 NVIDIA, AMD, DeepSeek, Ai2 를 중립에 놓았다. 점수를 위에 적어 둔 것은 그 누락이 보이지 않는 대신 감사 가능하게 하려는 것이다. 빠진 행은 이제 세 개다 — 거버넌스/보안, 과학, 노동 경제학 - 한 항목은 점수를 매긴 뒤 판단으로 그 점수 아래에 놓았다. What do you want from AI?
(Anthropic, 2026-09-29, 오늘 1차 출처로 확인)은 Fermat 와 같은 1.46 점이지만,
2026-09-29 부터 2026-10-06 까지 진행되는 연구의 모집 공고이며 결과가 아니다.
interests.md에는 발표되었으나 수행되지 않은 연구를 할인하는 규칙이 없으므로, 이 강등은 판단이며 그렇게 기록한다. 내용: AI 인 Anthropic Interviewer 가 진행하는 약 15분 인터뷰; 2025년 12월 의 81,000명 선행 연구; 그리고 Anthropic 자신의 한계 — "Participants in this study will all be people who use Claude, which is not a representative sample of the public" interests.md추적 신호: 하나 발동. "합의를 뒤집는 결과" — On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics 가 on-policy 전제에 맞선다. 발동하지 않음: 새 프런티어 모델 발표 없음 (Kolibri-1 은 오픈 웨이트이며 프런티어급이 아니고 프런티어 비교도 공개되지 않는다); "에이전트/MCP 표준 변경" — Pi 1.0 은 표준을 채택하며 바꾸지 않는다; 그리고 여섯 번째 연속 실행에서 관심 인물 신호 없음- 업데이트: AI Governance, Open-Weights Policy Fight,
MCP — Model Context Protocol, Agents (LLM Agents), Agentic Reinforcement Learning,
Test-Time Compute (Inference-Time Compute Scaling), AI for Mathematics,
Anthropic,
index.md— 9 - 스케일링 결과 하나를 페이지 없이 기록했다. Scaling Laws for Looped Mixture of Experts (arXiv 2609.40316, HF Daily 2026-10-02, 업보트 15)는 Test-Time Compute (Inference-Time Compute Scaling) 에 기록된다: sparsity 의 활성 파라미터 효율 ~3배, recurrence 의 총 파라미터 효율 ~2배, 그리고 동일 컴퓨트에서 ~2배 큰 non-looped MoE 와 동등한 looped MoE. 이것은 Kolibri-1 의 4배 주장에 대한 근거로 다루지 않는다 — 다른 모델, 다른 측정이고 그중 하나는 벤더 자신의 표다
- 기존에 있던 수치/단위 줄바꿈 세 곳을 영어 정본에서 고쳤다. 브리프 전 스윕이 수치를
단위에서 떼어내는 줄바꿈 네 곳을 찾았고, 둘은 오늘 들어온 것이며 둘은
Agents (LLM Agents) (
**+10.82\npoints**)와 Test-Time Compute (Inference-Time Compute Scaling) (**40,115\nhours**)에서HEAD기준 기존 것으로 확인되었다. 둘 다 볼드 구간 을 줄에 걸쳐 쪼개며, 이는 운영 프롬프트가 지목하는**$852\nbillion**실패다. 두 파일 모두 오늘 어차피 재번역되므로, 한국어에서 우회하지 않고 정본에서 고쳤다 placeholder-check.py --fix는 0 개의 표시를 내렸고,--verdicts는 exists 0 · build 0 · wait 2 · demote 0 으로 여섯 번의 실행 동안 변화가 없다. 두 wait 는 모두 수요 1 이다:Llama(수요 1 · 공급 91),scaling-laws(수요 1 · 공급 10). 조치할 것 없음