$ cat briefs/daily/2026-08-31.md
2026-08-31
2026년 8월 31일 (월)
스토리 2건 · 논문 픽 2건 · 워치 3건 · 신규 페이지 2건
> **오늘 가장 높은 점수를 받은 항목은 Top Story 가 아니라 Paper Pick 이고, 그대로 둔다.** > WikiSkill 은 **1.75** 로, 선두 스토리의 **1.20** 을 넘는다. 그것은 논문이고 Paper > Picks 는 논문을 위한 섹션이다. 위로 올리면 번호 매김이 섹션들이 담고 있지 않은 순위를 > 함의하게 된다. 아래 모든 점수를 적어 두었으니 이 배치에 직접 반박할 수 있다. > **스냅숏 Action 이 닷새 연속으로 예정 시각을 놓쳤고, 이 실행이 사흘 연속으로 직접 > 디스패치했다.** `eval-snapshots.yml` 은 22:20 UTC 논문 크론에서 **47분** 지나 있었고 > 생성된 실행이 없었다. 가장 최근 실행은 2026-08-30T00:25Z 의 #23 이었다. 수동 > 디스패치는 약 20초 만에 파일 세 개를 모두 썼다. **스크레이퍼는 매번 성공하고 있고 > 스케줄러가 문제다** — 오늘의 47분이 아니라 닷새 연속이 발견이다. W36 lint 에 점검 > 2o 로 넘긴다.
주요 소식
1. Tencent 가 1.5 TB 모델의 200 GiB 판본을 가중치 하루 뒤에 내놓고는, 그 대가에 대해 측정 가능한 말을 하지 않았다 — 점수 1.20
- Tencent Hunyuan 이 2026-08-29 에 MIX-STQ1_0 를 발표하고, 자사 AngelSlim 툴킷으로 Hy4 preview 를 1.5 TB 에서 ~200 GiB GGUF 로 압축해
AngelSlim/Hy4-preview-GGUF로 공개했다. 방식은 균일한 비트 폭이 아니라 캘리브레이션 데이터가 층마다 비트 폭을 고르는 혼합 정밀도로, 일부는 1.31-bit(STQ1_0) 까지 내려가고 일부는 2.06-bit(IQ2_XXS) 까지 올라간다 (source) - 품질 주장은 "it still works well" 이고 그게 전부다. 벤치마크 표도, 과제별 차이도, 유지된 정확도 수치도 공개되지 않았다. 떠도는 "약 98% 성능" 은 Reddit 게시자의 제목이지 Tencent 의 수치가 아니고 어떤 표로도 추적되지 않는다 — 위키 페이지에는 의도적으로 싣지 않았다
- 왜 중요한가: 가중치와 같은 주에 제공사가 직접 내놓은 7.5배 축소는 오픈 웨이트 공개가 데이터센터 바깥에서 쓰일 수 있는지를 가르는 단계이고, 이번 보름의 중국 오픈 웨이트 두 건에서 Z.ai 도 Alibaba 도 밟지 않은 단계다 — 둘 다 양자화를 제3자에게 맡겼다. Hy4 preview 가 08-30 에 지적한 공백을 절반만 메운다. 없던 아티팩트가 생겼지만 하드웨어 목표, 처리량, 메모리 수치는 누구에게서도 나오지 않았다
- → Hy4 preview, Tencent
2. 음악 출판사 두 곳이 Claude 의 학습 방식을 문제 삼아 Anthropic 을 제소했고, 점수는 어느 레인에서 읽느냐에 달려 있다 — 점수 0.91
- Sony Music Publishing 과 Warner Chappell Music 이 2026-08-28 에 제소하며, 자사 악곡 "thousands upon thousands" 에 대해 "brazen campaign of illegally torrenting, scraping and downloading copyrighted works on a massive scale" 이 있었다고 주장한다. 청구: 침해 저작물당 최대 $150,000, 저작권 관리 정보 제거 1건당 $25,000, 배심 재판 (source)
- 보도는 이를 Anthropic 에 대한 네 번째 음악 출판 소송으로 놓는다 — Concord/UMG, BMG(2026-03, 493 compositions), Round Hill Music(2026-08-17) 에 이어 — 그리고 다른 소송들이 좁은 저작물 집합을 지목한 데 비해 수만 곡을 주장한다는 점에서 범위로 구분한다
- 점수는 다툴 여지가 있고 두 해석을 모두 적는다. 소송·비즈니스로 읽으면(
0.7× Anthropic1.3) 0.91 이 되어 두 번째에 놓이고, 프런티어 모델·학습 데이터로 읽으면(1.3×1.3) 1.69 가 되어 브리프를 이끈다.interests.md가 소송 신호를 명시하지 않고 추적 신호 목록이 역량에 관한 것이라 낮은 쪽을 택했으나, 학습 데이터 출처가 역량 문제라고 본다면 높은 쪽도 타당하다 - 왜 중요한가: 이 위키는 Anthropic 의 법적 노출을 정부와의 마찰로 추적해 왔다 — Pentagon 지정, 봉인 해제된 Anthropic v. DoD 이메일. 이 건은 다른 종류이며 모델이 어떻게 만들어졌는가를 문제 삼는 첫 항목이다. 공개 제도가 끌어내든 아니든 디스커버리는 학습 데이터 출처에 이른다. 이는 주장이고, 어느 법원도 판단하지 않았으며, Anthropic 의 답변은 읽지 못했다
- → Anthropic, AI Governance
논문 픽
WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution — arXiv:2608.27454 — 점수 1.75
- TL;DR: 스스로 스킬을 발견하는 에이전트는 각 스킬 뒤의 추론 을 최적화 이력에 흩어진 채로 두어 재사용할 수 없게 만든다. WikiSkill 은 원시 경험, 축적된 지식 베이스(wiki), 실행 가능한 스킬을 세 개의 층으로 나누고 스킬과 wiki 를 함께 진화시킨다. 어블레이션은 그 지속적 축적이 작동에 결정적이라고 보고한다.
- 구성에서 따라 나오지 않는 세 가지 결과: 스킬이 모델과 모델 계열을 넘어 이전되고, 다른 모델이 진화시킨 스킬이 자기 진화 스킬을 이길 수 있으며, 스킬을 갖춘 작은 모델이 스킬 없는 훨씬 큰 모델을 능가할 수 있다.
- 읽어야 하는 이유: LLM Knowledge Bases (LLM-curated personal wikis) 가 세워진 전제 아래에 어블레이션을 놓은, 이 위키가 보유한 첫 논문이다. 그리고 이전 결과는 축적된 아티팩트가 공유 자산이라고 말한다 — 개선이 모델의 속성이기를 그치고 그 옆에 놓인 객체의 속성이 된다.
- 위의 모든 것을 제한하는 유보: 초록은 벤치마크도, 모델도, 수치도 명시하지 않으며 "대부분의 모델-벤치마크 조합"이라고 물러선다. 방향이지 크기가 아니다.
- → WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution
Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment — arXiv:2608.23691 — 점수 1.00
- TL;DR: Stephen Chung, Wenyu Du, William J. Wesley 가 서로 다른 모델 계열의 에이전트들을 the Station 이라는 환경에 하나의 공유 연구 목표와 함께 두되 중앙 조정자도 사전에 짜인 파이프라인도 없이 두었다. 보고된 결과는 다섯 개의 미해결 문제에서 수학 문헌에 새로운 결과다.
- 최초 발견은 Claude 에이전트에게 18(64.3%), GPT 에이전트에게 9(32.1%), Gemini 에이전트에게 1(3.6%) 귀속된다.
- 읽어야 하는 이유: 이 위키가 보유한 모든 다중 에이전트 배치는 역할이 배정된 한 계열이다. 오케스트레이터가 없는 혼합 계열 집단은 다른 종류의 대상이며, 여기 기록된 첫 계열별 귀속 분포다.
- 64.3% 는 가장 잘못 인용되기 쉬운 수치다. 각 계열의 에이전트가 몇이나 있었는지 밝힌 자료가 없으므로 역량 비교가 아니다. 모델 버전도 공개되지 않았다.
- 출처가 얇고 그렇다고 적어 두었다: 이 실행에서
arxiv.org는 차단되어 있고 논문을 읽지 못했다. 페이지는 서로 다른 질의로 수행한 두 번의 검색이 모든 수치에서 일치한 데 기대고 있다. - → Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment
관찰
- 공개 나흘째, Hy4 preview 에 대해 누구든 가진 수치는 여전히 Tencent 자신의 것뿐이다. 오늘의 Artificial Analysis 캡처는 Tencent 를 Hy3 하나로만, Intelligence Index 42 로 변함없이 등재한다. 가정이 아니라 확인한 결과이며 — 모든 행의 Intelligence Index 와 Cost per Task 가 어제와 바이트 단위로 동일하고 서비스 관련 세 열만 움직였다는 점도 적어 둘 만하다 (source)
- Anthropic Alignment Science 상시 점검이 사흘 연속으로 수행되지 못했다. 여기서
alignment.anthropic.com은EGRESS_BLOCKED를 반환하므로 인덱스를 아예 읽지 못했다. Introspection Adapters(2026년 4월)와 The Hot Mess of AI(2026년 2월)는 20일째 미포착 상태다. 해소가 아니라 이번 실행에서 읽을 수 없었음으로 기록한다 — 이 점검의 요지는 어떤 소스가 목록에 있고 24회 인용되고도 한 번도 페치되지 않을 수 있다는 것이다 - 이 샌드박스의 이그레스가 사흘 연속 전면 차단이며,
agents/daily-run.md가 적어 둔 범위보다 넓다:www.anthropic.com,alignment.anthropic.com,openai.com,arxiv.org,huggingface.co,simonwillison.net모두 curl 에서000을 반환했다. WebSearch 는 작동한다. 그 대가는 위에 드러나 있다 — 논문 페이지 두 개 모두 여기서 논문으로부터 읽지 않은 수치를 싣고 있다
위키 신규
오늘은 신규 엔티티·개념 페이지가 없으므로 사용자 검토가 필요한 항목이 없다.
업데이트
- Hy4 preview: MIX-STQ1_0 양자화, 1.5 TB / 1.56 TB 아티팩트 크기, 같은 기준의 Hy3 비교(295B/21B/256K/598 GB 대 770B/49B/1M/1.56 TB), 그리고 제3자 측정이 여전히 없음을 확인한 오늘의 리더보드
- Tencent: 양자화 공개, 그리고 이번 보름에 다른 어느 중국 연구소도 제공사 직접 양자화를 내놓지 않았다는 점
- Anthropic: Sony/Warner 제소, 읽지 못한 피고 답변을 부재가 아니라 미확인으로 표시
- AI Governance: 이미 추적 중인 EU AI Act 공개 의무 옆에, 학습 데이터 출처에 이르는 두 번째 경로로서의 소송
- LLM Knowledge Bases (LLM-curated personal wikis): WikiSkill 의 어블레이션, 그리고 그 이전 결과가 스키마의 "portability first" 원칙에 대해 말하는 것
- AI for Mathematics: the Station 결과, 그리고 그것이 이 페이지의 "공통 척도가 없다"는 열린 문제에 어떻게 내려앉는지
- Agents (LLM Agents): 에이전트가 가중치를 움직이지 않고 좋아지는 두 가지 방식, 둘 다 옮길 수 있다