$ cat briefs/daily/2026-08-23.md
2026-08-23
2026년 8월 23일 (일)
논문 7건 · 리더보드 캡처 2건 · 스토리 4건 · 논문 픽 2건 · 관찰 2건
주요 소식
1. 벤치마크는 최적화의 대상이 되고 있다 — 그리고 시드가 방법보다 점수를 더 많이 움직인다
- Hugging Face 의 Measuring benchmark optimization in speech recognition (2026-08-21)은 "benchmaxxing" 을 재기 위한 테스트 세 가지를 제시하고 이를 널리 쓰이는 오픈소스 ASR 모델 11개에 적용한다. 가장 높은 점수를 받은 시스템 여럿이 오디오가 뒷받침하지 않는데도 VoxPopuli English 와 LibriSpeech 의 참조 전사를 재생산한다: 오디오에 없는 단어를 내놓고, 묵음 처리된 숫자를 높은 비율로 복원하며, 오디오가 두 표기를 똑같이 뒷받침할 때는 그 벤치마크가 기대하는 표기 변형을 고른다 (source)
- 세 번째 양상이 남겨둘 부분이다: 암기된 정답이 아니라 암기된 전사 관례이며, 오디오를 아무리 held-out 으로 두어도 잡히지 않는다. 서술된 해법은 완전한 held-out 세트를 쓰고, 단일 공개 벤치마크의 WER 만 읽지 않는 것이다
- 별개로 Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See (arXiv:2608.17744) 은 첫 번째 결과로 활성 파라미터 3.6–4.0B 규모에서 랜덤 시드만 바꿔도 정확도 점수가 7.7점 움직인다고 보고한다 — 논문이 측정한 모든 데이터·레시피 효과보다 크다
- 의의: Eval Harness Configuration 은 이제 서로 독립적인 변동 요인 네 가지를 담고 있다 — 하네스(6.8점), 맥락 품질, 기억, 그리고 이제 7.7점의 시드 — 각각이 릴리스 노트가 쓰이는 델타와 비슷한 크기다. 그 바닥보다 작은 단일 벤치마크 델타는 정보를 담지 않으며, 공개 벤치마크에서의 델타는 held-out 벤치마크에서의 같은 델타보다 덜 담는다
- → Eval Harness Configuration, Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See (arXiv:2608.17744)
2. GLM-5.3 이 첫 독립 수치를 얻었고, 그것은 벤더의 주장보다 작다
- 오늘의 일요일 캡처는 GLM-5.3 (max) 을 Artificial Analysis Intelligence Index 60, 과제당 $0.68, 컨텍스트 1M 으로 싣는다 — 이 모델은 2026-08-16 캡처에는 없었다 (source)
- 같은 표의 GLM-5.2 (max) 53 과 견주면, 이는 Z.ai 가 베이스가 바뀌지 않았다고 서술한 두 모델 사이의 제3자 종합 지표에서의 7점 이동이다 — Post-Training Scaling 의 핵심 주장을 팔 것이 없는 쪽에서 뒷받침한 첫 사례다
- 같은 주장은 아니다. 지표 종합값은 Z.ai 내부 평가의 ~50% 코딩 개선이 아니며,
(max)는 각 모델의 최상위 추론 설정끼리를 비교한다. 정직하게 읽으면 두 배가 아니라 한 티어다. 가중치는 여전히 공개되지 않았다 — 서술된 안전성 평가 기간은 2026-08-28 무렵 끝난다 - 의의: "역량이 가중치로 도착하기를 멈췄다"는 W33 이래 릴리스 노트를 읽어낸 해석이었다. 독립적 측정이 그 주장이 예측하는 방향으로 움직인 것은 이번이 처음이고, 그것이 어디까지인지를 누군가 한정한 것도 처음이다
- → GLM-5.3, Post-Training Scaling, Z.ai
3. 논문 두 편이 과제 성공은 잘못된 숫자라고 말한다 — 체화 스택의 양 끝에서
- SoftVTBench: A Deformation-Aware Visuo-Tactile Dataset and Benchmark for Deformable-Object Manipulation (arXiv:2608.18701) 는 정책이 볼 수 있는 촉각 관측을 평가자 전용 유한요소 정답과 짝짓고, Diffusion Policy, π₀.₅, FastWAM 전반에서 분포 내 설정 12개 모두가 변형 허용 범위를 위반한 성공 롤아웃을 포함한다 — 각 설정 성공의 0.7–24% 임을 발견한다. 정책은 물체를 으스러뜨리면서도 기존의 모든 벤치마크를 통과한다
- 설계를 바꿔야 할 두 번째 발견은 이것이다: 촉각은 분포 외 비교 여섯 건 모두에서 성공률을 올리지만 DSR 은 다섯 건에서만 올리고, 분포 내에서는 이득이 엇갈린다 — "촉각을 사용할 수 있게 만드는 것만으로 효과적인 멀티모달 융합이 보장되지는 않는다"
- Decision-Metric Alignment in Latent World Models: Diagnostics and Action-Conditioned Objectives for MPC Planning (arXiv:2608.18746) 는 JEPA 계열 계획기가 실제로 필요로 하는 것 — 잠재 목표 거리가 계획을 실제 진척 순서로 정렬하는가 — 에 이름을 붙이고, 그것이 표현 품질에서 따라 나오지 않음을 보인다: DA-LeWM 은 프로브 점수가 비슷하게 유지되는 채로 온라인 성공률을 높인다
- 의의: 둘 다 편리한 대리 지표를, 시험 대상 시스템이 볼 수 없는 독립 채널로 대체한다. 이는 1번 스토리의 ASR 게시물이 하는 것과 같은 교정이며, 같은 날 물리 제어에서 도착했다
- → Embodied Agents, Mechanistic Interpretability
4. 이 위키가 해소일로 오늘을 지목하며 남겨둔 질문이, 적힌 그대로 해소되었다
- 2026-08-19 에 Qwen 3.8 27B 는 이름이 밝혀진 저자로부터 제3자 Intelligence Index 52 를 기록하면서, 그것이 보유된 측정치가 아니며 "다음 캡처는 2026-08-23"이라고 적어두었다
- 오늘 캡처는 08-16 에 하나도 없던 Qwen3.8 27B 행을 셋 담고 있다: xhigh 52, medium 44, low 43, 모두 256k (source)
- 새로운 정보는 그 격차다. 43 → 52 는 같은 가중치에서 9점이며, 원래 주장이 "막상막하"라고 불렀던 어느 모델과의 격차보다도 크다. Grok 4.6 도 같은 캡처에서 설정 셋을 얻었고 격차도 같은 9점이다 — 그리고 그 모델은
high(61) 가xhigh(60) 보다 5분의 4 비용으로 더 높은 점수를 받았으며, 읽은 그대로 기록한다 - 의의: 리더보드의 한 행은 모델이 아니라 설정을 가리킨다. 설정 없이 인용하면 아무것도 가리키지 않는데, 이 위키는 8월 내내 Grok 4.6, GLM-5.3, Qwen 3.8 27B 전반에서 그런 행들을 인용해왔다
- → Qwen 3.8 27B, Grok 4.6
논문 픽
Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See — arXiv:2608.17744
- TL;DR: 그리스어로 추론하도록 파인튜닝한 프런티어 MoE 모델 셋. 정확도는 거의 움직이지 않고, 이 규모에서 벤치마크는 잡음이다. 베이스 모델은 그리스어 질문에도 그리스어 추론 트레이스를 1,000개 중 0개 내놓지만 SFT 이후 항목의 **약 98%**에서 그렇게 하며, RLVR 이 SFT 가 못 고치는 것을 고친다 — 형식 이탈 24% → 2.5%, 채널 누출 3.5% → 0.0% — 그리고 그리스어 습관은 정확도만 보는 그래디언트를 그대로 견딘다
- 읽어야 할 이유: 방법론이 드문 부분이다 — 학습 전 사전 등록, 평탄한 랜덤 보상 대조군, 길이 상관성에 대해 게이팅된 모든 지표, 그리고 저자 자신의 계측기가 거짓말한 여섯 번의 공개. 모니터 가능성 결과이기도 하다: 사용자가 읽을 수 없는 언어로 추론하는 모델은 어떤 기만도 개입하지 않은 채 감사 불가능하다
- → Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See (arXiv:2608.17744)
Repo0: Design-Driven Zero-to-All Code Generation — arXiv:2608.19854
- TL;DR: 아키텍처가 미리 정의되지 않은 상태에서 자연어 요구사항으로부터 프로젝트 전체를 만들며, 명시적 Dual-DAG(요구사항 DAG, 컴포넌트 DAG, 정렬 관계)를 유지하고 모듈성 지표로 컴포넌트 경계를 구조적 수렴까지 진화시킨 뒤 테스트 우선으로 코드를 생성한다. RepoCraft 저장소 여섯 개에서 RPG 대비 Functionality Coverage +20.08pp, Pass Rate +29.74pp
- 읽어야 할 이유: 이번 주의 다른 방향과 어긋난다. MemTrapBench, SWE-bench Science, Demystifying Agent Skills 는 모두 추가된 맥락이 에이전트에 세금이 된다고 보았는데, 이것은 값을 하는 추가된 구조이고 어블레이션이 어느 부분인지 말해준다. 단서: 백엔드 모델 둘 다 중간급이므로, 프런티어 생성기가 어차피 맥락 안에 담는 것을 보완하고 있을 수 있다
- → Repo0: Design-Driven Zero-to-All Code Generation (arXiv:2608.19854)
관찰
- GLM-5.3 의 가중치가 2026-08-28 무렵 돌아올 예정이며, 닷새 남았다. Training Leaves Traces: Centered Residual Signatures for Language Model Lineage Verification (arXiv:2608.14929) 는 체크포인트만으로 가중치 계보를 AUROC 1.0 으로 검증한다 — 따라서 가중치가 나오면 Z.ai 의 "베이스는 그대로" 주장은 단언이 아니라 검증 가능한 것이 되며, 벤더 주장이 그렇게 되는 일은 드물다 (GLM-5.3)
- Hugging Face 의 State of Open Models: Summer 2026 Observations 가 아흐레째 도달 불가이며 Open-Weights Policy Fight 에 정확히 부합한다. 오늘의 비대칭에 주목하라: 같은 차단된 호스트의 다른 게시물은 검색이 본문을 인용할 만큼 띄워주었기 때문에 인제스트되었다. 문제는 호스트가 아니다
위키 신규
오늘은 새 엔티티·개념·인물 페이지가 없다 — 사용자 검토가 필요한 항목 없음.
새 논문 페이지 일곱 개: Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See (arXiv:2608.17744), Repo0: Design-Driven Zero-to-All Code Generation (arXiv:2608.19854), SoftVTBench: A Deformation-Aware Visuo-Tactile Dataset and Benchmark for Deformable-Object Manipulation (arXiv:2608.18701), Decision-Metric Alignment in Latent World Models: Diagnostics and Action-Conditioned Objectives for MPC Planning (arXiv:2608.18746), FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving (arXiv:2608.19758), The More Popular, The Harder to Forget: Adaptive Popularity for LLM Unlearning (arXiv:2608.14229), SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation (arXiv:2608.17426).
갱신
- Eval Harness Configuration: 새 날짜 섹션 — ASR 에서 측정된 벤치마크 최적화, 그리고 네 번째 변동 요인으로서의 시드
- Embodied Agents: 현재 수준이 2026-08-23 으로 이동; 측정에 관한 새 열린 문제 둘
- Mechanistic Interpretability: 열린 문제 6·7 — 정직하지만 읽을 수 없는 트레이스, 그리고 표현이 쓸 만한지는 말해주지 못하는 프로브
- Post-Training Scaling: 첫 제3자 수치, 그리고 그것이 제공하지 못하는 것
- Agents (LLM Agents): Repo0 이 언급에서 페이지로 승격 · AI Alignment: AdaPop 이 주요 논문에 추가
- GLM-5.3:
Context window가 제3자 등재를 근거로unknown에서 벗어났고 그 이유가 기록됨; 첫 독립 지표 수치 - Qwen 3.8 27B: 52 가 보유된 측정치가 됨 · Grok 4.6: 설정 셋 추가 · Claude Fable 5: LMArena #2 → #3, 구간은 겹치고 신뢰구간은 ±2.57% → ±1.70% 로 좁아짐
- Z.ai: 최근 활동 — GLM-5.3 의 첫 독립 수치