$ cat briefs/daily/2026-08-27.md
2026-08-27
2026년 8월 27일 (목)
스토리 4건 · 신규 페이지 5건 · 논문 픽 1건 · 관찰 3건 · 새 조직 하나, 그리고 HF Daily 스냅샷 없음
주요 소식
1. Anthropic 은 이제 자사 해석가능성 도구가 이득을 주지 않는다는 것을 세 번째로 측정했다 — 이번에는 행동 예측에서
- Would This Change Your Answer? (Adam Karvonen, Euan Ong, Subhash Kantamneni, Samuel Marks, arXiv 2608.16747, 2026-08-17) 는 모델 행동에 대한 설명을 반사실 시뮬레이션 가능성으로 채점한다 — 그 설명이 관련된 편집 프롬프트에서 모델이 무엇을 할지 예측하게 해 주는가 — 그리고 CHIVE (Counterfactual Hypothesis Investigation Via Edits) 를 만들어 실제 사용 환경에서 행동을 찾고 각각을 프롬프트 편집으로 대규모로 조사한다 (source)
- 결과: 연구된 어떤 해석가능성 기법도 이득을 주지 않았다. 활성값을 읽는 도구를 쥔 에이전트가 트랜스크립트만 읽은 에이전트보다 나은 예측을 하지 못했다
- 건설적인 절반: CHIVE 실험 결과를 예측하도록 학습된 모델은 빠진 설정으로 일반화한다 — 설명의 품질이 취향이 아니라 학습 가능한 목표가 된다는 뜻이다
- 왜 중요한가: Fine-Tuned Lie Detectors Failed to Generalize (2026-08-21) 및 AuditBench (2026-03-10, 스캐폴딩된 블랙박스 도구가 화이트박스를 전반적으로 앞섰다) 와 함께 보면, 같은 방향을 가리키는 Anthropic 자체 측정이 셋이다 — 목적 설계된 내부 도구가 모델 자신의 출력을 읽는 것을 이기지 못한다. 이 위키의 Mechanistic Interpretability 페이지는 첫 문장에서 그것을 "정렬의 일차적 경험 도구"라고 부르지만, 이 세 과제에서는 그 주인 랩 자신의 보고에 따라 그렇지 않다
- 무엇이 이 발견을 제약하는가: 읽은 어떤 자료에도 수치 결과가 없고, 어떤 기법들을 비교했는지도 끝내 명시되지 않았다. 동점은 정확도 90% 에서와 55% 에서 서로 다른 발견이다
- → Would this change your answer? Evaluating Explanations of LLM Behavior In The Wild with Counterfactual Experiments, Mechanistic Interpretability, Anthropic
2. 중국의 두 랩이 몇 시간 간격으로 비용 최적화된 오픈 멀티모달 MoE 를 냈다 — 그중 하나는 자기 형님이 아직 쥐고 있는 가중치를 냈다
- GLM-5.3-Flash (Z.ai, 2026-08-26): 320B-A18B 네이티브 멀티모달 MoE, 1M 컨텍스트, 희소 + 선형 어텐션 하이브리드, MIT License, $0.15/M input · $0.03/M cached · $0.50/M output 에 50% 런치 할인. 벤더 자체 DeepSWE v1.1 63.4 대 GLM-5.2 의 46.2, Terminal-Bench 2.1 84.3, AutomationBench 48.8; 독립 Artificial Analysis Intelligence Index 57, 태스크당 $0.045 (source)
- Qwen3.8-Flash-Next (Alibaba / Qwen AI Lab, 2026-08-26): ModelScope 카운트다운이 가리킨 날짜에 공개 — 125B 본체 모델 + 51B N-gram 임베딩 = 176B, 토큰당 6B 활성, 262,144 네이티브 컨텍스트, 1M 까지 확장, 라이선스
qwen-community-1.0, Hugging Face 와 ModelScope 에 BF16 및 FP8 (source) - 더 날카로운 이야기는 Z.ai 내부의 대비다. 열이틀 전 GLM-5.3 은 가중치 없이 출시되었다 — "가장 강력한 오픈 웨이트 코딩 모델"로 마케팅되면서 안전성 평가를 이유로 약 2주 보류, 창은 2026-08-28 경 마감. 동생 모델은 첫날 MIT 가중치를 냈고, 읽은 어떤 자료도 왜 게이트가 한쪽에만 걸리는지 설명하지 않는다
- Qwen 의 점수 열보다 비교 열을 먼저 읽어라: 짝지어진 행은 전부 Claude Opus 4.6 Max 상대다 — Claude Opus 4.8 보다 마이너 두 버전, Claude Opus 5 보다 세 버전 뒤졌고, 어느 쪽도 표에 없다. 6B 활성 파라미터로 두 버전 전의 프런티어 모델을 이기는 것은 진짜 결과이지 프레이밍이 유도하는 결과가 아니다
- 왜 중요한가: 제3자가 Qwen3.8-Flash-Next 를 측정한 적은 전혀 없는 반면, GLM-5.3-Flash 는 독립 종합 지수를 이미 달고 도착했다. 하루 간격의 비교 가능한 두 공개에서 검증 가능한 쪽은 하나뿐이며 — 그것이 이 위키가 무엇을 사실로 게시할 수 있는지를 가른다
- → GLM-5.3-Flash, Qwen3.8-Flash-Next, Open-Weights Policy Fight
3. Z.ai 는 자사 실리콘을 각주가 아니라 헤드라인 항목으로 발표했다
- GLM-5.3-Flash 런치 포스트는 이 모델이 "running entirely on Chinese AI chips" 라고 말한다 — 묻지도 않은 채, 발표문 안에서, 파라미터 수와 라이선스와 나란히 (source)
- 부품명도, 벤더도, 범위도 없다: "entirely" 가 학습을 가리키는지 서빙을 가리키는지 둘 다인지를 말하는 자료가 없다
- 왜 중요한가: 이 위키는 이미 Huawei Ascend 910 에서 학습된 LongCat-2.0 을 보유하고 있으므로 역량 자체는 새롭지 않다. 새로운 것은 랩이 그것을 파는 것이며, 이는 수출 통제를 중국 랩이 우회하는 제약에서 광고하는 주장으로 재구성한다. 모델이 아니라 공급망에 관한 사실이므로 스토리 2 와 분리해 둔다
- → Z.ai, AI Governance
4. Gemini 3.5 Transcribe 는 자기 일 중 벤치마크가 있는 절반을 측정한다
- DeepMind 가 Gemini 3.5 Transcribe 를 공개 (2026-08-26): 85개 이상 언어 자동 감지, FLEURS 스트리밍 WER 5.50% / 비스트리밍 5.04%, Google 자사 Chirp 3 대비 최종 전사까지 70% 단축. Google Antigravity 와 Gboard Rambler 에 탑재; Search Live, Gemini Live, Docs, Keep, Gmail, Chrome 에 적용 예정 (source)
- 이 모델은 정형화되지 않은 발화를 서식 있는 텍스트로 바꾸고 필러 워드를 제거한다 — 인식만이 아니라 편집을 한다. 편집을 측정한 자료는 없다: 서식이 올바른지도, 의미를 담고 있던 비유창성이 사라질 때 사용자가 무엇을 잃는지도
- WER 에는 단서가 둘 따라붙는다: 유일한 비교 기준이 Google 자사의 이전 모델이라는 점, 그리고 "상위 언어·로케일 집합 기준"이 FLEURS 의 102개 언어 중 부분집합을 명시하지 않는다는 점 — 85개 이상 언어 감지를 말하는 주장에서 이는 하중을 진다
- 왜 중요한가: 이번 달 들어 역량을 정확도보다 먼저 공개한 두 번째 DeepMind 인식 모델이다. SL2T 는 수치를 전혀 내지 않았고, 이 모델은 쉬운 절반에 대한 수치를 낸다
- 읽은 어디에도 가격과 API model id 가 없다
- → Gemini 3.5 Transcribe, Google DeepMind
논문 픽
오늘자 HuggingFace Daily Papers 스냅샷이 존재하지 않는다. sources/papers-daily/hf-daily-2026-08-27.md 가 커밋되지 않았다 — eval-snapshots Action 이 07:20 KST 예정 시각을 한 시간 넘겨도 시작되지 않았다(마지막 성공 실행: 2026-08-25 22:49 UTC). agents/daily-run.md 에 따라 웹 검색으로 대체하지 않았다. lint 점검 2o 로 넘긴다.
오늘의 유일한 논문은 Would this change your answer? Evaluating Explanations of LLM Behavior In The Wild with Counterfactual Experiments 이며, 여기서 반복하지 않고 위의 주요 소식 1 에 두었다.
관찰
- IBM 이 agentic RL 을 엔터프라이즈 오픈 웨이트 등급에 실어 보냈다. Granite 4.2 (2026-08-25, Apache 2.0, 3B/8B/30B) 는 thinking/non-thinking 스위치를 갖춘 명시적 추론을 중심으로 만들어진 첫 Granite 이며, 8B 와 30B 는 실제 샌드박스에서 코드를 편집하고 터미널을 다루고 웹 검색을 실행하도록 학습하는 agentic RL 블록을 더한다. SWE-Bench Verified 47.67 (8B) / 57.00 (30B), 벤더 자체 수치이고 3B 에 대한 공개 수치는 없다. 프런티어 랩들이 2026년 초에 내보낸 기법이 30B 온프레미스 라이선스에 도달하는 지점으로 볼 만하다 (source) → IBM, Agentic Reinforcement Learning
- 한 영향력 공작이 ChatGPT 를 자기 지문 지우는 데 썼다. OpenAI 가 가공의 International Burke Institute 를 내세운 은밀한 공작을 운영하던 러시아발 계정들을 차단했다 — Fukuyama 와 Chomsky 를 허위로 내세우고, 36편 중 34편이 표절이며, "sovereignty index" 를 발행했다. 중요한 지시는 "선전을 써라"가 아니라 출처를 드러낼 특징을 제거하라였다. 이 위키가 추적하는 어떤 Content Provenance (AI output marking) 메커니즘도 그것을 다루지 않는다: 워터마킹은 모델이 무엇을 생성했는지를 표시하고, 여기서 숨겨야 했던 것은 작성자였다. 탐지율도 탐지까지 걸린 시간도 공개되지 않았다. 어제의 제외 목록에서 올린 항목 (source) → OpenAI
- GLM-5.3 의 가중치 창이 2026-08-28 경 — 내일 — 마감된다. 2026-08-14 에 안전성 평가를 이유로 약 2주 보류로 발표되었다. 열리는지, 미뤄지는지, 조용히 흘러가는지는 하루면 확인할 수 있고, 위의 스토리 2 가 그 답을 전보다 흥미롭게 만들었다
위키 신규
- IBM (신규 조직 페이지 — 검토 필요. 산출물 두 건에서 작성했고,
## 전략적 위치는 추측 대신 모르는 것을 모른다고 적어 두었다) - GLM-5.3-Flash · Gemini 3.5 Transcribe · Granite 4.2
- Would this change your answer? Evaluating Explanations of LLM Behavior In The Wild with Counterfactual Experiments
업데이트
- Qwen3.8-Flash-Next:
Released: not yet→ 2026-08-26, 어제 "없음"이라고 적혀 있던 자리에 벤치마크 표 전체, 라이선스 이름, 컨텍스트 창. 어제의 3자 파라미터 충돌은 해소되었고 애초에 모순이 아니었다 — 125B 와 176B 는 트랜스포머와 산출물 전체를 말하고 있었다. 충돌 항목은 남겨 둔다. 세 출처가 파라미터 수를 두고 엇갈릴 때 그것은 사실 문제만큼이나 자주 단위 문제이기 때문이다 - Mechanistic Interpretability: 아홉 번째 열린 문제이자, 그 페이지 자신의 첫 문장을 가장 정면으로 반박하는 항목
- Anthropic · Z.ai · Alibaba / Qwen AI Lab · Google DeepMind · OpenAI: 각각 최근 활동 항목 하나씩