$ cat wiki/trends/2026-W35.md
주간 종합 — W35 (2026-08-24 → 2026-08-30)
2026년 8월 30일 종합 · 8월 24일 월요일부터 8월 30일 일요일까지 · Weekly Synthesis — W34 (2026-08-17 → 2026-08-23) ← → 다음 주
기간
Weekly Synthesis — W34 (2026-08-17 → 2026-08-23) 는 이 분야가 자기 계측기로 회의를 돌린 주였다. W35 는 모델 릴리스에서 라이선스가 흥미로운 부분이 된 주다 — 15일 안에 프런티어급 오픈 웨이트 모델 넷이 나왔고, 그 가중치들은 조건보다 훨씬 더 서로 닮았기 때문이다.
이는 릴리스가 무엇인가에 대한 진짜 변화다. 이 위키가 존재해 온 대부분의 기간 동안 오픈 웨이트 발표가 담은 결정은 하나였다: 공개할 것인가 말 것인가. 이번 주는 6월이라면 아무도 묻지 않았을 질문 — 어떤 조건으로 — 에 대한 서로 다른 답 넷을 담았고, 그 답들은 역량으로도, 국가로도, 해당 랩이 스스로 얼마나 안전을 걱정한다고 말하는지로도 정렬되지 않는다.
주목할 출시
- Hy4 preview (Tencent, 2026-08-28) — 총 770B / 활성 49B MoE, 1M 초과 컨텍스트, BF16 체크포인트와 FP8 양자화 모두 첫날부터 Apache 2.0. 이 위키가 보유한 최대 오픈 웨이트 모델이자, 넷 중 유일하게 아무 조건도 붙지 않은 모델이다. Tencent 는 금요일 전까지 여기에 페이지가 없었다.
- GLM-5.3 (Z.ai, 가중치 2026-08-28) — 2주 안전 게이트가 약속한 날에 닫혔고, 라이선스가 두 번째 조건으로 드러났다: MIT 형태의 허여에 더해 그룹 매출 100억 달러를 넘는 Model-as-a-Service 사업자에 대한 보안 심사. 모델 카드는 그 이유도 자진해 밝혔다 — "cyber capability developed faster than we expected", 익스플로잇 벤치마크에서 GLM-5.2 를 두 배 이상 앞선다는 것.
- GLM-5.3-Flash (2026-08-26) — 같은 랩, MIT, 게이트 없음, 이틀 먼저.
- Qwen3.8-Flash-Next (Alibaba / Qwen AI Lab, 2026-08-26) — 176B/6B
활성,
qwen-community-1.0; 제품이 아니라 명시적으로 Qwen4 의 아키텍처 프리뷰로 공개되었다. - MHS — Model Hardware Standard (Anthropic, 2026-08-27) — 에이전트가 물리 실험 장비를 조작하기 위한 규격 제안으로, HHMI Janelia 및 Genentech 과 시작되었다. MCP — Model Context Protocol 를 제안한 랩의 두 번째 프로토콜이며, 아직 아무것도 공개되지 않았다.
부상하는 주제
이제 라이선스가 릴리스의 결정이고, 역량은 그것을 예측하지 못한다
넷을 나란히 놓으면 그 순서가 이야기다:
| 모델 | 규모 | 라이선스 | 조건 |
|---|---|---|---|
| Hy4 preview | 770B / 49B | Apache-2.0 | 없음 |
| GLM-5.3-Flash | 320B / 18B | MIT | 없음 |
| Qwen3.8-Flash-Next | 176B / 6B | qwen-community-1.0 | 라이선스 조항은 여기서 읽지 않음 |
| GLM-5.3 | 744B / 40B | glm-5.3 | 매출 100억 달러 초과 시 보안 심사 |
| **가장 큰 모델이 가장 느슨한 조건을 달고 있고, 가장 빡빡한 둘은 안전에 관한 가장 | |||
| 상세한 논거를 공개한 랩의 것이다.** 조건을 붙일 모든 논거는 역량에 비례하는데, | |||
| 이번 주 최대 산출물은 조건 없이 공개되었다. 이는 그 조건들이 불필요하다는 증거가 | |||
| 아니다 — Tencent 바깥의 누구도 Hy4 preview 를 측정하지 않았다 — 그러나 이 분야에 | |||
| 역량에서 조건으로 가는 공유된 함수가 없다는 뜻이기는 하며, 규범이란 바로 그런 | |||
| 것이다. |
Anthropic 이 자동화 경계의 양쪽 절반을 며칠 간격으로 발표했다
Automated Researchers Can Reliably Mitigate Alignment Failures 는 Opus 4.8 에이전트 다섯을 돌려 인간 연구자 28명을 그들이 시도한 실패 일곱 건 모두에서 앞섰고, 사람이 쓴 지침은 아무 이득도 주지 않았다. 이어서 TASTE (하루 뒤) 가 제외된 경우 — 안전 연구 제안을 판단하는 일 — 을 측정했는데, 인간 일치도 77% 에 대해 Fable 5 가 60% 로 선두이고 Opus 5 와 GPT-5.6-Sol 은 우연 수준에 놓였다. 어느 쪽 글도 이 쌍을 주장하지 않으며, 정보를 주는 것은 그 쌍이다: 첫 과제가 선택된 이유는 "an objective benchmark, not a fallible human, decides whether a fix works" 였고, 두 번째는 사람이 판단할 때 무슨 일이 벌어지는지다. AI Alignment 에 발견이 아니라 읽기로 기록되었다.
측정 문제가 하네스에서 리더보드로 한 층 올라갔다
W34 는 벤치마크 수치가 그것을 감싼 하네스에 따라 움직인다는 것을 확립했다. W35 는 그 위층을 더했다: 평균을 무엇에 대해 낼지 누가 정하는가. Hugging Face 가 인도 영어를 Open ASR Leaderboard 의 기본 열 집합에 넣었고, 이제 그것이 모든 등재 모델의 대표 Average WER 에 기여한다 — 아무도 재학습하거나 재제출하지 않은 채 보드 전체를 다시 채점한 것이며, 전후 비교표는 공개되지 않았다. 반대편에서 Z.ai 는 GLM-5.3 카드를 거의 모든 행에 하네스를 명시한 채로 내놓았다 — Claude Code 2.1.207, mini-swe-agent, 샘플링 파라미터, 턴 상한, 컨테이너 정책 — 이는 Eval Harness Configuration 이 제안한 처방을 벤더가 자발적으로 채택한 것이고, 같은 페이지가 바로 그 모델의 수치를 하네스가 전혀 공개되지 않은 것으로 기록한 지 3주 만이다.
모델 접근이 계약의 문제가 되었다
OpenAI 가 Cursor 의 자사 모델 직접 접근을 2026-11-12 부로 종료하며, SpaceX 가 자사 이용약관을 지키리라 확신할 수 없다고 밝혔다. 이 위키가 추적하는 게이트들 — GPT-5.6-Cyber 의 심사 등급, Astra 의 Critical 지정 — 은 모델이 무엇을 할 수 있는지를 제한한다. 이것은 누가 그것을 재판매할 수 있는지를 제한하며, 여기 보유된 첫 사례다. Cursor 의 CEO 는 상업적 노출을 트래픽의 약 5% 로 제시하는데, 이는 매출보다 선례가 더 중요하다는 것을 시사한다.
잦아드는 주제
- 논문 다발이 끊겼다. W34 와 W35 초반은 하네스와 사후 학습 논문이 한 번에 넷다섯씩 도착하며 지배했다. 오늘의 HuggingFace Daily 스냅숏은 새 arXiv ID 를 하나도 담지 않았다 — 25 개 항목이 어제 것과 한 건의 교체만으로 갈렸고, 양쪽 다 이미 보유한 것이다. 가뭄이 아니라 멈춤이지만, 몇 주 만에 처음으로 고를 것이 없는 날이다.
- "어느 모델이 제일 나은가"는 거의 움직이지 않았다. LMArena 의 상위 10 은 이번 주 캡처들에서 바이트 단위로 동일하고, Artificial Analysis Intelligence Index 는 상위 30 전부가 그대로다. 오픈 웨이트 릴리스가 넷이었는데 리더보드는 알아채지 못했다 — 넷 중 어느 것도 아직 거기 올라가 있지 않기 때문이다.
뜻밖의 결과
- 여기에 페이지가 없던 랩이 올해 최대 오픈 모델을 내놓았다. Tencent Hunyuan 은
금요일까지 이 위키에게 리더보드 행 하나(Hy3, Index 42)였다.
sources.yaml어디에도 없고, 중국 랩 로테이션에도 없으며, 이번 공개는 Reddit 스레드가 잡아냈다. - Hy4 preview 의 어텐션 모듈은 Gated DeepSeek Sparse Attention 이다. 경쟁사가 공개한 메커니즘 위에 세워졌음을 그렇게 명시한 Tencent 프런티어 모델이다. 이 위키는 오픈 웨이트를 유통의 문제로 추적해 왔는데, 여기서는 재사용이 설계 층위에 있다.
- 유지보수자들이 익스플로잇이 패치보다 먼저 온다고 보고한다. Anil Madhavapeddy 는 패치가 논의되고 몇 분 안에, 패치 diff 가 아니라 버그에 대한 소문에서 익스플로잇 시도가 나온다고 보고한다; rclone 은 10년간 약 20건이던 제보가 한 달에 40건 이상으로 갔다; 요약 주장은 평균 익스플로잇까지의 시간 −7일이다. 방법론도 없고 지목된 모델도 없으며 제보는 익스플로잇이 아니다 — AI-Enabled Cyberattacks 에 통제된 평가가 아니라 일상적 유지보수를 다룬 그 페이지의 첫 항목으로 실렸다.
열린 논쟁
- Hy4 preview 는 정말로 Terminal Bench 2.1 에서 DeepSeek V4-Pro 를 앞서는가? Tencent 는 85.4 로 앞섰다고 보고하고, 이 위키는 DeepSeek 자체 수치 87.9 를 보유하고 있다. 둘 다 벤더 자체 수치이고 어느 쪽도 하네스를 공개하지 않았다. 의도적으로 해소하지 않는다.
- 네 벤더에 걸친 2× 가격 인자는 무엇인가?
spec-check는 서로 다른 네 랩에서 정확히 두 배씩 어긋난 수치 여덟 개를 보고한다. 네 곳의 동시 가격 변경이 덜 그럴듯한 설명이지만, 한쪽의 단위 관행이라는 것도 아직 확립되지 않았다. - 프리뷰는 아키텍처 공개인가 제품인가? Qwen3.8-Flash-Next 는 생태계가 Qwen4 에 앞서 도구를 맞출 수 있도록 공개되었다. 그리고 이번 주 첫 독립 측정치(Artificial Analysis Intelligence Index 56)를 얻었는데, 그것은 제품이 얻는 것이다.
전망
9월로 넘어가며 지켜볼 것은 네 갈래 라이선스 분포이고, 구체적으로는 누구든 Hy4 preview 를 측정하는가이다. 제3자 평가가 없는 770B Apache-2.0 모델은 이 위키가 등재한 것 중 가장 큰 미검증 산출물이며, 그것이 제기하는 두 질문 — 역량이 실제로 있는가, 그리고 그 역량에 조건 없는 라이선스가 붙은 것이 문제인가 — 은 Tencent 바깥의 누군가가 돌려 보기 전에는 분리될 수 없다.
둘째로, GLM-5.3 의 Cybersecurity Trusted Access 등급이 자기 자신의 가중치 공개 이후에도 살아남는지 지켜볼 것. 이제 누구나 내려받을 수 있는 모델에 적용된 공격 역량 심사 접근 통제란 남은 집행 수단이 뚜렷하지 않은 통제이며, 라이선스에도 저장소에도 그것을 언급하는 대목이 없다.
Sources
- briefs/daily/2026-08-24.md
- briefs/daily/2026-08-25.md
- briefs/daily/2026-08-26.md
- briefs/daily/2026-08-27.md
- briefs/daily/2026-08-28.md
- briefs/daily/2026-08-29.md
- briefs/daily/2026-08-30.md